背景
现在各家模型厂商一直在搞军备竞赛一样,几乎每个月都会有模型新版本上线。
DeepSeek、QWEN、MiniMax、MiMo、GLM、ChatGPT、Claude……名字越来越多,版本越来越快,但到底哪一家的模型Coding能力最强?
我做了一个测试。同一个提示词,分别丢给7个模型。
让它们各生成一个"调酒小游戏"的单文件HTML页面。提示词要求能选鸡尾酒、展示标准配方、用力度条控制倒酒量、有液体动画、有装饰物、最后还要根据配方比对打分。

提示词以及各个AI产出物已开源,附在文章后面,对详细结果感兴趣的可去试试。
我的提示词给了一个范围和约束,并没有精确到每个像素、每个交互细节。这其实更接近我们真实的开发场景——一般我们不会只丢一段话就让模型输出,也不会把PRD写到事无巨细的程度。通常是有一个相对详细的约束框架,但具体怎么实现、怎么发挥,留给模型自己决定。
这种情况下的产出质量,我觉得比"完全自由发挥"和"严格按规格执行"都更能说明问题。因为它同时考察了模型的UI审美、交互设计、代码逻辑和知识准确性。
测试的7个模型:
ChatGPT 5.5 xhigh模式(Codex) QWEN 3.7 Max(Codex) DeepSeek V4 Pro(Claude Code) MiniMax 3.0(Claude Code) MiMo 2.5 Pro(Claude Code) GLM 5.1(Claude Code) Claude Opus 4.8(Claude Code)
Agent:ChatGPT和QWEN接入的Codex,其余都是接入的Claude Code v2.1.141。
模型纯度:只有Opus4.8走中转站,剩下的都是官方纯血API或订阅。
QWEN 3.7
有免费额度,大致用了29万token。
因为QWEN的Anthropic调用地址在CC Switch里获取不到模型列表,配置不进Claude Code,我只能走Codex,算是个对照组。
进到页面第一感觉:藏蓝色配色,没有酒吧的感觉,有点土。鸡尾酒名字全是英文。
布局极其不合理——调酒杯模块拉得太长,倒入模块和调酒杯是上下级关系。我在下方点击倒入,页面要拖到上面才能看到加了什么东西。2K屏幕都没法在一个屏幕内同时进行倒酒和查看已加材料。
存在装饰物排布不合理、能无限倒酒的问题。

MiMo 2.5 Pro
token消耗未统计。
紫底配金黄标题,辅以青绿色按钮,还真有点酒吧氛围。但调酒杯没什么玻璃质感,酒名也全是英文。
最让我困惑的是交互设计。它是唯一一个"长按倒入按钮不放、松手倒入"的交互形式。其他6个模型都是点一下倒入、或通过力度条控制,只有MiMo搞了个长按。
布局也很奇怪:上面选好了酒之后会弹到下面来,所有基酒是竖状排列,导致我要操作好几下鼠标在页面里来回上下滚动,而且装饰物排布设计也不行。从产品角度来说,这个交互不合格。

杯子容量设计有上限:最多只能到260ml,之后就无法倒入了但没有提示。松开倒入按钮后进度条会卡在那里。

GLM 5.1
API费用¥5.13。
骨架是有的,但视觉完成度一般。几个模块甚至没有好好对齐。金汤力的配方写成了加苏打水——这是第一个在知识性上翻车的模型。
我查了一下维基百科,金汤力(Gin & Tonic)的配方就是金酒加汤力水,没有苏打水什么事。
优点是倒酒动画比较流畅,而且最大容量设置为280ml,再往上的时候会提示"杯子已满",不会让你一直加。这个边界处理比后面几个模型好。
我看小红薯上把GLM 5.1都吹上天了,简直国产coding之光,官网的plan也是搞”饥饿营销“一样难抢的很,导致我对它预期很高,出来这个效果我是有点失望的,至少在这个任务上,没表现出和其他模型的区别。

MiniMax 3.0
API费用¥5.98。
6月新鲜出炉的最新模型:MiniMax M3。第一眼看过去确实惊艳。排版舒服,材料选择区还做了分类。视觉气质在所有模型里排前列。
选酒的交互逻辑有问题:第一次倒金酒没问题,紧接着倒第二次的时候,必须在下方重新选一下金酒,进度条才会开始摇晃。如果第一次倒完直接再点"倒入",会弹提示说"力度太小,加大力度再倒"。
Bug还是有的,可以在杯子里无限加酒,没有容量上限。

DeepSeek V4 Pro
API费用¥0.4,136,734个token。和MiniMax的¥5.92比,差了十几倍。
杯子做得还挺好看的,有玻璃质感,还象征性放了几个冰块。液体材料和装饰物的按钮样式做了区分,UI上算用心。
但金汤力的配方也写成了加苏打水。
和GLM一样的知识错误——金汤力的核心就是汤力水,把汤力水换成苏打水,那还叫金汤力吗?
可以在杯子里无限倒酒,没有容量上限。装饰物排列也不太合理。
但¥0.4跑出来这个效果,还要啥自行车??就算有问题,那也是我的问题!梁圣的恩情还不完啊。

商汤 SenseNova
其实我还测试了商汤的模型。我看说SenseNova现已支持Anthropic Messages API协议,能接入到CC里,所以让它也试了一下。
但不知道是我操作问题还是什么,能接进来进行问答,一旦把这个HTML任务给它就报错:API Error: 400 engine is not available temporarily。
没能跑出成品,遗憾退场。

ChatGPT 5.5 Xhigh
最不达预期的模型,我的评价是拉完了。
首先:我把提示词给ChatGPT之后,它竟然没有直接生成HTML文件,而是把代码贴在了聊天框里。这是这些模型里唯一一个需要我主动要求"请生成HTML文件"的。我一度怀疑它是不是被降智了。

再说成品。配色还行,但布局一般——"完成调酒"和"重置"这些操作按钮放在了画面右上角,和调酒杯不在一个区域。用户在下方倒完酒,要跑到右上角去点完成,这和常规操作习惯完全不一样。
评分区域的问题:点击"完成调酒"之后,评分结果出现在页面下方的独立区域,但页面不会自动滚动到那里。用户点了按钮没反应,得自己往下滚才能看到——这个交互会让很多人以为功能坏了。
优点:每个液体材料的上限是动态调整的。比如苦精上限只有10ml,不像其他模型给一个固定的毫升上限。这个设计确实更合理。
调酒动画倒是唯一有吧台氛围的(虽然看起来很抽象),但起码能看出是个吧台场景。装饰物布局也相对合理——但装饰物本身实在是太丑了。
额度消耗:就生成这么一个HTML,用了15%的五小时额度。Plus套餐基本干不了什么活,没问几个问题就到限制了。
至少在这个任务上:再回过头来想想DeepSeek花了4毛钱真的太香了。

彩蛋:我一开始出于能让AI干的都不自己干的原则思想,不想手写评测,把所有HTML丢给ChatGPT,想让它用视觉能力自己评测——结果它把自己评的分最高,说明AI主观思想还是非常严重的。

Chatgpt自己出的评测结论
Claude Opus 4.8
Opus4.8真出乎我意料了,因为它是最后一个测的,然后其他模型开发的内容我已经都看过了,脑子里已经有大概知道模型会针对于这个调酒提示词开发出什么样式了,结果没想到claude还是给了我一个惊喜,真是我个人体感最好的。
两个亮点是其他模型都没有做的:一是整个页面加了随机上浮的气泡动画,酒吧氛围一下子就出来了;二是倒酒的时候竟然做了音效——提示词里完全没提声音的要求,它自己"脑补"了。
然后力度条做了区域配色区分,速度也调得比较舒服。
杯子容量上限320ml,满了会提示。
完成调酒后的评分弹窗也有动画。
但金汤力的配方也写错了——加的是苏打水而不是汤力水。
这个错误在DeepSeek、GLM、Claude三个模型上都出现了,说明"金汤力=苏打水"这个错误认知在训练数据里可能相当普遍。

测试发现
金汤力成了照妖镜。 DeepSeek、GLM、Claude三个模型都把金汤力的辅料写成了苏打水。ChatGPT、MiniMax、MiMo、QWEN写对了。跟模型是哪国的没关系,纯粹是训练数据的问题。
容量上限区分产品思维。 MiMo(260ml)、GLM(280ml)、Claude(320ml)有容量上限且满了会提示;ChatGPT更进一步做了动态上限。DeepSeek、MiniMax、QWEN可以无限倒酒——说明模型在生成代码没有考虑"边界条件"。
ChatGPT自我评测带倾向性。 让ChatGPT用视觉能力评其他模型的产出,它给自己打了最高分。用AI评AI,永远不能完全信任。(换句话说,让AI自己去review代码也可能会出现这种情况,至少不能让相同模型去review代码)
Claude能力。 opus4.8在这个测试里确实表现最好,但我不认为这就能直接得出"Claude的基模能力最强"的结论。
因为这次测试大部分模型都是接在Claude Code里跑的,而Claude Code本身就是Anthropic做的工具。
自家的Agent工具配自家的模型,适配性天然就是最高的——提示词的解析方式、上下文的传递机制、工具调用的协议,可能都是围绕自家模型优化的。
不代表说opus4.8基模能力就比其他模型更好。
一句话总结
Claude给到夯中之夯(而且还不是纯血) DeepSeek性价比最高 ChatGPT最让人失望(但我还是会给它机会的) MiniMax M3审美在线 GLM5.1细节差(有点拉) QWEN布局最不合理(比较拉) MiMo开发不太行(拉完了)

如果让我选:复杂项目用Claude,简单任务用DeepSeek省钱,至于ChatGPT……我再试试吧(昨天刚续的plus啊)。
以上纯个人体感,不构成任何技术评测标准。每个人对"好用"的定义不一样,建议自己跑一遍再下结论。
测试的提示词以及各个模型开发成果物已开源至GitHub上,在那上面可以直观看到效果。
项目名称:one-prompt-model-test

