不跑 benchmark,不问算法题。同一份需求、同一个空目录、同样的工具权限、全程无人干预—— 三个模型各自交出一个能用的网页。题目、成品、源码、验收脚本、原始用量数据,全部公开。
下面三个页面功能完全一样,都是"输入你的 Token 用量,算出 DeepSeek 调价前后的月成本"。 风格差异全部来自模型自己的选择——题目里一个字都没规定长什么样。
13 项机器验收——计算结果核验、手机端无横向滚动、零外部依赖、非法输入不冒 NaN…… 三家全部满分。差别不在能不能做对。
输出 Token 是最贵的一档(调价后 ¥9/百万)。同样做完一道题, 写得多不等于写得好——三家产物都通过了同一套验收。
MiMo 做完整道题,只吃掉 opencode go 5 小时套餐的 1%,月额度纹丝不动。 按这个强度,套餐一天能扛几十上百次这样的任务。
每一行都可复核:DeepSeek 侧走独立评测 API key(后台可按 key 查)、MiMo 侧走网关逐请求日志、 Luna 侧走 codex 会话记录。三边计费方式不同,成本分开列,不硬凑成一个数字。
| 指标 | DeepSeek V4 Flash | MiMo V2.5 | GPT-5.6 Luna |
|---|---|---|---|
| 计费方式 | API 按 Token 真实付费 | opencode go 套餐(按请求) | ChatGPT Plus 套餐 |
| 完成耗时 | 7 分 17 秒 | 4 分 12 秒 | 3 分 45 秒 |
| 总 Token | 3,592,952 | 2,223,940 | 497,766 |
| 其中 · 输出 | 96,649 | 8,350 | 9,798 |
| 其中 · 命中缓存 | 3,388,288 | 520,000 | 432,384 |
| 真实花费 | ¥1.53 | 套餐内 · 5h 额度 1% | 套餐内 |
| 若都按调价后价折算 | ¥1.53 | ≈ ¥5.20 | ≈ ¥0.30 |
| 产物 | 3 文件 / 979 行 | 1 文件 / 731 行 | 5 文件(含 2 个自测脚本) |
| 是否自验 | — | 自己截图核对 | 自己写测试脚本跑 |
| 机器验收 | 13 / 13 | 13 / 13 | 13 / 13 |
| UI 视觉 | 不由我评分 —— 交给你投票,见文末 | ||
753f04c2…,
全程不因为某个模型犯了什么错而事后追加验收项。mimo-v2.5 这个模型名,
默认按 200K 上下文处理,所以 MiMo 跑到 19.8 万 Token 时触发了一次上下文压缩;
而 deepseek-v4-flash[1m] 的后缀被识别为 1M,Flash 全程没压缩。
这是工具配置差异,不是模型能力差异(MiMo 实测能吃 72 万)。
三家最终都是 13/13,压缩没有影响结果,但这个不对等如实披露。
现已通过 CLAUDE_CODE_MAX_CONTEXT_TOKENS 修正,下一轮不会再有。机器能判的 13 项,三家都满分。唯一分不出高下的是 UI——而这一项我故意不打分, 因为"评测者偏爱某个模型"是这类横评最容易被质疑的地方。三个成品都在上面,你自己点开看, 然后去评论区投一票:哪个页面你更愿意用?