同 题 实 测 · 2026-08-17

同一道题,我让 MiMo V2.5DeepSeek V4 FlashGPT-5.6 Luna 各做了一次

不跑 benchmark,不问算法题。同一份需求、同一个空目录、同样的工具权限、全程无人干预—— 三个模型各自交出一个能用的网页。题目、成品、源码、验收脚本、原始用量数据,全部公开。

题目冻结指纹 753f04c2… 验收项 13 项全自动 人工干预 0 次

01三份成品,自己点开看

下面三个页面功能完全一样,都是"输入你的 Token 用量,算出 DeepSeek 调价前后的月成本"。 风格差异全部来自模型自己的选择——题目里一个字都没规定长什么样。

DeepSeek V4 Flash

深色科技风 · 信息密度最高 · 3 个文件 979 行
DeepSeek V4 Flash 的成品截图

MiMo V2.5

亮色渐变 · 三档同屏对比 · 单文件 731 行
MiMo V2.5 的成品截图

GPT-5.6 Luna

极简杂志风 · 滑块交互 · 5 个文件(含 2 个自测脚本)
GPT-5.6 Luna 的成品截图

02三个数字,先看结论

能不能做对?三家都能

13 / 13

13 项机器验收——计算结果核验、手机端无横向滚动、零外部依赖、非法输入不冒 NaN…… 三家全部满分。差别不在能不能做对。

Flash 的输出是 MiMo 的 11 倍

96,649 vs 8,350

输出 Token 是最贵的一档(调价后 ¥9/百万)。同样做完一道题, 写得多不等于写得好——三家产物都通过了同一套验收。

套餐这边,几乎没感觉

1 %

MiMo 做完整道题,只吃掉 opencode go 5 小时套餐的 1%,月额度纹丝不动。 按这个强度,套餐一天能扛几十上百次这样的任务。

03完整数据

每一行都可复核:DeepSeek 侧走独立评测 API key(后台可按 key 查)、MiMo 侧走网关逐请求日志、 Luna 侧走 codex 会话记录。三边计费方式不同,成本分开列,不硬凑成一个数字。

指标DeepSeek V4 FlashMiMo V2.5GPT-5.6 Luna
计费方式API 按 Token 真实付费opencode go 套餐(按请求)ChatGPT Plus 套餐
完成耗时7 分 17 秒4 分 12 秒3 分 45 秒
总 Token3,592,9522,223,940497,766
其中 · 输出96,6498,3509,798
其中 · 命中缓存3,388,288520,000432,384
真实花费¥1.53套餐内 · 5h 额度 1%套餐内
若都按调价后价折算¥1.53≈ ¥5.20≈ ¥0.30
产物3 文件 / 979 行1 文件 / 731 行5 文件(含 2 个自测脚本)
是否自验自己截图核对自己写测试脚本跑
机器验收13 / 1313 / 1313 / 13
UI 视觉不由我评分 —— 交给你投票,见文末
🔴 一条反直觉的发现:MiMo 便宜,不是因为模型便宜

04怎么保证公平

05轮到你了

机器能判的 13 项,三家都满分。唯一分不出高下的是 UI——而这一项我故意不打分, 因为"评测者偏爱某个模型"是这类横评最容易被质疑的地方。三个成品都在上面,你自己点开看, 然后去评论区投一票:哪个页面你更愿意用?

下一期预告