9 个 AI 模型收到同一份提示词,各自生成一个「OpenCode Go 订阅用量统计」网页。本报告基于全页截图视觉评审、逐行代码审查、对照官方文档的数据核验与计算逻辑验算,从五个维度评分。
总分 = 视觉设计(25) + 数据准确(25) + 需求覆盖(20) + 交互功能(15) + 代码质量(15)。条形按五个维度分段着色。
点击表头可按任意维度重新排序。
| #▾ | 产出 | 视觉 /25 | 数据 /25 | 覆盖 /20 | 交互 /15 | 代码 /15 | 总分 | 评级 |
|---|
所有产出生成于 7 月 21 日前后,而官方文档在 7 月 24 日更新过。交叉验证确认当时存在两个旧版本:14 模型版(opus4.8、fable5 采信,含 GLM-5、Kimi K2.5、MiniMax M2.5 与旧定价——两份产出数字完全一致,证实非编造)与 15 模型版(其余 6 份采信,Kimi K2.7 Code 当时为 4,630/9,250,现已改为 3,380/6,750)。现行文档新增的 Hy3 九份全部没有——因为当时它还不存在。此类差异一律按「生成时文档」评判,不计为错误;只有真实的编造与算错才扣分。
把三档限额(5小时/周/月)的 token 总量真正乘出来的只有 4/9(opus4.8、fable5、fable5-new、minimax-m3);glm-5.2 只算了 5 小时档;deepseek-v4flash 的「各阶段」小节名不副实;gpt-5.6sol 把「阶段」曲解成了编造的工作流阶段。
官方对 Grok 4.5 等四个模型只给 $15/月额度(计入限额约为牌价 4 倍)。只有 fable5-new 把这个语义算对;glm-5.2 和 minimax-m3 都展示了额度列却在计算时忽略它,得出与同页官方请求数矛盾 4 倍的结果。
gpt-5.6sol 生成了一个视觉最精致的「个人用量仪表盘」,但 86.4M token、$41.04 消耗、逐日趋势全为虚构,且与官方单价矛盾最高达 22 倍、表格与卡片总量互相对不上。形式与内容的反差是全场最大教训。
5 份实现了表格排序,其中 2 份带静默失效 bug:glm-5.2 的请求表 3 个总量列排序无效、kimi-k3 的默认排序键与字段名错配导致「月均请求」列永远排不动。opus4.8、fable5、minimax-m3 的排序经查全部可用。
4 份零外部依赖离线可用(opus4.8、fable5、fable5-new、deepseekv4-pro),4 份依赖 Chart.js CDN——其中 glm-5.2 断网时连计算器和 API 表都会被连带击穿(同一 script 块单点故障)。gpt-5.6sol 还额外依赖 Google Fonts。
认真做了键盘可达与 aria 的只有 fable5-new(图表可 Tab 聚焦出提示)和 gpt-5.6sol(aria/role/sr-only 体系完整)。其余 7 份的排序表头、tab、图表基本键盘不可达、读屏不可用。
单请求成本公式(Σ token/1M × 单价)8/9 实现正确且能与官方请求数互相验证(如 minimax-m3 模拟 100% 时恰为 $11.97 ≈ $12 限额)。翻车都发生在二级指标:minimax-m3 的「节省」少算 110 倍、runway 周/月单位混淆;glm-5.2 存在死代码与错误注释。
7 份做成「文档数据可视化」,2 份做成「工具」——deepseekv4-pro 是纯手动记账器(交互全可用但几乎不呈现文档数据),gpt-5.6sol 是虚构遥测仪表盘。对「统计 token 用量」这个诉求,可视化 + 模拟器的混合形态(fable5 系)得分最高。
按排名排列。截图为首屏实拍(Playwright · 1360×850),点击可看整页长图;「打开原页」在新标签页查看产出本身。