BLOG · 2026-07-28

同一编程任务:9个模型都成功完成,但最贵的比最便宜的贵出32倍

这个被称为RRLab Bench的项目是RRLab成立后的第一个项目。做这件事的原因其实很朴素:过去半年我用了不少模型。有一个感受越来越强烈:很多模型发布的时候都说自己在某某排行榜上拿了多少分。但实际用起来,总觉得不是那么回事请。那么那些排行榜到底是在说什么呢?我们用户最终应该相信谁?

实际排名只是体现这个模型知道哪些方面的知识,能完成怎样的事情。但这个可能和你使用下来的感受不一定有关系。排名高的用着不一定快、排名低的用着不一定省…

于是我想了下:能否给模型在同等思考深度的情况下,在完成同一个任务时看看各自的差异有哪些?!我模拟了三个在真实开发里会遇到的场景:

  • 改一个API的方法签名,三个调用点会跟着挂
  • 修一个日期解析的bug,依赖旧行为的模块会崩
  • 加一个输入校验,边界数据会不通过

每个模型跑这三个场景,每个场景重复3次。不是让它回答选择题,是让它真的在沙箱里改代码,跑测试,出结果。

第一轮我们审计了9个模型配置。所有模型都用最高的思考深度。

数据

先说不意外的部分:9个模型全部完成了任务,FRR全是0%。换句话说,所有9个模型都完成了任务,谁都没把别的东西搞崩。这表明:在”会不会做"这件事上,这9个模型没有区别。

但换个角度区分度就出来了:

模型回合耗时Token费用/次综合评分
Grok 4.5623s19,000¥0.310.772
DS Flash1439s71,000¥0.070.615
DS Pro1249s53,000¥0.170.447
MiniMax M31272s59,000¥0.150.410
GLM 5.21084s34,000¥0.300.387
Opus 4.8781s35,000¥1.980.377
Kimi K310124s45,000¥1.170.280
Opus 521226s228,000¥9.940.106

综合评分是费用 30%、耗时 30%、回合数 20%、Token 20% 加权算出来的。不是"谁最聪明",是"谁最便宜地用同样的质量把事办了"。

三个反直觉的地方

第一:最快的不一定最贵。

Grok 4.5 一骑绝尘——6 个回合、23 秒、19K Token,一次任务 ¥0.31。9 个模型里三项第一。而最贵的 Opus 5 MAX 花了 ¥9.94,做了同一件事,结果一样。

这两个数字之间差了 32 倍。

第二:深度思考在 Agent 场景里是个负资产。

Opus 5 在Thinking Level为MAX的情况下给出了21轮回复、226秒时间和超22万的Token输出。这难不成是“人傻钱多”的表现?想想是不是因为Opus 5的思考深度太高了?我调整了Opus 5的Thinking Level为:MEDIUM 档,结果如下:12 回合,77 秒,花费 ¥3.19。MAX 档:21 回合,226 秒,花费 ¥9.94——费用翻了 3 倍,结果没变。

那么Opus 5之前Thinking为MAX的时候,多出来的回合去哪了?全耗在过度自我验证上。反复检查、反复推敲、反复确认一个自己已经做对了的事。在考试里这是加分项,在Agent里每一轮都是用户的时间和钱。

第三:排行榜和实际使用是两码事。

Kimi K3在好几个标准基准里都是名列前茅的。但在这个测试里,它比DS V4 Flash贵16倍,慢3倍,Token用得更多,回合数还不占优。

不是 Kimi K3不好——它FRR也是0%,它最终也完成了任务。而是"排行榜高"和"用起来划算"之间隔了一整条河。排行榜测的是模型在标准考试里能拿多少分,RRLabBench测的是你请它干一天活,月底的账单长什么样。

从一开始我们就没打算做一个新的"第一名第二名"榜单。

一方面是觉得没什么意思——排名本身就是一种简化,它把一堆不同维度的数据压成一个数字,反而把最有用的信息弄丢了。我想知道的是,在我需要完成的任务类中哪个模型最合适!

另一方面,RRLabBench 已经开源了:https://github.com/rrlab-tech/rrlab-bench。你可以自己跑自己的模型,跑出来的数据自己看。我们也接受社区提交数据——跑完把结果通过 GitHub Issue 或 PR 发过来,经验证后归档到社区数据集里。每季度汇总一份匿名化的效率对比报告,不做排名、不做评价,只做数据可视化。

我们提供方法论,你决定用哪个模型。

下一步

RRLab 后面要做的事情,是从"效率"往"可靠性"走。我们定义了几个新的指标:

  • DRI(破坏性风险指数):模型完成任务时,改了不该改的文件的概率
  • FDR(首次诊断成功率):遇到错误时是诊断根因,还是换个方案再试
  • 多轮一致性:长对话里能不能保持同一套规则和风格

这些是现有评测框架完全不碰的东西。也是真正决定"能不能把模型放进生产线"的问题。

这些还在开发中,后面有了数据会再写。

这几天我在考虑另外一个事情,如果谁有兴趣可以加我一起商讨。“现有模型的注意力是否真的能覆盖 1M 的上下文?”


RRLab-Bench 代码:https://github.com/rrlab-tech/rrlab-bench
联系我:rodneyrui@gmail.com