EN FR ES PT DE AR 中文

大模型跑分集体“通胀”:企业该如何真正评估AI模型

公开排行榜的分数已经挤在一起,不再传递任何信息。当每一款前沿模型都能刷出高分,唯一还没被“刷”掉的信号,是你自己私有测试集上的“单位正确任务成本”。

市场对信息定价,而不是对努力定价。所以当一连串前沿大模型在几天之内接连发布,而每一款都在同一批公开测试上刷出几乎相同的高分时,市场其实是把一个已经失去区分力的数字丢给了所有人。这正是采购团队眼下的尴尬处境,也是如何评估AI模型是否适合自己的业务从一个“看排行榜”的问题,悄悄变成了一个“如何采购”的问题的原因。

排行榜曾经确实有用,那是在模型之间差距悬殊、一次公开测试就能一眼看出强弱的年代。这扇窗口正在关闭。一旦某个基准测试成为供应商互相较量的KPI,它就不再衡量能力,而开始衡量“全行业朝同一个固定目标优化了多久”。分数越刷越高,彼此的差距越缩越小,排名逐渐变成一件营销道具。在一个已经“刷满”的排行榜顶端领先一分,不过是噪音戴上了一朵红花。

为什么公开的AI基准测试,已经不能再告诉买家任何有用信息?

原因有两个,而且都不需要假设供应商在使坏。第一,公开测试集是一个有限且静态的目标,而任何静态的东西终究会被“学会”。无论是通过直接的数据污染,还是整个行业更缓慢地朝同一批题目趋同调优,一套测试只要公开的时间够久,区分能力就会不断衰减。“实验室蓄意用测试数据训练模型”这种说法,值得放在心里当作一个待验证的假设,而不是已被证实的事实,你甚至不需要“阴谋论”成立,数学本身就足以解释这一切。第二,趋同本身就是破绽。当五款模型的分数挤在一分之内,诚实的解读不是“它们在你的实际工作上同样出色”,而是“这套测试的天花板已经见顶”。

细看之下,信号比表面看起来还要单薄。独立测试机构对ARC-AGI推理测试集进行评估时,一款被大肆宣传的预览版模型在半私有测试集上拿到约75.7%的准确率,这个数字足够写进标题,却几乎帮不了任何一位采购决策者。准确率只能说明一款模型能不能得出答案,却完全不说明得出这个答案花了多少钱,而“成本”恰恰是当下各家模型之间真正拉开差距的地方。

“单位正确任务成本”到底衡量什么?

供应商唯一无法靠营销抹去的指标,就是在固定能力水平下的“单位正确任务成本”。它是一个真实的经济事实。一款模型如果能以对手一小部分的花费,达到同等准确率,这才是有意义的结果,而不是排行榜上小数点后的领先。你能不能负担得起把一个模型跑上一百万次,是唯一能在真实部署中存活下来的问题。两款模型可能在推理测试上打出相同的分数,但它们完成每一个正确任务的成本可能相差一个数量级,而这个差距,在拿到媒体报道的那张排行榜上完全看不见。

把定义说清楚,因为这个短语承载的信息比看上去要多。单位正确任务成本,就是跑完你的任务集的总花费,除以模型真正做对的任务数量,在单次作答的情形下,即每任务的token成本除以通过率。没什么玄乎的,但它只有在三个前提下才站得住脚。你需要一个你信得过的评分者,可以是自动化校验,也可以是人工审核,能够在你的留出测试集上给出对错判断。你需要在自己的实际提示词上测量token用量,而不是照搬供应商给出的整洁假设,因为冗长的推理过程对这个数字的影响,往往比表面上的通过率更大。你还必须决定一个错误答案的代价是什么:如果一个“看起来对、实际上错”的输出很难被发现和纠正,那么单位正确任务成本会不公平地偏向便宜的模型,因此要按失败的实际代价加权。

把真实数字代入试试。取同一家供应商旗下两款被广泛部署的模型,按公开报价:一款经济型模型每百万输入token收费0.15美元,每百万输出token收费0.60美元,一款高端型号在同等用量下收费2.50美元和10美元。假设你的测试集中每个任务大约用到2,000个输入token和500个输出token。经济型模型每次调用成本约为0.0006美元,高端型号约为0.01美元,贵了大约十六倍。再把准确率,也就是价目表刻意忽略的另一半,考虑进去。假设在你的留出测试集上,经济型模型的通过率是55%,高端型号是75%。用成本除以通过率,真实数字才浮出水面:经济型模型每个正确答案约0.0011美元,高端型号约0.013美元。

慢慢读一遍这个结果。高端模型的准确率领先20个百分点,但每解决一个问题的实际花费,仍然是经济型模型的约十二倍。要买到5,500个正确答案,经济型模型只需约6美元,同样的5,500个答案,高端型号要花约73美元。把视野拉宽,这个差距只会更明显:公开报价从经济档的每百万token 0.15美元和0.60美元起步,到中端档的0.80美元和4美元,再到前沿档的3美元、15美元甚至更高的重度推理模式,横跨两个数量级,而支撑这一切的基准分数往往只相差一两分。排行榜只会给你看准确率的差距,不会给你看价格的差距。这笔交易是否划算,是一个需要认真权衡的真实决策,而不是默认答案:如果错误答案发现和重试的成本很低,经济型模型直接胜出;如果一次悄无声息的错误代价高昂,那么为准确率多付钱是正确的选择。

企业究竟该如何评估AI模型是否适合自己的业务?

答案是搭建一套私有评测框架。从你自己的实际业务中抽取一批留出任务,确保没有任何供应商见过、也无法针对性优化,然后用“成本调整后的准确率”给每一个候选模型打分。把它保持私有,并持续更新,让它成为你真正据以决策的数字。一个公开分数回答的是一个你从未问过的问题;你自己的评测回答的才是你真正想问的那个。这也是我们在谈“构建前先做好AI准备”时一贯强调的纪律,也是为什么模型选型应当纳入技术战略的范畴,而不是等一份新闻稿发布之后再被动跟进。相比让整个公司因为一个营销数字误判为能力信号,而在错误的供应商上标准化,这套评测框架的成本几乎可以忽略不计。

真正的二阶风险,是排行榜永远不会呈现的那些。空间与物理推理仍是结构性短板:在我们自己的测试中,一些在通用推理排行榜上高分过关的模型,一旦任务涉及从图像中推断深度、相对位置或物理布局,就会明显失手。如果你的部署要从单个摄像头或纯视觉输入中读取深度或位置信息,一个通用推理高分不仅无用,反而更危险,因为它会显示出虚高的水平,而你真正依赖的那项具体能力实际得分很低。这正是私有评测能够揪出、而公开评测会悄悄“洗白”的失败模式,也是为什么在任何有实际后果的场景中,我们始终坚持人在回路。

什么样的证据会让这个判断反转?如果某个公开基准测试在发布一年后仍能保持区分能力,分数继续保持分散,而不是全部挤到天花板附近,这将是排行榜依然有信号价值的有力证据。又或者,如果单位正确任务成本与头部准确率之间的相关性变得足够紧密,让这个“廉价替代指标”不再撒谎,情况同样会反转。只要行业的激励机制仍然是优化那个看得见的数字,这两种情况都不太可能出现。在这一切改变之前,那个至今没人定价的不对称机会就是:那些默默搭建自己私有评测的买家,正在做出比看着同一张排行榜的竞争对手更好的决策,而且付出的成本只是对方的零头。

常见问题

AI模型评估框架真正应该衡量什么?

应该衡量在贴近你真实业务场景的任务上,经过成本调整后的准确率,而且这批任务要留出、私有,而不是公开测试的分数。既要看模型是否给出正确答案,也要看每一个正确答案花了多少钱,因为在排行榜上看起来不相上下的模型,往往正是在第二个数字上被拉开差距。

公开的AI基准测试是不是已经完全没用了?

并非完全没用,但价值衰减得很快。一套刚发布、任务足够新颖的基准测试,依然能提供一些信息。但当前沿模型的分数挤在一分之内,它就无法再帮你区分谁更适合你的业务,这时候应该把排行榜名次当作一个很弱的先验,真正的决策权交给你自己的留出评测。

为什么空间推理能力在比较AI模型时如此重要?

因为这是一个有据可查、却被通用推理分数掩盖的结构性弱点。如果你的业务场景需要从视觉输入中推断深度、位置或物理布局,一个很高的综合基准分数,完全可能掩盖住这项具体能力偏低的真相,这正是任务导向的私有评测胜过任何公开综合指标的原因。

相关阅读

本文由 Abyshire 专有编辑系统的 AI 编辑角色撰写,并经我们的团队审核。