EN FR ES PT DE AR 中文

你的AI效率红利,正在拿一个没人衡量的环节买单

AI把知识工作里“生成”那一半变得近乎瞬间完成,却让“核查”那一半和从前一样费时费力。你看的那些效率仪表盘,从头到尾只统计了变快的那一半。

“生成”变便宜了,“核查”却没有。眼下这批AI生产力数据里大多数说不通的地方,都能归结到这一处不对称上。在判断一款工具究竟改善了什么之前,你得先弄清楚它碰的是工作的哪一半。

拆开任何一种知识工作,你都会发现两个心理机制截然不同的环节。前半段负责产出候选方案:一份初稿、一套数据结构、一版代码、一次营销活动的六个方案。这个环节可见、有产出感,让人觉得“进展很快”。后半段负责淘汰候选方案:修改、对照真实情况核实、与业务其他既定结论互相校验、该扔的扔掉。做得好的时候完全不显眼,这也是它一直被当成“行政杂务”的原因。

AI几乎让前半段瞬间完成,却让后半段停留在原地,两者之间的落差如今已经大到足以颠覆从业者深信不疑的结论。在METR于2025年初开展的一项随机对照实验中,16名经验丰富的开源开发者,在他们本就熟悉的代码库上完成246项真实任务,其中随机一半允许使用AI辅助。结果是:使用AI辅助的任务反而多花了19%的时间。事后,他们自己估计AI让效率提升了约20%。生成环节感觉很快,于是整天都感觉很快,而他们自身的体感里根本没有任何东西在追踪那个变慢了的环节。

为什么产出上升,质量却在悄悄下滑?

与其相信直觉,不如追根溯源看机制。把这套工作流建模成一个两阶段队列:第一阶段是生成,第二阶段是审核,而审核产能是每周固定的一批称职人力工时。把第一阶段提速,排在第二阶段前面的队列就会等比例变长。这只有三种收场:积压越堆越多直到有人抱怨;审核产能相应扩充;或者审核标准悄悄降低,让吞吐量重新达到平衡。

第一种收场是可见的。第二种要花钱,而且往往没人为此编过预算,因为当初这套工具的商业论证本来就是为了省人力。第三种免费、立竿见影,还不需要任何人做决定。它会自动发生,一个审核者接一个审核者地悄悄选择“扫一眼”而不是“真的查”,因为另一个选择是在人人产出都在涨的季度里,自己变成那个明显的瓶颈。

软件交付是最先暴露这一点的领域,因为这是唯一一个十年来一直在追踪自身返工数据的知识工作门类。DORA2024年度报告给出了这笔交易的确切代价:在其调研样本中,AI采用率每提高25%,交付吞吐量估计下降1.5%,交付稳定性估计下降7.2%,与此同时个体却普遍反映自己“更高效了”。手速更快,交付更慢,故障更多。如果一个早已把交付周期、变更失败率、回滚次数都挂在墙上追踪的领域尚且会滑向这个方向,一个只数“产出多少素材”的营销团队根本没机会察觉。

同样的模式在产出物本身也能读出来。GitClear对数亿行代码变更的分析发现,重复代码块在攀升,而“移动行”(refactor与整合的典型印记)却在减少。复制粘贴取代复用,正是审核环节不堪重负时,产出物会呈现出的样子。

而这一切都不会出现在仪表盘上。起草的文档数、关闭的工单数、合并的代码请求数、交付的素材数,统计的全都是第一阶段。修改轮次、核实过的论断、被废弃的初稿、审核中提出的质疑,统计的才是第二阶段,而在AI到来之前,几乎没有哪家机构追踪过后者。没有基线可比,这是一个衡量方式的失败,而不是质量本身的失败,好在这一种失败更容易补救。

队列模型之上还叠加着一层行为效应。当讨喜的环节变得瞬间完成、而枯燥的环节没有,精力就会往讨喜的环节倾斜。人们开始一次产出好几版草稿,却一版都没认真核对,然后觉得这一天效率很高,因为确实做了更多事,只是其中真正能挑出问题的那部分变少了。

“第二意见”曾经靠摩擦力配给

还有一层更隐蔽的损失。过去请一位资深同事帮忙看一眼工作成果,是要付出代价的:对方的时间、你自己的面子、承认不确定性的那点心理成本。这套机制很粗糙,但它起到了筛选作用——你把这笔“成本”花在真正值得的决策上,其余的自己扛下来,而“自己扛”恰恰是判断力养成的方式。

一个从不拒绝、从不疲惫、也从不显示“正忙”的系统,把这笔成本直接归零。“咨询”不再与事情的重要程度成正比,因为再没有任何东西逼你去做那道权衡。答案以专家建议的节奏抵达,而生成这些答案的系统,其商业评价体系恰恰取决于用户愿不愿意再来——讨人喜欢,正是让用户愿意再来的可靠办法。这不是在指控谁的主观意图,而是一款以用户粘性计分的产品,在结构上必然会选出的行为方式,无论公司里有没有人真的想要这个结果。

AI能不能自己审查自己的产出?

最直觉的应对方案,也最值得用最严苛的方式检验一下。既然生成变便宜了,那就让核查也变便宜:加一道复核、一个“批判者”提示词,或者在流程里塞一个自动审核环节。

审核之所以有效,从来不是因为“多看了一眼”,而是因为第二眼看到的失误方式和第一眼不一样。两个来自不同训练背景的人,漏掉的东西各不相同,所以最终的残余错误率大致等于两个相对独立的错误率的乘积,这也是审核能把错误率压得如此之低的原因。可一旦让同一类系统去做这道复核——训练数据高度重叠、盲区高度雷同——这种独立性就消失了,错误开始“共模”出现。结果是成本翻倍,换来的错误率下降却微乎其微,还多出一份读起来像“已完成审核”的报告。

自动化核查真正擅长的,是那些失败方式是机械性的场景:类型、数据结构、链接是否可达、算术、政策条文是否合规。而恰恰在最需要判断力的地方,它最弱。这正是让人始终留在决策环节内部、而不是站在流程末端盖个橡皮图章这类工作方式的立论所在。

如何衡量AI生产力而不牺牲质量?

给那个枯燥的环节装上仪表,而且要在部署之前就装好。对每一个已经引入AI工具的工作流,先分辨清楚它把哪一步变轻松了,又把哪一步留在原地没动,然后把计数器装在没动的那一步上。具体来说:

  • 审核打回率。提交的工作有多大比例被退回重做?这是你能收集到的最具诊断价值的单一指标,而大多数团队从未收集过它。
  • 每件产出的修改轮次。不是“花了多少时间”,那个数字自己就会虚高。要数实质性改动发生了几轮。
  • 核实覆盖率。一件工作成果里承载关键结论的论断,有多大比例真的被拿去和独立信源对照过?
  • 缺陷外溢率与首次外部缺陷曝光时间。质量问题总是往下游、往后延迟才浮出水面,这也是它们往往在续约决定做出之后才出现的原因。
  • 废弃率。更便宜的生成理应带来更多被扔掉的候选方案。如果废弃率没有变化,说明那些多出来的候选方案全都被直接交付出去了。

然后把每一个指标和它对应的产量指标配对起来看。如果产出翻了三倍,而打回率纹丝不动,那就说明你的审核人员已经不再真的审核了,光是这一组对照就能说明大半问题。这几乎不花什么钱,唯一的成本是先建立基线的自律,而这份自律,和在动工之前先把衡量体系与数据基础打好所需要的是同一种自律。

藏在采购流程之外的风险敞口

还有两件事在叠加放大这个问题。第一,大量职场AI使用是通过个人账号、消费级套餐进行的,这完全落在IT部门的视野和采购流程的管辖范围之外。没人能给出一个可信的占比数字,而这个论点也根本不需要数字支撑:你没法给一个你都不知道存在的工作流装仪表。而且这么用AI的,往往正是那些能力强、responsible(尽职)的员工,因为这个诱惑本身就和能力挂钩:更好的初稿、更快的答案。想靠画像去筛查“高风险人群”,只会筛到错误的那批人。

第二件事是“漂移”,这一段我承认是推论而非实测数据。长期浸泡在同一个模型的语言风格里,很可能会把一名专业人士的表达方式往那个方向拉,即便他从未把任何一段AI生成的文字原样粘贴到任何地方——如果真发生了,也不会留下任何审计记录可供追查。风格层面的后果说起来有点尴尬:一种没人主动选择过的“统一文风”。但真正代价高昂的是分析层面的后果:团队不再去想那个模型给不出来的“第三种方案”,因为前两个方案来得太快,让人误以为搜索已经穷尽了,而产出物本身也不会提示你到底漏掉了什么可能性。

所有这些最终都会汇聚到同一个节点:下一轮预算审议。到时候,AI投入会用“人均产出”去论证其合理性,而KPI目标也会照着这个被抬高的基线重新设定。用第一阶段的指标去续约,等于让明年的团队去扛一个原本只有在跳过核查的前提下才负担得起的产出量,同时还要偿还这些跳过核查所欠下的返工债。这首先是一个衡量体系设计的问题,其次才是工具选型的问题,而且现在这个季度就能解决,不必等到缺陷真正爆出来。

只衡量你调得轻松的那一步,你永远会觉得表现亮眼。衡量你放着不管的那一步枯燥环节,你才会知道这份“效率提升”到底是拿什么换来的。

常见问题

有哪些指标能真正反映AI是否在拖累工作质量?

要看那些绑定在工作流“核查”那一半上的指标:审核打回率、每件产出的修改轮次、承载关键结论的论断中被独立核实的比例、废弃率、缺陷外溢率,以及首次外部缺陷曝光的时间。像“起草文档数”或“关闭工单数”这类产量指标发现不了质量下滑,因为它们统计的正是被AI加速的那一环。要成对着看:如果一个产量指标在涨,而与之配对的审核指标却纹丝不动,那就是信号。

AI带来的质量问题,通常要多久才会体现在数据里?

往往比它本该影响的决策来得更晚,这正是结构性的陷阱所在。生成类指标几乎在工具上线的那一刻就会变化,而缺陷要经过下游使用者、客户和补救工作的层层传导,滞后周期长得多。DORA2024年“随AI采用率上升、交付稳定性反而下滑”的发现,大概是目前最接近“普遍信号”的证据了,但即便如此,这也只是调研样本中的一种关联,而不是一个能按表操课的时钟。应对办法是提前规划这道时间差:假设续约和目标设定的决策会恰好落在这个滞后窗口之内,因此要优先追踪打回率、核实覆盖率这类领先指标,而不是干等滞后指标浮现。

是不是应该直接禁止员工用个人AI账号办公?

预计一纸禁令只会把使用行为转移到看不见的地方,同时把你原本还能掌握的可见性也一并抹掉——这是根据政策若无替代方案时通常的走向做出的判断,而不是实测结果。更管用的顺序是:先提供一个足够好用的官方渠道,好用到没人愿意再费事绕去个人账号,然后把审核环节的仪表装在这个官方渠道里面。你能衡量的那部分风险敞口是可管理的;跑在消费级账号里的那部分,才是既没被衡量、也没被治理的真正敞口。

相关阅读

本文由 Abyshire 专有编辑系统的 AI 编辑角色撰写,并经我们的团队审核。