EN FR ES PT DE AR 中文

自建AI还是云端AI:你正在租用本可自有的推理能力

激进量化已把能打的开源权重模型从数据中心级压到了笔记本级。对越来越多的企业任务而言,「该签哪家前沿厂商」已经是一个问错方向的开场问题。

多数AI采购都从「该签哪家厂商」问起。这个开场问题问错了方向,而自建AI与云端AI的成本对比正是原因所在。按token计费的账单,是运行一个模型时最显眼、却也最无趣的成本,因为账单背后越来越多的工作,已经不再需要别人家的数据中心。

跟着机制走,因为这里没什么玄机。模型的权重就是一堆数字,每个数字用多少比特来存,是一个工程选择,而非物理定律。每权重十六比特一直是默认的工作配置。围绕激进量化的研究,包括已公开的三值权重模型工作——把每个权重限制在三种状态,正把这个数字往两三比特的方向拽。

自己动手把算术算一遍,因为这道算术就是全部论点。取一个270亿参数的模型。每权重十六比特时,权重约54GB,意味着服务器级硬件。降到约1.58比特,落到6GB附近。降到一比特,接近3.5GB。这些是从参数量和比特宽度推算出的示意数字,并非任何具体发布版本的基准结果,真实构建还有这道算术忽略掉的额外开销。经得起这些附注的,是数量级。

一个6GB的文件,能舒舒服服装进一台中端笔记本。一个3.5GB的文件,能装进一部当下的手机。任何能跑在手机上的模型,都能跑在你员工早已随身携带的每一台笔记本上,也能跑在你机架里每一台闲置的服务器上。

该怎么比较自建AI与云端AI的成本?

别用月度账单除以token数来比。那种比法是在替API说好话,因为它只给API所收费的那一项定了价,其余全在计价表之外。文档一出你的边界,就带上了出口流量和数据驻留的暴露。长提示会烧掉你要付两遍钱的重试和上下文超限。一个你已经围着它搭好工作流的模型,可能按厂商的节奏、而非你的节奏被弃用,或被改写条款。

自有硬件把这个形状反了过来。资本支出固定且已知,单次请求的边际成本接近于零,而且没有任何东西越过你的边界。取代成本成为约束条件的,是能力方差:压缩后的模型在一条任务带内可靠,出了这条带就不可靠,而这条带比营销说辞窄得多。为你自己的业务负载把这条带准确地画出来,才是AI采购与技术战略中真正的手艺,是一件不出彩、却无可替代的活儿。

公布的保留率数字里有个陷阱,值得点破。当厂商报告说它的压缩版本保留了满精度基准均分的九成多,那读起来像是一笔不重的税。均值掩盖分布。在一套混合测试上掉五个点,可能是在你流程所依赖的那一项单一能力上崩掉二十个点,再由你根本不跑的那些任务上的零损失来抵平。没有任何公布的均值能告诉你,你买到的是哪一种,所以你只能从自己的数据里凑出一套评测集,亲自去测。

哪些任务仍然值得用计费API?

把问题重构一下,答案就不再是一个厂商名字,而变成一份清单。分类、抽取、脱敏、路由、内部文档摘要和初稿起草,全都是自有模型的候选任务。长跨度的智能体化工程——系统要跨几十个步骤做规划、还要从自己的错误里恢复——则不是,至少现在还不是。

凡是指望靠一份排名来了结此事的人,都该看看这些排名彼此之间有多不一致。像LMArena这样的公开评测竞技场把榜单按类目拆开,同一批模型在文本、代码、视觉和网页开发上占据的位置差异显著。这种分化所携带的信息,比任何一个头名位置都多。能力是因任务而异的,这让「最佳模型」在成为一个采购错误之前,先就是一个范畴错误,而一份锚定在某个复合数字上的多年期承诺,锚定的是一个从未在衡量你这份工作的东西。这也正是就绪评估该放在动工之前、而非合同之后的原因。

厂商声望作为代理指标也好不到哪去。融资轮次和创始人履历,定价定的是市场对某个实验室未来的预期,而非对它上个月交付出的那个模型的度量,而这两者早已多次背离,以至于把估值读作技术领先的证据,本身又是一种范畴错误。真正的优势会在你的评测集上现身。如果它只在融资公告里现身,那你买到的是一套叙事,而不是一项能力。

安全这条理由指向同一方向,但只到某一点为止

这里我要对自己的论点反戈一击。把推理搬到内部会收窄你的数据暴露面,这值得拥有,但它修不好提示注入。一旦模型读取不可信的邮件、网页或附件,并且随后能采取行动,数据与指令之间的边界就成了你的攻击面,而无论权重是躺在你的机架里还是别人的机架里,它都还是你的攻击面。本地部署在不触及注入本身的前提下限制了数据侧的爆炸半径,这是一个真实的好处,也是一个比「主权」话术所暗示的要窄得多的好处。这正是为什么智能体系统需要经过设计的隔离,而不是换个托管方。

预期这种不对称会先扩大、再收窄。自动化攻击工具随可用算力一起扩张,而与之对应的防御性修复,往往是在构建这些模型的组织内部开发并留在内部的。把这读作一个去设计你自己可控的隔离的理由,而不是一个坐等厂商替你解决的理由。

更大的信号在于:那些在商业上举足轻重的发布,正从聊天界面漂向基础设施。中国科学院计算技术研究所的「启蒙」(QiMeng)项目称,其系统在五小时内自动完成了一款工业级RISC-V CPU设计,且流片后的芯片能运行Linux。这是研究团队的说法,而非独立复现,这个附注很重要,但它所描述的雄心,瞄准的是底层基座。

今年签下多年期AI承诺的公司,是在把一套成本结构和一份依赖画像,钉死在一条正在其脚下移动的技术基线上。你能跑的最便宜的推理,是你已经拥有的那份推理,而要诚实地弄清你的工作有多大比例够得上这个条件,唯一的办法是在签任何东西之前,先用你自己的数据测一遍。

常见问题

本地跑AI模型真的比按token付费更便宜吗?

对于稳定、高量、定义清晰的任务,通常是的,因为自有硬件的资本支出固定、每次请求的边际成本接近于零。对于波动大、低量或真正吃重的推理工作,计费API一般更便宜,否则你等于买下了能力却让它闲置。盈亏平衡点取决于你的请求量和利用率,而不取决于任何公布的价格对比。

在本地跑一个量化模型,到底需要什么硬件?

这完全取决于压缩后的体积。一个4到8GB区间的构建,能舒舒服服装进一台现代开发者笔记本或一块中端GPU。不过真正的约束很少是模型文件本身,而是并发:同时服务二十个用户,所需的显存和吞吐要比一个人在工作站上测试高出一大截,而这恰恰是多数试点忘了去预估的那个数字。

在本地跑模型能防住提示注入吗?

不能。提示注入利用的是模型无法可靠区分不可信内容与指令这一事实,而这个缺陷会随模型跑到哪里就跟到哪里。本地部署限制的是攻击一旦得手后哪些数据能离开你的网络,它缩小的是后果,而非移除漏洞本身。你仍然需要工具权限边界、输出校验,以及在有后果的动作上加人工确认。

相关阅读

本文由 Abyshire 专有编辑系统的 AI 编辑角色撰写,并经我们的团队审核。