你公司的 AI,到底是在创造利润,还是放大成本?
原文作者:Mocha · 原文来源:今日头条
本文为作者本人文章的站内同步版本。
很多公司已经开始大规模采购 AI 工具、接入大模型、搭建 Agent。
后台的数据看起来也很热闹:
调用量不断上涨,Token 消耗越来越高,接入的员工越来越多,AI 生成的内容也越来越多。
但这些数字并不能回答一个最关键的问题:
AI 用得越来越多,究竟意味着公司效率提高了,还是意味着公司的技术账单变贵了?
判断一套 AI 系统有没有价值,不能只看它“运行了多少次”,而要看它最终“完成了多少工作”。
OpenAI 提出了一个值得企业关注的衡量思路:
Useful Intelligence per Dollar。
可以将它理解为:每美元有效智能。
它关注的是,公司投入一单位成本后,究竟换回了多少可靠、合格、可以直接进入业务流程的工作成果。
这或许才是企业评估 AI 投资回报时,真正应该计算的一笔账。

调用次数,不等于完成工作
企业在评估 AI 时,很容易陷入一种误区:
把调用量当成工作量,把内容生成量当成生产力。
但一次模型调用,只能说明系统执行过一次。
它不代表任务已经完成,更不代表结果能够直接使用。
一项工作真正被 AI 接走,至少要经过三个层次。
第一层,任务顺利执行完成。
Agent 没有报错,工作流没有中断,系统也确实返回了结果。
这只是最基本的要求。
第二层,结果符合质量标准。
AI 不仅要给出答案,还要保证答案准确、完整,并符合企业内部的业务规则。
以客服场景为例,AI 是否正确理解了客户的问题?有没有遗漏关键信息?给出的解决方案是否符合公司的服务规范?
第三层,结果可以直接投入使用。
后续员工不需要重新核对所有资料,也不需要重新完成一遍判断,就可以直接采用 AI 的处理结果。
比如,AI 根据客户的历史对话生成了一张工单。
客服人员打开后,不需要再次翻阅全部聊天记录,就能确认问题判断准确、信息填写完整、处理建议符合规定,并直接继续处理。
只有走到这一步,AI 才真正替员工完成了这项工作。
因此,企业真正应该统计的,不是 AI 执行了多少次,而是:
AI 成功交付了多少项达到业务质量标准的任务。
不同业务,对“成功任务”的定义也不同。
在客服部门,它可能是一个被真正解决的客户问题。
在研发部门,它可能是一次通过测试并进入交付流程的代码修改。
在法务部门,它可能是一份按时完成、风险识别准确的合同审查结果。
当企业开始用“成功任务”而不是“模型调用”作为统计单位,AI 的真实产出才会逐渐清晰。
便宜的模型,不一定带来更低的成本
算清楚产出之后,还要重新理解 AI 的成本。
很多企业计算 AI 投入时,最先统计的通常是几项显性费用:
模型 API 费用、软件订阅费用、Token 消耗和服务器成本。
这些数字确实重要,但它们并不是全部。
在实际业务中,AI 还会产生大量容易被忽略的隐性成本。
例如,员工需要花时间准备资料、整理上下文、描述任务要求;
AI 给出结果之后,员工还要进行审核和核对;
结果不准确时,需要人工修改和返工;
任务执行失败时,还要重新提交和多次重试;
工程团队需要投入时间接入系统、维护工作流、排查异常;
如果错误结果进入业务流程,还可能带来延误、投诉、合规问题和其他风险。
所以,企业真正需要回答的不是:
调用一次模型要花多少钱?
而是:
得到一个符合质量标准的最终结果,总共要花多少钱?
可以用一个简单的公式来理解:
成功任务成本 = 完整成本 ÷ 合格任务数
这里的“完整成本”,不仅包括模型费用,也要包括系统费用、人工审核、修改、重试、返工和异常处理所产生的全部投入。

举一个报销审核的例子。
某家公司准备使用 AI 检查员工提交的报销单。
模型 A 每处理一张报销单只需要一元,看起来非常便宜。
但它只有一半的结果可以直接使用。其余报销单仍然需要财务人员逐项检查,每张平均花费十分钟。
模型 B 每次处理需要三元,单次价格是模型 A 的三倍,但它有九成结果能够直接使用,财务人员只需要处理少量异常情况。
只比较 API 单价,模型 A 显然更便宜。
可一旦把人工检查、错误修改、任务重试和返工成本全部算进去,模型 B 的实际成本很可能更低。
原因并不复杂。
公司真正需要的,从来不是一次便宜的模型调用,而是一张已经完成准确审核、可以进入后续付款流程的报销单。
模型只是完成这项工作的其中一个环节。
准确率很高,为什么员工还是不敢用?
除了产出和成本,企业还必须关注第三个问题:
AI 给出的结果,员工究竟敢不敢直接使用?
很多团队习惯用“准确率”描述模型效果。
例如,某个系统的准确率达到了 90%。
这个数字听起来不错,但它并不足以说明 AI 已经具备生产价值。
如果剩下的 10% 错误没有任何规律,员工无法提前判断哪些结果可能出错,那么每条结果仍然需要人工重新检查。
即使模型平均准确率很高,只要人类必须对所有结果进行复核,AI 就没有真正承担完整工作。
从企业应用的角度看,AI 的处理结果更适合被分为三类。
第一类:可以直接使用
AI 已经完整完成任务,结果准确、信息完整,也符合公司的业务规范。
后续人员无需再次判断,可以直接采用。
这部分任务,才是 AI 真正创造出来的新增产能。
第二类:需要人工修正
AI 已经完成了大部分工作,但结果仍然存在遗漏、偏差或格式问题,需要员工继续补充和修改。
例如:
客服回复的整体方向正确,但漏掉了一项关键信息;
AI 修改了代码,但代码没有通过测试;
合同中的风险点被识别出来了,但引用了错误的条款。
对于这类结果,企业不能简单地把它们计入“已完成任务”。
还需要进一步统计:
员工平均要花多长时间修改?
每次需要调整多少内容?
修改过程中是否还需要专业人员重新做出判断?
如果人工仍然需要重新理解任务、重新判断结论,那么 AI 只是提供了一个初稿,并没有真正接管工作。
第三类:必须交给人
有些任务 AI 无法处理,或者当前场景不适合继续自动执行,必须及时升级给人工。
很多企业认为,升级给人意味着 AI 能力不足。
实际上,恰当的人工升级机制恰恰是系统可靠性的一部分。
一个可靠的 AI,不仅要知道自己能做什么,也要知道自己在什么时候应该停止。
如果 AI 完全不了解能力边界,遇到任何问题都强行给出答案,看起来自动化率很高,实际风险反而更大。
因此,企业需要关注的不是“AI 参与了多少工作”,而是:
AI 最终接管了多少工作。
假设系统处理了一百项任务:
其中有多少可以完全交给 AI?
有多少只需要员工做少量修改?
又有多少最终仍然需要员工从头完成?
这项数据可以被称为 任务接管率。
它比员工使用率、AI 活跃率或者模型调用量更接近业务真实价值。

真正有价值的 AI,不只是会做难题
一个 AI 偶尔完成一次极其复杂的任务,很适合拿来做产品演示。
但这并不意味着它已经成为企业生产力。
企业真正需要的是,AI 能够在真实工作环境中,持续、稳定、可控地处理大量任务。
模型能力强,可以吸引员工进行第一次尝试。
但是,只有结果足够可靠、流程足够稳定、异常可以被及时识别,AI 才能长期进入业务系统。
这也是为什么,一套模型在测试环境中表现优秀,并不意味着它进入生产环境后就一定有价值。
测试通常关注模型“能不能完成”。
生产环境更关注模型“能不能持续完成”“能不能稳定完成”,以及“出错时能不能控制风险”。
能力决定 AI 能不能进入业务。
可靠性决定 AI 能不能留在业务里。
AI 用得越多,价值就一定越大吗?
当企业开始扩大 AI 使用规模后,还需要计算最后一笔账:
这套系统是否具备规模经济?
很多管理者看到 AI 调用量持续增长,就会自然地认为 AI 创造的价值也在同步增长。
但使用量和价值之间,并不存在必然关系。
假设一家公司的 AI 调用量增长了三倍,总成本也增长了三倍,但真正达到质量标准的工作成果只增长了一倍。
这意味着,公司扩大的是 AI 的消耗,而不是 AI 的产能。
健康的规模化应该呈现出另一种状态:
随着使用规模扩大,合格工作成果的增长速度快于完整成本的增长速度;
系统处理的任务越来越多,但结果质量没有明显下降;
人工审核、返工和异常处理的比例逐渐降低;
每个成功任务的平均成本持续下降。
换句话说:
AI 用得越多,每一块钱就应该完成更多工作。
这才是真正的规模经济。
相反,如果 AI 使用量增长以后,员工需要检查的内容更多、系统重试次数更多、返工成本越来越高,那么扩大规模只会加快烧钱速度。

企业上 AI,至少要满足两条标准
一套 AI 系统是否属于正向投入,可以归结为两个判断标准。
第一,AI 创造的合格工作价值,要高于完成这些工作的完整成本。
这说明系统当前已经产生了正向回报。
第二,随着使用规模扩大,结果质量仍然稳定,单个成功任务的成本持续下降。
这说明 AI 创造的价值不仅存在,而且可以被健康地放大。
过去,企业购买软件,本质上是为员工提供一套工具。
因此,管理者习惯统计账号数、活跃用户数、使用频率和续费率。
但当 AI 开始直接承担工作以后,衡量方式也必须改变。
企业需要关注的,不再只是有多少员工正在使用 AI,而是:
AI 能否稳定交付一项项真实工作?
这些工作是否达到了业务质量标准?
完成这些工作的完整成本是多少?
有多少任务已经不再需要员工重新处理?
AI 的使用规模扩大后,单位产出成本有没有降低?
这些指标,才真正决定 AI 是生产力工具,还是一项不断扩大的技术开支。
结语
判断一家公司的 AI 到底是在赚钱,还是在烧钱,最后仍然要回到一个最朴素的问题:
公司每花一块钱,AI 究竟替企业完成了多少可靠、合格、可以直接使用的真实工作?
不要只看调用量,也不要只看模型价格。
不要只统计生成了多少内容,也不要被一个笼统的准确率说服。
企业真正需要计算的是:
成功完成了多少任务,完成这些任务投入了多少完整成本,以及这种效率能否随着规模扩大而持续提升。
只有把这笔账算明白,企业对 AI 的投入,才不再是一场依赖感觉和热度的尝试。
