阅读约 9 分钟

AI智能体开发成本与运行成本:一个AI智能体到底要花多少钱?

AI智能体的成本分为一次性的开发投入和持续的运行账单。本文说明两者各自的驱动因素,给出附带明确假设的示意区间,并介绍如何让单任务成本始终清晰可见。

其他语言版本EnglishالعربيةDeutschEspañolFrançais

AI智能体开发成本分为两部分:一次性的开发成本,取决于系统集成、写入操作和评估工作;持续的运行成本,取决于每个任务的模型调用、人工审核和日常维护。只服务单一流程的智能体是中等规模的项目;需要写入多个业务系统的智能体,则是一项平台级决策。

本文解释每个数字背后的驱动因素,给出附带明确假设的示意区间,并说明如何在正式投入之前测算单任务成本。这些区间只是规划参考,并非报价。真正决定数字的,是您的业务流程、数据状况以及对错误的容忍度,而不是某家供应商的价目表。文中金额均以美元计;如果您以新加坡元或港元编制预算,可按当时汇率换算,换算结果同样只作示意参考,不构成价格。

为什么AI智能体的成本难以估算

聊天机器人回答一次就结束了。智能体则会先做规划,调用工具,读取结果,再决定是否继续。每个任务需要调用模型多少次并不固定,而是取决于输入内容。两张看起来相似的客服工单,可能一张只需三步就完成,另一张却要跑十二步,而后者的处理成本是前者的好几倍。

开发成本难以确定,则是另一个原因。演示版本是最便宜的部分。一个调用模型和一个接口的原型,几天就能搭好。真正昂贵的工作在边缘地带:没有测试环境的系统、彼此矛盾的数据记录、审批界面、权限范围设定、评估、监控,以及写入操作只完成一半时的恢复路径。这些在演示中都看不到,却决定了智能体能否长期在线运行。

团队常犯的错误

最常见的错误,是给模型定价,而不是给业务流程定价。Token是最显眼的费用项,所以预算往往以它为锚点。但在很多流程中,Token并不是最大的成本。人工审核草稿所花的时间、系统集成投入的工程工时,以及模型版本下线后每月的维护工作,通常影响更大。

其他反复出现的错误包括:

  • 把原型当作开发工作的主体,事后才发现投产所需的工作量才是大头。
  • 忽略审核时间。实际上,每一个审批环节都会把模型输出转化为需要付费的人工分钟数。
  • 忘记维护。模型会被弃用,供应商接口会升级版本,每一次提示词修改都需要跑一轮回归测试。
  • 不设上限。一个没有步数限制、也没有单次运行预算的智能体,可能会在一个不断出错的工具上陷入循环,一直消耗费用,直到有人发现为止。
  • 只按日费率比较方案,而真正的差别在于是否包含评估、监控和交接。

估算开发成本的实用方法

从业务流程出发,由内向外估算开发成本。写下智能体需要读取哪些系统、写入哪些系统、要做哪些决策,以及最坏但现实可能发生的错误是什么。开发人员能够据此报价的,是这份清单,而不是选用哪个模型。

开发成本的驱动因素

  • 涉及的系统:每一项集成都需要身份认证、错误处理和测试。没有接口或没有沙箱环境的系统,要么增加工作量,要么必须设置明确的人工步骤。
  • 只读还是写入:让一个只读助手做到安全,远比让一个会修改记录、发送消息或转移资金的智能体做到安全便宜得多。
  • 审批体验:审核人员需要看到拟议的更改、支持该更改的依据,以及在批准前进行编辑的方式。
  • 数据准备:在杂乱的文档上做检索,会产生语气笃定却错误的答案。通常需要先清理某个流程所依赖的那一部分数据。
  • 评估数据集:使用已知正确结果的真实历史案例,再加上对抗性输入,以便在上线前以及每次修改后衡量质量。
  • 可观测性与限制:按次运行的日志、成本追踪、告警和上限设置。
  • 执行模式:简短的请求响应式智能体可以在一次网页请求内完成;长时间运行则需要队列、后台任务进程和检查点。

开发成本的示意区间

以下区间的假设条件是:一支小型资深团队,现有系统具备可用的接口,一个生产环境,并且客户能够提供真实的历史案例用于评估。区间不包括软件许可费、超出该流程自身范围的大规模数据清理,以及需要法律审查的合规工作。这些只是用于预算讨论的数量级,并非价格。

  • 只读助手:基于您自己的文档或一个系统,提供引用来源并配有评估数据集,约8,000至25,000美元。
  • 单流程智能体:在一个系统中起草操作,配有审批环节、审计日志和监控,约20,000至60,000美元。
  • 多系统智能体:具备多项写入集成、持久化执行、按工具划分的权限以及共享工具层,通常在60,000至150,000美元或以上,一般分阶段交付。

要拿到固定报价,需要先界定流程范围、准备样本数据,并以书面形式定义什么是正确结果。缺少这些,任何数字都只是披着价格外衣的猜测。

如何估算单任务运行成本

运行成本最容易按单个任务来推算,再乘以业务量。可以使用一个简单模型:单任务成本等于模型费用,加上工具与接口费用,加上基础设施费用,加上人工审核时间,再加上分摊的每月维护费用。

下面是一个使用占位价格的示例;在使用真实数字之前,请查阅供应商当前的价目表。假设某模型每百万输入Token收费1美元,每百万输出Token收费5美元。一个典型任务调用模型八次,每次发送约6,000个输入Token,接收约500个输出Token。合计为48,000个输入Token,约0.048美元;4,000个输出Token,0.02美元;因此每个任务约0.07美元。如果每月处理20,000个任务,模型费用约为1,360美元。

现在把审核加进来。如果每批准一份草稿需要人工花两分钟,那么20,000个任务每月约需667小时的审核时间。在这个例子里,审核人员的时间远比Token费用高。这正是为什么审批设计既是安全决策,也是成本决策,详见人机协同的AI智能体。

维护与变更成本

即使一切运行正常,也要为经常性工作编列预算。模型版本会下线,替代版本的表现也会不同。所连接的系统会更改接口。真实流量中会出现新的边缘情况,这些情况又会变成新的评估案例。每次修改提示词或更换模型,在发布前都需要跑一轮回归测试。团队通常通过按月的支持协议,或内部工程师固定比例的工作时间来覆盖这部分工作。

会直接改变账单的实施考量

有几项工程决策会直接影响运行成本:

  • 步数限制:限制每次运行的推理步数,让陷入混乱的智能体停下来,而不是不断循环。
  • 单次运行预算:当单个任务的Token用量超过阈值时,停止运行或升级给人工处理。
  • 输出整形:在把体量较大的工具结果送回模型上下文之前,先截断或摘要。
  • 模型路由:分类和信息抽取步骤使用较小的模型,规划或起草步骤才使用较大的模型。
  • 有限重试:只对重试后有可能成功的错误进行重试,并采用退避策略。每一次重试都是又一次付费调用。
  • 用量记录:按步骤记录Token用量,让单任务成本来自数据,而不是估计。
  • 缓存:在供应商支持的情况下,复用已检索的上下文和稳定的系统指令。

取舍

更便宜的模型如果需要更多步骤、更多重试或更多人工纠正,反而可能推高总成本。要衡量的是整个任务,而不是每个Token的单价。

审批环节会消耗审核时间,但能降低事故的预期成本。在出错代价高的地方保留审批,在有证据表明智能体可靠的地方取消审批。

一开始就建设持久化执行、工具调用台账和评估体系,会提高初期开发成本。但等智能体投产后再补上,通常花费更多,因为原型阶段的捷径已经蔓延到整个代码库。将现有系统迁移到智能体一文介绍的分阶段做法,可以让第一阶段保持精简,同时保留这套结构。

来自ImadDhin实践的经验

以下观察来自本门户网站Agent工作区的代码,属于实现层面和代码层面的记录,并非客户成果,也不是生产环境的成本数据。

  • 成本敞口是一项产品决策。免费聊天在服务器端按访客设定次数上限;调用付费外部接口的研究工具,除非访客拥有高级版权限,否则会返回需要付费的响应。昂贵的能力在调用之前就被把关,而不是等账单来了才处理。
  • 计数器需要合适的一致性。使用上限的可靠程度,取决于计数器的更新方式。先读后写的计数器会让并发请求绕过上限,这在审查用AI构建的产品时是常见问题。对于少量免费额度,这或许可以接受;但凡涉及计费或额度点数,都应使用原子递增或事务。
  • 运行在多个环节受到约束。工作流运行时把一次运行限制在固定数量的图步骤内,拒绝超过大小预算的已存储检查点,并在把工具输出返回给模型之前进行截断。每一项限制都拦住一种不同类型的失控。
  • 用量按步骤记录。每个推理步骤都会把模型的用量元数据写入该次运行的事件日志,因此单任务成本可以直接根据记录计算出来。
  • 重试就是支出。研究功能的封装最多尝试三次,遇到限流时遵循供应商返回的重试等待时间,遇到超时和服务器错误时进行退避,而对错误请求和认证失败则从不重试。

需要重点测试的常见错误

上线之前,要像测试回答质量一样认真测试成本表现:

  • 发送异常冗长或具有对抗性的输入,确认每次运行的Token用量仍在上限之内。
  • 让某个工具反复失败,确认智能体会停止或升级处理,而不是陷入循环。
  • 向任何使用上限发起并发请求,确认它在必须守住的地方守得住。
  • 模拟供应商服务中断,检查备用路径的成本和行为。
  • 在运行中途取消任务,确认费用随即停止。
  • 确认您能按每个流程报告单任务成本,而不只是每月账单总额。

何时更简单的方案更好

如果任务总是遵循相同的步骤,那么一个确定性的工作流,加上一次用于分类或起草的模型调用,比智能体更便宜开发、更便宜运行,也更容易测试。如果业务量很低,一个配有好模板的员工可能才是最省钱的选择。

当输入差异大到必须逐个案例决定处理路径,而且业务量高到足以摊薄开发成本时,智能体才物有所值。如果不确定某个流程落在这条线的哪一边,AI Readiness Scan是一种低成本的判断方式,可以在决定开发之前先弄清楚。

为您自己的流程建立成本模型

有用的估算从业务流程、它涉及的系统以及最坏但现实可能发生的错误出发,再把开发成本与单任务成本分开计算。如果您希望围绕实际流程建立这样的模型,请了解AI智能体开发,或带上您的流程和当前业务量,预约一次30分钟通话。

常见问题

影响AI智能体成本的最大因素是什么?

开发阶段,最大的因素是智能体需要写入多少个系统,以及这些写入操作需要多严格的安全处理。运行阶段,人工审核时间和维护往往比模型Token费用更重,尤其是在每个操作都需要审批的情况下。

AI智能体可以拿到固定报价吗?

可以,前提是流程范围已经界定、样本数据已经具备,并且正确结果已有书面定义。在此之前,固定报价要么包含大额风险预留,要么省略了评估、监控和交接。

如何估算每月运行成本?

先估算单任务成本:按供应商价格计算模型调用次数乘以每次调用的Token数,再加上工具费用、基础设施、审核分钟数和分摊的维护费用。然后乘以预期的月业务量,并在影子运行期间用实际记录的用量加以验证。

更便宜的模型一定能降低成本吗?

不一定。如果更便宜的模型需要更多步骤、重试或人工纠正,每个完成任务的成本可能反而更高。应使用您的评估数据集,在完整任务上比较不同模型。

哪些控制手段能让智能体支出保持可预测?

每次运行的步数限制、每个任务的Token预算、截断的工具输出、仅针对可重试错误的有限重试、按步骤记录用量,以及单任务成本出现偏移时的告警。

围绕真实业务流程建立成本模型

带上一个流程及其当前业务量,了解主要的开发与运行成本驱动因素。

预约30分钟通话

范围明确的开发项目,包含评估、审批、审计记录和成本上限。

了解AI智能体开发

判断一个流程需要的是智能体,还是更简单的自动化。

进行AI Readiness Scan

延伸阅读