Agent 成本失控背后:上下文、人工审核与维护成本正在被低估|请回答 WAIC 2026

宾果软件 . 发布于 2026-08-01 09:31:09 . 阅读 18

WAIC 2026 展示了未来的多种可能性


在 WAIC 2026 的展馆里,关于未来的答案比比皆是。


一些展示展示了能够自主操作电脑的 Agent,另一些则讨论了模型的推理能力。还有人试图证明,AI 已经可以进入研发、办公和企业生产系统。


世博展览馆的会议室几乎场场爆满,热门展位前排起长队,社交平台上的大会话题持续升温。模型越来越强、Agent 越来越自主,构成了这届大会最直观的叙事。



Agent 成本问题引发关注


然而,在一个不那么热闹但越来越现实的问题上,人们开始关注这些能力最终要花多少钱。


这不是一个简单的 Token 定价问题。一次普通对话可能只调用一次模型,但一次 Agent 任务背后,往往包含目标理解、任务拆解、信息检索、工具调用、上下文读取、记忆存储和结果验证。任何一个环节出现偏差,Agent 都可能重新规划、重新调用,甚至从头执行。因此,尽管模型单价不断下降,企业的调用总量、基础设施压力和人工维护成本却可能持续上涨。



探讨 AI 在企业中的实际应用


设定这个问题,也与围绕“请回答 WAIC 2026|AI 正在重写什么?”这一主题进行的多场对话有关。这些对话更关心的是 AI 离开展台之后发生的事情:它如何进入企业,如何改变技术系统,又如何改变一家公司计算投入和产出的方式。


在“为了钱包考虑,你必须关注的 AI 基础设施”这场对话中,优刻得 CTO 王凯和焱融科技 CTO 张文涛受邀参与。王凯长期关注云计算、GPU 算力和模型推理服务,张文涛则从 AI 训练与推理存储的角度观察 Agent 基础设施的变化。



Agent 成本失控的原因


讨论从一个看似简单的问题开始:为什么 Demo 阶段看起来成本不高的 Agent,一旦进入企业生产流程,账单就可能迅速失控?


随着对话展开,两位嘉宾谈到的远不只是 Token。他们将这笔账逐渐拆解为任务成功率、上下文膨胀、人工审核、代码维护、多模型编排和企业内部治理。


到最后,问题变得更加清晰:Agent 时代,企业真正需要控制的不是 Token 数量,而是一次有效任务所消耗的全部资源。



Agent 越来越聪明,企业账单为何反而失控?


在大模型调用价格持续下降的同时,企业的 AI 账单却未必同步下降。


原因并不难理解。普通聊天通常只需要一问一答,但 Agent 要完成的往往是一整条任务链:理解目标、拆解任务、调用工具、检索数据、生成内容、检查结果,失败后还要重新规划和再次尝试。随着上下文不断累积,任务链越来越长,计算、存储和人工干预成本也随之增长。


当模型单价不断下降,企业使用 Agent 的总成本为什么还在增加?企业真正应该优化的,究竟是每百万 Token 的价格,还是完成一次有效任务所付出的全部成本?



企业最容易漏算的成本


Token 账单至少是可见的。更难处理的是那些没有直接出现在云平台账单里的隐性成本。


企业最容易忽略三部分成本:人的时间、结果质量和后续维护。AI 生成代码后,企业通常不可能直接将其投入生产。工程师仍然需要进行代码审查、测试、安全检查和结果验收。即使代码最初能够运行,也不意味着它具备长期可维护性。


与此同时,Agent 的记忆和上下文还会持续增长。随着对话历史、任务状态和外部数据不断写入 Memory,每一次模型调用所携带的上下文可能越来越长。如果缺少记忆压缩、摘要提取和缓存机制,同一任务后期的调用成本可能远高于初期。


除了运行成本,企业还需要投入人员构建 Agent 工作流、评价体系和维护机制。AI 生成的代码如果只能继续由 AI 维护,企业还必须建立一套用于评价、更新和纠错的体系,而这些体系仍然离不开人。



AI Coding 不是生成代码,而是重构软件工程流程


AI Coding 被普遍认为是当前落地最快的 Agent 场景之一,但从生成代码到真正投入生产,中间仍然存在很长的距离。


企业要构建 AI 原生的软件开发流程,需要的不只是一个代码模型,而是一整套完整体系:如何拆解需求、如何定义不同 Agent 的角色、如何设计测试、如何评价结果,以及新增功能后能否自动完成回归测试和验收。


只有需求、开发、测试和评价被完整串联起来,AI 生成的软件才有可能保持可控。



多模型不是目的,可替换才是能力


随着模型数量不断增加,企业往往希望同时接入多个模型、平台和 Agent 框架,以降低被单一供应商锁定的风险。


但多技术栈本身也会增加学习、适配和运维成本。企业真正需要的不是为了“多模型”而多模型,而是一套清晰的编排架构。企业应明确不同基础设施层分别提供什么能力、上下层之间以什么接口连接,以及某项服务被替换后,其他环节是否仍能正常运行。


在这种架构下,模型、搜索、存储、网络、支付等能力都可以被服务化调用。企业选择多个供应商,不是为了形式上的分散,而是为了在价格、能力或供应发生变化时,能够以较低成本完成替换。



不要先比较 Token 单价,要先比较任务成功率


当企业面对多个模型时,一个常见问题是:应该选择单价更低但成功率一般的模型,还是选择价格更高但任务完成率更高的模型?


两位嘉宾的答案都很明确:先看成功率。企业引入 AI 的第一阶段,核心问题是任务能否真正完成,而不是完成得是否足够便宜。失败的调用不仅意味着模型费用被浪费,还可能让人沿着错误方向继续重试,而错误判断和反复试错往往是最高的成本。


更合理的路径是,先使用能力较强的模型跑通工作流,证明 AI 确实能够解决问题;随后再拆解流程,判断哪些环节存在“智力过剩”,可以替换成更便宜的小模型、传统程序或固定规则。



企业不能只发一个 Key,然后对使用情况一无所知


当 AI 从个别员工的实验变成企业级工具,成本问题也会逐渐转化为治理问题:谁来承担费用,如何分配预算,是否限制 Token,以及怎样判断一个团队用得过多还是过少。


目前很多企业还处于边使用、边建立规则的阶段。不同团队对 AI 的使用方式差异很大,很难简单按照部门人数或者统一 Token 配额分配预算。


企业至少需要具备用量可见、日志审计、多 Key 管理、限速和限流等基础能力。企业不能只向所有员工发放同一个 Key,之后既不知道谁在使用,也无法在成本异常时关闭“水龙头”。



下一阶段的 AI Infra,不只是 GPU 和存储


企业之外,个人用户也开始面对 AI 订阅叠加的问题。单个平台的月费看起来并不高,但同时订阅多个聊天、编程、图片和视频工具后,长期成本同样不可忽视。


对于大多数个人用户,包月套餐通常比直接调用 API 更合适。模型厂商希望通过套餐降低普通用户使用 AI 的门槛,同时大量用户并不会完全用满额度,因此包月产品往往具有较高的综合性价比。


API 更适合需要自动化调用、批量处理或者构建产品的开发者和“超级个体”。普通用户很少需要直接管理多个模型的 API Key、计费和调用逻辑。


一种更现实的组合是:选择一款最常使用的包月产品,同时保留一个支持多模型、按量付费的平台,用于偶尔调用其他模型。



未来 AI 基础设施的发展方向


在对话的最后,问题回到了 AI 基础设施未来会演变成什么形态。


当前行业变化速度很快,很难准确预测一年后的具体格局。但一个比较确定的方向是,GPU、推理框架、模型和存储之间的兼容性需要进一步提升。目前,不同国产 GPU、推理引擎、模型格式和存储产品仍处于分别发展的阶段,厂商之间的适配成本较高。随着推理需求增长,行业需要更标准的接口,让不同硬件和软件组件可以更容易接入和替换。


未来一年,新一代 AI Infra 的产品形态会逐渐变得清晰。云计算时代形成了计算实例、数据库、对象存储等标准产品,而 Agent 时代也会出现属于自己的基础设施组件。这些组件可能包括 Agent 身份认证、AI 邮箱、支付账户、Key 管理、计量计费、日志审计,以及用于限制 Agent 权限的运行沙箱。


尤其是沙箱。Agent 既需要获得文件、代码、浏览器和企业系统权限,企业又不希望它在缺乏约束的环境中直接运行。如何在赋予能力的同时隔离风险,将成为 Agent 基础设施必须解决的问题。


从这个角度看,AI Infra 的下一阶段并不只是寻找更多 GPU,也不仅仅是降低每个 Token 的推理价格。它需要回答的是:如何让模型、数据、工具和组织流程组合成一个稳定、可替换、可治理,同时能够持续计算投入产出比的生产系统。


Agent 越来越聪明并不必然意味着企业成本越来越低。只有当任务目标被定义清楚、工作流程可以被评价、模型能够被替换、使用成本可以被看见,并且 AI 真正替代了原有环节,Token 单价的下降才可能转化为企业实际成本的下降。否则,企业购买的可能不是生产力,而是一场不断追加预算的试验。