
2026年2月3日菲利普·泽利格指出,大语言模型(LLM)智能体成本呈二次方增长,当代码编写智能体上下文长度达50000个标记时,缓存读取成本或占API调用成本一半。
智能体工作原理回顾
代码编写智能体将对话内容发至LLM,在其请求调用工具时循环操作,无工具运行则等用户输入后重启流程,可用代码直观表示其循环逻辑。
LLM调用成本构成
LLM提供商对输入标记、缓存写入、输出标记和缓存读取收费。每次调用从缓存读对话内容,写入上次输出及新输入,输出结果。成本累计呈二次方增长曲线。
成本增长实例
一个普通功能实现对话花费约12.93美元,结束时缓存读取成本占总成本87%,27500个标记时占一半。exe.dev网关记录成本,不同对话成本曲线不同。
成本模拟与思考
构建模拟器,按Anthropic收费标准,20000个标记时缓存读取成本占主导。开发者需权衡减少调用次数省钱与智能体方向偏差问题。
应对策略探讨
部分智能体拒绝大量工具输出返回错误,子智能体和工具可在主上下文外迭代。重新开始对话或更便宜且效果相同,成本、上下文和编排问题待解。
编辑观点:大语言模型智能体成本二次方增长是行业挑战,开发者需在成本与性能间找到平衡,新方法或成破局关键。

545

被折叠的 条评论
为什么被折叠?



