Claude 最近分享了一套很值得借鉴的方法论:
AI 应用里,成本和性能不一定是二选一。
真正的问题往往不是“模型太贵”,而是:
你有没有让模型把算力花在真正需要的地方。
Anthropic 给出的思路可以浓缩成三件事:
1. 能复用的,不要重复算
很多 AI 应用每次请求都会带上一大段相同的系统提示词、工具定义、文档和上下文。
这些内容明明没变,却被反复处理。
解决办法就是 Prompt Caching:
把稳定、重复出现的内容放在可缓存的前缀里,后面的请求直接复用;动态内容、临时指令、低频工具则尽量不要污染这个稳定前缀。
这样做的意义很简单:
不是让模型少干活,而是别让它把已经干过的活再干一遍。
在 Anthropic 的 tau2-bench retail 测试中,仅通过优化缓存策略,成本下降约 72%,通过率基本保持不变。
2. 别把上一代模型的“补丁”一直留给下一代模型
这是我觉得最有意思的一点。
以前模型能力没那么强,我们经常在 Prompt 里写:
“再检查一遍。”
“务必彻底。”
“严格按照六步执行。”
“必须先搜索三个来源。”
“输出前再次验证。”
这些指令当时可能有用。
但模型升级以后,它们可能已经变成了 Prompt 技术债。
因为更强的模型本身就会推理、检查和调用工具。
你再强制它重复检查,可能就变成了:
多一次搜索、多一次工具调用、多一轮推理、多花一笔 token。
更麻烦的是,旧 Prompt 里还可能存在互相冲突的规则,模型能力越强,反而越可能认真执行这些规则。
所以 Anthropic 提供了 prompt-audit:
先审计旧 Prompt,再决定哪些指令真的还需要。
在一个客服场景的测试里,清理这些旧的 Prompt anti-pattern 后:
成本下降 14.6%,准确率提高 5.3 个百分点。
这其实给 AI 应用一个很重要的提醒:
模型升级了,Prompt 也应该升级。
不要把一年前为了“管住模型”写的所有规则,原封不动地带到新模型上。
3. 不要默认所有任务都开最大算力
第三个问题,是很多 Agent 系统都会遇到的:
模型越努力,真的就越好吗?
不一定。
简单的问题,如果每次都让模型高 effort、多轮推理、多次搜索,当然更贵,而且可能根本没有收益。
反过来,复杂问题如果 effort 太低,模型可能看完第一个搜索结果就下结论,答案看起来完整,实际上信息根本没收齐。
所以真正应该优化的不是:
“永远用最强模型。”
而是:
“让任务难度和模型投入的算力匹配。”
Anthropic 的 hillclimb 就是在做这件事:
把不同模型、不同 effort、不同 Prompt 配置组合起来跑评测,看看什么配置能够用更低的成本达到甚至超过原来的效果。
一个客服 benchmark 中,最终找到的优化配置成本约为原来的 1/5,准确率则从 78.6% 提高到 90.5%。
也就是说:
便宜配置不一定意味着性能下降。
关键是找到“刚刚够用”的配置。
所以把这三件事放在一起,其实就是一套很完整的 AI 成本优化方法:
第一层:减少重复计算。
Prompt Cache,把已经算过的东西复用起来。
第二层:减少无效工作。
Prompt Audit,把上一代模型留下来的冗余指令、重复检查和冲突规则清掉。
第三层:减少过度计算。
Model + Effort Routing,让简单任务少花算力,复杂任务把算力用在刀刃上。
Anthropic 进一步把这些思路放进 cost-optimize 工作流。
在四个公开 benchmark 上,报告的成本下降幅度大约在 52%–73%,同时没有观察到明确的整体性能退化。
所以我觉得,这套方法最值得记住的不是某一个“省 72%”的数字。
而是一个更普遍的原则:
AI 成本优化,不只是换便宜模型。
真正应该优化的是:
重复计算 → 无效指令 → 过度推理。
而模型越强,这件事反而越重要。
因为以前为了让模型做好一件事,我们会不断给它加规则。
现在模型越来越强,下一步可能不是继续加 Prompt,
而是:
删掉那些模型已经不需要的东西。
这可能才是 AI 应用从“能跑”走向“高性价比”的关键。
你现在的 AI Agent / Claude Prompt 里,还有哪些规则是几个月甚至一年前留下来的?