Anthropic官方省钱方案全解读 | 搭配接口AI省一半Token

Category: Technical ExchangePublished:建议阅读时长:13分钟
Author: sodope llm

9 月 8 日,Lance Martin 在 Claude 官方博客发了一篇 Reducing cost and improving performance with Claude Platform,把降本做成三招,还打包进一个 claude-api skill。官方拿四组基准跑了一遍,省幅在 52% 到 73% 之间,通过率不受影响。这三招省的是同一份官方价目表下的开销。搭配接口AI,能剩一半的钱。

第一招,把缓存命中率提上去

Claude 处理输入时最贵的环节是 prefill,把提示词转成模型内部的 KV 状态。命中缓存的部分可以直接读回来,不用重算,官方对缓存读取按输入价的一个零头计费。看接口AI 现在的价目表,claude-sonnet-5 输入每百万 token 2 美元,缓存读取 0.2 美元,claude-haiku-4-5 输入 1 美元,缓存读取 0.1 美元。差出来的这部分就是缓存的价值。

难的地方在于缓存很脆。官方列了几种最常见的失效方式。

对话中途改 effort 或 thinking 设置会让缓存断掉,因为这些参数排在正文前面,属于缓存前缀的一部分。Opus 5 和 Fable 5.1 是两个例外,支持在不破坏缓存的前提下中途换 effort。系统提示里塞时间戳、请求 ID 这类每次都变的值,等于每轮都在写新缓存。工具定义换了顺序也不行,工具渲染在提示词最顶部,任何改动都会让整条前缀作废。子代理和分支会话各自分叉,前缀、模型、effort 三者只要有一项不同,缓存就没法共享。还有一种更隐蔽,同步工具调用一旦阻塞,或者子代理拖过了缓存有效期,下一轮就要按写入价重算。5 分钟缓存收正常输入价的 1.25 倍,1 小时缓存收 2 倍。

官方给的对策也都是具体的。在 Claude Console 里盯命中率,或者用缓存诊断 API 看两次请求到底从哪里开始分叉。不常用的工具用 defer_loading 标记,让它们不进缓存前缀,等用到时再加载。系统提示要改,就走对话消息改,别动原文。静态内容放前面,对话往后追加。模型和 effort 的切换挑缓存本来就失效的时刻做,比如上下文压缩的时候。另外可以开自动缓存、用 max_tokens: 0 配合显式断点预热,跑长任务的代理换成 1 小时 TTL。

在接口AI 上还有一条要留意。其计费说明里专门提过,Claude 的 Prompt Caching 如果没有命中,会按缓存输入价计费,可能比普通输入更贵。命中率没跑通之前,缓存配了反而会推高账单。缓存写入与缓存读取单独计价,官方资源档与 Anthropic 的价目一致,低价档同比例下调,claude-haiku-4-5 低价档的缓存读取低到每百万 0.02 美元。第一招省下来的钱,在它的计价口径里能原样过账。

第二招,清掉提示词里的老习惯

官方把提示词反模式列了六类,都是为老模型打的补丁,放到新模型上会让它变啰嗦、变贵。

第一类是验证仪式,「double-check your work」「verify twice before responding」这类话,模型会照字面执行。第二类是强调词,「be maximally thorough」「YOU MUST ALWAYS」会换来更长的输出和更多工具调用。第三类是强制步骤和草稿板脚手架,模板会和模型自带的推理流程叠加。第四类是过时的 few-shot 例子,教出了一堆用不上的长推理链。第五类是互相矛盾的规则,新模型会更严格地照做,结果反而更差。第六类是过期配置,手写的 thinking budget 可能直接被 API 拒绝。

省多少有实测。在一个客服类基准上把 Opus 4.8 迁到 Opus 5,跑一遍官方 skill 里的 /claude-api prompt-audit,成本降了 14.6%,准确率平均升了 5.3%。官方还附了几个翻车案例,一个已经退休的 thinking 设置让所有路由请求被拒;互相矛盾的退款规则让 Opus 5 少退了四笔该退的钱;草稿板和内置思考打架,工具调用被写在推理里,最后没有执行。

第三招,校准 effort

effort 决定模型愿意花多大力气,两个方向都可能错。开高了会过度思考,超出证据能支撑的范围;开低了会过早收手,拿到第一个结果就交卷,而不是去找第三个。

官方的数字很直接。Fable 5 在 FrontierCode Diamond 上,low effort 花 5.35 美元一题拿到 11.5%,max effort 花 19 美元拿到 30.9%,成绩涨 2.7 倍,成本涨 3.5 倍。Fable 5.1 在 Humanity’s Last Exam 上,low effort 约 53% 花 0.3 美元一题,max effort 约 61% 花 2.23 美元,最后那一档多花 46% 的钱只换来半分左右的提升,落在运行间波动里。CursorBench 3.2 上的对比更划算,Fable 5.1 在 low effort 下追平了 Fable 5 的 high effort,成本只有三分之一。

判断一个任务要不要调 effort,官方给的方法也简单。把 effort 从低扫到高,如果成本性能曲线是平的,说明这个任务不受思考深度影响,往上加钱没有意义。

官方自己跑出来的账

省钱的活官方也做成了自动化。/claude-api cost-optimize 先分析 token 花在哪里,可以从 Admin API 用量报告、每次响应的 usage 字段,或者读请求构造代码入手,然后按收益排序,缓存排第一,后面依次是裁 payload、限制输出、把不需要实时返回的活送去批处理。

基准省幅主要手段
LegalBench约 58%共享前缀缓存、low effort、Batch API
tau2-bench retail约 73%显式缓存断点
OfficeQA Pro约 52%批处理加文档缓存,136.20 美元降到 64.87 美元
SWE-bench Verified约 55%medium effort、缩短输出,步骤中位数从 29 降到 17

三个命令的使用顺序官方也给了建议。刚迁到新模型,先跑 prompt-audit;想审整笔开销,用 cost-optimize;手里有评测集、想做一轮成本与性能的迭代搜索,用 hillclimb。同一组客服基准上,Opus 5 配 low effort 加 prompt-audit,训练集准确率 98.9%,每张工单 2.6 美分;Sonnet 5 配 low effort 只要 1 美分,但准确率掉到 88.9%,补上路由规则和退款上限的交叉引用后回到 98.9%。留出的 14 张工单上,前者 90.5%,后者 78.6%,成本约为前者的五分之一。

省上加省

三招省的是消耗。接口AI的官方资源档比 Anthropic 略低。低价档带 -r、-dd、-cc 后缀,价格依次走低,拿 claude-sonnet-4-6 做例子,输入价从每百万 3 美元降到 0.6 美元,代价是不承诺 SLA,官方资源档承诺 99.5% 可用性,生产负载走这一档。

两边的账可以叠。官方三招的省幅是消耗侧的降幅,走官方资源档时原样适用;企业订阅包按官方标价 75 折,特惠资源包约八折,叠上去账单落在原价的四成上下。

有一条要注意,其计费说明里专门提过,缓存未命中会按缓存输入价计费,可能比普通输入更贵,命中率没跑通之前,缓存配了反而推高账单。想要更低的单价还有两套月包,特惠资源包 Lite 档 2000 万融合 token 每月 15.9 美元,企业订阅包 Basic 档 5 亿融合 token 每月 375 美元,带 99.5% SLA、200 个席位和企业开票,付款支持支付宝直接充值。

落地的顺序

三招有先后。缓存收益最大,先做,把命中率和缓存诊断跑起来,把工具定义和系统提示里的易变值清干净。然后跑 prompt-audit 清提示词,这一步在迁移新模型之后做收益最明显。最后扫 effort,只要曲线是平的,就把档位降下来。都做完再考虑档位和套餐采购,这时候你手里有真实的用量结构,谈价格才有依据。

有一个细节容易踩坑。Claude 4.7 以后换了一套分词器,同样的文本会比老版本多出约三成 token。比价时别只看每百万 token 单价,得按实际 token 量算。

省一半这句话拆得开。官方四组基准的省幅是 52% 到 73%,计价口径这一层再叠上去,账单还能往下走一截。要做的事不复杂,先把缓存和提示词收拾干净,再去谈价格。

Share:
Contact Us