下面是经过验证的实战技巧,可以显著提升体验和降低成本。
充分利用 Prompt Caching
Claude 系列支持 prompt cache,缓存读取价格 ≈ 0.1× 原价。如果你有固定的 system prompt,加上缓存标记:
{
"model": "claude-sonnet-5",
"system": [
{"type":"text","text":"很长的系统提示...","cache_control":{"type":"ephemeral"}}
],
"messages": [...]
}
用量记录 HIT 数字表示本次缓存命中的 tokens,越大越省钱。
流式响应
对于 chatbot 等实时场景,加 stream: true 可以让用户提前看到内容生成,体验更好。
错误重试
建议对 5xx 和 429 实现指数退避重试:初始 1s,每次 ×2,最多 5 次,最大间隔 32s。
限制输出长度
明确指定 max_tokens,避免模型自由发挥导致输出过长 → 成本意外增加。