返回首页 TOP API DOCS 开 发 文 档
文档/模型学习/调用最佳实践
TOP API DOCUMENTATION

调用最佳实践

提示词模板 · 缓存策略 · 错误重试

下面是经过验证的实战技巧,可以显著提升体验和降低成本。

充分利用 Prompt Caching

Claude 系列支持 prompt cache,缓存读取价格 ≈ 0.1× 原价。如果你有固定的 system prompt,加上缓存标记:

{
  "model": "claude-sonnet-5",
  "system": [
    {"type":"text","text":"很长的系统提示...","cache_control":{"type":"ephemeral"}}
  ],
  "messages": [...]
}

用量记录 HIT 数字表示本次缓存命中的 tokens,越大越省钱。

流式响应

对于 chatbot 等实时场景,加 stream: true 可以让用户提前看到内容生成,体验更好。

错误重试

建议对 5xx 和 429 实现指数退避重试:初始 1s,每次 ×2,最多 5 次,最大间隔 32s。

限制输出长度

明确指定 max_tokens,避免模型自由发挥导致输出过长 → 成本意外增加。