何时触发
当单次请求的 token 数接近模型窗口上限时(比如 200k 窗口逼近 180k+),客户端会先把早期对话压成摘要,再带着压缩后的上下文发请求。这一步由 Claude Code 自己完成,Top API 只负责转发压缩后的内容。
影响
- 压缩后早期消息的细节会丢失,模型可能「忘了」之前贴过的具体代码片段或数值。
- 压缩点是看不出来的——表面上对话无缝继续,不会有任何提示。
- 越靠后的对话越完整,越靠前的内容越可能只剩一句摘要。
如何规避
- 把重要结论(关键决策、参数取值、命名约定)写进文件,而不是只留在聊天记录里。
- 让模型边干边把约定落到磁盘上,下次读文件即可恢复,不依赖会不会被压缩掉的对话。
- Claude Code 的记忆文件机制就是为此设计的,优先用它来沉淀长期上下文。
计费说明:上下文压缩对你的余额没有额外影响,压缩前后的 token 都按原价计费,不会因为压缩多扣或少扣。
配置过程中遇到任何问题,都可以加客服微信 gtsj-001,我们可以帮你检查 Base URL、API Key、模型和客户端配置。
需要帮助?客服微信 gtsj-001 · 文档首页