prompt 缓存

最佳实践与 FAQ

查看 Markdown

最佳实践

  1. 始终设置 x-grok-conv-id(Responses API 使用 prompt_cache_key)可将请求路由到同一服务器,从而最大化缓存命中率。

  2. 使用稳定的对话 ID — UUID 或应用的会话 ID 都是合适的选择。

  3. 绝不要修改先前的消息 — 只能追加新消息。任何编辑、删除或重新排序都会破坏缓存。

  4. 将静态内容前置 — 将 system prompt、少样本示例和参考文档置于开头,以形成稳定的前缀。

  5. 监控 cached_tokens — 如果始终为 0,请检查对话 ID 和消息顺序。

  6. 妥善处理缓存未命中 — 缓存逐出和路由意味着无法保证缓存命中。应用应能在未使用缓存时正常工作。


支持的模型

prompt 缓存适用于所有 grok 语言模型。请查看 价格页面,了解哪些模型支持缓存及其具体的缓存 token 价格。


FAQ

缓存会影响输出质量吗?

不会。缓存只会加速 prompt 处理阶段。无论 prompt 由缓存提供还是从头计算,模型输出都完全相同。

缓存条目会保留多久?

缓存条目可能因服务器负载或重启而随时被逐出。请使用 x-grok-conv-id 将请求路由到同一服务器,以最大限度延长保留时间。

可以强制触发缓存未命中吗?

可以,使用不同的 x-grok-conv-id,或完全省略该请求头。这会将请求路由到另一台可能没有该 prompt 缓存的服务器。

缓存支持流式传输吗?

支持。prompt 缓存同时支持流式和非流式请求。流中的第一个空 token 对应缓存查找和预填充阶段。

缓存支持 tool call 和 function calling 吗?

支持。可缓存前缀包含截至 tool call 结果在内的所有消息。只要前缀保持不变,后续请求就能受益于缓存。


最后更新:2026 年 5 月 10 日