高级 API 用法Prompt 缓存复制给 LLM复制中...已复制复制失败 查看 Markdown创建 API Key 了解 Grok 4.7 当连续请求的起始消息相同时,xAI API 会自动缓存这些消息。下一次请求中,开头完全匹配的消息会直接由缓存提供:更快的首个 token 响应时间 — 模型无需重新计算已缓存的消息更低的成本 — 缓存 token 按较低费率计费本节内容工作原理 — 了解缓存如何从 messages array 的开头开始工作最大化缓存命中率 — 配置 x-grok-conv-id 和 prompt_cache_key,实现最优缓存效果哪些情况会破坏缓存 — 导致缓存未命中的常见错误用量与价格 — 读取缓存 token 计数并了解计费方式最佳实践与 FAQ — 提示、支持的模型和常见问题最后更新:2026 年 3 月 16 日上一篇速率限制下一篇工作原理