prompt 缓存

用量与价格

查看 Markdown

Chat Completions API

缓存 token 会显示在 usage.prompt_tokens_details.cached_tokens

JSON

{
  "usage": {
    "prompt_tokens": 125,
    "completion_tokens": 48,
    "total_tokens": 173,
    "prompt_tokens_details": {
      "text_tokens": 125,
      "audio_tokens": 0,
      "image_tokens": 0,
      "cached_tokens": 98
    },
    "completion_tokens_details": {
      "reasoning_tokens": 0,
      "audio_tokens": 0,
      "accepted_prediction_tokens": 0,
      "rejected_prediction_tokens": 0
    }
  }
}

Responses API

缓存 token 会显示在 usage.input_tokens_details.cached_tokens

JSON

{
  "usage": {
    "input_tokens": 125,
    "output_tokens": 48,
    "total_tokens": 173,
    "input_tokens_details": {
      "cached_tokens": 98
    },
    "output_tokens_details": {
      "reasoning_tokens": 0
    }
  }
}

验证缓存命中

要判断请求是否受益于 prompt 缓存,请检查响应中的 cached_tokens 值:

cached_tokens含义
0缓存未命中 — 整个 prompt 都是从头计算的。首次请求或缓存被逐出后出现这种情况是正常的。
> 0缓存命中 — prompt 前缀的一部分或全部由缓存提供。该数值表示复用了多少 token。
等于 prompt_tokens完全缓存命中 — 整个 prompt 都由缓存提供(较少见,通常发生在重新发送完全相同的请求时)。

在典型的多轮对话中,cached_tokens 会随时间增长:

Text

Turn 1: prompt_tokens=50,  cached_tokens=0    # First request, cache established
Turn 2: prompt_tokens=120, cached_tokens=50   # Previous 50 tokens cached
Turn 3: prompt_tokens=200, cached_tokens=120  # Previous 120 tokens cached

价格

缓存 token 按缓存 prompt token 价格计费,该价格显著低于常规 prompt token 价格。具体费率因模型而异,请查看 价格页面了解当前价格。

token 类型计费费率
prompt token(未缓存)完整 prompt token 价格
缓存 prompt token优惠的缓存 prompt token 价格
completion token完整 completion token 价格
reasoning token完整 completion token 价格

后续内容


最后更新:2026 年 5 月 10 日