prompt 缓存
用量与价格
Chat Completions API
缓存 token 会显示在 usage.prompt_tokens_details.cached_tokens:
{
"usage": {
"prompt_tokens": 125,
"completion_tokens": 48,
"total_tokens": 173,
"prompt_tokens_details": {
"text_tokens": 125,
"audio_tokens": 0,
"image_tokens": 0,
"cached_tokens": 98
},
"completion_tokens_details": {
"reasoning_tokens": 0,
"audio_tokens": 0,
"accepted_prediction_tokens": 0,
"rejected_prediction_tokens": 0
}
}
}Responses API
缓存 token 会显示在 usage.input_tokens_details.cached_tokens:
{
"usage": {
"input_tokens": 125,
"output_tokens": 48,
"total_tokens": 173,
"input_tokens_details": {
"cached_tokens": 98
},
"output_tokens_details": {
"reasoning_tokens": 0
}
}
}验证缓存命中
要判断请求是否受益于 prompt 缓存,请检查响应中的 cached_tokens 值:
cached_tokens 值 | 含义 |
|---|---|
0 | 缓存未命中 — 整个 prompt 都是从头计算的。首次请求或缓存被逐出后出现这种情况是正常的。 |
> 0 | 缓存命中 — prompt 前缀的一部分或全部由缓存提供。该数值表示复用了多少 token。 |
等于 prompt_tokens | 完全缓存命中 — 整个 prompt 都由缓存提供(较少见,通常发生在重新发送完全相同的请求时)。 |
在典型的多轮对话中,cached_tokens 会随时间增长:
Turn 1: prompt_tokens=50, cached_tokens=0 # First request, cache established
Turn 2: prompt_tokens=120, cached_tokens=50 # Previous 50 tokens cached
Turn 3: prompt_tokens=200, cached_tokens=120 # Previous 120 tokens cached价格
缓存 token 按缓存 prompt token 价格计费,该价格显著低于常规 prompt token 价格。具体费率因模型而异,请查看 价格页面了解当前价格。
| token 类型 | 计费费率 |
|---|---|
| prompt token(未缓存) | 完整 prompt token 价格 |
| 缓存 prompt token | 优惠的缓存 prompt token 价格 |
| completion token | 完整 completion token 价格 |
| reasoning token | 完整 completion token 价格 |
后续内容
最后更新:2026 年 5 月 10 日