高级 API 用法

优先处理

查看 Markdown

优先处理会为 xAI API 请求提供更高的调度优先级,通常可缩短首 token 时间(TTFT)和 token 间延迟(ITL),在高需求时段尤其明显。将 service_tier: "priority" 添加到任意请求正文即可启用,无需预留容量或提前配置。该参数支持文本推理 endpoint:聊天补全和 Responses。

有可用的优先处理容量时,请求会排在标准流量之前。响应始终包含 service_tier 字段,指示是否获授优先处理;请据此确认。


工作原理

service_tier 字段添加到任意受支持的请求。API 会在响应中返回实际使用的层级,以便确认升级是否生效。

service_tier 字段接受以下值:

含义
"default"标准处理,与完全省略该字段相同。
"priority"以更高的每 token 价格请求更高的调度优先级。

优先处理请求按更高的每 token 费率计费。在应用优先处理倍数前,缓存输入 token 仍可享受缓存折扣。有关各模型当前费率和确切优先处理加价,请参阅 价格页面。


快速开始

在请求正文中传入 service_tier: "priority"。响应中包含 service_tier 字段,用于确认实际使用的层级。

curl https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain the Riemann hypothesis in one paragraph.",
    "service_tier": "priority"
  }'

请求以优先层级提供服务时,响应包含 "service_tier": "priority";如果改为使用默认层级,则包含 "service_tier": "default"。只有响应确认值为 "priority" 时,才会按优先处理费率计费。

JSON

{
  "id": "resp_abc123",
  "model": "grok-4.7",
  "service_tier": "priority",
  "usage": {
    "input_tokens": 42,
    "output_tokens": 156,
    "cost_in_usd_ticks": 37756000
  }
}

最佳实践

  • 优先用于延迟敏感路径 — 对于响应时间直接影响体验的面向用户请求,优先处理最有价值。后台任务、评测和批量处理更适合使用 Batch API 时,才会按优先处理费率计费。

  • 监控 service_tier 字段 — 记录返回的层级,追踪请求以优先或默认层级提供服务的频率,并与延迟指标关联分析。

  • 结合 prompt caching — 在应用优先处理倍数前,缓存输入 token 会先享受折扣,因此 prompt caching 与优先处理可以很好地互补。


最后更新:2026 年 6 月 15 日