高级 API 用法

Priority Processing

Priority Processing 会为 xAI API 请求提供更高的调度优先级,通常能降低 time-to-first-token(TTFT)并改善 inter-token latency(ITL),在高需求时段尤其明显。将 service_tier: "priority" 添加到任意 request body 即可启用,无需预留容量或提前配置。该参数支持 Text Inference Endpoint:Chat Completions 和 Responses。

Priority 容量可用时,请求会优先于标准流量调度。Response 始终包含 service_tier 字段,用于指示是否获得 Priority;请检查该字段进行确认。

工作原理

service_tier 字段添加到任意受支持的请求。API 会在 response 中返回实际使用的 tier,以便确认升级是否生效。

service_tier 字段接受以下值:

含义
"default"标准处理,与完全省略该字段相同。
"priority"以更高的 token price 请求更高的调度优先级。

Priority Request 按更高的 per-token rate 计费。在应用 multiplier 前,cached input token 仍享受 cache discount。有关各模型的当前费率和准确的 Priority Premium,请参阅价格页面。

快速开始

在 request body 中传入 service_tier: "priority"。Response 中包含 service_tier 字段,用于确认实际使用的 tier。

curl https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Explain the Riemann hypothesis in one paragraph.",
    "service_tier": "priority"
  }'

当请求以 Priority Tier 提供服务时,response 包含 "service_tier": "priority";如果改为使用 Default Tier,则包含 "service_tier": "default"。只有在 response 确认值为 "priority" 时,才会按 Priority Rate 计费。

JSON

{
  "id": "resp_abc123",
  "model": "grok-4.5",
  "service_tier": "priority",
  "usage": {
    "input_tokens": 42,
    "output_tokens": 156,
    "cost_in_usd_ticks": 37756000
  }
}

最佳实践

  • 优先用于延迟敏感路径 — Priority Processing 最适合响应时间直接影响体验的面向用户请求。后台任务、评测和批量处理更适合使用 Batch API 时,才会按 Priority Rate 计费。

  • 监控 service_tier 字段 — 记录返回的 tier,追踪请求以 Priority 或 Default 提供服务的频率,并与 latency metric 关联分析。

  • 与 Prompt Caching 结合 — Cached input token 会在应用 Priority Multiplier 前享受折扣,因此 Prompt Caching 与 Priority Processing 可以很好地互补。