高级 API 用法
Priority Processing
Priority Processing 会为 xAI API 请求提供更高的调度优先级,通常能降低 time-to-first-token(TTFT)并改善 inter-token latency(ITL),在高需求时段尤其明显。将 service_tier: "priority" 添加到任意 request body 即可启用,无需预留容量或提前配置。该参数支持 Text Inference Endpoint:Chat Completions 和 Responses。
Priority 容量可用时,请求会优先于标准流量调度。Response 始终包含 service_tier 字段,用于指示是否获得 Priority;请检查该字段进行确认。
工作原理
将 service_tier 字段添加到任意受支持的请求。API 会在 response 中返回实际使用的 tier,以便确认升级是否生效。
该 service_tier 字段接受以下值:
| 值 | 含义 |
|---|---|
"default" | 标准处理,与完全省略该字段相同。 |
"priority" | 以更高的 token price 请求更高的调度优先级。 |
Priority Request 按更高的 per-token rate 计费。在应用 multiplier 前,cached input token 仍享受 cache discount。有关各模型的当前费率和准确的 Priority Premium,请参阅价格页面。
快速开始
在 request body 中传入 service_tier: "priority"。Response 中包含 service_tier 字段,用于确认实际使用的 tier。
curl https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Explain the Riemann hypothesis in one paragraph.",
"service_tier": "priority"
}'当请求以 Priority Tier 提供服务时,response 包含 "service_tier": "priority";如果改为使用 Default Tier,则包含 "service_tier": "default"。只有在 response 确认值为 "priority" 时,才会按 Priority Rate 计费。
{
"id": "resp_abc123",
"model": "grok-4.5",
"service_tier": "priority",
"usage": {
"input_tokens": 42,
"output_tokens": 156,
"cost_in_usd_ticks": 37756000
}
}最佳实践
优先用于延迟敏感路径 — Priority Processing 最适合响应时间直接影响体验的面向用户请求。后台任务、评测和批量处理更适合使用 Batch API 时,才会按 Priority Rate 计费。
监控
service_tier字段 — 记录返回的 tier,追踪请求以 Priority 或 Default 提供服务的频率,并与 latency metric 关联分析。与 Prompt Caching 结合 — Cached input token 会在应用 Priority Multiplier 前享受折扣,因此 Prompt Caching 与 Priority Processing 可以很好地互补。