高级 API 用法
优先处理
优先处理会为 xAI API 请求提供更高的调度优先级,通常可缩短首 token 时间(TTFT)和 token 间延迟(ITL),在高需求时段尤其明显。将 service_tier: "priority" 添加到任意请求正文即可启用,无需预留容量或提前配置。该参数支持文本推理 endpoint:聊天补全和 Responses。
有可用的优先处理容量时,请求会排在标准流量之前。响应始终包含 service_tier 字段,指示是否获授优先处理;请据此确认。
工作原理
将 service_tier 字段添加到任意受支持的请求。API 会在响应中返回实际使用的层级,以便确认升级是否生效。
该 service_tier 字段接受以下值:
| 值 | 含义 |
|---|---|
"default" | 标准处理,与完全省略该字段相同。 |
"priority" | 以更高的每 token 价格请求更高的调度优先级。 |
优先处理请求按更高的每 token 费率计费。在应用优先处理倍数前,缓存输入 token 仍可享受缓存折扣。有关各模型当前费率和确切优先处理加价,请参阅 价格页面。
快速开始
在请求正文中传入 service_tier: "priority"。响应中包含 service_tier 字段,用于确认实际使用的层级。
curl https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"input": "Explain the Riemann hypothesis in one paragraph.",
"service_tier": "priority"
}'请求以优先层级提供服务时,响应包含 "service_tier": "priority";如果改为使用默认层级,则包含 "service_tier": "default"。只有响应确认值为 "priority" 时,才会按优先处理费率计费。
{
"id": "resp_abc123",
"model": "grok-4.7",
"service_tier": "priority",
"usage": {
"input_tokens": 42,
"output_tokens": 156,
"cost_in_usd_ticks": 37756000
}
}最佳实践
优先用于延迟敏感路径 — 对于响应时间直接影响体验的面向用户请求,优先处理最有价值。后台任务、评测和批量处理更适合使用 Batch API 时,才会按优先处理费率计费。
监控
service_tier字段 — 记录返回的层级,追踪请求以优先或默认层级提供服务的频率,并与延迟指标关联分析。结合 prompt caching — 在应用优先处理倍数前,缓存输入 token 会先享受折扣,因此 prompt caching 与优先处理可以很好地互补。
最后更新:2026 年 6 月 15 日