关键信息
Rate Limit
每个 xAI API team 都有两个维度的 per-model rate limit:requests per second(RPS) 和 tokens per minute(TPM)。每秒限制由每分钟请求预算(RPM / 60)得出:不能在一秒内用完一整分钟的请求额度,从而保护 API 免受突发流量影响。这些限制会随 team 的 tier 变化,而 tier 由 API 累计支出决定。
可以在 xAI Console 的 Rate Limit 页面查看 team 当前的 tier 和 per-model limit。
Rate limit tier
Tier 取决于自 2026 年 1 月 1 日起在 xAI API 上的累计支出。随着支出增加,tier 会自动解锁。
| Tier | 支出门槛 |
|---|---|
| Tier 0 | $0(默认) |
| Tier 1 | $50 |
| Tier 2 | $250 |
| Tier 3 | $1,000 |
| Tier 4 | $5,000 |
| Enterprise | 可申请 |
资格依据通过预付 credit 购买或已成功履行 invoice 收到的总收入确定。一旦达到某个 tier,将永久保留该资格,tier 不会降级。
Per-model limit
每个 tier 都为每个 model 设置严格的 RPS 和 TPM 上限。限制会随 tier 指数级增长。超过任一限制都会返回 429 Too Many Requests error。
下表列出每个 model 在各 tier 的 RPS 和 TPM 限制。也可以在 xAI Console 的 Rate Limit 页面查看 team 当前的 tier 和 per-model limit。
| Model | Tier | Requests per second | Tokens per minute |
|---|---|---|---|
| Language Models | |||
grok-4.20-0309-non-reasoning | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-4.20-0309-reasoning | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-4.20-multi-agent-0309 | T0T1T2T3T4 | 912183156 | 2.5M3.7M6.2M11M21M |
grok-4.3 | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-4.5 | T0T1T2T3T4 | 150172208312500 | 50M53M60M74M100M |
grok-build-0.1 | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
| Image Generation | |||
grok-imagine-image | 所有 tier | 5 | — |
grok-imagine-image-quality | 所有 tier | 5 | — |
| Video Generation | |||
grok-imagine-video-1.5 | 所有 tier | 10 | — |
grok-imagine-video | 所有 tier | 10 | — |
哪些内容计入 TPM
请求消耗的所有 token 都会计入该 model 的 TPM 限制:
Prompt token(文本、图像和音频)
Completion token
Reasoning token(在 reasoning model 上)
Cached prompt token(仍计入 TPM,但按较低费率计费)
有关 token 计数和定价方式的详情,请参阅 Model 与定价。有关 per-request 成本追踪,请参阅 成本追踪。
处理 Rate Limit Error
超过 rate limit 时,API 会返回 HTTP 429。请实现 exponential backoff,以妥善处理该情况:
import os
import time
from openai import OpenAI, RateLimitError
client = OpenAI(base_url="https://api.x.ai/v1", api_key=os.getenv("XAI_API_KEY"))
def request_with_backoff(messages, max_retries=5):
for attempt in range(max_retries):
try:
return client.chat.completions.create(
model="grok-4.5",
messages=messages,
)
except RateLimitError:
wait = 2 ** attempt
time.sleep(wait)
raise RateLimitError("Max retries exceeded")提高限制
增加支出。Tier 会根据累计支出自动升级,无需执行任何操作。
申请提高限制。如果需要在不增加支出的情况下提高限制,或需要超过 Tier 4 的限制,请通过 xAI Console 提交申请。
联系销售团队。如需企业级 capacity,请发送邮件至 sales@x.ai。