关键信息

Rate Limit

每个 xAI API team 都有两个维度的 per-model rate limit:requests per second(RPS)tokens per minute(TPM)。每秒限制由每分钟请求预算(RPM / 60)得出:不能在一秒内用完一整分钟的请求额度,从而保护 API 免受突发流量影响。这些限制会随 team 的 tier 变化,而 tier 由 API 累计支出决定。

可以在 xAI Console 的 Rate Limit 页面查看 team 当前的 tier 和 per-model limit。

Rate limit tier

Tier 取决于自 2026 年 1 月 1 日起在 xAI API 上的累计支出。随着支出增加,tier 会自动解锁。

Tier支出门槛
Tier 0$0(默认)
Tier 1$50
Tier 2$250
Tier 3$1,000
Tier 4$5,000
Enterprise可申请

资格依据通过预付 credit 购买或已成功履行 invoice 收到的总收入确定。一旦达到某个 tier,将永久保留该资格,tier 不会降级。

Per-model limit

每个 tier 都为每个 model 设置严格的 RPS 和 TPM 上限。限制会随 tier 指数级增长。超过任一限制都会返回 429 Too Many Requests error。

下表列出每个 model 在各 tier 的 RPS 和 TPM 限制。也可以在 xAI Console 的 Rate Limit 页面查看 team 当前的 tier 和 per-model limit。

ModelTierRequests per secondTokens per minute
Language Models
grok-4.20-0309-non-reasoningT0T1T2T3T437507512520810M15M25M45M85M
grok-4.20-0309-reasoningT0T1T2T3T437507512520810M15M25M45M85M
grok-4.20-multi-agent-0309T0T1T2T3T49121831562.5M3.7M6.2M11M21M
grok-4.3T0T1T2T3T437507512520810M15M25M45M85M
grok-4.5T0T1T2T3T415017220831250050M53M60M74M100M
grok-build-0.1T0T1T2T3T437507512520810M15M25M45M85M
Image Generation
grok-imagine-image所有 tier5
grok-imagine-image-quality所有 tier5
Video Generation
grok-imagine-video-1.5所有 tier10
grok-imagine-video所有 tier10

哪些内容计入 TPM

请求消耗的所有 token 都会计入该 model 的 TPM 限制:

  • Prompt token(文本、图像和音频)

  • Completion token

  • Reasoning token(在 reasoning model 上)

  • Cached prompt token(仍计入 TPM,但按较低费率计费)

有关 token 计数和定价方式的详情,请参阅 Model 与定价。有关 per-request 成本追踪,请参阅 成本追踪

处理 Rate Limit Error

超过 rate limit 时,API 会返回 HTTP 429。请实现 exponential backoff,以妥善处理该情况:

import os
import time
from openai import OpenAI, RateLimitError

client = OpenAI(base_url="https://api.x.ai/v1", api_key=os.getenv("XAI_API_KEY"))

def request_with_backoff(messages, max_retries=5):
    for attempt in range(max_retries):
        try:
            return client.chat.completions.create(
                model="grok-4.5",
                messages=messages,
            )
        except RateLimitError:
            wait = 2 ** attempt
            time.sleep(wait)
    raise RateLimitError("Max retries exceeded")

提高限制

  • 增加支出。Tier 会根据累计支出自动升级,无需执行任何操作。

  • 申请提高限制。如果需要在不增加支出的情况下提高限制,或需要超过 Tier 4 的限制,请通过 xAI Console 提交申请。

  • 联系销售团队。如需企业级 capacity,请发送邮件至 sales@x.ai