关键信息

速率限制

查看 Markdown

每个 xAI API 团队都有两个维度的按模型速率限制:每秒请求数(RPS)每分钟 token 数(TPM)。每秒限制由每分钟请求预算(RPM / 60)得出:不能在一秒内用完一整分钟的请求额度,从而保护 API 免受突发流量影响。这些限制会随团队的 级别 变化,而级别由 API 累计支出决定。

可以在 xAI Console 的 Models 页面查看团队当前的级别和按模型限制。


速率限制级别

级别取决于自 2026 年 1 月 1 日起在 xAI API 上的累计支出。随着支出增加,级别会自动解锁。

级别支出门槛
Tier 0$0(默认)
Tier 1$50
Tier 2$250
Tier 3$1,000
Tier 4$5,000
企业级可申请

资格依据通过预付余额购买或已成功履行的发票收到的总收入确定。一旦达到某个级别,将永久保留该资格,级别不会降级。


按模型限制

每个等级都会为每个模型设置严格的 RPS 和 TPM 上限。限制会随等级呈指数增长。超过任一限制都会返回 429 Too Many Requests 错误。

下表列出各模型在每个等级的 RPS 和 TPM 限额。其后列出语音与音频端点,这些端点按每秒请求数和并发会话数(CST)限制,而非 token 数;Speech to Speech 仅限制并发会话数。你也可以在 xAI Console 的 Models 页面查看团队当前的级别和按模型限制。

ModelTier每秒请求数每分钟 token 数
语言模型
grok-4.7T0T1T2T3T415017220831250050M53M60M74M100M
grok-4.6T0T1T2T3T415017220831250050M53M60M74M100M
grok-4.5T0T1T2T3T415017220831250050M53M60M74M100M
grok-4.3T0T1T2T3T437507512520810M15M25M45M85M
grok-4.20-0309-reasoningT0T1T2T3T437507512520810M15M25M45M85M
grok-4.20-0309-non-reasoningT0T1T2T3T437507512520810M15M25M45M85M
grok-build-0.1T0T1T2T3T437507512520810M15M25M45M85M
grok-4.20-multi-agent-0309T0T1T2T3T49121831562.5M3.7M6.2M11M21M
图像生成
grok-imagine-image-qualityT0T1T2T3T46122550100
grok-imagine-image-2.0T0T1T2T3T46122550100
grok-imagine-imageT0T1T2T3T46122550100
视频生成
grok-imagine-video-1.5T0T1T2T3T410203979158
grok-imagine-videoT0T1T2T3T410203979158

语音与音频

模型RPS并发会话数
grok-voice-think-fast-2.0T0: 10, T1: 20, T2: 50, T3: 100, T4: 200
语音合成T0: 50, T1: 50, T2: 100, T3: 250, T4: 500T0: 100, T1: 200, T2: 200, T3: 300, T4: 500
语音转文本T0: 10, T1: 10, T2: 20, T3: 30, T4: 40T0: 100, T1: 200, T2: 200, T3: 300, T4: 500

哪些内容计入 TPM

请求消耗的所有 token 都会计入该模型的 TPM 限制:

  • prompt token(文本、图像和音频)

  • 补全 token

  • 推理 token(在推理模型上)

  • 缓存 prompt token(仍计入 TPM,但按较低费率计费)

有关 token 计数和定价方式的详情,请参阅 模型与定价。有关 per-request 成本追踪,请参阅 成本追踪


处理速率限制错误

超过速率限制时,API 会返回 HTTP 429。请实现指数退避,以妥善处理该情况:

import os
import time
from openai import OpenAI, RateLimitError

client = OpenAI(base_url="https://api.x.ai/v1", api_key=os.getenv("XAI_API_KEY"))

def request_with_backoff(messages, max_retries=5):
    for attempt in range(max_retries):
        try:
            return client.chat.completions.create(
                model="grok-4.7",
                messages=messages,
            )
        except RateLimitError:
            wait = 2 ** attempt
            time.sleep(wait)
    raise RateLimitError("Max retries exceeded")

提高限制

  • 增加支出。Tier 会根据累计支出自动升级,无需执行任何操作。

  • 申请提高限制。如果需要在不增加支出的情况下提高限制,或需要超过 Tier 4 的限制,请通过 xAI Console 提交申请。

  • 联系销售团队。如需企业级容量,请发送邮件至 sales@x.ai


最后更新:2026 年 9 月 17 日