关键信息
速率限制
每个 xAI API 团队都有两个维度的按模型速率限制:每秒请求数(RPS) 和 每分钟 token 数(TPM)。每秒限制由每分钟请求预算(RPM / 60)得出:不能在一秒内用完一整分钟的请求额度,从而保护 API 免受突发流量影响。这些限制会随团队的 级别 变化,而级别由 API 累计支出决定。
可以在 xAI Console 的 Models 页面查看团队当前的级别和按模型限制。
速率限制级别
级别取决于自 2026 年 1 月 1 日起在 xAI API 上的累计支出。随着支出增加,级别会自动解锁。
| 级别 | 支出门槛 |
|---|---|
| Tier 0 | $0(默认) |
| Tier 1 | $50 |
| Tier 2 | $250 |
| Tier 3 | $1,000 |
| Tier 4 | $5,000 |
| 企业级 | 可申请 |
资格依据通过预付余额购买或已成功履行的发票收到的总收入确定。一旦达到某个级别,将永久保留该资格,级别不会降级。
按模型限制
每个等级都会为每个模型设置严格的 RPS 和 TPM 上限。限制会随等级呈指数增长。超过任一限制都会返回 429 Too Many Requests 错误。
下表列出各模型在每个等级的 RPS 和 TPM 限额。其后列出语音与音频端点,这些端点按每秒请求数和并发会话数(CST)限制,而非 token 数;Speech to Speech 仅限制并发会话数。你也可以在 xAI Console 的 Models 页面查看团队当前的级别和按模型限制。
| Model | Tier | 每秒请求数 | 每分钟 token 数 |
|---|---|---|---|
| 语言模型 | |||
grok-4.7 | T0T1T2T3T4 | 150172208312500 | 50M53M60M74M100M |
grok-4.6 | T0T1T2T3T4 | 150172208312500 | 50M53M60M74M100M |
grok-4.5 | T0T1T2T3T4 | 150172208312500 | 50M53M60M74M100M |
grok-4.3 | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-4.20-0309-reasoning | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-4.20-0309-non-reasoning | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-build-0.1 | T0T1T2T3T4 | 375075125208 | 10M15M25M45M85M |
grok-4.20-multi-agent-0309 | T0T1T2T3T4 | 912183156 | 2.5M3.7M6.2M11M21M |
| 图像生成 | |||
grok-imagine-image-quality | T0T1T2T3T4 | 6122550100 | — |
grok-imagine-image-2.0 | T0T1T2T3T4 | 6122550100 | — |
grok-imagine-image | T0T1T2T3T4 | 6122550100 | — |
| 视频生成 | |||
grok-imagine-video-1.5 | T0T1T2T3T4 | 10203979158 | — |
grok-imagine-video | T0T1T2T3T4 | 10203979158 | — |
语音与音频
| 模型 | RPS | 并发会话数 |
|---|---|---|
| grok-voice-think-fast-2.0 | — | T0: 10, T1: 20, T2: 50, T3: 100, T4: 200 |
| 语音合成 | T0: 50, T1: 50, T2: 100, T3: 250, T4: 500 | T0: 100, T1: 200, T2: 200, T3: 300, T4: 500 |
| 语音转文本 | T0: 10, T1: 10, T2: 20, T3: 30, T4: 40 | T0: 100, T1: 200, T2: 200, T3: 300, T4: 500 |
哪些内容计入 TPM
请求消耗的所有 token 都会计入该模型的 TPM 限制:
prompt token(文本、图像和音频)
补全 token
推理 token(在推理模型上)
缓存 prompt token(仍计入 TPM,但按较低费率计费)
有关 token 计数和定价方式的详情,请参阅 模型与定价。有关 per-request 成本追踪,请参阅 成本追踪。
处理速率限制错误
超过速率限制时,API 会返回 HTTP 429。请实现指数退避,以妥善处理该情况:
import os
import time
from openai import OpenAI, RateLimitError
client = OpenAI(base_url="https://api.x.ai/v1", api_key=os.getenv("XAI_API_KEY"))
def request_with_backoff(messages, max_retries=5):
for attempt in range(max_retries):
try:
return client.chat.completions.create(
model="grok-4.7",
messages=messages,
)
except RateLimitError:
wait = 2 ** attempt
time.sleep(wait)
raise RateLimitError("Max retries exceeded")提高限制
增加支出。Tier 会根据累计支出自动升级,无需执行任何操作。
申请提高限制。如果需要在不增加支出的情况下提高限制,或需要超过 Tier 4 的限制,请通过 xAI Console 提交申请。
联系销售团队。如需企业级容量,请发送邮件至 sales@x.ai。
最后更新:2026 年 9 月 17 日