模型能力
语音概览
xAI Voice API 提供一系列由 Grok 驱动的强大语音能力,并具备企业级可靠性和亚秒级延迟。
Speech to Speech
由 Grok 驱动、支持使用工具的实时 Speech to Speech 对话。
- 延迟
- 亚秒级
- 实时
- 起价 $0.05 / min
- Endpoint
- /v1/realtime
Text to Speech
使用富有表现力的多语言语音、speech tag 和电话编解码器生成语音。
- 语音
- 富有表现力、多语言
- 价格
- $15.00 / 1M chars
- Endpoint
- /v1/tts
Speech to Text
使用 batch 和 streaming 模式,将 25 种语言的音频转录为文本。
- 批处理
- $0.10 / hour
- 流式
- $0.20 / hour
- Endpoint
- /v1/stt
语音转语音
通过 WebSocket 构建实时语音转语音智能体,并支持低延迟轮次交互和工具使用。对于客户端应用,请使用 Ephemeral Tokens进行安全连接,避免暴露 API key。
import asyncio
import json
import os
import websockets
async def voice_agent():
async with websockets.connect(
"wss://api.x.ai/v1/realtime?model=grok-voice-latest",
additional_headers={"Authorization": f"Bearer {os.environ['XAI_API_KEY']}"}
) as ws:
# Configure voice and enable tools
await ws.send(json.dumps({
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "You are a helpful customer support agent.",
"turn_detection": {"type": "server_vad"},
"tools": [{"type": "web_search"}]
}
}))
# Stream audio and receive responses
async for message in ws:
event = json.loads(message)
if event["type"] == "response.output_audio.delta":
# Play audio: base64.b64decode(event["delta"])
pass
asyncio.run(voice_agent())演示应用: Web Agent · Twilio Phone Agent · WebRTC Agent · iOS Tester App
文本转语音
使用丰富且富有表现力的语音将文本转换为语音音频。支持内联语音标签(笑声、耳语、停顿),以及从高保真 MP3 到电话 μ-law 的多种输出格式。可使用单次请求或 WebSocket 流式传输。
curl -X POST https://api.x.ai/v1/tts \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Welcome to xAI. How can I help you today?",
"voice_id": "eve",
"language": "en"
}' \
--output welcome.mp3语音转文本
通过一次调用转写音频文件,或通过 WebSocket 流式转写。可使用 grok-voice-transcribe-1.0 或 grok-voice-transcribe-2.0;默认使用 grok-voice-transcribe-2.0。支持 12 种音频格式、词级时间戳、多声道、说话人分离、Smart Turn 话轮结束检测以及 25 种语言。
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F file=@recording.mp3实际应用示例: Voximplant
快速开始:自定义语音
从一段简短的参考音频片段克隆语音,然后可以在任何支持内置语音的位置使用生成的 voice_id:
# 1. Create a custom voice from a reference audio clip (max 120s).
curl -X POST https://api.x.ai/v1/custom-voices \
-H "Authorization: Bearer $XAI_API_KEY" \
-F "name=Friendly Narrator" \
-F "language=en" \
-F "file=@reference.wav;type=audio/wav"
# Response: { "voice_id": "nlbqfwie", ... }
# 2. Use the custom voice for TTS.
curl -X POST https://api.x.ai/v1/tts \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "Hello! This is my custom voice.",
"voice_id": "nlbqfwie",
"language": "en"
}' \
--output custom.mp3自定义 voice_id 同样适用于流式 TTS WebSocket 和语音转语音实时 API。完整 API 请参阅 Custom Voices 指南。
语音
使用 Speech to Speech API 或 Text to Speech 时,可从所有内置声音中选择。每种声音都有独特的个性和语气,并且都能使用每一种支持的语言。请选择最适合应用的声音(eve 为默认语音):
企业合规与安全
xAI Voice API 面向具有严格安全与合规要求的生产工作负载构建。所有音频数据均实时处理,绝不会存储或用于训练。
SOC 2 Type II — 针对安全性、可用性和保密性实施经审计的控制措施
符合 HIPAA 资格 — 可为处理 PHI 的医疗健康应用提供 BAA
符合 GDPR — 提供数据处理协议和 EU 数据驻留选项
数据驻留 — 根据合规要求进行区域化处理
高可用性 — 为企业工作负载提供多区域基础设施和定制 SLA
SSO 与 RBAC — 支持 SAML SSO、基于角色的访问控制和审计日志
最后更新:2026 年 9 月 19 日