Models
语音转文本
Speech to Text API 可将音频转写为文本。可使用 grok-voice-transcribe-1.0 或 grok-voice-transcribe-2.0;默认为 grok-voice-transcribe-2.0。文件型批量转写使用 REST endpoint,实时低延迟转写使用 streaming endpoint。
概览
| 详情 | |
|---|---|
| 模态 | 音频 → 文本 |
| REST 定价 | / 小时 |
| Streaming 定价 | / 小时 |
| 区域 | us-east-1 |
定价
| 详情 | |
|---|---|
| REST(每小时) | / 小时 |
| Streaming(每小时) | / 小时 |
速率限制
| REST | Streaming | |
|---|---|---|
| RPS(每秒请求数) | ||
| 并发会话数 | — | 每个团队 个 |
功能
REST 和 streaming 转写
多种音频格式(WAV、MP3、WebM、OGG、M4A)
多种语言
实时中间结果(streaming)
可针对领域词汇使用 keyterm prompting
Smart Turn 回合结束检测(streaming)— 基于 ML 预测说话者是否已完成表达
可用性
| 详情 | |
|---|---|
| 集群 | us-east-1 |
文档
Speech to Text 指南 — 开始使用 speech to text
Voice 概览 — 所有语音功能的概览
定价 — 完整定价概览
最后更新:2026 年 9 月 18 日