Models

语音转文本

查看 Markdown

Speech to Text API 可将音频转写为文本。可使用 grok-voice-transcribe-1.0grok-voice-transcribe-2.0;默认为 grok-voice-transcribe-2.0。文件型批量转写使用 REST endpoint,实时低延迟转写使用 streaming endpoint。


概览

详情
模态音频 → 文本
REST 定价/ 小时
Streaming 定价/ 小时
区域us-east-1

定价

详情
REST(每小时)/ 小时
Streaming(每小时)/ 小时

速率限制

RESTStreaming
RPS(每秒请求数)
并发会话数每个团队 个

功能

  • REST 和 streaming 转写

  • 多种音频格式(WAV、MP3、WebM、OGG、M4A)

  • 多种语言

  • 实时中间结果(streaming)

  • 可针对领域词汇使用 keyterm prompting

  • Smart Turn 回合结束检测(streaming)— 基于 ML 预测说话者是否已完成表达


可用性

详情
集群us-east-1

文档


最后更新:2026 年 9 月 18 日