Models
语音转语音
Speech to Speech API 可通过 WebSocket 实现实时语音对话,按音频分钟数以及每条文本输入消息的固定费用计费。支持结合 web search、X search、collections、MCP 和自定义函数使用 function calling。
概览
| 详情 | |
|---|---|
| 模态 | 文本、音频 → 文本、音频 |
| 音频定价 | / 分钟或 / 小时 |
| 文本输入定价 | / 条消息 |
| 区域 | us-east-1 |
定价
Speech to Speech API 按音频时长和不含音频的文本事件收费。
| 详情 | |
|---|---|
| 音频 | 发送或接收的音频按 / 分钟或 / 小时计费 |
| 文本输入 | 每个 conversation.item.create 事件收费 |
哪些内容算作文本输入消息
客户端发送的每个 conversation.item.create 事件均按 计费,但以下两种情况除外:
function_call_output项(服务端请求的 tool result)不收费。内容为
input_audio或audio的项改按音频计费。
response.create 不是计费事件。它仅请求模型生成下一轮回复;模型在该轮生成的任何音频均按上述音频计费。
速率限制
| 详情 | |
|---|---|
| 并发会话数 | 每个团队 个 |
| 最长会话时长 | 120 分钟 |
功能
Function calling
Web search
X search
Collections search
Remote MCP tools
可用性
| 详情 | |
|---|---|
| 集群 | us-east-1 |
文档
Speech to Speech 指南 — 开始使用实时语音对话
API 参考 — WebSocket endpoint 参考
定价 — 完整定价概览
最后更新:2026 年 9 月 12 日