Models

语音转语音

查看 Markdown

Speech to Speech API 可通过 WebSocket 实现实时语音对话,按音频分钟数以及每条文本输入消息的固定费用计费。支持结合 web search、X search、collections、MCP 和自定义函数使用 function calling。


概览

详情
模态文本、音频 → 文本、音频
音频定价/ 分钟或 / 小时
文本输入定价/ 条消息
区域us-east-1

定价

Speech to Speech API 按音频时长和不含音频的文本事件收费。

详情
音频发送或接收的音频按 / 分钟或 / 小时计费
文本输入每个 conversation.item.create 事件收费

哪些内容算作文本输入消息

客户端发送的每个 conversation.item.create 事件均按 计费,但以下两种情况除外:

  • function_call_output 项(服务端请求的 tool result)不收费。

  • 内容为 input_audioaudio 的项改按音频计费。

response.create 不是计费事件。它仅请求模型生成下一轮回复;模型在该轮生成的任何音频均按上述音频计费。


速率限制

详情
并发会话数每个团队 个
最长会话时长120 分钟

功能

  • Function calling

  • Web search

  • X search

  • Collections search

  • Remote MCP tools


可用性

详情
集群us-east-1

文档


最后更新:2026 年 9 月 12 日