Skip to main content
OpenAI Realtime API 提供双向、低延迟的语音 / 文本流,适用于语音助手 / 实时会议总结等场景。
OpenAI 官方支持 WebRTC / WebSocket / SIP 三种接入方式,并提供 gpt-realtime-2gpt-realtime-1.5 等新一代实时模型。OpenPAI 网关当前以 WebSocket 为主,其他传输方式与模型是否开放以 控制台 / 公告 为准。

连接

握手时通过 子协议Header 传递鉴权:
浏览器子协议方式会把密钥放在客户端,仅用于 demo。生产请通过自己的后端创建临时 token。

创建临时 Token

返回中的 client_secret.value 是短期 token,可安全发送到浏览器作为子协议。

事件协议

WebSocket 上双向收发 JSON 事件,关键事件:

简化示例(Node.js)

音频格式

  • 输入:PCM 16-bit、24kHz、单声道,base64 编码。
  • 输出:同样 PCM 16-bit / 24kHz。
可借助 webrtc-adapterMediaRecorderffmpeg 等工具转换。

工具调用

session.update 中可声明 tools,模型在生成过程中可能产生 response.function_call_arguments.delta 事件, 你需要执行工具并把结果通过 conversation.item.create(type: function_call_output)回传。

计费

  • 音频输入 / 输出 token文本 token 分别计费,价格高于普通 chat。
  • 连接保持期间不计费,但若长时间空闲建议主动关闭。
详见 模型定价