WebRTC
默认适合浏览器和移动客户端,尤其是需要低延迟音频和直接媒体处理时。
消费级产品与开发者 API
GPT-Live 是 ChatGPT 内的消费级 Voice 体验;GPT-Realtime-2.1 和 GPT-Realtime-2.1 mini 是用于自建语音 Agent 的正式 API 模型。都支持实时交互,不代表它们是可互换的产品或模型 ID。
最后核验:
| 问题 | GPT-Live | GPT-Realtime 2.1 |
|---|---|---|
| 在哪里运行? | ChatGPT Voice 内,包括桌面端 Work 与 Codex | 你的应用、服务或电话流程内 |
| 谁控制界面和账户? | OpenAI / ChatGPT | 你通过 OpenAI API 项目控制 |
| 模型名称 | GPT-Live-1 与 GPT-Live-1 mini | gpt-realtime-2.1 与 gpt-realtime-2.1-mini |
| 访问方式 | ChatGPT 套餐、地区、工作区和滚动发布 | API 账户、项目限制和正式端点 |
| 计费单位 | ChatGPT 订阅和 Voice 额度 | 按 token 计费 |
| 传输方式 | 由 ChatGPT 管理 | WebRTC、WebSocket 或 SIP |
按每百万 token 计算。两个模型都列出 128,000 token 上下文与 32,000 最大输出。
| 模型 | 文本输入 / 缓存 / 输出 | 音频输入 / 缓存 / 输出 | 图片输入 / 缓存 |
|---|---|---|---|
| gpt-realtime-2.1 | $4 / $0.40 / $24 | $32 / $0.40 / $64 | $5 / $0.50 |
| gpt-realtime-2.1-mini | $0.60 / $0.06 / $2.40 | $10 / $0.30 / $20 | $0.80 / $0.08 |
默认适合浏览器和移动客户端,尤其是需要低延迟音频和直接媒体处理时。
适合服务端应用、自定义音频管线,以及由后端掌控会话的环境。
适合呼入电话、呼叫中心和现有电信服务商。呼出拨号需要由服务商控制的拨号器或媒体桥。
直接在 ChatGPT 中使用 GPT-Live,并选择符合任务的 Voice 模式。
从 WebRTC 和 gpt-realtime-2.1 开始,对照延迟、质量与成本目标测试 mini。
使用 SIP 或服务端媒体桥,并加入 webhook 验证、同意、升级和转接控制。
加入通知列表并等待正式 API;不要杜撰模型 ID,也不要把登记表单当成 API 发布。
截至 2026-07-19,没有正式公开 API 合约支持该模型 ID。请使用官方 Realtime 模型 ID。
支持图片输入。官方模型页列出文字、音频、图片输入和文字、音频输出,并明确不支持视频。
不是。mini 是更低成本、更快的模型,只要测试证明质量满足任务,也可以用于生产环境。