消费级产品与开发者 API

GPT-Live 与 GPT-Realtime 2.1

GPT-Live 是 ChatGPT 内的消费级 Voice 体验;GPT-Realtime-2.1 和 GPT-Realtime-2.1 mini 是用于自建语音 Agent 的正式 API 模型。都支持实时交互,不代表它们是可互换的产品或模型 ID。

最后核验:

最重要的边界

问题GPT-LiveGPT-Realtime 2.1
在哪里运行?ChatGPT Voice 内,包括桌面端 Work 与 Codex你的应用、服务或电话流程内
谁控制界面和账户?OpenAI / ChatGPT你通过 OpenAI API 项目控制
模型名称GPT-Live-1 与 GPT-Live-1 minigpt-realtime-2.1 与 gpt-realtime-2.1-mini
访问方式ChatGPT 套餐、地区、工作区和滚动发布API 账户、项目限制和正式端点
计费单位ChatGPT 订阅和 Voice 额度按 token 计费
传输方式由 ChatGPT 管理WebRTC、WebSocket 或 SIP

GPT-Realtime-2.1 模型与价格

按每百万 token 计算。两个模型都列出 128,000 token 上下文与 32,000 最大输出。

模型文本输入 / 缓存 / 输出音频输入 / 缓存 / 输出图片输入 / 缓存
gpt-realtime-2.1$4 / $0.40 / $24$32 / $0.40 / $64$5 / $0.50
gpt-realtime-2.1-mini$0.60 / $0.06 / $2.40$10 / $0.30 / $20$0.80 / $0.08

选择 WebRTC、WebSocket 还是 SIP?

WebRTC

默认适合浏览器和移动客户端,尤其是需要低延迟音频和直接媒体处理时。

WebSocket

适合服务端应用、自定义音频管线,以及由后端掌控会话的环境。

SIP

适合呼入电话、呼叫中心和现有电信服务商。呼出拨号需要由服务商控制的拨号器或媒体桥。

选择正确路线

只想使用 Voice

直接在 ChatGPT 中使用 GPT-Live,并选择符合任务的 Voice 模式。

构建网页或移动 Agent

从 WebRTC 和 gpt-realtime-2.1 开始,对照延迟、质量与成本目标测试 mini。

构建电话 Agent

使用 SIP 或服务端媒体桥,并加入 webhook 验证、同意、升级和转接控制。

明确需要 GPT-Live-1

加入通知列表并等待正式 API;不要杜撰模型 ID,也不要把登记表单当成 API 发布。

GPT-Live 与 Realtime 常见问题

能把 gpt-live-1 当作 API 模型名发送吗?

截至 2026-07-19,没有正式公开 API 合约支持该模型 ID。请使用官方 Realtime 模型 ID。

GPT-Realtime-2.1 支持图片吗?

支持图片输入。官方模型页列出文字、音频、图片输入和文字、音频输出,并明确不支持视频。

mini 只能用于原型吗?

不是。mini 是更低成本、更快的模型,只要测试证明质量满足任务,也可以用于生产环境。