GPT-Live-1 全双工语音模型:能边听边说的 AI,每分钟 $0.05
OpenAI 的 GPT-Live-1 从 2026 年 9 月 10 日起开放 API,是能同时听和说的全双工语音模型,按分钟计费每分钟 $0.05。本文讲清全双工和传统语音管线的区别、它把推理委派给后端模型的架构,以及企业做语音客服怎么落地。
GPT-Live-1 是 OpenAI 的全双工语音模型,从 2026 年 9 月 10 日起对开发者开放 API。 它在 ChatGPT 里已经跑了两个月(2026 年 7 月 8 日上线,取代原来的高级语音模式),现在可以接进自己的系统了。
官方对它的定义只有一句,但这句话是整篇文章的重点:
a full-duplex voice model for real-time conversations. It can listen and speak at the same time
能同时听和说——这是语音 AI 和"能用的语音 AI"之间的分水岭。
一、全双工到底解决了什么?
过去做语音机器人,标准做法是三段式管线:语音转文字 → 大模型想 → 文字转语音。三段串起来,每一段都要等上一段结束。结果就是大家都熟悉的那种体验:
- 你说完,要等一两秒它才开口
- 你想插一句"不是这个意思",它听不见,得等它把整段念完
- 它念到一半你已经明白了,但打断不了
这三条都是半双工造成的:同一时刻只能听或只能说。
全双工模型把听和说放进同一个模型、同时进行。你插话它立刻停下、你"嗯"一声它知道你在跟、你沉默两秒它知道该接话还是该等你想完——停顿、抢话、接话这些人类对话里最自然的部分,才第一次变得自然。
据公开报道,OpenAI 称 GPT-Live-1 在自家的 Full Duplex Bench 上比 GPT-Realtime-2.1 提升了 30 个百分点。
二、它自己不"想",把难题交给后端模型
这是 GPT-Live-1 架构上最值得理解的一点:它主要负责把对话这件事做好——听、说、停顿、被打断、判断什么时候需要外援;复杂推理和工具调用委派给后端的模型去做(官方原文:delegate reasoning and tool use to a backend agent)。
这个分工对企业有两个直接影响:
一是效果更好。 让一个模型既要保持毫秒级的对话节奏、又要做复杂推理,必然顾此失彼。分开之后,前台专心对话、后台专心思考。
二是成本要分开算。 语音会话 $0.05/分钟只是前台的钱,后端模型按它自己的 token 价另计。做预算时两笔都要算进去——只看每分钟五分钱会低估。
后端接哪个模型由你定,这也是控成本的主要抓手:需要复杂判断的场景(比如退换货政策的边界情况)值得上 GPT-6 Astra 这类旗舰,日常查单改址用更便宜的型号就够。分层路由做得好,整体成本能差出一个量级。
模型支持流式处理与函数调用,端点只有 v1/live/sessions。有几个限制要提前知道:不支持图像与视频模态,也不支持 structured outputs、微调与 predicted outputs;官方文档标注的知识截止是 2025 年 7 月 31 日——需要最新知识的问题,本来也该交给后端模型或检索系统。
三、每分钟 $0.05 是什么概念
官方定价:$0.05 每分钟,按秒计费。按秒计费这点对实际账单影响不小——大量语音咨询是三五十秒就结束的,按分钟取整会多付不少。
换算成场景(仅前台语音部分,后端模型另计):
| 场景 | 时长 | 前台成本 |
|---|---|---|
| 一通 3 分钟的售后咨询 | 3 分钟 | 约 $0.15 |
| 每天 200 通、平均 3 分钟 | 600 分钟/天 | 约 $30/天 |
| 同上,一个月 | 约 18,000 分钟 | 约 $900/月 |
拿这个数字和一个坐席的人力成本比,账很好算。但别按这个就下单——真实成本还要加上后端模型、电话线路或 WebRTC 通道、以及最容易被低估的那部分:把它接进你现有业务系统的工程量。
四、企业能把它用在哪
它适合的是高频、标准化、但又必须"对话"才能完成的场景:
- 售后与客服:查订单、改地址、退换货、报修派单
- 预约与排期:门诊、维修、看房、试驾
- 外呼回访:满意度回访、续费提醒、到期通知
- 语言陪练与培训:全双工的打断和纠正才像真人对练
- 前台分流:把简单问题解决掉,复杂的转人工并带上完整上下文
最后这条最容易被低估。 语音 AI 真正的价值往往不是"全自动无人工",而是把 70% 的简单问题挡在人工之前,并且转接时把已经问清楚的信息一并递过去——坐席不用再让客户从头说一遍。
不确定自己的业务适不适合,可以先看我们写过的 AI 客服 90 天落地路线,里面讲的分阶段做法同样适用于语音。
五、Azure 上的可用状态
微软已宣布 GPT-Live-1 与 GPT-Image-2.5 系列进入 Microsoft Foundry。不过截至本文发布,Microsoft Learn 的「Models sold by Azure」模型清单(最近更新 2026 年 9 月 4 日)尚未收录 gpt-live-1——同族的 gpt-live-transcribe(实时低延迟转写)已在列,且与 GPT-Live-1 一样采用按时长计费。
所以实际接入前,请以 Foundry 控制台里能否看到该模型、以及微软官方最新说明为准。需要确认区域、配额与部署形态的,可以让我们代为对接微软侧渠道。
走 Azure 的好处和其他模型一致:Entra 身份、私网与权限开箱即用,账单并入既有订阅,且微软官方文档写明提示与输出不对 OpenAI 等模型提供方开放、不用于改进其模型。语音场景涉及客户真实通话内容,这条尤其要紧。
六、我们能帮你做什么
- 接入与账务:Azure 订阅开通与代付、Foundry 配额申请、人民币开票
- 方案与成本测算:前台语音 + 后端模型两笔账一起算,按你的真实通话量出预算
- 落地实施:AI 客服方案、与工单/CRM/电话系统对接,转人工时带上完整上下文
- 知识底座:语音 Agent 答得准不准,取决于它背后有没有一个整理好的知识库——见企业 AI 知识库
结语
全双工不是参数上的小改进,是语音交互第一次不那么像在跟机器说话。但模型只是其中一环——真正决定效果的是背后的知识库、系统对接和转人工的设计。
同期 OpenAI 还发布了图像模型 GPT-Image-2.5,拆成快速生成与精确编辑两个型号且没有涨价,见GPT-Image-2.5:Flare 与 Sunburst 怎么选。
想评估自己的业务适不适合上语音 AI,把每天通话量、常见问题类型、现有工单系统三样告诉我们,可以先做一次可行性判断。
北京元空间科技有限公司(Linkmetax 元空间科技)成立于 2022 年,已通过 ISO 9001、ISO 27001、ISO 20000-1、ISO 45001、ISO 14001 五大体系认证。欢迎联系:400-024-2195 / info@linkmetax.com。
联系我们做一次语音 AI 可行性评估 → | Microsoft 企业云中心
参考资料(官方):gpt-live-1 模型文档(OpenAI Developers)、OpenAI API 定价页、Foundry Models sold by Azure(Microsoft Learn)、Foundry 数据隐私与安全(Microsoft Learn)。Full Duplex Bench 提升幅度为公开报道转述的 OpenAI 说法。可用性、配额与价格以 OpenAI、微软官方最新说明为准。
下载《GPT-Live-1 全双工语音模型:能边听边说的 AI,每分钟 $0.05》PDF 完整版
留下邮箱,立刻获取本文 PDF + 后续企业 AI / 软件采购干货
- ✓ 含全部图表、检查清单、参考链接
- ✓ 可用于内部分享 / 招投标资料引用
- ✓ 后续更新自动推送 · 不发垃圾邮件
想把这些经验落到你的企业?
1 个工作日内出方案 / 报价 · 可签 NDA · 支持招投标
相关文章
GPT-Image-2.5 发布:Flare 与 Sunburst 怎么选?定价与 Azure 接入
OpenAI 于 2026 年 9 月 8 日发布 GPT-Image-2.5,拆成 Flare(快速生成)与 Sunburst(精确编辑)两个 API 型号,定价与上一代 GPT-Image-2 完全相同。本文讲清两个型号怎么选、价格怎么算、以及企业在 Microsoft Foundry 上怎么接入。
GPT-6 Astra 有多强?Microsoft Foundry 上的能力、定价与接入
GPT-6 Astra 是 OpenAI 2026 年 9 月 3 日发布的最强模型:105 万 token 上下文、ARC-AGI-2 独立验证 95.0%、能跨应用操作没有 API 的老系统,同日上线 Microsoft Foundry。本文讲清它强在哪、企业能把哪些活交给它、Azure 定价与接入路径。
喜报!Linkmetax 元空间科技获得微软 Solutions Partner 认定 · Data and AI (Azure) 路径
北京元空间科技有限公司(Linkmetax)获得微软 Solutions Partner for Cloud & AI Platforms 认定,子项 Data and AI (Azure) 路径。四条能力线:Azure 数据平台落地、企业 AI 应用与私有部署、AI 工作站混合算力、数据迁移与合规基线。
