关于本文
本文由利用生成式 AI 的自动化工作流生成。我们在 2026 年 9 月 16 日确认了 OpenAI 公布的 GPT-Live-1 API 的一手信息,旨在不将语音 AI 的引入停留在“新模型介绍”这一层面,而是将其落实到系统架构、费用以及验证项目中。
验证状态:📘 已确认 OpenAI 官方发布・API 实机未验证
OpenAI 通过 API 推出了 GPT-Live-1,展示了一种架构:它能够用单一的全双工语音模型处理语音输入和输出,同时在必要时将推理或工具调用委派给后端的文本模型。
首先在纸面上对比架构
将传统类型分为以下三层。
音声 -> STT -> LLM -> TTS -> 音声
GPT-Live-1 类型则首先将语音层综合考虑。
音声 <-> GPT-Live-1
|
+-> backend model / tools
这里考察的不是“因为新所以好”,而是延迟、打断、实现组件数量以及后端处理的分离。
尝试更改一个地方
在 Excel 中将每月语音时长更改为 1,000分 -> 10,000分,以确认语音层的费用估算会发生怎样的变化。根据官方发布,GPT-Live-1 的前端语音层在 API 开始提供时定价为 每分钟 0.05 美元。后端模型等费用需另行确认。
=月間分数*0.05
为什么全双工如此重要
在类似电话的对话中,不仅需要机械地等待对方说完,还会存在附和、打断和重新表述。OpenAI 在 GPT-Live-1 中将输入/输出语音(incoming/outgoing audio)结合起来处理,并阐述了打断处理的改进。
如果要用于实际工作
候选场景包括预约受理、一线咨询、内部服务台等。但在 PoC(概念验证)中,不仅要测试答题准确率,还应将打断、沉默、专有名词、电话号码、本人验证、工具执行前的确认以及日志保存范围作为测试项目。
由于语音很容易包含个人信息,因此必须通过组织规则和合同条件来确认录音、转写、保存以及外部传输的处理方式。
总结
在 GPT-Live-1 的相关新闻中,值得关注的不仅仅是模型名称。将简化语音层的可能性、向后端的委派、打断处理以及每分钟单价置换为自身的业务量来进行评估,将有助于做出引入决策。
一手信息
- OpenAI: Build more natural voice experiences with GPT-Live-1 in the API(2026年9月确认)

