OpenAI 推出 GPT-Live-1,语音交互更自然

GPT‑Live‑1 in the API

OpenAI 正式在 API 中推出 GPT-Live-1,这是一款专为构建自然语音体验而设计的强大模型。与传统的 STT-LLM-TTS 串联架构不同,GPT-Live-1 能在单个模型中同时处理听力和说话,显著降低了延迟并优化了打断处理。早期评估显示,该模型在语言教学场景中能将打断率降低近 80%,让学习者有更多思考时间。开发者可以通过系统提示词灵活调整语音的语调、语速和风格,并支持将深度推理任务委托给 GPT-6 Astra 等后端模型。此外,GPT-Live-1 还增强了在嘈杂环境下的抗干扰能力,支持电话场景的全双工语音代理部署,让语音助手在真实世界中更加可靠和自然。

GPT-Live-1 能够在单个模型中同时处理听力和说话,从而避免了传统串联架构中的延迟和脆弱的交接过程。
  1. dbbk

    我等这一天好久了!我正在学西班牙语,所以自己写了个 App 来教自己,但特别聚焦于我生活中的具体场景,比如“在巴塞罗那的酒吧看巴萨比赛”。它既做 FSRS 闪卡训练,也做实时对话练习。

    我觉得教育领域是这些实时对话模型非常未被充分探索的。没错,你确实可以用 ChatGPT Live,但那是自由形式且无结构的,没有课程大纲,也无法展示辅助视觉材料等等。从宏观角度看,如果你能给每个孩子配备专属的个人导师,而不是仅仅依赖集体教学,教育成果可能会有巨大的飞跃。

  2. agentdev001

    重发我在 https://news.ycombinator.com/item?id=49646963 的评论

    恭喜发布。过去几个小时我一直在折腾这个——超级超级酷。我一直兴奋地等着它上线 API,因为显然之前并没有一个高保真、即插即用的语音接口选项能直接嵌入现有的框架中。到目前为止这简直让我震惊!

    (顺便问一句,有没有一个统一的地方可以关注 API 的更新,能涵盖所有变更?据我所记,你们发过几条推文提到了一些新增功能,但从未出现在 API 变更日志里 ;])

  3. almogo

    即使作为一个非常拥抱 AI 的人,这里对我来说卖点也实在不够。我几乎从来不想和 AI 说话。我根本不认为我会有有用的语音交互体验。也许智能体(agents)能解决这个问题,但要克服从机器人电话客服开始长达 30 年的负面先例,我不认为光靠一个新 API 就能在一夜之间改变这一切。

  4. kailpa1

    我觉得这在“通过教别人来学习”的场景下可能很有用,而这里的“别人”就是 AI。我们都知道,费曼技巧(通过教学来学习)是发现知识盲点、检查自己能否把话题解释得足够简单让“学生”听懂的好方法。但在这个流程中,找到合适的“学生”是最难的。用这个模型(背后或许还有一个更强的推理模型)来替代学生,对于这种场景来说,听起来是一个足够好的真人替代品。

  5. ndom91

    一直想试试把它用在 https://github.com/TristanBrotherton/voicepe-realtime 之上,配合 HomeAssistant VoicePE。

    还有其他人用 HA 或 Voice PE 搞出点什么了吗?

    看起来它需要第二个模型来做函数调用(function calling),而 gpt-realtime-2.5 不需要。此外,Voice PE 的 XMOS 芯片音频管道可能不太适合全双工来回对话,就像 gpt-live-1 现在支持的那样。

同日更多故事

2026-09-11