OpenAI发布新语音模型,升级ChatGPT实时对话
摘要
OpenAI 发布两款新的语音对话模型 GPT-Live-1 和 GPT-Live-1 mini,主打更自然的实时交流体验。公司同时调整了 ChatGPT 的语音功能,默认将现有高级语音模式切换为 GPT-Live-1 mini,付费用户可使用更大的 GPT-Live-...
OpenAI 发布两款新的语音对话模型 GPT-Live-1 和 GPT-Live-1 mini,主打更自然的实时交流体验。公司同时调整了 ChatGPT 的语音功能,默认将现有高级语音模式切换为 GPT-Live-1 mini,付费用户可使用更大的 GPT-Live-1。
支持边听边说
这两款模型采用全双工语音架构,能够在说话和听取用户输入时同时运行。与此前“语音转文字—文本生成—文字转语音”的串联方式相比,新模型更强调连续对话能力,用户可以像与人交谈一样自然打断,也能支持实时翻译等场景。
OpenAI 在媒体沟通会上表示,新模型重点改进了两类问题:一是系统在用户尚未说完时插话,二是回答复杂问题时能力不足。按照公司的说法,语音层在持续对话的同时,还可以把请求发送给更新的文本模型,例如 GPT-5.5,以调用搜索、推理或代理能力。
默认接入 ChatGPT
OpenAI 表示,新语音模式面向更长时长的连续交流设计。ChatGPT Voice 产品负责人 Atty Eleti 在介绍中称,他曾在散步时与该功能持续对话 30 到 40 分钟。
公司还展示了另一项能力:模型可以在较长时间内保持安静,持续吸收上下文,直到用户再次发起指令。由于新语音模式可调用更新的 GPT 模型,它也能在部分场景中用可视化方式呈现信息,而不只输出语音结果。
- 默认模型:GPT-Live-1 mini
- 付费层可用:GPT-Live-1
- 已有用户规模:超过 1.5 亿人使用 Voice 和 Dictation 与 ChatGPT 交流
语音助手竞争继续升温
OpenAI 认为,语音未来可能成为处理复杂任务的主要计算入口之一。不过公司这次没有披露任何硬件产品信息。此前市场曾传出 OpenAI 可能在年内推出具备 AI 功能的耳机产品。
在行业层面,语音助手正成为 AI 公司竞争的新方向。苹果和亚马逊都在更新各自助手的对话能力与上下文处理表现,一些初创公司也在尝试让助手在后台执行任务的同时,提供更自然的语音互动。
不过,OpenAI 也承认新语音模式仍有改进空间。演示实时印地语翻译时,助手带有明显的美式口音,表达也偏书面化。公司称该模式已针对“多数常用口语”做了优化,但没有列出具体支持范围。
OpenAI 还表示,新模型并非朝“AI 陪伴”方向设计。公司称,系统内置了安全措施,在面对青少年用户时会给出更符合年龄的回应;如果对话涉及自残等内容,也会提供相关帮助资源。
评论 (5)
1.5亿用户呢,新模型应该会受欢迎,不过口音问题得赶紧解决。
这更新挺牛啊,边听边说方便多了,就是不知道实际使用效果咋样。
没硬件产品信息有点可惜,还期待AI耳机呢,这竞争越来越激烈了。
能持续对话这么久不错,可视化呈现信息也是亮点,就是支持口语范围不明确。
改进了插话和回答复杂问题的能力,希望真能提升使用感受,别光说不练。