中国政策档案 Governance Archive HOLDINGS 234,771 · FONDS 122
Record · qbitai ACC. 900072581

OpenAI Launches GPT-Live: Real-Time Voice Translation and Enhanced AI Interaction

同声传译一夜失业!GPT-Live瞬间翻译,老太太现场抬杠AI看傻全网

Issuer
Date
2026-07-09
Instrument
other
Cited by
0
This media report covers OpenAI's release of GPT-Live, a new voice mode with real-time translation, enhanced natural conversation, and improved reasoning capabilities, demonstrating significant advancements in AI voice interaction.
Full text · 原文 2,348 字
Jay 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 同声传译,这下可能是真寄了啊……<br> 刚刚,OpenAI发布了GPT-Live,语音交互迎来了一次质的飞跃。<br> 真·一句话说完,瞬间翻译。<br> 俩老太太也是角色扮演上了。<br> 这效果,说实话,比去年AirPods Pro 3宣传片里画的饼强太多了。<br> Apple Intelligence你慢慢上线吧,我等OpenAI自己出硬件了(doge)。<br> 更重要的是推理+搜索能力的提升。<br> 老太太把GPT当Google使,一会儿问天气,一会儿考历史,你来我往跟抬杠大赛似的。<br> 而且全是有效信息,AI终于不再用一堆车轱辘话敷衍你了。<br> 除此之外,官方还一次性放出了一堆demo。<br> 厨房场景:不用再对着空气大喊Siri了。GPT可以边一步步指导你烹饪,边帮你计时,真正解放双手。<br> 面试复盘:智能水平大幅提升,AI帮你复盘面试表现,甚至现场教你如何谈薪资。<br> 甚至,OpenAI昨晚还开了一场直播进行现场演示,也是很自信了。。。<br> 感兴趣的可以到官网查看更多demo。<br> OpenAI透露,每周有1.5亿人在和ChatGPT对话。而现在,你手机上的那个白色软件,要变成可随时煲电话粥的「真人」了。<br> 真·美国版豆包(bushi)。<br> 全新的ChatGPT语音体验<br> 总结一下,新的语音模式主要有三点改进。<br> 1、更自然的对话。<br> 以前和AI语音聊天,最怕的就是「抢麦」。现在,你可以随时插话、停下来思考。<br> 当你说话时,它还会时不时发出「嗯、对」这种简短的回应,让你知道它在听。<br> 在抗噪方面也做了优化,面对马路上的车流声或旁边的闲聊,它能更精准地聚焦你的声音。<br> 但关于这一点,评论区有不同声音,不少网友表示,虽然更流畅了,但也老是装作「松弛」地打断用户。<br> 可能还是需要视觉信息吧,毕竟即便是人在开腾讯会议时,也会经常出现互相打断的情况,微表情还是很重要的上下文。<br> 对了,「声优」们也升级了,OpenAI这次特意为GPT-Live重新打磨了ChatGPT里的9种默认音色。<br> 2、更聪明的回答。<br> 以前的语音模式,往往调用的是相对较弱的模型,但这次,ChatGPT Voice接入了GPT-5.5。<br> 还支持自定义推理强度:<br> Instant:适合查天气、闲聊等快问快答,主打秒回。<br> Medium / High:适合需要深度思考的复杂问题。<br> 3、可视化对话。<br> 边听边看,体验拉满。<br> 在语音对话中,ChatGPT 可以实时弹出天气、股票、体育赛事等主题的可视化卡片,不用你再切回屏幕去干看文字。<br> 此外,语音通话现在全面支持联网搜索、记忆功能、图片识别和文件上传。<br> 这意味着,语音不再是一个独立的「阉割模式」,而是正式成为了ChatGPT全套能力的统一交互入口。<br> 全新的AI交互范式<br> 如果你用过之前的ChatGPT语音模式,大概率会有这种感觉:<br> 刚上手很惊艳,用久了就发现——完全是鸡肋啊!!<br> 你说一句,它顿一下再回你;你再说,它再回。永远有一种回合感。还特别喜欢反问,动不动就「还有什么我可以帮你的吗?」<br> 为什么会这样?<br> 最早期的ChatGPT Voice,本质上是三个模型在接力跑:<br> 1、先把你的语音转成文字(ASR)<br> 2、再把文字喂给大语言模型生成回复(LLM)<br> 3、最后把文字转成语音读出来(TTS)<br> 三个模型串联,每一步都有延迟,每一步都在丢信息。你说话时的语气、停顿、情绪,在第一关语音转文字时就被抹平了。<br> 上下文不够,自然会有问题。<br> 后来OpenAI搞了Advanced Voice Mode,把音频处理和音频生成塞进了同一个模型里,做成端到端,延迟确实降了不少,对话也顺滑了一些。<br> 但它骨子里还是「轮次式」的。通过检测「沉默」来判断你是不是讲完了。所以你稍微停顿想个词,或者旁边有人咳了一声,它就可能觉得「好,轮到我发言了」,直接抢麦。<br> GPT-Live这次在两个地方动了刀子。<br> 1、全双工架构:边说边听<br> 在说话的同时,还在听你在说什么。<br> GPT-Live不再只处理一个个分开的消息序列,而是在生成输出的同时持续处理输入。因此,模型可以在一秒内多次判断互动策略。<br> 这让对话终于有了真正的「来回感」,时间感知更精准,也天然支持了实时翻译等需要极低延迟的场景。<br> 2、深度任务委托:前台陪聊,后台干活<br> 本质上就是个路由。<br> GPT-Live 负责前台的连续语音交互,保持对话流畅不卡顿;<br> 但当你问的问题需要联网搜索、深度推理或更复杂的代理能力时,它会悄悄把任务委托给GPT-5.5这样的重型模型在后台处理。<br> 这样一来,即使后台正在处理多个复杂任务,前台的语音对话也完全不会中断。<br> 最终效果在Benchmark上也有体现。<br> OpenAI专门为GPT-Live建立了一套新的人工评测体系,核心就衡量两个指标:愉悦感和对话丝滑程度。<br> 结果显示,在「像不像真人聊天」这件事上,GPT-Live确实做的不错。<br> 至于推理和搜索能力,则更是薄纱之前的AVM了。尤其是Agentic Search这一块,官方数据说直接提升了100倍……<br> 其他细节就不展开了,数据大家看看就行,Demo才是最有说服力的。<br> OMT<br> 《Her》里的那个场景,可能比所有人想象的要来得更快。<br> 从键盘到鼠标,从触屏到语音助手,每一次交互方式的改变,都重新定义了什么是「用电脑」。<br> 但之前的语音交互,说到底还是命令式的。你跟Siri说「设个闹钟」「放首歌」,是在对机器下指令。<br> GPT-Live让我第一次觉得,跟AI说话这件事,从「使用工具」变成了「跟一个人交流」。<br> 未来,你手机右下角那个语音通话按钮,可能会变成你最常用的入口。<br> 参考链接:<br> [1]https://openai.com/index/introducing-gpt-live/