中国政策档案 Governance Archive HOLDINGS 234,771 · FONDS 122
Record · qbitai ACC. 900072531

Fast and Smart: Alibaba Releases Qwen-Audio-3.0-Realtime with Four Upgrades to Real-Time Voice Large Model

又快又聪明,阿里发布Qwen-Audio-3.0-Realtime:实时语音大模型四项功能升级

Issuer
Date
2026-07-15
Instrument
other
Cited by
0
This document reports on Alibaba's release of the Qwen-Audio-3.0-Realtime voice interaction model, which features upgrades in intelligence, agent tool invocation, empathetic dialogue, and duplex interaction fluency. The model aims to improve response speed and naturalness for applications such as customer service, education, and entertainment.
Full text · 原文 1,587 字
7月15日,阿里巴巴发布实时语音交互对话模型Qwen-Audio-3.0-Realtime,在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。模型包括推理更强的Plus版本和速度更快的Flash版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。今年5月,模型的Preview版本曾在全球权威第三方评测平台Artificial Analysis榜单斩获了两项冠军,超越GPT-Realtime-2。<br> 为压低时延,实时语音模型往往牺牲推理深度,智商衰减。Qwen-Audio-3.0-Realtime针对日常对话、简单问答等对时延敏感的场景,可直接生成回复,毫秒级响应。在考验“AI会不会答”的语音问答基准VoiceBench上,以书面化的标准prompt和口语化的prompt提问,Plus版本得分分别为92.5和90.5,仅下降2.0——意味着模型能扛住真人说话的随意性。在更难的多轮音频对话挑战AudioMultiChallenge基准测试中,Flash版本标准和口语化prompt得分分别为43.6和38.1,仅下降5.5。今年5月,模型的Preview版本Fun-Realtime-Audiochat在“语音推理能力”指标上曾以97.6%登顶Artificial Analysis。<br> 文本大模型的Agent能力已相当成熟,但语音模型往往是“能聊天不能办事”,模型要边听边判断何时该调工具,往往需要用户明显说出“帮我打开XX””才能触发工具,且切回闲聊后,容易出现上下文断裂。Qwen-Audio-3.0-Realtime无需明确的指令,即可自行调用外部工具,调用结果还会自动融入对话记忆,一次调用的结果会被记住,后面几轮追问都能接着用。例如用户先问“附近有什么川菜馆”,再追问“评分4.5以上的哪家最近”,模型会自动衔接地图工具的上一次返回结果继续检索。模型基于FunctionCall标准协议,可以完成MCP、API、知识库的引入。<br> 共情对话是本版本最能改变用户主观体验的部分。Qwen-Audio-3.0-Realtime摆脱了传统语音助手的机械感,可根据对话语境动态调整语气、节奏、音调与情感,比如在辩论场景中,模型能准确抓取对方论点并快速组织反驳,并保持恰当的语气强度。在情感陪伴中,则通过语调、节奏与笑声、叹息、犹豫等副语言信号进行共情回应。在专门考“AI说得像不像人”的S2S语音指令遵循公开基准VStyle上,模型取得SOTA成绩。<br> 双工交互流畅度意为即模型能边说边听,像真人一样随时打断、插话,而非一问一答的对讲机模式。Qwen-Audio-3.0-Realtime内置“多模态感知的双工控制”子模型,通过分析音频信号、语义内容与说话人声纹特征,来判断如何交谈。比如在餐厅、开放工区等嘈杂环境中,它不会被背景噪声误打断;在多人讨论中能锁定主对话对象、忽略旁听者交谈;在多说话人切换时,则能根据语义线索自然过渡。因此,今年5月,模型的Preview版本在对话流畅度指标上曾以97.6%登顶Artificial Analysis。此外,模型的API还预留了audio_prompt字段,用户可上传提前录制的音频样本,锁定声纹,聚焦特定的说话人。<br> 上述能力的提升源于模型采用的On-Policy Distillation(在线策略蒸馏)框架。研究团队将文本大模型的完整推理能力蒸馏至语音模型——语音模型一边自己生成回答、一边由文本大模型实时纠正。同时引入多教师蒸馏策略:口语多轮偏好教师保障口语化表达与指令遵循,通用教师负责基础问答与推理,Agentic教师锁定工具调用与复杂任务,音频理解教师处理副语言与音频语义信息,确保模型在四条主线上均不偏科。<br> 本文由阿里巴巴提供,量子位获授权转载,观点归原作者所有。