【大屏时代】首页 > 3D快报内容详情

千问一口气端出五款语音大模型,TTS价格腰斩七成、ASR砍掉九成五,把耳朵和嗓子全打包给了开发者

59分钟前 4 大屏时代

阿里千问在9月23日把自家语音栈整体翻了个新。Qwen-Audio-3.1系列一口气放出五款模型,从识别、合成到实时交互再到音频创作与理解,凑齐了一套覆盖"理解—生成—交互—创作"的完整音频能力矩阵,顺手还把全线价格狠狠往下拽了一把:TTS直降约70%,Realtime降幅约85%,ASR更是砍掉95%。这套组合拳的潜台词很直白——语音能力不再藏着掖着,直接把使用门槛砸到地板上。

识别这条线,Qwen-Audio-3.1-ASR成了新一代语音识别大模型。它最见功夫的是"听得懂上下文",新增的原生转写润色能自动剥掉语气词、删掉重复表达、重组语义,让吐出来的文字更顺、更有逻辑,而不是一堆 raw 转录。分角色转写则把"谁在什么时候说了什么"完整还原,给会议、访谈和对话分析留下可追溯的结构化记录。这套端到端方案把说话人标签、时间戳和文本联合输出,既能处理轮流发言,也能留住短插话和重叠语音,把每个人说的话掰清楚。

耳朵的覆盖广度也夸张:一套模型吃下30种语言和16种中文方言,行业词、专业实体和分级热词都能识别,还会参考长音频历史上下文让人名和术语保持一致。延迟上首字响应压到约160毫秒,边说边转写不卡顿。成绩单同样硬:公开方言数据集KeSpeech和WSYue的11个子集上平均字错误率4.55%,中文16种方言内部测试平均字错误率10.38%、温州话这类难啃的方言提升尤其明显,方言翻普通话的平均语义句准率冲到82.10%。

更野的一步来自基于下代架构的Qwen-Audio-3.1-ASR-Next。它把识别对象从"语音里的文字"扩成了"完整的音频信息"——能听懂人物情绪、环境声和机械声,完成声音描述、事件定位和音频问答推理。给一段混着对话、背景音乐和环境声的音频,它不光输出字幕,还能告诉你里面有哪些声音、相关事件何时发生,并回答关于整段内容的提问。分角色ASR测试里,ASR-Flash-Next和ASR-Flash版本分别在八项指标里拿下五项和三项最优,全面压过此前的Fun-ASR级联系统。

合成这边,Qwen-Audio-3.1-TTS强调真实表达而非只求字音正确。它支持多语种与方言合成,同一音色跨语言时能自然迁移,让你秒讲数种语言,还能靠指令控制情绪、语速和表达方式,让声音贴合具体内容与场景。

真正的惊喜是下代架构的Qwen-Audio-3.1-TTS-Next,它把音频创作从"单一人声合成"升格成了"通用音频生成系统"。过去做一段完整音频,得主播、音效师、混音师、剪辑师分头干活再后期缝合;现在围绕文本、时间戳和参考音频,一个模型就能统一生成人声、音效和环境音。它支持多人音色复刻与多轮对话,连续内容里各角色音色不"变声",还会演绎停顿、接话、附和和情绪转折;多类声音融合生成,呈现材质、远近与空间层次——有声书里能同时处理旁白、两角色对话,再补上城市低鸣、晚风和易拉罐碰撞声,让对话像真发生在故事场景里。更专业的是它吃自然语言控制,能指定语气、语速、音量、音乐风格与配器,支持细粒度时间戳、声音复刻和48kHz输出,对白起止和声音事件节奏都能精准排布,喂饱播客、有声书、影视、游戏和广告的需求。

实时交互这条线,Qwen-Audio-3.1-Realtime不再把识别、模型和合成简单串糖葫芦。它走全双工,能同时说和听,用户随时插话、打断,体验贴近真人通话。模型理解的不再只是文字,还有声音背后的情绪与意图——察觉你语气低落,它不会机械回一句"我理解",而是放慢语速、调整措辞;对话里切语言,上下文、语气和节奏不断档;面对不确定信息少编、面对高风险内容守边界。它还基于多教师蒸馏架构在保持低延迟的同时提升推理与安全,并能在实时对话里直接调用Agent工具,连API、知识库和业务系统去查、去执行,把结果自然带回对话。

落地已经在路上。Qwen-Audio-3.1-Realtime正和Qoder、千问办公等Agent,以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等硬件结合,让用户不必开电脑手机,直接动嘴发起任务、在对话里追加条件或修改需求。从ASR的润色与方言、到ASR-Next的泛音频理解、TTS的跨语言音色、TTS-Next的完整音频创作、再到Realtime的拟人共情与工具调用,千问这五款模型沿着五条清晰技术路径同时推进,把"能听懂、能创作、能聊天"打包成语音这一连接人、内容与AI的自然入口,而九成五的ASR降价,则把这道入口的门槛几乎拆到了地平线以下。


相关文章

相关标签: 千问一口气端出五款语音大模型,TTS价格腰斩七成、ASR砍掉九成五,把耳朵和嗓子全打包给了开发者