阿里巴巴旗下Qwen团队发布了全新语音AI模型系列「Qwen-Audio 3.1」,涵盖语音识别、语音合成与实时语音对话。此次更新的五款模型不仅提升了性能,API使用费用也大幅下调,部分场景下成本降幅最高可达95%。

五款模型覆盖识别、合成与对话全流程

本次发布的五款模型分别是语音识别模型(ASR)、其进阶版ASR-Next、语音合成模型(TTS)、其进阶版TTS-Next,以及支持双向交互的实时语音模型。新系列取代了此前的Qwen-Audio产品线,仅通过阿里云的云端API提供服务,并不开放模型权重下载。

新增情绪识别与环境音感知能力

ASR模型提升了多语言与多方言的识别准确率,并能在转写过程中自动清理口头禅和重复内容。进阶版ASR-Next在此基础上新增了带时间戳的说话人分离功能、情绪判断,以及对背景音、环境噪音的识别能力。

TTS(语音合成)支持跨语言的自然音色迁移,仅凭文本指令即可控制语气与说话风格。进阶版TTS-Next将语言模型与扩散模型相结合,可以在一次处理中同时生成人声、音效与环境音。

实时语音模型可以像人类对话一样一边说话一边聆听对方,被打断时也能立即作出反应。阿里巴巴表示,该模型还能通过声音判断用户情绪,并据此调整回应速度与共情程度,但尚未公布相关能力的具体测试数据。

API价格最高下调95%

伴随新系列发布,阿里巴巴同时大幅下调了API使用费用:语音识别最高降价95%,语音合成降价约70%,实时对话降价约85%。此举意在降低企业将语音AI功能集成到自身产品中的开发与运营成本门槛。

在语音AI领域,OpenAI、谷歌等欧美主要AI企业也在持续强化各自的对话式语音功能,性能与价格上的竞争日趋激烈。中国科技企业同样加大了在语音AI领域的投入,阿里巴巴此次大幅降价,也被认为是这场价格竞争的延续。

总结

2026年9月23日,阿里巴巴发布了覆盖语音识别、语音合成与实时对话的新系列「Qwen-Audio 3.1」。在新增说话人分离、情绪识别等功能的同时,API价格最高下调95%,这将进一步降低企业将语音AI集成到自身服务中的门槛。中国的语音AI能否在实际应用中站稳脚跟,值得后续关注。