阿里巴巴旗下Qwen團隊發表全新語音AI模型系列「Qwen-Audio 3.1」,涵蓋語音辨識、語音合成與即時語音對話。此次更新的五款模型不僅提升了效能,API使用費用也大幅調降,部分應用情境下成本最高可降低95%。
五款模型涵蓋辨識、合成與對話全流程
本次發表的五款模型分別為語音辨識模型(ASR)、其進階版ASR-Next、語音合成模型(TTS)、其進階版TTS-Next,以及支援雙向互動的即時語音模型。新系列取代了先前的Qwen-Audio產品線,僅透過阿里雲的雲端API提供服務,並未開放模型權重下載。
新增情緒辨識與環境音感知功能
ASR模型提升了多語言與多方言的辨識準確度,並能在轉錄過程中自動清除口頭禪與重複內容。進階版ASR-Next在此基礎上新增了附時間戳記的講者分離功能、情緒判讀,以及對背景音、環境噪音的辨識能力。
TTS(語音合成)支援跨語言的自然音色轉移,僅需文字指令即可控制語氣與說話風格。進階版TTS-Next將語言模型與擴散模型結合,能在單次處理中同時生成人聲、音效與環境音。
即時語音模型可以像人類對話一樣邊說邊聽,被打斷時也能立即回應。阿里巴巴表示,該模型還能透過聲音判斷使用者情緒,並據此調整回應速度與同理程度,但尚未公布相關能力的具體測試數據。
API價格最高調降95%
伴隨新系列發表,阿里巴巴同時大幅調降了API使用費用:語音辨識最高降價95%,語音合成降價約70%,即時對話降價約85%。此舉意在降低企業將語音AI功能整合進自家產品的開發與維運成本門檻。
在語音AI領域,OpenAI、Google等歐美主要AI企業也持續強化各自的對話式語音功能,效能與價格上的競爭日益激烈。中國科技企業同樣加大了在語音AI領域的投資,阿里巴巴此次大幅降價,也被視為這場價格競爭的延續。
總結
2026年9月23日,阿里巴巴發表了涵蓋語音辨識、語音合成與即時對話的新系列「Qwen-Audio 3.1」。在新增講者分離、情緒辨識等功能的同時,API價格最高調降95%,這將進一步降低企業將語音AI整合進自家服務的門檻。中國的語音AI能否在實際應用中站穩腳步,值得持續關注。
