中国Alibaba傘下の生成AIブランド「Qwen」の開発チームが、音声認識・音声合成・リアルタイム対話を担う新しい音声AIモデル群「Qwen-Audio 3.1」を公開しました。5つのモデルから成る新シリーズは性能を底上げしただけでなく、API利用料金も大幅に引き下げており、用途によっては最大95パーセントのコスト削減になるとしています。

音声認識から対話まで、5つのモデルを一新

今回公開されたのは、音声認識(ASR)、その上位版のASR-Next、音声合成(TTS)、上位版のTTS-Next、そして双方向のリアルタイム対話モデルの5種類です。従来のQwen-Audioシリーズを置き換える形で刷新されており、いずれもクラウドAPI経由で利用できます。モデル本体をダウンロードして手元で動かす方式ではなく、Alibaba Cloudが提供するホスト型のAPIとして提供されている点が特徴です。

感情や周囲の音まで読み取る新機能

ASRは複数の言語や方言に対する認識精度を高めたほか、言い淀みや同じ内容の繰り返しを自動的に整えて書き起こす機能を備えています。上位のASR-Nextはこれに加え、話者ごとの発言をタイムスタンプ付きで識別する話者分離、話し手の感情の推定、さらに周囲の環境音や機械音まで認識する機能を新たに搭載しました。

TTS(音声合成)は言語をまたいだ自然な声質の引き継ぎに対応しており、テキストによる指示だけで話し方や口調を制御できます。上位のTTS-Nextは言語モデルと拡散モデルを組み合わせた仕組みを採用し、声だけでなく効果音や環境音までを一度の処理でまとめて生成できるようになりました。

リアルタイムモデルは、人が会話するときのように話しながら同時に相手の声を聞き取ることができ、会話への割り込みにも即座に反応できるとしています。ユーザーの声の調子から感情を読み取り、応答の速度や共感的な受け答えを調整する機能も盛り込まれているとしていますが、具体的な精度を示す数値は公開されていません。

API料金は最大95%引き下げ

Alibabaは新シリーズの公開にあわせて、API利用料金も大幅に引き下げました。音声認識(ASR)は最大95パーセント、音声合成(TTS)は約70パーセント、リアルタイム対話は約85パーセントの値下げとなります。音声AIを使ったサービスの開発・運用コストを抑えたい企業にとって、導入のハードルを下げる狙いがあるとみられます。

音声AIをめぐっては、OpenAIやGoogleなど欧米の主要AI企業も対話型の音声機能を相次いで強化しており、性能と価格の両面で開発競争が激しくなっています。中国のテクノロジー企業各社も音声AIへの投資を強めており、今回の大幅値下げはこうした価格競争を意識した動きだと考えられます。

まとめ

Alibabaは2026年9月23日、音声認識・音声合成・リアルタイム対話をカバーする新シリーズ「Qwen-Audio 3.1」を公開しました。話者分離や感情推定といった新機能を備えつつ、API料金を最大95パーセント引き下げたことで、音声AIを自社サービスに組み込むハードルは一段と下がりそうです。中国発の音声AIが実用面でどこまで存在感を示せるか、今後の展開が注目されます。