MetaのSuperintelligence Labsが、リアルタイムで音声を扱う初のモデル「Muse Voice Transcribe」を公開しました。話しながら文字起こしを返し、誰が話しているかを切り分け、発話の切れ目まで1つのモデルで判定します。価格は1時間あたり0.18ドル(約28円)で、同種のサービスの半額以下という水準です。
1時間28円という値付け
音声のリアルタイム書き起こしは、これまで用途のわりに単価の高い領域でした。Metaが提示したのは、音声1,000分あたり3ドル(約460円)、時間換算で0.18ドル(約28円)という価格です。
競合と並べると差がはっきりします。Cartesiaの「Ink-2」が1,000分あたり4ドル(約610円)、ElevenLabsの「Scribe v2 Realtime」とDeepgramの「Flux」はいずれも6.5ドル(約990円)です。つまりMetaは、最も安い競合よりさらに25パーセント安いところに置いたことになります。
※1米ドル=153円換算(2026年9月9日時点)
この領域はもともと競争が激しく、OpenAIも5月に同じ用途の「GPT-Realtime-Whisper」を投入し、7月には文字起こしモデルの価格を引き下げています。そこへ、性能で真っ向勝負するのではなく価格で殴り込むという構えです。Metaが「Muse Spark 1.1」「1.2」で見せた戦い方と同じ流れにあります。
80ミリ秒ごとに「待つか、出すか」を決める
技術的な要点は、待ち時間の扱い方にあります。Muse Voice Transcribeは入力された音声を80ミリ秒ずつの塊に切り、その塊を処理するたびに「もう少し聞き続けるか、次の単語をテキストとして出すか」を判断します。
長く待てば前後の文脈が増えて精度は上がりますが、そのぶん表示は遅れます。逆に急げば誤りが増えます。このモデルは、単語ごとの難しさに応じて待ち時間を動的に変えます。聞き取りやすい語はすぐ出し、判断に迷う語には長めに耳を傾ける、という挙動です。
Metaはこの振る舞いを強化学習(望ましい結果に報酬を与えて方策を学ばせる手法)で獲得させたとしています。誤り率の低さと遅延の短さの両方に報酬を与えることで、どちらか一方に倒れないよう調整したかたちです。
話者の切り分けと文の区切りも同じモデルで
従来、リアルタイムの音声処理は、書き起こし、話者の分離、発話終了の検出をそれぞれ別のシステムで担うのが一般的でした。Muse Voice Transcribeは、この3つを1つのモデルに統合しています。
話者については、流れていくテキストの中に話者の交代を書き込み、AからZまでの識別子を各区間に付けます。同時に20人を超える話者を区別でき、1時間を超える録音も後処理なしで扱えるとしています。8人が同じ部屋にいる状況のデモでは、発言をその場で個人に割り当てて見せました。
対応言語は70を超え、うち25言語は詳しく検証済みで、日本語もそこに含まれます。文の途中で言語が切り替わる、いわゆるコードスイッチングにもそのまま対応します。固有名詞に弱いという音声認識の弱点については、あらかじめキーワードや文脈をヒントとして渡すことで精度を補える設計になっています。
第三者評価では精度で首位、遅延では僅差
Metaの主張は、第三者であるArtificial Analysisの評価でもおおむね裏付けられました。英語での単語誤り率は3.1パーセント、話者が話し終えてから結果が確定するまでの時間は0.16秒です。
同じ条件で、ElevenLabsのScribe v2 Realtimeは3.6パーセント・0.14秒、AssemblyAIの「Universal-3.5 Pro Realtime」は4.0パーセントでした。CartesiaのInk-2は、発話終了を自前で検出するか外部の仕組みに頼るかで3.4パーセントと4.0パーセントに割れます。
精度では確かに先頭ですが、遅延ではElevenLabsのほうがわずかに速く、数字の差そのものは小さいと言えます。この結果を見るかぎり、性能面での優位よりも、冒頭の価格差のほうが実務では効いてきそうです。
公開されていないもの
一方で、Metaはパラメータ数も学習データの量も、音声データの出どころも明らかにしていません。重みの公開もありません。オープンな公開を掲げてきた同社の以前の姿勢を思えば、この点は素直に受け取りにくいところです。
利用できる場所は現時点で3つです。Meta AIとMuse Codeの音声入力、そしてMeta Model APIです。任意のアプリでFnキーを押し続けると音声入力が立ち上がる、という使い方も用意されています。
背景にあるのは、CEOのMark Zuckerberg氏が掲げる「パーソナル超知能」という構想です。Metaの社員が公開したデモでは、AIグラスを通して実際の会話を聞き取り続ける個人向けAIエージェントの土台として、確実な音声認識が要るのだと語られています。なお同社のカメラ付きグラスをめぐっては、ドイツで禁止が議論されたものの、連邦ネットワーク庁は追及しない判断を下しています。
まとめ
Muse Voice Transcribeは、書き起こし・話者分離・発話終了の検出という3つの処理を1つのモデルにまとめ、単語ごとに待ち時間を変えることで速度と精度を両立させたモデルです。第三者評価での精度は首位ですが、遅延の差はわずかで、性能そのものは各社が横並びに近づいています。その中で1時間0.18ドルという価格を置いてきたところに、この発表の意図がよく表れています。会議の記録や字幕付与のように、長時間まわし続ける用途ほど効いてくる差になりそうです。
