Meta 旗下的 Superintelligence Labs 推出首款針對即時音訊的模型 Muse Voice Transcribe。它能在對方還在說話時就輸出文字,分辨是誰在說,並判斷一句話在哪裡結束,這三件事全由同一個模型完成。價格為每小時 0.18 美元(約 28 日圓),不到同類服務的一半。

每小時 0.18 美元的定價

即時語音轉寫長期以來單價偏高。Meta 開出的價格是每 1,000 分鐘音訊 3 美元(約 460 日圓),換算成小時約為 0.18 美元(約 28 日圓)。

與競爭對手並列來看,差距相當明顯。Cartesia 的 Ink-2 為每 1,000 分鐘 4 美元(約 610 日圓),ElevenLabs 的 Scribe v2 Realtime 與 Deepgram 的 Flux 都是 6.5 美元(約 990 日圓)。換句話說,Meta 把價格壓在比最便宜的競品再低 25 個百分點的位置。

※1 美元 = 153 日圓(截至 2026 年 9 月 9 日)

這個領域原本就競爭激烈。OpenAI 在 5 月投入用途相同的 GPT-Realtime-Whisper,7 月又調降了轉寫模型的價格。Meta 沒有在效能上正面交鋒,而是直接以價格切入,這與它在 Muse Spark 1.1、1.2 上的做法一致。

每 80 毫秒判斷一次「繼續聽,還是先輸出」

技術上的重點在於如何處理延遲。Muse Voice Transcribe 把輸入的音訊切成 80 毫秒的區塊,每處理完一塊,就判斷要繼續聽下去,還是把下一個詞當成文字輸出。

等得越久,前後文越充足、準確度越高,但輸出也越落後;反之若急著輸出,錯誤就會增加。這個模型會依每個詞的難易度動態調整等待時間:容易辨識的詞立刻輸出,難以判斷的詞則多聽一會兒。

Meta 表示,這樣的行為是透過強化學習(對期望結果給予獎勵以學習策略的方法)取得的。同時對低錯誤率與短延遲給予獎勵,讓模型不會往任一邊傾斜。

說話者分辨與斷句也在同一個模型內完成

過去的即時音訊處理,通常由不同系統分別負責轉寫、說話者分離與發言結束偵測。Muse Voice Transcribe 把這三項整合進單一模型。

在說話者方面,它會把發言者的輪替直接寫進持續產生的文字中,並為每個段落標上 A 到 Z 的識別碼。它可同時分辨 20 人以上,也能在不做後處理的情況下應付超過 1 小時的錄音。在 8 人同處一室的示範中,系統當場把發言分配給了各個人。

支援語言超過 70 種,其中 25 種經過深入驗證,日語也包含在內。對於句子中途切換語言的所謂語碼轉換,它同樣能直接處理。語音辨識在專有名詞上的既有弱點,則可透過事先傳入關鍵字與情境作為提示來補強。

第三方評測準確度居冠,延遲差距卻很小

Meta 的說法大致獲得第三方機構 Artificial Analysis 的驗證。英語的詞錯誤率為 3.1 個百分點,從說話者結束發言到結果確定為 0.16 秒。

在相同條件下,ElevenLabs 的 Scribe v2 Realtime 為 3.6 個百分點、0.14 秒,AssemblyAI 的 Universal-3.5 Pro Realtime 為 4.0 個百分點。Cartesia 的 Ink-2 則視其為自行偵測發言結束或倚賴外部機制,分別為 3.4 與 4.0 個百分點。

準確度上 Meta 確實領先,但延遲方面 ElevenLabs 略快一些,各項數字之間的差距本來就不大。從這組結果來看,實務上真正發揮作用的,恐怕還是開頭提到的價差。

尚未公開的部分

另一方面,Meta 並未公布參數量與訓練資料的規模,也沒有說明音訊資料的來源,權重同樣沒有釋出。想到這家公司過去在開放釋出上的姿態,這一點並不容易照單全收。

目前可用的管道有三個:Meta AI 與 Muse Code 的語音輸入,以及 Meta Model API。在任何應用程式中長按 Fn 鍵,就能叫出語音輸入。

這一切的背景,是執行長 Mark Zuckerberg 提出的「個人超級智慧」構想。在 Meta 員工公開的示範中,他們強調可靠的語音辨識,是讓個人 AI 代理透過 AI 眼鏡持續聽取真實對話的基礎。順帶一提,該公司搭載攝影鏡頭的眼鏡在德國曾被討論是否禁售,聯邦網路管理局最後決定不予追究。

總結

Muse Voice Transcribe 把轉寫、說話者分離與發言結束偵測這三項處理整合進單一模型,並藉由逐詞調整等待時間,在速度與準確度之間取得平衡。第三方評測中它的準確度居冠,但延遲差距很小,各家的效能正逐漸拉近。在這樣的局面下端出每小時 0.18 美元的價格,正好說明了這次發表的用意。會議記錄、字幕製作這類需要長時間連續運作的用途,感受到的差異會更明顯。