微軟 AI 於 2026 年 9 月 3 日推出自家研發的語音辨識模型 MAI-Transcribe-2。在多語系基準測試 FLEURS 中,該模型於 60 種語言的平均字錯誤率為 5.2%,排名第一,定價則是每小時音訊 0.10 美元(約 16 日圓)。語音轉文字領域長期難以同時兼顧精確度、速度與價格,這次微軟是三項一起衝。
※1 美元 = 156 日圓(截至 2026 年 9 月 4 日)
每小時 0.10 美元的定價
最先吸引目光的是價格。轉寫 1 小時音訊只要 0.10 美元,換算日圓不到 20 日圓。就算每天處理 10 段 1 小時的會議錄音,每月支出也還在數百日圓的量級。不過這個費率是到年底為止的限時優惠,微軟並未說明之後的正式價格。若考慮導入,等正式價格公布後仍需重新試算。
微軟把這樣的定價歸因於處理速度。若 1 小時音訊約 10 秒即可回傳,同一張 GPU 單位時間能消化的工作量大增,單筆成本自然下降。
10 秒回傳 1 小時音訊
速度方面的佐證,來自第三方評測機構 Artificial Analysis 的量測結果。依這些數據,MAI-Transcribe-2 的處理速度是 OpenAI GPT-Transcribe 的 10 倍、ElevenLabs Scribe v2 的 7 倍、Google Gemini 3.5 Transcribe 的 5 倍,精確度同時還更高。
具體數字為錯誤率 2.0%、速度係數 403.6。速度係數 403.6 代表處理速度約為實際時間的 400 倍,也就是 1 小時音訊約 10 秒回傳。在以精確度與速度為兩軸的分布圖上,微軟表示 MAI-Transcribe-2 單獨位於最有利的象限。若單看 Artificial Analysis 的字錯誤率排行榜,該模型則排在第二。
60 種語言精確度不掉
多語系能力的衡量標準是公開基準測試 FLEURS。微軟指出,MAI-Transcribe-2 在受測的全部 60 種語言都維持高精確度,以平均字錯誤率 5.2% 拿下第一。微軟表示,目前還沒有其他模型能在這麼廣的語言範圍內維持精確度。
對於現在得按語言切換模型的開發者來說,這一點在實務上意義不小。處理多語系音訊的服務通常先做語言判別,再分派到對應模型,每一道分支都會增加實作與維運的負擔。若一個模型就能通吃,這些分支可以整組拿掉;也不必依語言分別保留 GPU 資源,閒置率跟著下降。
語言指定為選用項目,預設由模型自動判別所使用的語言。像 Hinglish、Spanglish 這種在同一句話中混用兩種語言的語碼轉換,也在自動處理範圍內。微軟的說明文件建議,只有在自動判別失敗時才明確指定語言。
為實務打造的細部設定
功能面準備了不少針對業務場景的參數。啟用語者分離後,錄音會依語者切分,並回傳帶有起始位置與長度資訊的片段。時間戳記可在字級、片段級與不回傳三種之間選擇。
另外還有片語清單機制。事先提供專業術語、縮寫與專有名詞,模型辨識時就會偏向這些詞。說明文件特別註明,這些只是提示,並不會強制輸出結果。
轉寫風格同樣可切換。預設是 verbatim,也就是完全照著所說內容記錄,連贅詞與說到一半重講都保留,適合合規查核、品質管理與對話分析這類在意實際措辭的用途。另一種 clean 則會去掉贅詞並自動整理成好讀的形式,較適合字幕、會議紀錄與對外發布的逐字稿。官方列出的應用場景包括影片字幕、會議、診療紀錄、客服中心紀錄、無障礙、內容製作與語音代理。
抗噪能力被描述為模型本身具備的特性,因此在無法控制錄音環境的現場音訊上也能維持品質。
使用方式與現階段限制
提供形式為 Azure Speech 的公開預覽版。沒有服務等級協議,並明確註記不建議用於正式環境。價格與效能雖然吸引人,但現階段還不適合接進不能停的業務流程。
呼叫方式是透過 Fast Transcription API 的增強模式,在模型屬性指定 MAI-Transcribe-2。輸入音訊需小於 300 MB,格式支援 WAV、MP3 與 FLAC。使用前需要 Azure 訂閱,以及供 Speech 使用的 Microsoft Foundry 資源。
enhanced mode model = MAI-Transcribe-2
語音互動用的 Voice Live API 也可透過工作階段設定項目,將 MAI-Transcribe 用於輸入音訊的轉寫。若只想先試試效果,可透過 Microsoft Foundry、MAI Playground 以及 OpenRouter 體驗展示。
版本管理也在推進。MAI-Transcribe-2 與 MAI-Transcribe-1.5 並存提供,初代的 MAI-Transcribe-1 已於 2026 年 8 月 20 日起標示為不建議使用。仍以舊版本建置流程的團隊,最好先確認移轉期限。
總結
MAI-Transcribe-2 的重點有三:60 種語言精確度不掉、1 小時音訊約 10 秒回傳,以及每小時 0.10 美元的年內限時價格。把原本依語言切換的模型收攏成一個,對經營多語系服務的開發者而言直接減少了實作量。另一方面,目前仍是預覽狀態,也沒有服務等級協議。比較務實的做法,是先在測試環境用自己的音訊資料量測精確度與速度,等正式價格明朗後再判斷是否投入正式環境。
