Google發布了兩款全新的文字轉語音模型:「Gemini 3.8 Flash TTS」只需透過文字描述,就能從零打造出全新的聲音;而「Gemini 3.8 Flash-Lite TTS」則專為高速、低成本的大量處理而設計。過去Google的語音合成模型只能從固定的預設聲音中挑選,新模型則可依照角色設定、口音、音色等文字指示,直接生成一個全新的聲音,為遊戲、有聲書與Podcast製作等領域帶來新的可能性。

從「挑選聲音」進化到「設計聲音」

過去Google的TTS模型主要提供約30種預設聲音供使用者挑選。這次發布的Flash TTS在保留這些預設聲音之餘,最大的變革在於使用者只要用自然語言描述角色、口音、音質等特徵,就能即時生成一個全新的聲音。Google也建立了涵蓋各地口音差異、總數超過2000種的聲音資料庫,並預告即將推出「聲音混音」功能,讓使用者能透過提示詞調整資料庫中既有聲音的音色、音高、語速與口音。Flash TTS支援130種語言,主打大量處理的Flash-Lite TTS則支援101種語言,兩者皆支援日語。

新模型同時搭載「聲音複製」功能,可透過約30秒的錄音樣本重現說話者的聲音。此功能僅限用於本人的聲音,或使用者擁有使用權的聲音,使用時必須提交聲音所有者口頭同意的錄音,系統也會驗證該錄音中的說話者是否與參考音檔一致。值得留意的是,在Google AI Studio中,美國伊利諾州、德州、歐洲經濟區(EEA)、英國、瑞士與印度目前皆無法使用此聲音複製功能。

演出指示與長篇內容的生成

兩款模型都支援在腳本中逐行加入類似舞台指示的提示,藉此細膩控制語速與情緒表現。即使是長達數小時的音檔,也能維持穩定的音質與自然的停頓節奏,並可由單一腳本生成兩位說話者之間的對話。笑聲、嘆息、倒抽一口氣等非語言聲音,以及「嗯」等附和語,都能透過腳本中的標籤插入。所有生成的音檔都內建Google的數位浮水印技術「SynthID」,透過聲音複製生成的音檔還會附加標示內容來源的「C2PA」認證資訊。

提供範圍與價格方案

兩款模型已於發布當天起陸續開放使用。開發者可透過Gemini API與Google AI Studio使用,一般使用者則可透過「Gemini Notebook」的語音導覽功能使用Flash TTS,並透過「Google Vids」使用Flash-Lite TTS。針對企業客戶的「Gemini Enterprise」API串接也即將推出。Agora、LiveKit、Pipecat、Vercel等開發者平台正透過Gemini API串接此功能,Figma、HeyGen等公司也在將其整合進自家服務。

在Gemini API的付費方案中,Flash TTS每百萬輸入token收費0.5美元(約79日圓),每百萬輸出token收費9美元(約1,400日圓);Flash-Lite TTS每百萬輸入token收費0.5美元(約79日圓),每百萬輸出token收費6美元(約940日圓)。上述價格僅適用至2026年12月31日,自2027年1月1日起將分別調漲約一倍。此外也提供免費額度,非同步處理的Batch與Flex模式則可享標準價格的五折優惠。

在效能表現上,Flash TTS在語音設計專業評測機構Hume AI的基準測試中拿下綜合第一,並在口音表現單項測試中同樣位居榜首;在該機構的綜合品質指標中,Flash TTS排名第一,Flash-Lite TTS排名第二。在由真人進行聽感比較的「Voice Arena」評測中,兩款模型在包含日語在內的多種語言測試裡皆名列前茅。這兩款模型也加入Google的「Gemini Audio」語音模型陣容,與支援即時語音對話的「Gemini 3.8 Live」、語音轉文字的「Gemini 3.5 Transcribe」等模型並列。

總結

Google此次發布的「Gemini 3.8 Flash TTS」與「Gemini 3.8 Flash-Lite TTS」,讓語音合成從單純挑選預設聲音,進化到能以自然語言描述從零設計出全新聲音。新模型在強化演出指示控制能力與長篇內容穩定性的同時,也透過SynthID浮水印與C2PA溯源資訊確保內容的真實性,並從開發者API到Gemini Notebook、Google Vids等一般使用者工具,提供多元的使用管道。

※1美元=157日圓(截至2026年9月25日)