Adobe 將 Firefly 的三項音訊功能——生成音樂、生成語音、生成音效——從測試版轉為正式提供,產出的音訊皆可商用。搭配畫面長度的配樂、依腳本朗讀的旁白、貼合動作時間點的音效,現在都能在瀏覽器裡一次備齊,不必再到素材庫裡翻找。

三項音訊工具總算到齊

這次轉正的是音樂、語音、音效三類,各自由不同的模型負責。生成音樂使用 Adobe Firefly Music Model,生成音效使用 Adobe Firefly Audio Model。

音樂這一側的設計,是依影片的長度與氛圍直接做出原創曲目,而不是事後把現成配樂剪到剛好,等於替剪輯的後段少了一道工。音效則是圍繞畫面裡的動作與時間點來生成,針對的是在素材庫裡反覆搜尋、最後只能將就選一個的老問題。

比起測試期三者各走各的,這次真正的變化在於它們被放進同一個 Firefly 環境。

旁白可以挑選模型

生成語音支援在 Adobe Firefly Speech Model 與 ElevenLabs 之間選擇。輸入腳本就能取得旁白音訊,除了音色,語速與情緒表現也能調整。

語音合成的好壞會因用途而異,能在同一個介面切換自家模型與外部專業模型,實務上相當好用。沉穩的解說嗓音與節奏輕快的宣傳口播,可以分別交給各自更擅長的模型處理。

音效可以用自己的聲音指定時間點

音效生成裡最有意思的一點,是能在文字提示之外錄一段自己的聲音一起送出。不必只寫下玻璃碎裂的聲音這類描述再碰運氣,用嘴把那個聲音演一次,系統會參考這段錄音的時間點與強弱來生成結果。

上傳自己的影片或音訊檔案後,音效可以準確落在指定位置。多層音效疊加能做出更厚實的環境音,位置與音量之後還能在時間軸上調整。單靠文字描述很難命中想要的聲音,先用聲音框出大致範圍是合理的切入方式。

以商用為前提的訓練資料

Adobe 一再強調的正是商用這一點。音效生成模型使用取得授權的內容與公共領域內容訓練,產出以免權利金的方式處理,不需要標示出處,也不另外收取授權費用。

生成式音訊一旦權利歸屬含糊,交付給客戶時就很難用。把訓練資料的來源講清楚,並明確表示產出可商用,對於靠這行吃飯的製作方而言是可參考的依據,無論做的是社群短影片、產品教學還是 Podcast。

AI 助理的日文免費體驗與新增 Gemini Omni Flash

與音訊功能一同推出的,還有 Adobe Firefly AI 助理的日文支援及配套的免費體驗方案。符合條件的使用者每天可免費生成一定次數的影像、影片與音訊,這個額度獨立於 Firefly 一般免費使用者的生成額度,試用不會吃掉手上既有的額度。

此外,Firefly 可用的 AI 模型新增了 Google 的 Gemini Omni Flash。這個模型接受文字搭配影片、音訊、影像的提示,定位是把想法整理成分鏡,再一路推進到初剪。方向已經相當清楚:Firefly 正把外部模型與自家模型並排擺出來,而不是押注單一自研模型。

總結

Firefly 的音訊功能進入正式提供階段,音樂、旁白與音效被收進同一個環境,而且明確可商用。用聲音指定音效時間點、語音可在 Speech Model 與 ElevenLabs 之間二選一,這些細節都看得出它是照著實際剪輯流程來設計的。日文版 AI 助理的免費體驗也已開放,從替手邊的影片補上一層聲音開始,是最容易上手的做法。

※圖片僅為示意。