Adobe 将 Firefly 的三项音频功能——生成音乐、生成语音、生成音效——从测试版转为正式提供,生成的音频均支持商用。配合画面长度的配乐、依据脚本朗读的旁白、贴合动作时间点的音效,如今都能在浏览器里一次备齐,不必再去素材库里翻找。
三项音频工具终于凑齐
此次转正的是音乐、语音、音效三类,各自由不同的模型驱动。生成音乐使用 Adobe Firefly Music Model,生成音效使用 Adobe Firefly Audio Model。
音乐这一侧的设计思路,是按视频的长度和氛围直接生成原创曲目,而不是事后把现成 BGM 剪到合适长度,等于替剪辑的后段省去一道工序。音效则围绕画面里的动作与时间点来生成,针对的是在素材库里反复搜索、最后只能凑合选一个的老问题。
比起测试期三者各自为政,这次真正的变化在于它们被放进了同一个 Firefly 环境里。
旁白可以选择模型
生成语音支持在 Adobe Firefly Speech Model 与 ElevenLabs 之间挑选。输入脚本即可得到旁白音频,音色之外,语速与情绪表达也能调整。
语音合成的效果好坏因用途而异,能在同一个界面里切换自家模型与外部专业模型,在实际工作中很实用。沉稳的讲解嗓音与节奏明快的宣传口播,可以分别交给各自更擅长的模型来处理。
音效可以用自己的声音指定时间点
音效生成里最有意思的一点,是可以在文本提示词之外录一段自己的声音一起提交。不必只写下玻璃碎裂的声音这类描述然后碰运气,用嘴把这个声音演一遍,系统会参考这段录音的时间点与强弱来生成结果。
上传自己的视频或音频文件后,音效可以精准落在指定位置。多层音效叠加能做出更厚实的环境声,位置与音量后续还能在时间轴上调整。单靠文字描述很难命中想要的声音,用声音先框出大致范围是合理的入口。
以商用为前提的训练数据
Adobe 反复强调的是商用这一点。音效生成模型使用获得授权的内容与公共领域内容训练,输出按免版税处理,无需署名,也不额外收取授权费用。
生成式音频一旦权利归属含糊,交付给客户时就很难用。把训练数据的来源讲清楚、并明确表示输出可商用,对于以此谋生的制作方来说是可参考的依据,无论做的是社交平台短视频、产品教程还是播客。
AI 助手的日语免费体验与新增 Gemini Omni Flash
与音频功能一同推出的,还有 Adobe Firefly AI 助手的日语支持及配套免费体验计划。符合条件的用户每天可免费生成一定次数的图像、视频与音频,该额度独立于 Firefly 普通免费用户的生成额度,试用不会消耗手头已有的额度。
此外,Firefly 可用的 AI 模型中新增了谷歌的 Gemini Omni Flash。这一模型接受文本搭配视频、音频、图像的提示词,定位是把想法整理成分镜,并一路推进到初剪。方向已经比较清楚:Firefly 正在把外部模型与自家模型并排摆出来,而不是押注单一自研模型。
总结
Firefly 的音频功能进入正式提供阶段,音乐、旁白与音效被收进同一个环境,且明确可商用。用声音指定音效时间点、语音在 Speech Model 与 ElevenLabs 之间二选一,这些细节都能看出它是照着实际剪辑流程来做的。日语版 AI 助手的免费体验也已开放,从给手头的视频补一层声音开始上手,是最直观的做法。
※图片仅供示意。
