Meta 旗下的 Superintelligence Labs 发布了首个面向实时音频的模型 Muse Voice Transcribe。它能在说话过程中就输出文字,区分说话人,并判断一句话在哪里结束,这三件事都由同一个模型完成。价格为每小时 0.18 美元(约 28 日元),不到同类服务的一半。

每小时 0.18 美元的定价

实时语音转写一直是单价偏高的领域。Meta 给出的价格是每 1,000 分钟音频 3 美元(约 460 日元),换算成小时约为 0.18 美元(约 28 日元)。

和竞争对手放在一起看,差距很明显。Cartesia 的 Ink-2 为每 1,000 分钟 4 美元(约 610 日元),ElevenLabs 的 Scribe v2 Realtime 和 Deepgram 的 Flux 都是 6.5 美元(约 990 日元)。也就是说,Meta 比最便宜的竞品还低 25 个百分点。

※1 美元 = 153 日元(截至 2026 年 9 月 9 日)

这一领域本身竞争激烈。OpenAI 在 5 月推出了用途相同的 GPT-Realtime-Whisper,7 月又下调了转写模型的价格。Meta 没有在性能上正面硬碰,而是直接用价格切入,这与它在 Muse Spark 1.1 和 1.2 上的打法一脉相承。

每 80 毫秒决定一次「继续听还是先输出」

技术上的关键在于如何处理延迟。Muse Voice Transcribe 把输入音频切成 80 毫秒的片段,每处理完一段,就判断是继续听下去,还是把下一个词作为文本输出。

等得越久,上下文越充分,准确率越高,但输出也越滞后;反过来赶时间,错误就会变多。这个模型会根据每个词的难度动态调整等待时间:好辨认的词立刻输出,拿不准的词多听一会儿。

Meta 表示,这一行为是通过强化学习(对期望结果给予奖励,从而训练策略的方法)习得的。同时对低错误率和短延迟给予奖励,使模型不会向任何一边偏倒。

说话人区分与断句也在同一个模型内完成

以往的实时音频处理,通常由不同系统分别负责转写、说话人分离和判断发言结束。Muse Voice Transcribe 把这三项整合进了一个模型。

在说话人方面,它会把发言人的切换直接写进不断生成的文本中,并为每个片段标上从 A 到 Z 的标识符。它可以同时区分 20 人以上,并且无需后处理就能应对超过 1 小时的录音。在 8 人同处一室的演示中,系统当场把每句话分配给了具体的人。

支持语言超过 70 种,其中 25 种经过深入验证,日语也在其中。对于句子中途切换语言的所谓语码转换,它也能直接应对。语音识别在专有名词上的固有弱点,则可以通过事先传入关键词和上下文作为提示来弥补。

第三方评测中准确率居首,但延迟差距很小

Meta 的说法基本得到了第三方机构 Artificial Analysis 的验证。英语的词错误率为 3.1 个百分点,从说话人结束发言到结果确定为 0.16 秒。

同等条件下,ElevenLabs 的 Scribe v2 Realtime 为 3.6 个百分点、0.14 秒,AssemblyAI 的 Universal-3.5 Pro Realtime 为 4.0 个百分点。Cartesia 的 Ink-2 则根据是自行检测发言结束还是依赖外部机制,分别为 3.4 和 4.0 个百分点。

准确率上 Meta 确实领先,但延迟方面 ElevenLabs 略快,而且各项数字之间的差距本就不大。从这组结果看,实际使用中起决定作用的,恐怕还是开头提到的价格差。

尚未公开的部分

另一方面,Meta 没有公布参数量、训练数据规模,也没有说明音频数据的来源,权重同样没有开放。考虑到这家公司此前在开放发布上的姿态,这一点并不容易照单全收。

目前可用的入口有三个:Meta AI 与 Muse Code 的语音输入,以及 Meta Model API。在任意应用中长按 Fn 键即可唤起语音输入。

这一切的背景,是 CEO Mark Zuckerberg 提出的「个人超级智能」构想。在 Meta 员工公开的演示中,他们强调可靠的语音识别,是让个人 AI 智能体通过 AI 眼镜持续听取真实对话的基础。顺带一提,围绕该公司带摄像头的眼镜,德国曾讨论过禁售,但联邦网络管理局最终决定不予追究。

总结

Muse Voice Transcribe 把转写、说话人分离和发言结束检测这三项处理合进了一个模型,并通过逐词调整等待时间,在速度和准确率之间取得平衡。第三方评测中它的准确率居首,但延迟差距很小,各家的性能正在趋于接近。在这种局面下抛出每小时 0.18 美元的价格,正体现了这次发布的用意。会议记录、字幕生成这类需要长时间连续运行的用途,受益会更明显。