开发机器人基础模型的 Generalist 在 8VC 领投下追加融资约 2 亿美元(约 320 亿日元),估值随之达到 30 亿美元(约 4800 亿日元),这一消息来自知情人士。本轮资金是该公司 6 月公布的 4 亿美元 B 轮的延期部分,使整轮融资总额升至 6 亿美元。这家成立两年、此前几乎不对外发声的公司,突然被推到了市场中心。
※1 美元 = 159 日元
两个月内估值变为原来的 1.5 倍
根据监管备案文件,本次新增资金接近 2 亿美元。6 月宣布的 B 轮由 Radical Ventures 领投,当时估值为 20 亿美元(约 3200 亿日元)。仅仅两个月,20 亿美元变成 30 亿美元,整轮融资也从 4 亿美元(约 640 亿日元)增至 6 亿美元(约 950 亿日元)。Generalist 与 8VC 均未置评。
从公司的来历看,资金聚集的理由并不难理解。Generalist 成立于 2024 年,创始人包括曾在 Google DeepMind 任职的研究员 Pete Florence 与 Andy Zeng,以及曾在 Boston Dynamics 担任工程师的 Andrew Barry。早期投资方除 8VC 和 Radical Ventures 外,还有英伟达、Union Square Ventures、Bezos Expeditions 以及研究者李飞飞。机器人学习与生成模型两个领域的知名人物,从创立之初就站在这家公司背后。
靠 3 到 12 秒的示范学会新任务
Generalist 要做的是不绑定特定机型的通用机器人基础模型。在 8 月发布的最新版 GEN-1.5 上,公司称机器人只需观看一段 3 到 12 秒的示范视频,就能执行新任务。既不做追加训练,也不更新梯度,而是把当场作为上下文接收到的视频直接组装成动作。
在该公司公布的评估中,针对 10 项任务的一次性示范平均成功率为 59%。若再用 5 分钟的数据做 10 步梯度更新,成功率可升至 83%。这两个数字之间的差距,正好体现了刚看完示范时的能力与稍作微调后的能力之间的距离。
有意思的是,模型的表现并不止于照搬。当训练中使用的刷子被换成簸箕时,机器人会把方块拿起来倒进碗里;它也用香蕉当过临时的刷子;示范里只用了一只手,它却能双手协作。据称,完全在仿真环境中录制的示范,也能直接作为实机的指令使用。如果在 30 秒的上下文窗口里放入两段示范,模型会自行补出衔接两者的动作,把它们作为一段更长的连续作业执行。
目前该公司与少数客户合作,并利用这些反馈针对具体用途打磨模型。
押注机器人的「ChatGPT 时刻」
把机器人大脑做成通用模型的,并不只有 Generalist。据报道,Physical Intelligence 估值为 110 亿美元(约 1.75 万亿日元),软银投资的 Skild AI 估值为 140 亿美元(约 2.23 万亿日元)。Genesis AI 上个月也在洽谈以 30 亿美元估值融资。在这份名单里,30 亿美元更接近入口而非顶端。
资金集中的背后,是一种判断:机器人也将迎来与大语言模型相同的转折点,即无需针对每项任务单独训练,就能完成通用工作的那一刻。
不过,冷静的声音同样存在。语言模型几乎可以把互联网上的全部文本用于训练,而机器人动作数据并没有与之相当的积累。用一段短视频就能迁移到新任务的特性,恰恰可以被理解为对这种数据匮乏的一种绕行方案。仍有风险投资人警告,真正意义上的通用机器人模型可能还要等上数年。
总结
Generalist 的估值在两个月内从 20 亿美元升至 30 亿美元。GEN-1.5 展示的「凭一段短示范切换到新任务」的行为,对机器人长期面临的数据不足给出了有说服力的回答。另一方面,平均成功率为 59%,即便加入微调也只有 83%。从实验室里的灵巧到产线上的良率,中间仍有距离。估值的增速与能力的增速是否一致,未来一年应该会看得更清楚。
