Preferred Networks与Preferred Robotics于9月9日宣布,双方将联合开发面向室内移动机器人的环境高度理解基础模型「PLaMo-SemGround」。该模型把自然语言指令与相机的RGB图像、深度信息结合起来,判断机器人可以行驶和禁止进入的区域,目标是把机器人导入时的设置工作交出九成给AI。该项目还入选了日本经济产业省与NEDO推进的GENIAC。

买下机器人之后才开始的琐碎工作

在人手短缺的背景下,物流仓库、制造现场和商业设施对搬运、巡检、清扫作业自动化的需求持续扩大。但室内移动机器人并不是运到现场的第二天就能开始干活。

需要先绘制设施地图,再逐条设定现场特有的行驶约束:这条通道是单向通行、那片区域禁止进入、这里有台阶。而且一旦布局发生变化,设定就得重做,往往又要请专业技术人员到场。这部分时间与成本,一直是让企业在导入前犹豫的因素。

PLaMo-SemGround瞄准的正是这一环。两家公司提出了明确的量化目标:把初期设置与运维任务的90%以上交给AI和现场负责人。也就是说,希望达到不必请专业人员、现场员工用语言说明即可完成的状态。

名称后半部分「SemGround」意味着什么

模型名称由两部分组成:一是PFN从零开始自主开发的日本国产生成AI基础模型「PLaMo」,二是grounding这一技术术语。grounding指的是把语言中包含的语义信息,与图像和三维空间中的物体、区域、位置对应起来的处理。

具体而言,PLaMo-SemGround会把「避开放在地面上的货物」这样的指令,与相机拍到的画面以及深度传感器测得的到周围物体、地面、墙壁的距离信息相对照,在二维和三维空间上同时确定这些货物的位置。确定结果会传递给带语义信息的地图(语义地图)和路径规划器,最终反映到机器人的实际动作中。

模型规模控制在20亿(2B)参数级以下。原因在于,它的前提是不经过云端,直接在机器人本体的计算机或现场配置的本地PC上运行。在工厂和仓库里,通信延迟或网络故障会直接导致停机;设施内的画面和布局信息不允许外传的情况也并不少见。PFN将把自研大语言模型PLaMo和视觉语言模型「PLaMo-VL」的经验,用于小型化与实现优化。

50个现场、80万帧的实测数据厚度

开发计划由5个支柱构成。数据采集由PFR负责,将从已获得许可的工厂、商业设施等50个以上现场收集RGB图像、深度信息、行驶日志和现场规则,确保80万帧以上规模的可用实测数据。除搬运和清扫机器人外,还会使用专门的数据采集台车。

PFN则把这些数据与公开数据、合成数据整合,构建可用于图像问答(VQA)和目标区域识别(visual grounding)的2000万样本以上的训练与评估数据基础。在评估方面,会把公开基准「EmbodiedScan」改造为适配本项目的评估任务,同时利用PFR在400个以上现场积累的既有数据,构建面向目标业务的自有基准。

开发出的模型将搭载到PFR的搬运、清扫机器人上,在5个行业、10个以上现场开展验证试验。试验不仅评估空间识别性能,还要评估前述90%移交目标的达成程度。

来自Kachaka的现场经验,以及对外销售的路线图

PFR自2023年起推出自主搬运机器人「Kachaka」系列,在面向工厂与物流的AMR(自主移动机器人)日本国内市场中位居厂商份额第一(2026年富士经济调查)。在400个以上现场部署中积累的运维经验,直接成为模型开发的素材。而PFN则从生成AI基础模型到自研AI处理器一应俱全。两家联手的意义在于,数据与算力都能在内部循环。

成果的出口也已明确。首先在2028年度(2028年4月至2029年3月)内先行搭载到PFR的产品上,之后PFN将以模型授权、SDK、评估基础等形式,分阶段向日本国内的机器人厂商、系统集成商和设施管理运营方进行商用销售。不把技术封闭在自家产品内,而是作为可搭载到其他公司机器人上的基础模型对外销售,这一方针从一开始就写进了计划。

视野也不止于AMR和AGV(无人搬运车)。未来还考虑应用于腿式机器人和人形机器人,并不局限于轮式形态。

总结

PLaMo-SemGround瞄准的不是机器人本体的性能,而是导入阶段那些不起眼的设置工作。20亿参数级以下这一相对克制的规模,也可以理解为从边缘运行这一前提反推出来的设计。先行搭载要等到2028年度,成果显现还需时日,但从收集50个现场实测数据开始做起的计划,透出了熟悉现场的企业才有的务实。这是一个再次点明日本国内机器人导入卡在哪里的项目。