Preferred Networks與Preferred Robotics於9月9日宣布,雙方將共同開發面向室內移動機器人的環境高度理解基礎模型「PLaMo-SemGround」。這個模型把自然語言指令與相機的RGB影像、深度資訊結合起來,判斷機器人可以行駛與禁止進入的區域,目標是把導入機器人時的設定工作交出九成給AI。本案也獲選為日本經濟產業省與NEDO推動的GENIAC計畫。

買下機器人之後才開始的瑣碎工作

在人力短缺的背景下,物流倉庫、製造現場與商業設施對搬運、巡檢、清掃作業自動化的需求持續擴大。不過室內移動機器人並不是送到現場的隔天就能開始工作。

必須先繪製設施地圖,再逐條設定現場特有的行駛限制:這條通道是單向通行、那片區域禁止進入、這裡有高低差。而且一旦配置有所變動,設定就得重做,往往又得再請專業技術人員到場。這部分的時間與成本,一直是讓企業在導入前猶豫的原因。

PLaMo-SemGround鎖定的正是這個環節。兩家公司提出了明確的量化目標:把初期設定與維運工作的90%以上交給AI與現場負責人。也就是希望達到不必請專業人員、現場人員用言語說明即可完成的狀態。

名稱後半的「SemGround」代表什麼

模型名稱由兩個部分組成:一是PFN從零開始自行開發的日本國產生成式AI基礎模型「PLaMo」,二是grounding這個技術用語。grounding指的是把語言所含的語意資訊,對應到影像與三維空間中的物體、區域與位置的處理。

具體來說,PLaMo-SemGround會把「避開放在地面上的貨物」這類指令,與相機拍到的畫面以及深度感測器測得的周圍物體、地面、牆面距離資訊相互對照,在二維與三維空間上同時鎖定這些貨物的位置。鎖定的結果會傳遞給帶語意資訊的地圖(語意地圖)與路徑規劃器,最後反映在機器人的實際動作上。

模型規模控制在20億(2B)參數級以下。原因在於,它的前提是不透過雲端,直接在機器人本體的電腦或現場架設的本機PC上運作。在工廠與倉庫裡,通訊延遲或網路故障會直接造成停機;設施內的影像與配置資訊不得外傳的情況也不算少見。PFN將把自行開發的大型語言模型PLaMo與視覺語言模型「PLaMo-VL」的經驗,投入到輕量化與實作最佳化上。

50個現場、80萬影格的實測資料厚度

開發計畫由5根支柱構成。資料蒐集由PFR負責,將從已取得許可的工廠、商業設施等50個以上現場蒐集RGB影像、深度資訊、行駛紀錄與現場規則,確保80萬影格以上規模的可用實測資料。除了搬運與清掃機器人之外,也會使用專用的資料擷取台車。

PFN則會把這些資料與公開資料、合成資料整合,建構可用於影像問答(VQA)與目標區域辨識(visual grounding)的2,000萬樣本以上訓練與評估資料基礎。在評估方面,會把公開基準「EmbodiedScan」改寫為適用於本案評估任務的版本,同時運用PFR在400個以上現場累積的既有資料,建構符合目標業務的自有基準。

開發完成的模型將搭載於PFR的搬運、清掃機器人,在5個業種、10個以上現場進行實證試驗。試驗除了評估空間辨識效能之外,也會評估前述90%移交目標的達成程度。

來自Kachaka的現場經驗,以及外售的路線圖

PFR自2023年起推出自主搬運機器人「Kachaka」系列,在面向工廠與物流的AMR(自主移動機器人)日本國內市場中位居製造商市占第一(2026年富士經濟調查)。在400個以上現場推展所累積的維運知識,直接成為模型開發的素材。另一方面,PFN從生成式AI基礎模型到自行開發的AI處理器都握在手上。兩家聯手的意義,在於資料與運算資源都能在內部循環。

成果的出口也已明確。首先在2028年度(2028年4月至2029年3月)內先行搭載於PFR的產品,之後PFN將以模型授權、SDK、評估基礎等形式,分階段向日本國內的機器人製造商、系統整合商與設施管理業者進行商用銷售。不把技術封閉在自家產品內,而是作為可搭載於其他公司機器人的基礎模型對外銷售,這項方針從一開始就寫進了計畫。

視野也不僅止於AMR與AGV(無人搬運車)。未來還考慮應用於腿型機器人與人形機器人,並不侷限於輪型形態。

總結

PLaMo-SemGround鎖定的不是機器人本體的效能,而是導入階段那些不起眼的設定工作。20億參數級以下這個相對節制的規模,也可以理解為從邊緣運作這項前提反推而來的設計。先行搭載要等到2028年度,成果顯現還需要一段時間,但從蒐集50個現場實測資料開始做起的計畫,透露出熟悉現場的公司才有的踏實。這是一個再次點出日本國內機器人導入究竟卡在哪裡的專案。