自駕車在空曠路面上突然減速時,車內的人幾乎無從得知理由。Motional與MIT的研究團隊開發出一套系統,將車載神經網路的內部狀態翻譯成人看得懂的說法,並在行駛過程中即時呈現。研究成果刊登於Nature,並在包含拉斯維加斯周邊一般道路在內的實車行駛中完成驗證。
把黑盒子轉換成語言
這套方法名為Concept-Wrapper Network,簡稱CW-Net。近年的自駕系統愈來愈仰賴以大量行駛資料訓練出的神經網路,而這類網路並不會對外揭露判斷依據,工程師稱之為黑盒子。
CW-Net把內部運算轉換成「接近停止車輛」「靠近自行車騎士」這類人能理解的概念。Motional表示,這些概念可以顯示在駕駛座的螢幕上,讓人在行駛中確認目前是哪些概念在左右駕駛判斷。
關鍵在於,這樣的說明並非事後的臆測。車輛最終的決策直接以這些可讀概念作為輸入。也就是說,只要發生煞車,就一定能找出觸發它的概念。Motional將此定位為因果上忠實的說明,並與生成自然語句說明的做法做出區隔。後者讀起來合理,卻未必與內部處理一致。
在三角錐前反覆停車的真正原因
可解釋AI的研究多半停留在模擬環境中。這次團隊把CW-Net裝上真實的自駕車,讓經驗豐富的安全駕駛坐在駕駛座,於專用測試場與拉斯維加斯周邊的一般道路上行駛。測試採用的是早期的實驗性深度學習規劃器,效能具備競爭力,但仍留有明顯弱點。
有兩個例子說明了系統的作用。第一個是車輛在交通錐附近反覆停車。安全駕駛原本認為原因就是三角錐,但移開之後車子照樣停下。CW-Net的顯示揭露了真正原因:實驗性規劃器把前方並不存在的停止車輛「看」了出來,這個模式最後被追溯到訓練資料。團隊因此理解了問題、預測了重現條件,並完成修正。
第二個例子與自行車騎士有關。車輛依預期偵測到騎士並停車,但CW-Net顯示,實驗性規劃器的判斷依據其實並不是騎士的存在。安全駕駛察覺之後,在騎士附近採取了更謹慎的駕駛方式。後續分析也證實這份謹慎有其必要,因為當時的煞車來自安全備援系統,而非主要的規劃器。
加上說明後,行駛效能幾乎沒有下滑
為AI系統疊上說明層,通常得犧牲速度與效能,Motional也承認這項風險。不過在與主流自駕演算法的對照測試中,CW-Net在行駛能力上的差距不到1%。
這個數字的意義不只在學術層面。安全駕駛若能當場分辨停車是源自「看見」了並不存在的車輛,還是源自備援系統接手,回報的精確度就會提高。工程團隊釐清故障的速度也會改變,而能夠區分預期行為與故障,直接關係到營運上的信心。
Motional執行長Laura Major認為,完全仰賴端到端深度學習有其上限。依她的說法,這種方式可以做到80%至90%,甚至95%的水準,但若要拿掉駕駛、要贏得城市、社區與使用者的信任,這樣還不夠。
有機會成為法規遵循的工具
隨著自駕技術進入新的市場與法域,業者承受的壓力也隨之升高。主管機關正要求更完整地說明AI系統如何得出判斷。Motional認為,CW-Net這類工具有可能走出研究階段,成為必須滿足的基本要求。
適用範圍也不限於乘用車。自主飛行的無人機、機器人外科手術同樣被列為攸關安全的領域,兩者都需要讓營運者與開發者掌握系統的能力、限制以及意料之外的行為。
總結
CW-Net把駕駛判斷翻譯成人可讀的概念,並讓這些概念本身進入決策環節,使說明與實際行為不會脫節。在一般道路上,它實際暴露出「看見」了並不存在的停止車輛,以及依據與設想不符的停車判斷等問題。行駛效能的損失控制在1%以內,「可解釋性必然要用效能來換」這個前提正在鬆動。當自駕的討論從精度與里程轉向信任的設計,能否說出判斷理由,可能就是能否走向實用的分水嶺。
