自动驾驶汽车在空旷路面上突然减速时,车内的人几乎无从得知原因。Motional与MIT的研究团队开发出一套系统,把车载神经网络的内部状态翻译成人能读懂的表述,并在行驶过程中实时呈现。研究成果发表于Nature,并在包括拉斯维加斯周边公开道路在内的实车行驶中完成验证。
把黑箱转换成语言
该方法名为Concept-Wrapper Network,简称CW-Net。近年的自动驾驶系统越来越依赖用海量行驶数据训练出来的神经网络,而这类网络并不会对外给出判断依据,工程师称之为黑箱。
CW-Net把内部计算转换成"接近停止车辆""靠近骑行者"这类人可以理解的概念。Motional表示,这些概念可以显示在驾驶位的屏幕上,让人在行驶中看到当前是哪些概念在影响驾驶判断。
关键在于,这种解释并非事后的推测。车辆最终的决策直接以这些可读概念作为输入。也就是说,只要发生制动,就一定能定位到触发它的概念。Motional把这称为因果上忠实的解释,并将其与生成自然语言说明的做法区分开来。后者读起来合理,却未必与内部处理一致。
在锥形桶前反复停车的真正原因
可解释AI的研究大多停留在仿真环境里。这次团队把CW-Net装到真实的自动驾驶车辆上,让经验丰富的安全员坐在驾驶位,在专用测试场和拉斯维加斯周边的公开道路上行驶。测试使用的是一套早期实验性深度学习规划器,性能具备竞争力,但仍留有明显短板。
有两个例子说明了系统的作用。第一个是车辆在交通锥附近反复停车。安全员起初认为原因就是锥形桶,但把它移走之后车仍然会停。CW-Net的显示揭示了真正的原因:实验性规划器把前方并不存在的停止车辆"看"了出来,这一模式最终被追溯到训练数据。团队由此理解了问题、预测了复现条件,并完成了修复。
第二个例子与骑行者有关。车辆按预期检测到骑行者并停车,但CW-Net显示,实验性规划器的判断依据其实并不是骑行者的存在。安全员注意到之后,在骑行者附近采取了更谨慎的驾驶方式。后续分析证实这种谨慎是必要的,因为当时的制动来自安全备份系统,而不是主规划器。
加上解释,行驶性能几乎不下降
给AI系统叠加解释层,通常要牺牲速度和性能,Motional也承认这一风险。不过在与主流自动驾驶算法的对比测试中,CW-Net在行驶能力上的差距不到1%。
这个数字的意义不止于学术层面。安全员如果能当场分辨出停车是源于"看见"了并不存在的车辆,还是源于备份系统接管,上报的精确度就会提高。工程团队定位故障的速度也会改变,而能够区分预期行为与故障,直接关系到运营层面的信心。
Motional首席执行官Laura Major认为,完全依赖端到端深度学习存在上限。按她的说法,这种方式可以做到80%至90%,甚至95%的水平,但要撤掉驾驶员、要赢得城市、社区和用户的信任,这还不够。
有可能成为监管合规的工具
随着自动驾驶进入新的市场和法域,运营方承受的压力也在增加。监管机构正在要求更详细地说明AI系统是如何得出判断的。Motional认为,CW-Net这类工具有可能走出研究阶段,成为必须满足的基本要求。
适用范围也不限于乘用车。自主飞行的无人机、机器人外科手术同样被列为安全攸关的领域,两者都需要让运营者和开发者掌握系统的能力、局限以及意料之外的行为。
总结
CW-Net把驾驶判断翻译成人可读的概念,并让这些概念本身进入决策环节,从而使解释与实际行为不会脱节。在公开道路上,它把"看见"了并不存在的停止车辆、以及依据与设想不符的停车判断等问题实际暴露了出来。行驶性能的损失控制在1%以内,"可解释性必然要用性能来换"这一前提正在动摇。当自动驾驶的讨论从精度和里程转向信任的设计,能否说出判断理由,可能就是能否走向实用的分水岭。
