#Gemini 车载推理受益
Waymo 2 亿英里复盘:纯视觉局限与 Gemini 慢思考
WooFun2026-08-31 11:27
核心要点
Waymo基于2亿英里L4经验总结10大AI心得,确立多传感器融合、Foundation Model及Gemini VLM双系统架构,强调数据飞轮与真实里程不可替代。
据 Woofun AI 消息,Waymo 在累计超过 2 亿英里完全无人驾驶里程后,正式提炼出十项 AI 开发核心经验。这一技术复盘不仅确立了多传感器融合与 Foundation Model 的架构地位,更通过引入 Gemini VLM 构建'快慢思考'双系统,重新定义了 L4 级自动驾驶的技术边界与行业壁垒。
在感知层的技术路线选择上,Waymo 对长期存在的 Camera-only 争议给出了明确否定。基于 2 亿英里的实战数据,公司认为单一传感器无法覆盖所有极端场景,必须依赖 LiDAR 激光雷达、Radar 雷达与摄像头的冗余组合。其中,LiDAR 负责构建高精度的 3D 几何信息,摄像头专注于识别交通信号与颜色等语义信息,而 Radar 则用于测量速度,并在大雨、浓雾或灰尘等摄像头失效的环境中提供关键数据。
这种刻意保留的信息冗余策略,与 Tesla 坚持的纯视觉哲学形成鲜明对立。此外,高清地图(HD Map)并未被 AI 淘汰,而是转化为模型的 Prior(先验信息)。正如人类驾驶员对熟悉路况的记忆,HD Map 让车辆无需消耗算力重新解析固定环境,从而将计算资源集中于处理施工、临时停止标志等动态突发事件,地图本身则通过 AI 系统实现持续更新。
模型架构层面,Waymo 正经历从模块化向 Foundation Model 的演进。早期系统由大量专用小模型组成,被内部称为难以维护的 Modular Spaghetti。如今,公司将其整合为数量更少、容量更大的专用 Foundation Models,使模型能从海量数据中自主习得特征,而非依赖工程师预设规则。
这一转变让自动驾驶模型得以享受推动 LLM 进步的 Scaling Law,并通过 Teacher-Student 架构降低车载推理成本。然而,Waymo 拒绝将整车变为神经网络黑盒子。
尽管 AI 实时生成驾驶决策,公司仍部署了独立车载验证系统,利用强化学习(RL)等技术,严格审查每条轨迹是否符合物理限制、交通规则及碰撞安全要求,以此规避纯粹 End-to-End 架构带来的决策不可解释性风险。
仿真与评估体系是 Waymo 应对 Long-tail scenarios 的关键。传统 Open-loop Simulation 仅能播放录制视频,其他车辆行为固定,无法反映真实互动。Waymo 转而大规模采用 Closed-loop Simulation,当 Waymo Driver 执行刹车或转向时,虚拟世界中的其他交通参与者会做出合理反应,从而提前测试极罕见场景。在此基础上,Waymo 引入了 Waymo Critic 机制,自动从交通法规、安全性、转弯顺畅度及刹车舒适性等多维度评估驾驶行为。面对每周数百万英里真实数据,人工检查已不可能,Critic 建立了自动化反馈闭环,避免 Driver 自我评估偏差。
这一思路与 Frontier AI Labs 训练大模型时强调 Generator 与 Verifier/Critic 并重的逻辑高度一致。同时,Gemini 训练的 Vision-Language Model(VLM)被用于处理复杂情境,如理解警察手势指挥的上下文。鉴于 VLM 速度慢且空间理解不足,Waymo 采用类似 Thinking Fast and Slow 的双系统架构:传感器融合与快速模型负责毫秒级实时控制,Gemini VLM 则负责较慢但深入的语义推理。
数据闭环构成了 Waymo 最难以复制的行业壁垒。车队每周累积数百万英里数据,经 Critic 与用户反馈筛选后,由 Auto-labeler 整理并重新训练模型,再进入 Simulation 验证与部署,形成持续运转的 Data Flywheel。
据 Woofun AI 整理,该体系已需处理 Exabyte 级别的数据。然而,Waymo 强调,无论 Simulation 规模多大,都无法完全替代 Fully Autonomous Miles。公司将'从 L2 升级至 L4'定义为 False Summit(假高峰),指出真正的 L4 系统必须从零开始以完全自动驾驶为目标设计,并承担无真人介入时的全部决策责任。这 2 亿英里真实里程的价值,正在于此。
评论
暂无评论