评估驱动:Waymo自动驾驶AI的成熟之道

在部署人工智能系统的企业中,几乎没有哪家公司比Alphabet旗下的Waymo自动驾驶公司面临更高的风险。其AI模型不仅生成文本或自动化后台任务,更帮助车辆在不可预测的道路上导航,应对其他驾驶员,并在物理世界做出瞬时决策。
然而,Waymo管理这些风险的方法——持续评估、精心筛选的数据、人工监督和明确的业务成果——为几乎所有行业部署智能体AI的企业提供了更广泛的参考方案。
Waymo系统智能与机器学习工程总监Manasi Joshi在VB Transform 2026大会上分享了公司如何大规模训练、测试和部署AI。迄今为止,Waymo已行驶超过2.2亿英里完全自动驾驶(或称”无乘客”)里程,据公司数据显示,在相同距离下,其严重伤害事故率比人类驾驶员低17倍。
为实现这些显著成果,Joshi表示Waymo采用了她所称的”评估驱动开发”,将评估作为工程核心,而非部署前的一次性最终检查。
“我们项目的成熟度可以很容易地根据所展示的评估成熟度来判断,”Joshi说道。
在实践中,Waymo通过检查围绕项目的测试成熟度来评估项目的准备情况。这种方法对构建客户服务智能体、编程助手、金融系统或其他AI应用的企业有明确启示:如果一个公司无法可靠地衡量系统性能,它可能尚未准备好将该系统投入生产。
评估在发布后仍需持续
Joshi表示,Waymo的大部分质量工作已转向评估,包括模型训练期间、训练后以及开环和闭环模拟中进行的测试。
“评估不是发布模型的一次性任务,”她说。
相反,Waymo将评估视为一个跨越驾驶、模拟和验证的持续过程。其方法论结合了数据集、性能指标和能够高效大规模运行的基础设施。
对企业而言,这意味着发布前测试智能体是不够的。团队必须随着底层模型、业务流程、用户行为和传入数据的变化继续对其进行评估。这些评估还应与实际业务成果相关联,而非仅依赖广泛的行业基准。
Joshi警告说,模型质量测量的可信度仅取决于其背后的评估数据。因此,Waymo将其性能主张与用于测试其系统的数据集特性信息配对。
测试罕见且危险的情况
Waymo的评估层次结构仍基于一个首要目标:安全。
公司利用第一方驾驶日志、部分第三方数据和逼真的模拟,使其系统接触涵盖数十亿合成英里的场景。任务负责人会选择专门的数据和指标,处理涉及弱势道路使用者、铁路道口、施工区域和其他复杂环境的情况。
同样的原则也适用于自动驾驶领域之外。企业不仅需要测试智能体成功处理的常规请求,还需要测试可能造成财务、法律、安全或声誉损害的罕见情况。
Joshi强调,Waymo不会将发布决策完全交给自动化系统。其生产准备审查包括广泛的人工监督,而内部安全负责人则负责批准软件发布和服务区域扩展。
“这不是AI驱动且完全自动化且零人工监督的,”她说。”人命关天。”
效率不能以牺牲可靠性为代价
Waymo面临另一个企业AI团队熟悉的问题:对计算、存储、内存和网络容量的需求增长快于可用资源。
公司在数据提取和存储、分布式模型训练、模型蒸馏、模拟和评估等方面追求效率。它还强调”数据效率”,选择最有用的训练示例,而非单纯认为数量越多越好。
Waymo于2017年开始使用transformers,随后扩展到大型语言模型、视觉-语言模型和视觉-语言-行动模型。Joshi表示,公司现在将生成式多模态模型作为其基础模型战略的一部分。
Waymo将其技术分为每辆车内的车载系统和用于模型开发、数据处理和模拟的车载基础设施。这种组合迫使公司优化实时推理和支撑它的大系统。
智能体需要自己的评估体系
Waymo还内部使用智能体作为工程师的生产力工具。Joshi表示,智能体帮助分析数据分布、评估数据效率,并对车辆遥测、训练运行和失败的评估工作中发现的问题进行分类。
目标是加速调查工作,使工程师能够将更多时间用于判断和解决复杂技术问题。但Waymo也评估这些智能体,确保它们产生可靠、准确的结果,而不是将员工引入无产出的路径。
对于企业领导者来说,Waymo更大的启示是,智能体AI不仅需要选择强大的模型。组织需要明确的目标、有代表性的评估数据、持续测试、能够高效运行的基础架构,以及负责部署的有名有姓的人类决策者。
“赢得信任至关重要,”Joshi说。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!