评估系统:AI产品的新蓝图

评估系统:新时代的产品需求
Expedia集团首位首席AI与数据官萨维·阿马特林(Xavi Amatriain)在上周于门洛帕克举行的VB Transform 2026大会上向与会者表示:”新的产品需求文档(PRD)就是评估系统。”他进一步解释道:”基本上,你通过评估系统来编码你希望产品实现的功能,这可能包括红队评估和各种其他类型的评估,这些评估已经包含了一系列安全要求。因此,在你开始编写代码之前,就已经将这些要求嵌入到了产品需求文档和产品设计文档中。”
阿马特林更进一步指出:”随着AI辅助或AI生成代码的出现,这将成为未来。就像你所有的思考都将投入到评估系统中一样。”
在2025年12月加入Expedia之前,阿马特林曾在谷歌担任AI与计算赋能副总裁,负责支持Gemini和谷歌搜索的多个平台。他还指导过后来创立Perplexity和Scale AI的人才。
根据VentureBeat的VB Pulse研究,评估差距问题凸显了这一趋势。在被调查的157家企业中,66%已经允许在没有人工审查的情况下进行部分生产部署,或计划在未来12个月内实现这一点,但只有5%完全信任能够做出此类决策的自动化评估。半数企业已经推出通过了内部评估但在实际客户面前失败的智能体。
安全护栏不应阻碍反馈
“你给系统设置的安全护栏和人工商业规则越多,情况就越糟糕,”阿马特林表示。”这不仅因为它们脆弱,还因为它们实际上会干扰反馈循环。你实际上是在偏导用户和用户反馈,然后你以错误的方式学习。”他将安全护栏称为”必要的恶”,并表示目标是随着时间的推移最小化它们的影响。
Transform大会上的并非所有人都认同这一观点。其他演讲者在活动期间 argued,最高风险的行为仍然需要非常严格的安全护栏。
相反,Expedia通过三层结构来管理AI。首先是原则,广泛传达。”我喜欢在非常高的层面上编码我期望的决策方式,因为在大型组织中,你将有很多分布式决策,”阿马特林说。”而且,如果你足够幸运,这些原则可能会融入你的文化。但大多数情况下,我的经验是,它们并没有。”接着是执行这些原则的流程和工具。”原则在墙上的图片中看起来很漂亮,但你需要给它们牙齿,”他说。自动化则建立在两者之上。
在实践中,这通过Expedia所谓的智能体发布收费站来实现,这些收费站根据风险进行调整。”治理需要与风险相关联,”阿马特林说。”如果你有低风险的事物,就不需要太多治理来阻碍。但如果风险很高,你就需要更多治理。这可以被编码进去。”这些收费站将评估轮次、红队测试和安全审查与每个智能体的风险水平联系起来,随着风险提高,检查从推荐变为必需。
专业化智能体胜过单一智能系统
“即使在谷歌工作时,我也不相信通用人工智能(AGI)是一种单一的、统一的单一模型,”阿马特林告诉与会者。”我认为更好地思考方式是将其视为组合,就像拥有非常擅长某些任务的专业化智能体,然后由这些专业化智能体组合成系统。”
Expedia的架构从组件级别开始。工具组合成技能,技能组装成子智能体,然后子智能体被编排成完整的智能体系统。”你需要那些统一的原则,涉及诸如我们使用的语气、如何与用户交流、如何传递上下文和记忆等问题,”他说。”所有这些都需要彻底设计。”他将这视为一个系统设计问题。”这不是关于模型,不是关于特定解决方案,而是关于你如何设计系统。”
阿马特林认为,将每个智能体的范围限定得窄一些也使系统更容易安全,因为团队可以在组合它们之前单独评估和锁定各个智能体。
用户应保留最终决定权
旅行价格实时变化,航班可用性每分钟都在变动,酒店评论常常与供应商的说法相矛盾。阿马特林描述了一个结合了检索增强生成和直接API工具调用的系统,根据延迟选择方法。”如果用户问你一个问题,比如七月份芝加哥的四星级酒店通常多少钱,你不希望智能体花两分钟来回答这个问题,”他说。”你期望立即得到答案,因为这个答案可以被缓存,不需要实时信息。”对于靠近密歇根湖的带游泳池的宠物友好型四星级酒店,可能需要30秒的推理窗口。
“供应商可能会说,是的,我们有一个很棒的游泳池,但我们也有旅客的评论,实际上我们看到有两条评论说游泳池不好或者晚上6点后不开放,”阿马特林解释道。他补充说,普通的聊天机器人只会展示供应商自行报告的内容,而Expedia会交叉参考自己的评论库。
“我们不希望智能体为用户预订酒店或购买机票,”阿马特林说。”这是用户必须拥有的自主权。智能体可以推荐、可以建议、可以与你讨论,但你必须点击确认。这是不可协商的。”他争辩说,这一限制也是一个安全决定。”一旦你确立了这些设计原则,你就不需要安全护栏了,否则你将不得不事后添加所有这些护栏。”
未来威胁将来自其他AI系统
“安全需要作为一个原则尽可能向左移,并作为设计本身的一部分,”阿马特林在回应一个观众提问时说。”而且通常当你需要安全护栏时,是因为你早期没有考虑到它。”
另一位观众询问从生产中获得的经验教训。阿马特林描述了一个反馈循环,监控信号流回评估套件。”你几乎可以自动化整个周期,”他说。”但从真实信号、你的运行AI系统到被报告和尽可能快速修复的整个反馈循环将成为 essential。”
阿马特林的收费站是一个赌注,即与风险相协调的治理能够领先于这个反馈循环。VentureBeat6月单独对智能体安全的Pulse调查(基于107家企业)显示这种差距有多小。超过一半(54%)已经经历过智能体安全事件或未遂事故。59%计划在12个月内采用、添加或更换智能体安全工具,29%计划在本季度进行。事件发生率随组织规模增长,在超过1000名员工的企业中达到63%,而在101至1000名员工的公司中为49%。而沙箱隔离(一种限制损害的事后控制)的采用率从较小公司的35%下降到最大公司的仅20%。
阿马特林警告说,威胁将越来越多地来自其他AI系统。”你将面临的威胁不仅来自人类,也将来自其他AI系统。”
他强调:”安全需要是设计的一部分,而不是事后添加的护栏。随着AI系统变得越来越自主,我们需要在设计阶段就考虑安全因素。”
在Expedia,阿马特林的三层治理框架帮助他们在不阻碍创新的同时确保安全。”我们的目标是创建既能推动业务价值又能保护用户安全的系统,”他总结道。
关注微信号:智享开源 ,及时了解更新信息。
原文链接:https://venturebeat.com/security/evals-are-the-new-prd-expedia-ai-chief-tells-vb-transform-2026


公众号:智享开源
还没有任何评论,你来说两句吧!