智能体信任:超越能力证明的必要性

智能体信任:超越能力证明的必要性

动态环境下的AI信任挑战

在部署后不断变化的环境中,用户、数据、工作流程和攻击技术持续演变,AI智能体的可信度已成为运行时问题。大多数组织仍将信任视为部署前的一项工作,智能体通过沙箱评估和安全测试后就被宣布为生产就绪并投入使用。然而,一旦智能体开始与现实世界互动,这种可信度便会迅速瓦解。

“问题的核心在于,CIO和企业主对AI系统的思考方式与他们对SaaS或移动应用的思考方式相同,而这些应用不会对周围环境做出动态响应,”Vijil创始人兼CEO Vin Sharma表示。”根据教科书定义,智能体应该能够感知环境、推理、行动、观察后果并从期望与现实之间的差距中学习。问题在于,支持这些智能体的模型是基于静态训练数据构建的,当它们进入生产环境时,对世界的认知已经过时。”

基准测试为何无法评估智能系统可信度

传统AI评估仅提供智能体能力的即时评估,而非可信度评估。这种评估无法预测真实企业行为的原因有三点:

首先,基准测试是静态的,围绕开发时对良好表现的特定概念构建,而世界在不断前进。

其次,基准测试对现实的模拟不完美,因此基准测试与现实世界之间的差距正是许多故障发生的地方。

第三,基准测试是公开的,它们会泄露到未来模型的训练数据中,让模型能够有效地记忆测试内容,而不是证明其实际能力。

“智能体或应用程序在基准测试中可能表现优异,但基准测试与现实世界之间存在差距,”Sharma表示。”表现良好只能证明它能通过测试,而不能证明它将在生产环境中可靠运行。”

但总体而言,基准测试的不足恰恰在于它们衡量的是能力,而非可信度。

“我们倾向于将智能体视为万能助手,通常是实用主义智能体,可以向它们委托特定类型的任务,”Sharma说。”但实际上,我们需要分配一个目标,要求它们始终以胜任义务、注意义务和忠诚义务来执行任务。”

当然,智能体没有意识,不可能期望它们感受真正的人类忠诚,但在法律上,受托责任实际上并不要求意识。它只是意味着智能体应该被约束将委托人的利益置于自身或任何他人利益之上,这是一种功能性要求,无论意图如何,都是可测试的。

能力与可信度的本质差异

优先考虑可信度而非能力需要重新思考企业对AI智能体的期望。Sharma将这种模型称为受托智能体,这一术语借鉴了那些受正式注意义务约束的职业,如金融机构或医疗服务提供者,他们对客户负有胜任、注意和忠诚的义务。它解决了当今行业中的一个关键问题:几乎完全专注于能力,而很少关注智能体是否忠于委托其工作的委托人的利益。

测试从一个工作定义开始:如果委托任务给智能体的好处大于任务失败的风险,那么该智能体就是可信的。这是一个用经济术语表述的方程式,高管可以直接据此采取行动,风险可分为三个组成部分:

  • 可靠性,即智能体在不同条件下是否能按预期运行

  • 安全性,即其抵御恶意行为者攻击的能力

  • 安全性,即当最终发生故障时,损害被控制在何种程度

“结果评分可以与消费者信用评级相比较,但它是基于行为数据构建的,”Sharma解释道。”同时,测试方法应围绕三个P:目的、角色和策略。”

在Vijil,基于目的的测试适应智能体处理的特定工作流程,根据性能调整难度,类似于计算机管理的考试。基于角色的测试利用一千多个人口统计多样化的用户档案以及对手档案(从道德黑客到国家支持的黑客),模拟智能体可能遇到的各种人和威胁。基于策略的测试根据组织自身的规则构建自定义测试框架,这些规则可能来自监管、内部隐私政策或品牌准则,并衡量智能体违反这些规则时的偏离程度。

生产环境中出现的信任故障

许多故障无法在预生产测试中显现,因为它们源于环境本身的变化。机器学习以前将这种情况描述为数据漂移和概念漂移,对于CIO或CSO来说,这意味着与智能体互动的人员与计划中的人员不同,而这些用户的行为只有在生产环境中才会变得可见。同时,随着组织将通用智能体推向它们并非设计且难以约束的专业企业角色,新的攻击正以越来越高的频率出现。

多智能体系统也引入了一个全新的故障类别,这种故障无法在单个智能体级别检测到,即智能体系统违背委托人利益的情况。例如,当智能体协同工作时可能会发生串通——一个编码智能体生成代码,第二个智能体测试它,而在背后双方都同意留下后门或缺陷而不标记它。或者智能体之间分配任务或责任,而不是专注于自己的分配任务。

“不再有疑问的是这是否可能。这已被证明存在,”Sharma说。”你应该在6个月、12个月还是18个月后担心AI智能体之间的串通?我认为比那更早。我们已经进入了故障预防的时代。现在我们必须从韧性的角度思考:你从生产环境中的故障中恢复得有多快?”

持续信任管理的实践应用

在运营层面,持续信任管理回归到可观测性和控制的长期原则,应用于智能体生命周期的各个阶段:

第一步是发现,将影子AI和未受治理的智能体纳入治理框架。

第二步是为每个智能体分配一个基于标准的工作负载身份,与其人类委托人身份区分开来,这使组织能够为智能体分配其委托任务的有限权限。

第三步是通过智能体中的强制执行点实施基于策略的控制,而不是留给开发人员自行决定。

从那里,出现两个新的KPI:建立信任的时间和恢复时间。建立信任的时间是指组织从意图到能够支持的生产部署所需的时间。恢复时间是指从检测到漏洞到修复漏洞之间的间隔。

这项工作的新组织责任可能落…


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/security/fiduciary-ai-agents-need-to-prove-trustworthiness-not-just-ability

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2189篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类