智能体评估与现实脱节,企业仍加速投产

评估差距:企业AI面临的现实匹配困境
通过对157家企业的调研发现,一个明显的趋势正在形成:企业正授予AI智能体更多自主权,但对控制这些自主权的评估系统的信任却在减弱。调查显示,半数企业已经部署了通过内部评估但在实际应用中失败的智能体;仅有5%的企业表示完全信任当前的自动化评估体系;而最常见的短板是评估系统与实际业务成果不匹配。尽管如此,三分之二的企业已经允许或正在积极构建仅通过自动化评估就部署智能体变更的流程,完全排除人工干预。
这导致了所谓的”评估差距”——企业给予智能体的自主程度与他们对测试系统的信任度之间的鸿沟。技术领导者如何衡量智能体性能、他们使用哪些可靠性评估平台、如何选择并信任这些平台、生产环境中会出现哪些问题,以及他们愿意让智能体在没有人工监督的情况下运行多远,都是本次调查关注的核心。
核心发现:评估不匹配现实
本次调查的核心发现是评估差距问题日益凸显。企业给予智能体的自主权与他们放在评估系统上的信任之间存在明显差距。半数组织(50%)在过去一年中部署了通过内部评估但在客户面前失败的智能体或LLM功能,四分之一的企业已多次遇到此类情况。对测试本身的信任度薄弱:只有5%的企业表示他们完全信任当前的自动化评估,最常见的局限性是评估与实际业务成果不一致(29%)。企业正在意识到,通过评估并不等同于智能体能够正常工作。
发现一:通过评估不等于工作良好的智能体
半数企业已部署评估通过但客户使用失败的智能体
我们询问了组织在过去12个月内是否曾部署通过内部评估但在实际使用中导致客户问题的智能体或LLM功能。运行评估的企业中,半数都遇到了这种情况。
这是报告中的关键数据。半数企业(50%)已经部署了通过内部评估但在客户面前失败的AI功能——错误的输出、中断的工作流程或质量问题事件,四分之一的企业已多次遇到此类情况。只有36%的企业报告没有发生过此类故障,其余企业要么不进行部署前评估(8%),要么没有密切跟踪根本原因而无法确定(6%)。这种故障是精确且代价高昂的:评估结果显示智能体已准备就绪,但实际上并非如此。随后的一切——企业如何信任他们的评估、他们监控什么、他们授予多少自主权——都受到这一经验的影响。
发现二:几乎无人完全信任自动化评估
主要投诉:评估与实际结果不匹配
我们询问了哪些因素最降低了对自动化智能体评估的信任度。几乎没有企业完全没有任何不满。
对自动化评估的信任稀缺且具体。只有5%的企业表示他们完全信任当前的自动化评估,这意味着95%的企业指出了一个限制他们信任的因素。最常见的是29%的企业提到的直接解释了发现一的问题:评估与实际业务成果不匹配,通过了后续会失败的智能体。偏见或不一致性(21%)和缺乏可解释性(18%)紧随其后——企业并不总能判断评估为何得出结论——17%的企业指出评估过程中存在数据泄露或隐私问题。本应认证智能体的测试尚未被信任来执行这一任务,这正是发现3中自主权轨迹如此令人惊讶的原因。
发现三:自主权限上限仍在上升
三分之二企业已允许或正在构建无人工部署
我们询问企业是否会允许自主智能体仅根据自动化评估结果就部署代码或系统变更到生产环境,没有人工验证干预。这一趋势直接穿越了信任差距。
这是报告核心的悖论。尽管几乎没有人完全信任自动化评估(发现二),但三分之二的企业(66%)要么已经允许低风险智能体进行无人工干预的部署(34%),要么正在积极构建管道以在一年内允许这样做(33%)。只有22%的企业在可预见的未来明确禁止这样做。方向是明确的:企业正在转向让评估自主控制生产——移除人工检查——就在他们表示这些评估不能可靠匹配现实的同一时刻。自主权限上限上升的速度超过了其下方的保障速度,这将使发现一中虚假自信的故障规模扩大而非缩小。
值得注意的是,自主权下注并非仅是小公司现象。按公司规模划分样本,大型企业比小型企业在无人工审查方面走得更远(70%对比64%),也更有可能已经部署了评估通过但随后让客户失败的智能体(54%对比48%)。在此样本中,大型、受监管组织将人工保留在循环中最久的假设是反向的。当然,这些是方向性数据,因为调查样本不是很大——57个回应者。
调研方法:VentureBeat作为其持续进行的Pulse Research系列的一部分进行了此次调查,名为”智能体可靠性与评估追踪器”,重点关注技术领导者如何评估智能体性能和可靠性。回应经过筛选,来自员工人数100人以上的组织(n=157),数据来自2026年6月的一次调查;由于这是单次调查而非多个月的综合样本,报告应横向解读,不应推断月度趋势。对于多选题选项,比例总和可能超过100%。
按角色划分,样本具有高级性和购买者可信度:38%是AI购买的最终决策者,另有34%是推荐者或影响者。产品经理和项目经理(15%)、顾问和顾问(10%)、工程/IT主管(8%)以及CIO/CTO/CISO(8%)是主要职位,还有大量”其他”职能(37%)。按组织规模,样本偏向中型市场:100-499人(37%)和500-2,499人(27%)的员工占主导,2,500-9,999人(20%)、10,000-49,999人(10%)和50,000人以上(6%)在其之上。技术/软件是最大的行业,占比23%,其次是零售/消费品(15%)、医疗保健/生命科学(12%)和制造业(10%)。
在157名受访者中,样本足够大,可以进行方向性解读,但应被视为方向性信号而非精确测量;它是自我选择的,不是概率样本。它偏向中型市场,因此最好将其解读为积极建立智能体评估实践的组织观点,而不是最大运营商的观点。
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!