企业评估智能体:失败经历者反而加速自动化

研究概述
在108家企业中,对自动化智能体评估的信任度在7月份急剧上升,而其本应预测的失败率却完全没有变化。完全信任自动化评估的组织比例几乎增长了三倍,从6月份的5%上升到13%,而关于评估与现实结果不匹配的投诉下降了10个百分点。然而,与上月相同比例——略低于一半——的企业部署了通过了评估但在客户面前失败的智能体。原因在交叉表格中显而易见:新的信任几乎完全属于尚未经历过”评估失败”的企业。在这些经历过失败的企业中,只有4%信任自动化评估;而在那些未经历过的企业中,这一比例为24%。而且,经历失败并没有减缓自动化的进程,反而加速了它。
研究背景
这是VentureBeat Pulse Research智能体可靠性追踪研究的第二波,也是首次使用与前一月完全相同的工具进行。这使得7月成为首次对趋势而非位置的解读:什么发生了变化,什么保持不变,以及这些变化意味着什么。
主要发现
信任度提升
6月份,只有5%的企业表示他们完全信任自动化评估,而最常引用的局限性是评估与实际结果不匹配(29%)。到了7月份,13%的企业完全信任自动化评估,而关于评估不匹配的投诉已降至19%,不再是主要的反对意见。这两项变化都足够显著,可以视为真实变化而非噪音。
失败率未变
近半数组织(49%)在过去一年中部署了一个通过了内部评估但在客户面前失败的智能体或LLM功能——与6月份的50%相比在统计上没有区别——四分之一(24%)的企业已多次目睹这种情况。信心提高了;正确性却没有。这就是7月份出现的差距:与6月份的自主性和信任之间的差距不同,这是信任与其证据之间的差距。
信任来源分析
交叉表格解释了新信心的来源,它并非来自更好的评估。信任几乎完全集中在那些没有经历过虚假信心失败的企业中:他们中有24%完全信任自动化评估,而经历过失败的企业中只有4%。信任曲线正在被缺乏经验所提升。与此同时,那些被”烧伤”的企业并没有远离自动化——85%已经允许零人类部署或正在朝这个方向努力,而未经历失败的企业中这一比例为61%。总体而言,自主化轨迹保持在67%,但轨迹内的群体已经转向那些有最直接证据表明评估存在疏漏的组织。
供应商市场变化
相比之下,供应商市场终于显示出稳定迹象。没有使用专用评估工具的企业比例从17%降至12%;专业平台有所增长,其中Braintrust几乎翻倍至15%,DeepEval达到17%;转换意向降温,计划不做更改的企业从36%上升到44%。选择标准也随之变化:易集成性超过成本成为首要因素,从27%跃升至39%。企业已完成基于价格的购物,开始基于适配性购买。
研究方法
VentureBeat作为其持续的Pulse Research系列的一部分进行了这项调查。这一波——智能体可靠性和评估追踪器——考察了技术领导者如何评估智能体的性能和可靠性。回应被过滤为拥有100名或以上员工的组织(n=108),数据来自2026年7月的调研。由于7月的调研工具与6月相同,本报告在适当时进行了月度比较;对于多项选择的问题,比例总和可能超过100%。
与6月(n=157)的比较经过显著性检验,只有少数几项变化通过了常规阈值:对自动化评估的完全信任度上升(5%至13%),与现实世界匹配度相关的投诉下降(29%至19%),易集成性作为选择因素的跃升(27%至39%),以及Braintrust作为主要平台的增长(8%至15%)。本报告中描述为稳定的变化——失败率、自主化轨迹、生产监控组合、投资排名——在波次之间在统计上没有区别,而这种稳定性本身就是一项发现。其他几点的差异应解读为样本变异而非趋势。
从角色来看,样本是资深且具有购买可信度的:44%是AI购买的最终决策者,另有25%是推荐者或影响者,比6月的样本稍微资深一些。产品项目经理(18%)、顾问(12%)、CIO/CTO/CISO(11%)和工程/IT总监(11%)是主要职位,还有大量”其他”职能(30%)。从组织规模来看,样本再次偏向中型市场:100-499人(33%)和500-2499人(30%)的企业领先,其次是2500-9999人(23%)、10000-49999人(9%)和50000+人(5%)。
发现一:失败率未变
近半数企业仍部署通过评估但在客户面前失败的智能体
我们询问,在过去12个月中,企业是否部署了通过了内部评估但在客户面前失败的智能体或LLM功能。答案与上月相同。
49%的企业部署了一个通过了内部评估但在客户面前失败的AI功能——错误的输出、中断的工作流程或质量事件——与6月份的50%相比。四分之一(24%)的企业已多次目睹这种情况,没有变化。在两波次和265家企业中,评估认证随后失败的智能体的率在1个百分点范围内保持稳定。
这种稳定性是后续一切的基础。本月所有的其他变化——上升的信任、整合的工具、转变的购买标准——都必须解读为对未响应的失败率的应对。无论企业在6月和7月之间做了什么,它都没有改变通过评估后来被证明是错误的频率。
发现二:信任上升——在那些没有被”烧伤”的人中
完全信任度几乎增长了三倍,匹配投诉下降了十个百分点
我们询问,目前哪些限制因素最降低了企业对自动化智能体评估的信任度。分布从6月份发生了实质性变化。
两件事同时发生了变化:对自动化评估的完全信任几乎增长了三倍,从5%上升到13%,而最直接描述虚假信心失败的问题——与现实结果不匹配——从29%降至19%,失去了首要位置,让位于评估偏见和一致性(22%),现在与数据泄露担忧(22%)并列。从表面上看,这似乎是评估层开始证明其价值。
但交叉表格表明情况并非如此。将企业分为两组后,我们发现新信任几乎完全来自未经历过虚假信心失败的企业。在这些企业中,24%完全信任自动化评估;而在经历过失败的企业中,这一比例仅为4%。这表明信任的提升主要源于缺乏直接经验,而非评估方法的实际改进。
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!