AI失误推动企业加速自动化部署
自动化评估信任度上升,但问题发生率仍高
最新研究显示,那些曾因AI智能体通过评估但在实际生产中失败而遭受损失的企业,正在加速减少人工在部署决策中的参与,而非放缓——尽管整体对自动化评估的信任度正在上升。

在7月对108家企业的调查中,13%的企业表示信任自动化评估,比上个月的5%显著增加。与此同时,将测试与实际结果之间的不一致性视为最大担忧的受访者比例下降了10个百分点,从29%降至19%。
然而,49%的受访者表示,通过公司测试的AI智能体或LLM功能后来给客户造成了可见问题,与6月份的50%基本持平。近四分之一(24%)的受访者表示,这种令人担忧的情况发生过多次。
企业智能体部署进入新阶段:评估层信心与实际效果之间的差距
VentureBeat Intelligence的最新调查揭示了企业智能体部署的一个更令人担忧的阶段:差距不再仅限于企业给予智能体的自主程度与验证能力之间,而是逐渐转变为对评估层信心与该层防止失败能力改善证据之间的差距。
最引人注目的数据差异出现在7月份的调查中。在经历过AI测试通过但让客户失望的企业中,只有4%对自动化检查完全信任。而在没有发现类似事件的企业中,24%表达了完全信心——相差六倍之多。
这不难理解:那些经历过测试通过的智能体在实际生产中失败的企业,自然更有可能怀疑自动化检查过程。
或许正因为如此,致力于解决此问题的公司——如自动化智能体错误监控和缓解平台Raindrop.ai——的市场在过去几个月发生了巨大变化。
“我们正在见证我们所知道的评估方式的急剧衰落,”Raindrop首席技术官Ben Hylak在直接消息中告诉VentureBeat。”财富100强企业正在日益减少评估集合并降低维护优先级。随着系统变得越来越复杂(如MCPs、子智能体等),完全列举所有失败情况变得不可能。相反,他们正在依赖生产前后的异常和问题检测解决方案。”
方向性发现,而非市场普查
VentureBeat在7月对108家员工至少100人的企业进行了调查,比6月的157名受访者有所减少。
在这108名受访者中,69%将自己描述为最终AI购买决策者或推荐和影响这些购买的人。样本偏向中型组织:63%的人在100至2,499名员工的公司工作。
这些调查结果应被理解为方向性指标。调查是自选而非概率样本,并且本文中提到的”受影响”与”未受影响”的分组基于41至53名受访者的群体,报告中其他交叉表格的范围在40至68之间。
行业组合也发生了变化:技术和软件参与度下降了9个百分点,降至14%,而零售和消费者份额增加了4个百分点,达到19%。
尽管如此,报告仍指出了四个值得注意的月度变化:更多受访者表示完全信任, fewer 将实际世界不一致性列为最大担忧,更多人选择集成便利性作为决定性购买因素,以及Braintrust获得主要平台份额。
自动化评估信心提升,但结果改善有限
VentureBeat 6月份的研究确定了企业评估差距:企业授予智能体权限的速度超过了开发可靠测试方法的速度。
7月份的数据保持了首次调查的关键数字。在两个月内265家企业回复中,报告至少有一个测试通过系统让客户失望的比例保持在单个百分点内:6月份为50%,7月份为49%。
这一数字并不意味着49%的所有智能体运行都失败,或者任何特定的评估产品都有49%的失败率。调查询问组织在过去一年中是否经历过AI功能通过内部测试后在客户面前至少发生一次事故。部署更多智能体的公司遇到此类事故的机会更多。
但这一限制并不会让结果变得不那么重要。内部评估充当发布关卡。如果近一半的受访组织看到这个关卡批准了后来在客户面前失败的系统,那么通过分数就不能被视为生产可靠性的证明。
交叉表格强化了这一观点。在41家没有发现测试失误的企业中,10家对自动化完全信任。而在53家先前”受影响”的企业中,只有两家表示同样态度。信心最强烈的是那些有最少证据表明发布关卡可能失败的受访者。
曾遭遇问题的企业加速转向零人工部署
这一违反直觉的发现是企业在评估失误后的做法。
总体而言,67%的企业要么允许智能体在某些低风险情况下无需人工批准即可推送代码或更改系统,要么正在修改其管道以在未来一年内支持这一做法。这一比例与6月份持平。在7月份,37%的企业已在有限情况下允许这样做,另有30%正在朝这一方向建设。
然而,在测试通过系统曾让客户失望的企业中,85%正在追求这种无审批模式,而在报告没有类似事件的小组中,这一比例为61%。只有11%的”受影响”受访者拒绝在未来几年内实现端到端部署自动化,而”未受影响”受访者中有24%持此态度。
人们很容易将此解读为鲁莽行为,但数据支持另一种合理的解释:部署成熟度。运行更多智能体、更高产量和跨越更关键工作流程的组织,更有可能遇到失败,并拥有自动化部署所需的工程基础设施。
调查无法确定哪种解释占主导地位。但它确实表明,客户可见的事故似乎并未阻碍自主化进程。有亲身证据表明测试可能遗漏缺陷的受访者,也最积极地让这些测试授权生产变更。
如果他们的每次部署失败率保持不变而部署量增加,那么即使受影响公司的百分比不增加,事故总数也可能增长。7月份的数据没有衡量事故量,因此这仍是模式所暗示的风险,而非可衡量的结果。
发布关卡已自动化,但生产质量监控仍落后
预部署评估和生产监控回答不同的问题。评估询问智能体是否准备好发布。生产监控则询问智能体在发布后的行为以及其实时输出是否仍然正确。
7月样本中的大多数公司仍强调系统是否按预期运行,而非智能体行为是否符合预期。这种关注点错位可能导致组织在智能体偏离预期轨道时缺乏足够洞察。
随着企业加速部署智能体,建立强大的生产监控系统变得至关重要。这不仅有助于及时发现潜在问题,还能为未来的评估提供宝贵数据,帮助改进测试方法。
那些经历过智能体失败的企业尤其需要加强生产监控。只有通过实时监控和快速响应机制,才能在问题扩大前及时干预,减少对客户的影响。
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!