八成企业因AI失误削减人工监管
最新研究表明,那些已因智能体评估通过但在实际应用中失败而遭受损失的企业,正加快移除人类在部署决策中的角色——即使在整体对自动评估的信任度普遍上升的情况下也是如此。
企业对智能体评估的态度转变

根据最新调查,企业界对AI智能体的评估和部署方式正在发生显著变化。数据显示,在7月接受调查的108家企业中,有13%表示信任自动评估,较前一月的5%有了显著提升。与此同时,将测试与实际结果不一致视为最大问题的受访者比例下降了10个百分点,从29%降至19%。
然而,调查结果也揭示了令人担忧的一面:仍有49%的受访者表示,通过公司测试的AI智能体或大语言模型驱动的功能随后造成了客户可见的问题,与6月的50%基本持平。更有甚者,近四分之一(24%)的受访者表示这种情况发生过不止一次。
评估信心提升但实际效果未改善
调查发现了一个更为深层次的问题:企业对智能体层级的信心与证据之间存在差距。那些经历过测试通过的智能体在实际生产中失败的企业,自然更有可能怀疑自动检查过程。
数据显示,在经历过智能体测试通过但在实际应用中令客户失望的企业中,仅有4%对自动检查完全信任。而在未发现类似问题的企业中,这一比例高达24%,相差六倍。
调查数据解读
- 调查对象为108家员工至少100人的企业,较6月的157有所减少
- 69%的受访者表示自己是最终AI购买决策者或推荐者
- 样本中63%来自中型企业(100-2,499名员工)
- 科技和软件行业参与度下降9个百分点,降至14%
- 零售和消费品行业参与度上升4个百分点,达到19%
尽管样本规模有所变化,但关键数据保持稳定:在两个月内共收集的265份企业回复中,报告至少有一个测试通过的系统令客户失望的比例保持在49%-50%之间。
经历过AI失误的企业加速减少人工干预
调查结果呈现了一个看似矛盾的发现:企业在经历评估失误后,反而更倾向于减少人工干预。
总体而言,67%的企业已允许智能体在某些低风险情况下无需人工批准即可推送代码或更改系统,或正在修改流程以支持这一做法,与6月数据持平。其中,37%已在有限情况下允许,另有30%正在朝此方向努力。
然而,在经历过测试通过但令客户失望的系统的企业中,85%正在追求这种无需批准的模式,而在未报告类似问题的企业中,这一比例为61%。只有11%的”受影响”受访者拒绝在未来几年内实现端到端部署自动化,相比之下,”未受影响”群体的这一比例为24%。
这可能并非鲁莽之举,而是部署成熟度的体现:运行更多智能体、更大规模且跨越更关键工作流程的组织,更有可能遭遇故障,同时也具备实现自动部署所需的工程基础设施。
评估自动化与生产质量监测的差距
部署前评估与生产监控回答不同的问题:评估关注智能体是否准备好发布,而生产监控关注智能体在发布后的行为及其输出是否仍然正确。
调查显示,大多数企业仍着重于系统功能是否按预期工作,而非智能体输出是否准确。这种关注点的差异可能反映了企业对不同阶段风险的认知差异。
随着智能体系统变得越来越复杂,传统的全面列举失败案例的方法已不可行。企业正转向依赖异常和问题检测解决方案,无论是在生产前还是生产后。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!