AI信任危机:智能体背景鸿沟显现

AI信任危机:智能体背景鸿沟显现

在对101家企业的调查中发现,为智能体提供业务背景的基础设施建设速度超过了其可信任度。检索增强生成(RAG)已成为默认的背景来源,而提供商原生检索已经悄然超越了定义类别的专用向量数据库——然而大多数企业已经目睹了他们的智能体产生自信的错误答案,这些答案可追溯到缺失或不一致的背景。受控语义层正在成为解决方案,但大多数仍在构建中;该领域正在向混合检索方向发展;即使提供商原生工具在实践中领先,仍有相当一部分企业表示他们打算保留最佳独立工具。结果是一个背景鸿沟——智能体听起来权威,但运行在其所有者尚未完全信任的基础上。

本期的调查研究了企业RAG和背景层:什么为智能体提供业务背景,企业运行哪些检索系统,他们如何购买和衡量这些系统,架构走向何方,以及最具揭示性的是——背景失效的频率。

核心发现是一个背景鸿沟——企业智能体回答的自信程度与支撑它们的背景可靠性之间的差距。大多数企业(57%)报告称,在过去的六个月中,他们的AI智能体产生了自信但错误的答案,这些答案可追溯到缺失或不一致的业务背景,其中超过一半的人表示这种情况发生了不止一次。这不是边缘性失败:对38%的企业而言,检索是主要的背景来源,比任何其他方法都多,因此当检索内容稀少或不一致时,它产生的错误却披着智能体的权威外衣。修复它的基础设施正在建设中——58%已经运行或正在构建受控语义层——但对大多数人来说,它尚未投入生产。

在底层,市场正在向一个令人惊讶的方向整合。提供商原生检索——OpenAI的文件搜索(40%)和Google的Vertex AI搜索(38%)——已经领先于所有专用向量数据库,企业预计到2026年底混合检索将占据主导地位(34%)。然而,相当一部分(36%)表示他们打算保留最佳独立工具,而不是整合到提供商的原生背景堆栈中,大多数(57%)计划在年内切换或添加提供商。表面偏好和实际使用方向相反——市场正在购买提供商原生产品,同时坚持需要独立性。

研究方法

本次调查聚焦于企业RAG基础设施和背景层——为智能体提供服务的检索系统、语义层和背景来源。回复被过滤至员工超过100人的组织(n=101);调查未收到100人或以下组织的回复,因此完整样本符合条件。所有回复均来自单一2026年第二季度(6月)的调查波,因此报告为横向解读,不推断月度趋势。几个问题为多选题,因此这些份额总和可能超过100%。

按组织规模,样本集中在中型市场:251-1,000名员工(31%)和101-250名员工(31%)领先,其次是1,001-5,000名员工(20%)、5,001-10,000名员工(12%)和10,001+名员工(7%)。按角色涵盖经理(39%)、个人贡献者(27%)、C级高管(16%)以及副总裁和总监(14%);在购买权限上具有可信的买家属性,其中46%为最终决策者,另有26%为推荐人或影响者。技术/软件是最大的行业,占20%,其次是医疗保健/生命科学(11%),以及零售、交通、金融服务、制造业和教育业的广泛分布。

101个受访者是一个适度的样本,应作为方向性信号而非精确测量来解读;它是自选样本,不是概率样本。最好将其视为积极建立RAG和背景基础设施的组织观点,而非最大运营商的观点。

发现1:自信且错误

超过一半的企业将智能体错误追溯到不良背景

我们询问企业在过去六个月中是否将智能体自信但错误的答案追溯到缺失或不一致的业务背景。大多数企业都遇到了这种情况。

这是本报告的定义性数据。大多数企业(57%)已经有过AI智能体产生自信但错误答案的经历,这些答案可追溯到不良背景——错误的指标、过时的定义或缺失的文档——其中超过一半的人表示这种情况发生了不止一次。只有28%报告没有此类失败,其余一小部分要么不在企业数据上运行智能体,要么没有密切追踪根本原因,因此无从知晓。

这种失败模式特定且危险:模型并非明显产生幻觉;它自信地给出错误答案,因为它所依赖的背景稀少或不一致。本报告中其他所有内容——企业检索什么、如何管理背景以及计划构建什么——都是这个问题的下游影响。

发现2:RAG是默认背景来源

检索比任何其他方式为更多智能体提供背景

我们询问企业的AI智能体主要使用什么方式理解其数据。检索以显著优势领先。

检索是企业背景的支柱。对38%的组织而言,RAG(基于文档或向量索引)是智能体理解业务的主要方式——几乎是下一种方法(受控语义层或本体,21%)的两倍。混合方法(14%)、直接实时系统查询(10%)和长上下文加载(6%)构成了其余部分,只有2%让智能体仅基于模型的通用知识运行。考虑到发现1中的集中度,这一点很重要:因为如此多的企业背景通过检索流动,检索的质量就是答案的质量。当RAG是默认来源时,稀疏检索不是边缘案例——它是主要的故障面。

一种方法在这些答案中因其缺席而值得注意:自定义模型权重,也称为微调。每个主要的业务背景来源都是在运行时注入的。我们对微调的最新直接测量来自4-5月的调查波,其中微调能力在模型选择的六个因素中排名最后,仅占5%——尽管该样本中仍有26%的人将微调和定制化列为他们期望增长的投资。微调已退出主要的选择对话;上下文注入是企业使智能体了解其业务的方式。

发现3:提供商原生检索已领先于向量数据库

OpenAI文件搜索和Vertex AI搜索领先专用工具

我们询问企业当前在生产中运行哪些检索系统。答案倾向于模型提供商和超大规模服务商而非专业厂商。

专用向量数据库不再是RAG堆栈的中心。OpenAI的文件搜索(40%)和Google的Vertex AI搜索(38%)领先——提供商原生和超大规模服务商原生检索——领先于每个专用的向量数据库。在专业厂商中,使用最多的是企业已因其他原因运行的系统(Elasticsearch/OpenSearch,20%)和开放嵌入式选项(pgvector,12%);定义类别的纯向量数据库——Weaviate、Qdrant、Pinecone、Milvus——各自占比从个位数到低两位数。值得注意的是,13%的企业表示他们目前仍未在生产中运行任何RAG。企业正倾向于使用他们已经购买的捆绑工具中的检索功能。

这一发现在调查的两个波中都保持一致。在较早的调查中,提供商构建的检索同样领先使用,而…


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/resources/the-ai-context-gap-enterprise-ai-organizations-have-a-trust-problem-not-a-retrieval-problem-and-most-are-still-building-the-fix

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2125篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类