智能体编排:企业AI部署问题凸显

研究概览
一项针对101家企业的最新研究表明,智能体编排正在向模型提供商平台集中,其中Anthropic的Claude平台以显著优势领先。企业选择这些平台主要基于底层模型的性能考量,并评判其可靠的多步骤执行能力。然而,企业的雄心与实际应用之间存在明显差距:大多数部署的”智能体”仍然是聊天机器人的包装,企业期望的控制平面采用混合架构以避免供应商锁定,而对token消耗的实时财务控制仍然是个例外情况。
这项深入探讨企业智能体编排的研究关注:企业在哪些平台上运行、选择平台的驱动因素、优化目标、预期的智能体控制结构,以及最关键的——部署的”智能体”实际编排程度以及运行成本的控制力度。
核心发现:雄心与现实的差距
研究的主要发现是编排雄心与编排现实之间存在差距。企业正在快速向主要模型平台集中:Anthropic的Claude是40%企业的首选平台,超过任何竞争对手的两倍,其次是微软(18%)和OpenAI(13%)。这种选择由”模型引力”驱动——与最先进基础模型的原生契合度(21%),成功标准则是可靠的多步骤执行(任务完成可靠性32%,多步骤工作流管理28%)。然而,当企业诚实地评估其智能体组合时,71%的企业表示其部署的”智能体”中只有四分之一或更少是真正的多步骤编排工作流,而非单提示聊天机器人包装,只有10%的企业已经超过这一门槛的一半。编排层的构建远超其应运行的编排组合。
企业架构的塑造
这一差距塑造了企业正在构建的架构。到2026年底,大多数企业(51%)期望采用混合控制平面——供应商原生加外部编排,只有6%期望将控制权交给供应商管理服务,因为如果控制权存在于模型提供商内部,供应商锁定(35%)是他们最担心的风险。投资随之而来:智能体工作流工具领先于支出(34%),其次是安全和权限执行(25%)。而财务控制则普遍滞后——超过四分之一(27%)的企业在账单到达前没有实时方法阻止失控的智能体消耗。
研究方法
作为其持续进行的Pulse研究系列的一部分,这项调查专注于企业智能体编排。回应经过筛选,仅包含100名以上员工的企业(n=101),数据来自2026年6月的单一波次;由于这是单一波次而非多个月份的汇总样本,报告应理解为横截面数据,不能推断月度趋势。
按组织规模,样本在各企业规模段均匀分布:100-499名员工、2,500-9,999名员工和50,000+名员工(各占21%),10,000-49,999名员工和500-2,499名员工(各占19%)。按角色分布,样本包含资深且有购买决策权的人员:产品和项目经理(15%)、CIO/CTO/CISO(13%)、顾问(13%),以及数据、AI和工程总监及副总裁的混合群体,其他职能占18%。在购买决策方面,81%是AI解决方案的推荐者、影响者或最终决策者(66%为推荐者/影响者,15%为最终决策者)。技术/软件是最大的行业,占44%,其次是金融服务(17%)和医疗保健/生命科学(8%)。
101个受访者的样本足够稳健,可以合理自信地解读方向性趋势,尽管样本为自选样本,并非概率样本。
发现1:编排运行在模型提供商平台上
Anthropic的Claude领先;开放框架边缘化
我们询问企业目前主要使用哪种智能体编排平台。答案集中在主要模型提供商身上,尤其是其中一个。
需要说明的是,如方法部分所述,受访者为自选样本,此问题要求他们仅选择一个主要平台——因此这些数字衡量的是在AI活跃的技术决策者自选群体中,每个企业部署的主导平台。此类构建的样本可能与支出加权市场指标存在显著差异,而且每个VB Pulse调查都有其自己的公司规模组合,因此供应商数据不应跨调查比较。这些份额应理解为描绘此群体目前将主要编排赌注放在何处,而非市场份额。
模型平台占据主导地位。Anthropic、微软、OpenAI、谷歌和亚马逊合计约占部署量的80%(101家中的81家),而在工程讨论中占主导地位的开放框架(LangChain/LangGraph)和内部定制构建则处于个位数。Anthropic的领先优势——40%,是下一平台的两倍多——反映了”模型引力”选择逻辑:企业选择与其希望构建的模型相关的编排层。与先前智能体安全波次中的安全供应商类似,在技术圈定义类别的工具尚未成为企业部署的集中点。3%的企业完全没有进行任何编排。
受访者对其使用的平台评分为3.94分(满分5分,109人回答),其中”性价比”为3.94分,”实施难度”是最低分,为3.85分——这使得编排在五项满意度指标中排名靠前,仅高于评估工具。来自96%计划在一年内改变其编排方法的用户评分接近4分,这表明这是一种临时接受:这些平台足以运行当前应用,但不足以停止寻找更好的方案。评分与普遍的变更意图并存,这是一个企业容忍度高于喜爱度的层次。
发现2:模型引力驱动平台选择
基础模型而非工具决定了平台选择
我们询问什么因素最影响编排平台的选择。最大的单一因素是底层模型的吸引力,尽管灵活性和开发便利性紧随其后。
模型引力领先是Anthropic平台优势的选择方解释:企业选择最接近他们已标准化采用的前沿模型的编排环境。但下一层因素使情况复杂化——跨模型和工具的灵活性(17%)和开发便利性(17%)表明企业也希望避免被这一选择所困,预示着供应商锁定风险。安全和权限(14%)和总拥有成本(11%)构成了一个务实的购买逻辑。性能(延迟/内存)排在最后,占4%,这提醒我们,在当前采用阶段,约束条件是模型契合度和选择性,而非原始速度。
发现3:任务是可靠的多步骤执行
企业通过是否能完成工作来评判编排
我们询问企业优化的重点——编排的首要成功指标。可靠性和多步骤工作流管理占据主导地位;面向开发者和用户的指标则落后。
任务完成可靠性(32%)和多步骤工作流管理(28%)合计占回答的59%(101家中的60家):在企业看来,编排成功的标准是可靠地将任务通过多个步骤完成。开发者生产力(17%)虽然重要但处于次要位置——与在框架讨论中的突出地位相反——最终用户体验(9%)则是次要考量,这与编排是内部执行问题而非用户体验问题的观点一致。这种以可靠性为先的标准正是”聊天机器人陷阱”发现如此尖锐的原因:企业将成功定义为可靠的多步骤执行,然而他们部署的多数”智能体”仍然是简单的聊天机器人。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!