AI计算:盲目追求速度忽视成本

AI计算:盲目追求速度忽视成本

研究背景

通过对170家企业的调查发现,AI基础设施已全面投入生产阶段——三分之二的企业已运行实时AI工作负载,十分之三的企业已实现规模化部署。然而,对这些基础设施成本的追踪能力却远远滞后。企业在采购决策中悄然将成本因素降级:性能和GPU可用性已超越总拥有成本成为首要考量,可靠性也超过价格成为成功的关键指标。这种优先级调整对于面临生产压力的团队而言有其合理性,但也暴露了一个令人不安的事实——不到一半的企业能够精确追踪AI计算成本,大多数GPU的利用率仍不足50%,而下一笔投资将流向专业云服务,但仅有不到二十分之一的企业实际采用此类服务。

本次VentureBeat Pulse研究聚焦企业AI基础设施与计算能力:探索组织在AI部署旅程中的位置、当前运行AI的平台、采购与衡量方式、未来投资方向,以及最具揭示性的——企业能否看清底层计算的经济效益。

AI部署现状

这批受访企业已进入运营成熟期。三分之二(66%)的企业在生产环境中运行AI工作负载,29%已实现规模化AI部署,仅4%尚未启动任何AI项目。这种成熟度反映在技术栈上:平均每家企业运行三个基础设施平台,其中OpenAI(49%)、Google Gemini(48%)、Microsoft Azure(47%)和Google Cloud(42%)均在约半数企业中使用。当被要求指定主要平台时,Azure以26%的占比领先。

决策标准的转变

企业决策过程中最具影响力的变化体现在优先级的重新排序。与现有云和数据栈的集成仍是首要选择因素(40%),但性能指标——包括延迟和吞吐量——已上升至第二位(35%),GPU可用性位居第三(24%),两者均超过了总拥有成本(22%)。同样的优先级排序也适用于成功衡量标准:正常运行时间和可靠性成为51%企业的首要成功指标,开发人员生产力占39%,均高于每百万代币成本(31%)。处于生产压力下的企业正为速度和可用性进行采购和衡量,将成本因素置于次要位置。

经济状况失控

若经济状况可控,上述现象本不足为奇,但事实并非如此。在运营自有GPU的155家企业中,69%报告利用率在50%或以下,仅23%超过半数利用率;12%甚至完全不衡量利用率。不到一半(47%)的企业能够严格追踪AI计算成本与回报,即便在生产环境中大规模运行AI的企业中,这一比例也仅为56%。物有所值是三个满意度评分中最弱的,为3.87分,而整体满意度为4.14分——这种差距恰恰出现在难以精确衡量的维度上。

未来投资方向

下一轮投资将转向当前技术栈之外。专业AI云成为最优先计划评估的领域,占比达44%,并且是所有基础设施方法中净势头最强的(+36),但CoreWeave和Lambda各自仅占当前使用量的3.5%,而新云领域的其他部分占比均低于3%。非NVIDIA加速器占比39%。62%的企业计划在12个月内更换或增加供应商——尽管考虑范围仍以他们已使用的现有主导供应商为主。

研究方法

VentureBeat通过其持续进行的Pulse研究系列开展本次调查,聚焦企业AI基础设施、计算与推理经济性。回复经过筛选,限定为员工超过100人的组织(n=170;排除了最小规模区间1-100人的企业),数据来源于2026年7月的一次调研。由于这是单次调研而非多个月份的汇总样本,报告应被视为横截面数据,不推断月度趋势;所有数据均仅来源于7月的调研。部分问题为多选题,因此比例总和可能超过100%。

按组织规模,本次调研比该系列通常的中等市场倾向更偏向高端:员工数251-1,000人(28%)和1,001-5,000人(25%)占主导,其次是10,001+人(19%)、101-250人(15%)和5,001-10,000人(12%)——这意味着57%的受访者所在企业员工超过1,000人。按职位划分,包括管理者(48%)、个人贡献者(27%)、C级高管(12%)和副总裁及总监(9%);在购买决策权方面,39%为最终决策者,另有43%为AI解决方案的推荐者或影响者。技术/软件是占比最大的行业(35%),其次是制造业(14%)、金融服务(12%)和医疗保健/生命科学(9%)。

样本量为170人,足以有信心地进行方向性解读,但仍应被视为方向性信号而非精确测量;这是自选样本,并非概率样本。最佳理解方式是将其视为积极构建和运营AI基础设施的组织的观点,而非来自最大的超大规模运营商。

发现一:三分之二企业已超越试点阶段

十分之三企业现已大规模运行AI

我们询问了组织在AI部署旅程中的位置。这批企业大多已超越实验阶段。

三分之二的企业(66%)在生产环境中运行AI工作负载,29%描述已实现大规模AI部署。仅30%仍处于概念验证阶段,4%尚未开始。这比该系列通常抽取的样本更具操作性,与其高端市场构成相符——57%的受访者所在企业员工超过1,000人。

这种成熟度是后续所有内容的框架。本报告中的基础设施决策主要由拥有生产工作负载和实际账单的组织做出,而非仍在规划试点的团队。这解释了发现五中购买标准重新排序的原因——性能和可用性取代了成本,这是运行实时系统的团队的优先事项。这也提高了发现六和发现七的重要性:在实验阶段无法衡量利用率或成本的企业面临规划问题,而在生产环境中大规模运行却无法衡量的企业则面临运营问题。

发现二:技术栈以超大规模云和API为主,深度达三个平台

专业GPU云仍几乎未被采用

我们询问企业目前使用哪些提供商和平台运行AI,以及他们将哪个视为主平台。答案仍然是现有主导者——同时使用其中的几个。

当前技术栈以超大规模云和API为主,且呈现多元态势:企业平均使用三个平台。通用云和主要模型API几乎涵盖了所有当前部署,其中四个平台——OpenAI、Gemini、Azure和Google Cloud——每个都在超过十分之四的企业中使用。当被要求选择一个主要平台时,Microsoft Azure以26%领先,Google Cloud以19%位居第二;若将OpenAI(14%)、Gemini(14%)和Anthropic(8%)合并计算,模型提供商共占主要地位的35%。

在AI基础设施新闻中占据主导地位的专业”新云”GPU提供商在实践中仍处于边缘地位。CoreWeave和Lambda各出现在3.5%的技术栈中,Baseten占3%,Crusoe、Nebius、Fireworks、Together和Anyscale各占2%或更低。合计起来,它们仅被1%的企业命名为主要平台。与此同时,13%运行定制的开源自管理栈,9%运营自己的GPU集群——两者的规模都比整个专业云类别更大。这种对比使得发现三中的评估意图值得关注。

关于这些比例的说明:如方法论部分所述,本样本是自选的,此问题计算了受访者使用的每个提供商。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/resources/infrastructure-and-compute-enterprises-are-buying-ai-compute-for-speed-while-flying-blind-on-what-it-costs

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2503篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类