性价比之王:GLM-5.3-Flash或将承担45%AI工作

神秘模型现身,引发行业关注

一周前,一个名为Ox Alpha的神秘模型出现在OpenRouter平台上,成为400多个模型中的新成员。每周约有10个新模型加入这一竞争激烈的市场。Ox Alpha之所以脱颖而出,不仅因为其免费策略,更在于其实际表现令人惊喜。爱好者和独立开发者迅速注意到这一模型,每天处理数万亿代币,社区估计数据显示,一周内的处理量从数万亿到超过20万亿不等。

模型身份揭秘

在随后的六天里,AI爱好者们展开了全方位的追踪分析和猜测,试图找出开发这一模型的团队以及能够支撑如此大规模免费服务的基础设施。最初的猜测指向美国实验室:可能是期待已久的Gemini,或是Anthropic推出的足够好的中等层级模型,又或者是埃隆·马斯克拥有过剩能力而推出的Ox Alpha(注意其命名特点)。人们通过分析分词器和网络信息来寻找线索,这简直就像一场真实的福尔摩斯探案。

直到8月26日,Z.ai正式揭晓谜底:Ox Alpha实际上是GLM-5.3-Flash。他们有意在公共流量上测试这一模型,但真正的惊喜不仅在于模型性能的优异(确实非常出色),更在于它完全基于中国芯片和基础设施提供服务。其定价为每百万代币15-50美分,OpenRouter的推广活动提供50%折扣,即每百万代币7.5-25美分,优惠期至9月9日。该模型采用MIT许可证开放权重,并由Z.ai、GMI Cloud、Cloudflare及其他美国推理服务提供商提供推理服务。

性价比优势明显

同一天,Artificial Analysis将该模型纳入其智能与成本对比图表中。GLM-5.3-Flash以约每任务9美分的价格在指数上排名第57位。相比之下,美国中等层级的GPT-5.6 Sol(max)以每任务67美分的价格排名第59位,这意味着为提高2个智能点,用户需要支付约7.4倍的费用。再进一步看,Grok 4.6以每任务94美分的价格排名第61位,相当于为提高4个智能点支付约10倍的费用。在这种情况下,代币经济性显著影响使用决策。在高端市场,性能增长曲线已经趋于平缓。如果我们接受这种开放权重模式的吸引,那么那些未考虑到中国推理竞争者的重大基础设施投资循环将何去何从?

企业面临的AI成本压力

美国企业已经感受到成本压力。以优步为例,其首席技术官Praveen Neppalli Naga在4月告诉《信息报》,他需要”回到绘图板”,因为”我认为需要的预算已经被完全消耗了”:公司整个2026年编程预算在四个月内就用完,Naga个人仅在一个两小时的演示中就消耗了1200美元。到6月,优步已实施每人每工具1500美元的使用上限。这些工具确实有用,但有用性和价值并不等同。优步首席运营官Andrew Macdonald仍然无法从那些仪表板中看出它们与”25%更有用的消费者功能”之间的直接联系。

根据麦肯锡2026年AI现状调查,80%的人表示使用AI后效率提高,37%的公司看到了某些息税前利润收益,32%的公司跳过了至少一次软件采购,因为他们能够使用编程智能体自行构建这些功能。组织希望削减账单,但他们无法放弃AI。现在的任务是在整个组织内优化AI使用。

中国模型的崛起

我们无法避免智谱、通义、深度思考等中国模型制造商。他们一次又一次地凭借自身创新挑战最先进实验室并降低成本。在OpenRouter平台上,中国模型的代币份额早在6月初就已超过美国模型,而该排行榜的前列仍主要由中国实验室占据。独立开发者领域已经呈现出以GLM Flash、DeepSeek Flash、MiniMax、Kimi为主导的格局,只有在已订阅重型服务的情况下才会使用Grok或Claude。如果您已通过公司订阅了Grok或OpenAI,那已成为沉没成本。财务部门将开始质疑,如果按使用付费变得如此便宜,那些席位是否仍然合理。

AI任务分层策略

那么,我们还有哪些选择?可以将您的编程和智能体工作分为三个层次,按任务占比和运行的代币量划分——而非美元金额,因为GLM-5.3-Flash的每代币价格低得多,即使按相同美元分配,大部分工作负载也会流向它。

高端层(5%)

最高端是Fable和Opus。如果您需要分析复杂战略或制定详细执行计划,额外的智能点至关重要,应该为这些无法削减的稀有任务支付最高价格——这大约占总任务量的5%。

中端层(50%)

中间层包括Kimi K3、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6,它们在智能指数上都位于60左右。Kimi在编程领域是实力派,深受用户喜爱;Grok 4.6紧随其后,但其较小的上下文窗口限制了其表现。将约50%的工作量分配给这一层级。

基础层(45%)

对于剩余的45%,强烈建议将GLM-5.3-Flash作为处理大规模任务的主力。您的工作组合(编程与内容与营销)和评估标准将定义您自己的边界。中国开放权重模型将为您节省资金——它们必须成为您成本计算的一部分。

未来趋势与建议

9月份预计将有大量新模型涌现——谷歌、xAI、Anthropic、OpenAI和深度思考都有发布计划。帕累托前沿可能会再次移动,但方向已经确定:以更少的成本获得更高的智能。无法降低服务成本的实验室将失去用户量——以及由此产生的受众。

九月前的准备工作

  1. 统计您的代币使用量。能否将支出与客户增长或收入增长等关键指标联系起来?如果不能,至少与开发速度或生产力挂钩?没有明确的目标,就难以证明支出的合理性。
  2. 重新构建您的AI预算</strong。按部门划分,计划的AI支出是多少?这些领导者能否提出方案并进行辩护?
  3. 按团队定义您的模型策略</strong。制定三个层级:高端用于不可逆转的决策和战略;中端用于付费座位和日常编程;基础层(GLM-5.3-Flash)用于大规模任务。

下个月,模型价格将再次下降,您的团队需求将更加强烈。能够从这一波变革中脱颖而出的公司将是那些有意识地进行投资决策的公司,他们不会让智能体在Opus或Fable上思考,除非任务确实值得。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/glm-5-3-flash-will-likely-handle-45-of-your-ai-workloads

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2772篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类