DeepSeek智能体:价格攀升,实战遇冷

DeepSeek智能体:价格攀升,实战遇冷

模型排行榜领先,实战测试表现不佳

自推出以来,DeepSeek的V4 Flash模型一直稳居模型排行榜榜首,并被开发者们赞誉为”完全怪物”。然而,在实际测试中,它仅成功完成了53.8%的复杂智能体任务。

Composio通过八种不同的智能体测试平台对该模型进行了评估,包括Claude Code、Codex和OpenCode,测试涵盖30个故意设计的高难度、多步骤任务,这些任务涉及Gmail、GitHub、Slack和Google Sheets等实时工具。在总共240次运行中,129次成功通过,而在所有测试平台中,仅有6个工作流程能够被完全成功完成。

这一差距说明了为什么编排能力而非原始模型性能,可能决定模型在企业环境中的成功与否:相同模型根据其运行的测试平台、工具配置、缓存行为、重试机制和提供商堆栈的不同,产生了截然不同的结果。

价格大幅调整,成本结构颠覆

DeepSeek宣布将上调V4 Flash和Pro模型的价格,这些模型已成为开发者构建编码助手和智能体的热门选择。

虽然这一举措似乎可能会削弱其核心吸引力——即以超低价格提供极具竞争力的模型能力,这是其他前沿提供商无法匹敌的——但随着早期用例的出现和企业确定不同模型如何融入其技术栈以及应针对哪些工作流程,这一转变也将使故事超越如今已沦为陈词滥调的”廉价中国模型”叙事。

DeepSeek于7月31日推出V4 Flash公共测试版,并于8月13日正式发布V4 Pro。拥有2840亿参数的Flash模型专为高容量和高速而设计,而拥有1.6万亿参数的Pro模型则适用于更复杂的工作流程。

两款模型都具有灵活的推理能力(低、高、最大)和应用思维链(CoT)推理以提高答案准确性的”思维模式”。

用户立即被Flash的能力所折服。自推出以来,它一直主导着OpenRouter的使用排行榜,目前是该平台上按每周令牌数量计算使用最多的模型。

“DeepSeek V4 Flash初期的采用数量令人难以置信,”机器学习研究员Nathan Lambert在X上发帖称,并补充说新版本”与GLM 5.2得分相同”,使其成为一个将被广泛使用的”完全怪物”。

DeepSeek改变成本模式增添了有趣的维度。

根据模型、令牌类型和使用时间的不同,V4 API费率将提高高达1100%。新的定价结构如下:

  • Flash模型在非高峰时段为每百万输入令牌22美分,每百万输出令牌66美分;在高峰时段则为每百万输入令牌44美分,每百万输出令牌1.32美元。这代表了57%到371%的增长。
  • Pro模型在非高峰时段为每百万输入令牌66美分,每百万输出令牌1.98美元;在高峰时段则为每百万输入令牌1.32美元,每百万输出令牌3.96美元。这显示了51%到355%的跃升。
  • 与此同时,缓存命中(当模型重用提示而非从头开始时)将上升52%至1100%。

DeepSeek表示,提供50%的非高峰时段折扣使用旨在鼓励”更灵活的工作负载调度”。在每24小时中有17小时保持半价,而新的结构实际上将其本土市场的定价定得最高。

“这不是简单的价格上涨,”Greyhound Research的Sanchit vir Gogia表示,”这是一种使推理时间成为经济变量的定价架构。”

可以等待的工作——如批量评估、合成数据生成和夜间开发运行——将转向廉价时段;而交互式智能体和实时操作则无法这样做。Gogia表示,开发者和企业的不满是真实且公开表达的,DeepSeek过去的低价并不要求它永远保持廉价。

乍一看,这似乎是”一个仍在寻求与更成熟的AI模型供应商可信度对抗的平台采取的自杀之举,”技术分析师Carmi Levy表示。这些上涨肯定会削弱DeepSeek的价格优势,并迫使客户更认真地考虑该公司中国背景带来的担忧。

然而,他表示,与OpenAI、Anthropic、Google、Cohere、xAI等竞争对手的模型相比,DeepSeek在所有定价衡量标准上仍然便宜得多。

因此,Levy表示,虽然这一举动将迫使DeepSeek强调性能和安全性而非成本,但它几乎不会抹去其已经显著的价格性能优势,并且仍然为客户提供足够的灵活性来证明其用于特定工作负载的合理性,数学计算只需更加精确。

“随着DeepSeek不可避免地继续调整价格以适应市场现实,这种优势可能会随着时间的推移而减弱,但目前,商业案例仍然很容易建立,”Levy说。

DeepSeek Flash如何融入企业环境?

由于成本、能力、可靠性、数据治理、安全性和其他因素,企业内部的采用仍然是一个悬而未决的问题。

一个用例是批量处理,Levy说。这类工作通常是常规和重复性的,而不是要求顶级智能,因此使用更便宜、更高效的模型是合理的。”这是一个高性能推理引擎,企业可以考虑将其用于点解决方案工作负载,而不是作为现有产品的全面替代品,”Levy说。

部分采用很可能涉及孤立的、非敏感的工作负载,具有明确的成功指标、严格的监督、权限控制和故障情况下的备用模型,他指出。更广泛的部署将需要DeepSeek及其托管合作伙伴展示强大的可靠性、安全性、隐私性、可审计性和部署选项。随着它根据需求调整价格结构,DeepSeek还必须保持足够大的价格性能优势来证明任何风险的合理性,他说。

随着IT团队熟悉新模型并确定何时以及如何将其提交给高级领导层以获得预算批准,预计将在后台实验室和受控测试环境中进行未经授权的小规模使用。

“DeepSeek已赢得了作为全球颠覆者的良好声誉,”他说,”很明显,它向更广泛的企业采用迈进的步伐将继续获得动力。”

多工具工作流程中的DeepSeek测试

虽然许多用例仍处于实验阶段,但Meta软件工程师Naman Ahuja提供了一个可直接转化为企业环境的用例。在一个与雇主无关的项目中,他使用DeepSeek V4 Flash构建了一个家庭自动化智能体,探索低成本模型作为真实多工具工作流程的推理/编排层的表现。

当他离家时,智能体协调多个跨系统的操作:例如,将恒温器设置为”离家”模式以减少不必要的能源使用,激活Ring安全系统,关闭并锁门。

“我感兴趣的不仅仅是模型能否理解命令,而是它能否在可靠性至关重要的多个工具中将意图转化为一系列操作,”Ahuja说。

最大的教训是,一旦模型能够采取行动,可靠性与智能同等重要。系统需要结构化的工具输出,


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/deepseeks-top-ranked-v4-flash-stumbles-on-real-agent-tasks-as-its-prices-surge

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2576篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类