阿里Qwen3.8-Max:超越GPT-5.6的智能体新星

阿里巴巴旗下著名的人工智能研究团队Qwen昨日正式发布全新旗舰模型Qwen3.8-Max。这款拥有2.4万亿参数的混合专家(MoE)多模态大语言模型,瞄准了前沿人工智能市场中最具竞争力的领域之一:自主软件工程与长期企业工作流。
若阿里巴巴公布的基准测试结果能在更广泛的独立测试中得到验证,那么Qwen3.8-Max不仅能够与当前领先的专有模型相抗衡,更能在智能体计算的部分关键基准测试中超越它们。
最引人注目的是,Qwen报告称Qwen3.8-Max在OSWorld-Verified基准测试中取得了86.1分,领先于GPT-5.6 Sol Max(83.2分)和Fable 5(85.0分)。同时,该模型在PaperBench上获得了最高报告分数,并在软件工程、研究复现、多模态推理和视觉Web开发等基准测试中处于领先或极具竞争力的地位。
此次发布也标志着阿里巴巴可能的重要战略转变:公司表示将于下周发布Qwen3.8-Max及其Qwen3.8-27B版本的开源权重。
若在宽松的许可协议下实现,这将首次使Max级别的Qwen模型可用于自托管部署—此举可能显著改变企业采用模式。然而,一个重要提醒是:阿里巴巴尚未披露具体许可条款,这增加了使用更严格自定义许可的可能性,类似于近期中国竞争对手Moonshot开放的Kimi K3前沿模型,而非采用Apache 2.0等广泛宽松的许可。
前沿定义的重新诠释
过去一年,基础模型的竞争格局日益专业化。
OpenAI的GPT系列主要侧重于通用推理、多模态交互和企业生产力。
Anthropic的Claude系列强调编码和可靠的长上下文推理能力。谷歌持续推进Gemini向多模态生产力和原生Web工作流发展。
近期,Moonshot AI的Kimi K3凭借前沿级性能与开源权重发布进入竞争格局。
Qwen3.8-Max试图将这些优势融合,打造一个专注于企业自动化的单一模型。
阿里巴巴并未强调对话智能,而是将此模型定位为能够执行跨越数天而非数分钟项目的自主同事。
据公司介绍,Qwen3.8-Max可自主完成持续超过10天的软件项目,复现涉及数千行代码的研究论文,执行迭代芯片设计优化,并利用多模态反馈循环持续修订计划。
这些演示仍由公司提供,尚未被独立评估者广泛复制。尽管如此,它们展示了一个日益明显的行业趋势:前沿模型正越来越多地以完成整个工作流的能力而非单个提示的响应能力作为竞争点。
基准测试日益注重自主执行能力
伴随Qwen3.8-Max发布的基准测试套件反映了这一转变。
许多重点评估不再仅关注传统推理考试或编码难题,而是测量长期执行能力。
在评估桌面环境中智能体计算机使用能力的OSWorld-Verified测试中,Qwen3.8-Max获得86.1分,领先于GPT-5.6 Sol Max的83.2分、Fable 5的85.0分以及Gemini 3.1 Pro的76.2分。
该模型还在以下测试中领先:
- PaperBench:93.0分
- TerminalBench 2.1:86.6分
- Vision2Web:69.0分
- LVBench:81.8分
- ERQA:77.8分
在其他领域,它与专有领导者保持竞争力,但在某些类别上仍有差距。例如,在专业软件工程基准SWE-Pro上,OpenAI的模型报告了最高分,而Opus 4.8继续在特定软件工程评估和智能体期末考试中领先。
与其在每个基准测试上都占据主导地位,Qwen似乎提供了当前最广泛且平衡的性能配置文件。
对于企业买家而言,这种平衡可能比孤立基准测试胜利更为重要。许多组织现在越来越多地评估模型完成异构工作流的可靠性——编写代码、阅读文档、导航界面、生成报告、检查图像和协调多个子任务,而非针对单一狭窄能力进行优化。
Qwen3.8-Max的优势领域
假设阿里巴巴公布的成果能转化为生产部署,几个企业工作负载特别适合Qwen3.8-Max。
1. 长期运行的软件工程
阿里巴巴的主要演示涉及持续超过十天的自主软件开发。尽管企业应将这些演示视为供应商声明,直到得到独立验证,但它们与对持续运行而非交互式操作的持久编码智能体日益增长的兴趣相一致。
正在尝试自主工程团队、CI/CD自动化、仓库维护、回归测试或功能实施的组织,如果其智能体性能在实验室环境外保持一致,可能会发现Qwen特别具有吸引力。
2. 计算机使用智能体
最显著的差异化因素可能是计算机使用能力。
OSWorld迅速成为行业最受关注的基准测试之一,因为它衡量模型与操作系统交互的能力,而不仅仅是生成文本。
能够可靠导航桌面软件的智能体可以自动化无数重复的业务流程,包括文档处理、企业软件集成、内部操作和可能不存在API的传统工作流。
如果基准测试性能能推广到生产环境,领先OSWorld可能转化为实际运营优势。
3. 研究自动化
Qwen在PaperBench的领先地位表明,在执行科学计算、文献综述、实验复现和技术分析的组织中具有强大潜力。
研究机构、制药公司和工业研发团队越来越多地使用大语言模型进行摘要和执行可复现的计算工作流。在这些环境中,能够在扩展会话中保持上下文的模型变得越来越有价值。
4. 多模态工业工作流
与主要分析上传图像的早期多模态系统不同,Qwen将视觉描述为持续整合到规划和执行中的反馈机制。
这种架构在制造业、物流、工程检查和设计审查领域可能特别有用,在这些领域中,视觉输入持续为运营决策提供信息,而非作为孤立提示。
经济因素同样关键
或许最大的竞争压力并非来自基准测试分数,而是通过Qwen云(QwenCloud)上的应用程序编程接口(API)定价。Qwen3.8-Max的输入/输出价格为每百万字符2/6美元。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!