阿里Qwen3.8-27B:本地运行的前沿AI模型

近日,在开发者和AI重度用户群体中引发最大关注的AI模型发布,并非来自OpenAI、Anthropic或Google的前沿云端模型。

而是阿里巴巴发布的270亿参数模型:Qwen3.8-27B于上周五登陆Hugging Face平台,采用企业友好、开源的Apache 2.0许可证,为开发者提供可下载的密集型多模态模型权重。

但Qwen3.8-27B并非普通的小型本地模型:它具备原生图像和视频理解能力,262,000的上下文窗口长度,可配置的推理功能,以及对编码和智能体工作流程的支持——这是其Qwen3.8系列中”紧凑、部署友好”的能力版本。

能力与规模的完美平衡

开发者们之所以反应热烈,正是因为其能力与规模的动态组合。

阿里巴巴发布的基准测试数据立即提供了第一个惊喜。该公司报告称,在SWE-bench Pro上得分为61.7,在LiveCodeBench v6上得分为90.3,在CoWorkBench办公工作基准测试上得分为70.7,在OSWorld-Verified上得分为84.3。

在阿里巴巴发布的比较表中,这个270亿参数的模型甚至在SWE-bench Pro和LiveCodeBench上超过了列出的Claude Opus 4.6 Max的结果,尽管在Terminal-Bench、GPQA Diamond和Humanity’s Last Exam上,Opus仍保持领先。

需要注意的是,阿里巴巴的部分评估是内部进行的,且不同比较之间的基准测试工具并不完全相同,因此这些数据不宜作为宣称”全面获胜”的依据。

第三方测试结果显示:本地模型性能媲美数月前的专有模型

当第三方测试结果于周一公布时,讨论方向发生了转变。

第三方AI基准测试机构Artificial Analysis给Qwen3.8-27B的智能指数评分为52分,这一分数综合了九项评估,涵盖编码、科学、推理和专业任务。巧合的是,这与Artificial Analysis目前分配给OpenAI的低端模型GPT-5.6 Luna在最高推理设置下的分数相同——而这是一个仅可通过云服务获取的专有产品。

正如开源编码智能体Cline在X平台所言:”这是本地模型首次获得前沿模型级别的能力。我们完全没料到本地进展的速度会如此之快。”

与此同时,在Artificial Analysis的智能体指数测试中(衡量模型在智能体任务上的表现),Qwen3.8-27B得分为51分,超过了Claude Opus 4.8在最高推理努力下的表现——而Claude Opus是Anthropic不到三个月前发布的前沿模型。

这并不意味着这些模型完全等同,但它解释了为何开发者和AI重度用户会如此关注。正如开发者兼AI播客主/YouTuber Sero(X平台账号@0xSero,真名Sharif Cherf)在X上写道:”一个只需3000美元硬件就能运行、超越四个月前所有模型的AI,包括Opus。永久性的下层阶级已经被取消。”

以将机器学习模型带入网络浏览器而闻名的开发者Joshua “Xenova” Lochner周一在X上分享了他的实验结果,包括运行带有自定义WebGPU内核的Qwen3.8-27B。他的反应——”这是多么活着的时代啊!”——捕捉了当下的氛围:一个得分接近专有前沿系统的模型可以被下载、修改并在本地运行,而非只能通过供应商API访问。

当模型被压缩后,其优势变得更加明显。开发者兼AI作家Simon Willision在M5 Max MacBook Pro和Nvidia DGX Spark上测试了一个约17GB的Q4_K_M量化版本

他发现该模型可以编写代码、解释图像并通过Pi智能体框架运行编码智能体循环。在一项实验中,模型导航了一个代码库来解释认证系统的工作原理;在另一项实验中,它编写并测试了一个Willison需要的Python工具,用于将智能体转录从JSONL转换为Markdown。

“一个17GB的文件能在我的家用机器上完成所有这些事情,简直是奇迹,”Willision写道。他的观点正是引起重度用户共鸣的核心:最近感觉只能通过昂贵托管模型才能获得的能力,正逐渐转移到小到可以保存在工作站上的文件中。

这种热情也反映在使用数据上。网络安全新闻网站Cybernews周一报道,Qwen3.8-27B在发布前三天内Hugging Face下载量已突破300万次,而量化版本也迅速出现在本地推理工具中。

Reddit上的LocalLLaMA社区专门创建了一个发布主题帖,以汇集海量的基准测试、量化版本、配置建议和比较信息。一位展示本地生成游戏的用户将该模型描述为”完全不同的存在”。

过度思考是一个问题

然而,这种热潮伴随着一个重要警示:Qwen3.8-27B似乎通过大量思考来换取部分质量提升。

Artificial Analysis表示,在其智能指数测试中,该模型生成了1.6亿个输出标记,而可比的开源权重模型中位数为4300万。

Willision遇到了相同行为的极端版本,因为Qwen默认使用其xhigh推理设置。一个生成”鹈鹕骑自行车”SVG图像的请求耗时21分钟,消耗了超过22,000个推理标记才产生答案。他建议对于普通的本地使用,应从低推理或无推理开始。

投资者兼开发者Tomasz Tunguz在与DeepSeek V4 Flash的小型九项任务测试中发现了类似的权衡:启用推理后,Qwen在其智能体堆栈中的质量略胜一筹,但他报告说速度大约慢了30倍,成本高了4.5倍。他明确指出,九项任务不足以做出最终判断。

推理软件可能会缩小这一差距。Qwen3.8-27B包含多标记预测功能,Willision报告称,在通过llama.cpp启用MTP后,其在DGX Spark上的性能提升了约72%,与默认的LM Studio配置相比。

即便如此,他正常的LM Studio运行每秒只能生成约15到30个标记——远低于许多托管模型的响应速度。

这种张力恰恰是Qwen3.8-27B比另一个排行榜排名更重要的原因。

企业应从Qwen3.8-27B中获取什么启示

对于企业而言,相关的比较并非简单地看一个270亿参数的模型是否能在基准测试中”击败”Claude或GPT。而是看一个足够小、能在组织自身基础设施内运行的模型,现在是否能够…


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/technology/qwen3-8-27b-runs-frontier-class-coding-agents-and-reasoning-locally-no-cloud-api-required

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2605篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类