Meta发布30B参数开源智能体模型Muse Glimmer

Meta发布30B参数开源智能体模型Muse Glimmer

Meta回归开源社区,推出全新智能体模型

近日,Meta正式发布了Muse Glimmer,这是一款拥有300亿参数的开源权重AI模型,专为在普通消费级设备上直接运行自主智能体而设计。该模型将原本依赖云端基础设施的智能体工作负载,转移到了高端Mac和PC设备上运行。

开创性Apache 2.0许可证

与模型功能同样引人注目的是其采用的许可证。Glimmer采用宽松的行业标准Apache 2.0开源许可证发布——这是Meta自今年四月推出专有Muse Spark模型取代开源Llama系列以来,首次完全开源的模型发布。

事实上,相比Llama系列,Muse Glimmer采用了更为宽松的许可协议。Llama特有的社区许可证曾因其7亿月活跃用户上限等限制而受到多年批评;而Apache 2.0没有此类限制,允许无限制的商业使用、修改和再分发。

多平台支持与合作伙伴

目前,该模型权重已可在Hugging Face平台获取。Meta表示,本周内将通过Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI和OpenRouter等平台提供支持,同时针对llama.cpp、MLX和ExecuTorch的优化集成也将陆续推出。Meta的博客文章还提到了Unsloth作为本地运行时合作伙伴,并推荐使用PyTorch的TorchTitan进行微调。

Meta正与AMD、Arm、Dell、Intel和Nvidia合作,优化跨设备性能,并已发布了涵盖自定义智能体框架的开发者文档。

CEO的开源承诺

“今天我们同样开放了Muse Glimmer的权重,这是一个优秀的300亿参数密集型模型,可以在本地运行,”Meta联合创始人兼CEO马克·扎克伯格在X平台(使用其长期使用的@finkd账号)发帖表示。”我们很快还将发布Muse Spark 1.2的权重,这是我们最新的基础模型。Meta是开源的坚定支持者,我为这些发布感到自豪。”

智能体工作流的本地化优势

对于开发者和企业而言,本地推理的实际意义不仅在于计算发生的地点。智能体在处理文件、截图、开发环境和其他敏感上下文时,可以在不持续将这些信息发送到远程推理服务的情况下执行工作流程。本地部署还消除了推理循环中的网络可用性和每标记API费用——尽管组织仍需承担硬件、电力、部署和管理成本。

围绕智能体循环构建的30B模型

Meta并非将Glimmer主要定位为通用聊天机器人,而是围绕自主智能体执行的操作序列进行训练:制定计划、调用工具、解释结果、持续工作以及在出现问题时恢复。

“就像更大的模型一样,muse glimmer可以通过规划、工具调用、检查自身结果和故障恢复来作为完全合格的智能体运行,”Meta首席AI官亚历山大·王在宣布发布的X平台线程中写道,并补充说该模型”可以在24GB显存下运行而不损失智能体可靠性。”

根据Hugging Face上的模型卡片,Glimmer是一个密集型因果transformer,在52层中拥有约296亿个总参数,包括一个专用的约18亿参数ViT-G/14感知编码器。它接受交错的文本和图像输入,生成文本,支持100多种语言,并有131,072个或更多标记的上下文长度,知识截止日期为2026年1月4日。

压缩智能体至24GB

硬件支持是此次发布的核心。在完整精度下,Meta表示30B模型需要超过55GB内存——超出任何单块消费级GPU。因此,公司开发了约4位量化版本,将语言模型权重压缩到20GB以下,为智能体在内存中需要的其他部分留出空间:KV缓存、感知编码器和推测解码模型,所有这些都能适配24GB或32GB的显存环境。

实际而言,这意味着量化版本可以在高端消费级设备上运行——尽管是其中高端配置。针对24GB的K-Quant-17GB配置可适配单块高端消费级显卡,如Nvidia的RTX 3090或RTX 4090(均配备24GB显存);而针对32GB的K-Quant-Dynamic版本则与新款RTX 5090的32GB显存相匹配。在Mac端,Apple Silicon的统一内存扮演了VRAM的角色,因此配备32GB或更大内存的MacBook Pro或Mac Studio可以容纳完整堆栈——Meta使用M4 Max和M5 Max MacBook Pro进行了自己的速度测试。然而,典型的8GB或16GB笔记本电脑仍无法支持,而完整精度的BF16版本(Meta定位为64GB)仍属于数据中心GPU和顶级Mac Studio配置的范畴。

Meta报告称,其针对32GB硬件的K-Quant-Dynamic版本在15项基准测试中的平均准确度下降仅为0.2%,而针对24GB硬件的K-Quant-17GB配置则为1%。这些数据是Meta自己的测量结果,并非独立评估。

Meta还使用DFlash推测解码来解决本地智能体的另一个大问题:延迟。与顺序生成每个标记不同,较小的DFlash”草稿”模型提出16个标记的区块,由主模型并行验证,从而更快地生成相同输出。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/technology/meta-returns-to-open-source-with-muse-glimmer-an-apache-2-0-licensed-30b-parameter-ai-model-optimized-for-agents-available-now

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2463篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类