四分之一体积,同等性能:Inkling-Small开源模型

在推出首款开源AI语言模型Inkling仅两周后,由前OpenAI首席技术官Mira Murati领导的资金充足创业公司Thinking Machines今日发布了Inkling-Small模型。令人惊喜的是,这款新模型在性能上并未明显牺牲,甚至在多项基准测试中超越了其前身。
Inkling-Small是一款拥有2760亿参数的多模态推理模型,采用宽松的Apache 2.0许可证。尽管原始Inkling拥有9750亿参数,但这款小型模型在第三方”人工智能分析智能指数”上的得分仅差一分。该模型可接受文本、图像和音频输入,生成文本内容,并支持长达一百万个token的上下文窗口。
性能接近,体积缩小四分之三
根据人工智能分析平台的评估,Inkling-Small在智能指数上获得40分,而原始Inkling得分为41分。这一结果引人注目,因为Inkling-Small总参数量为2760亿,活跃参数量为120亿;而Inkling总参数量达9750亿,活跃参数量为410亿。
该平台还报告称,在Inkling-Small同等规模或更小的开源权重模型中,没有模型在该指数上获得更高分数。
这款小型模型不仅在总体得分上接近旗舰版,在多项评估中甚至超越了原始Inkling。Thinking Machines报告称,Inkling-Small在SWE-bench Verified测试中得分为80.2%,高于Inkling的77.6%;在Terminal Bench 2.1测试中得分为64.7%,高于大模型的63.8%。它还在SciCode、人类最后考试、GPQA钻石和CritPt等测试中略微领先。
不过,这种优势并非全面。Inkling在事实知识和一些智能体任务上仍具有明显优势。Inkling-Small在τ³-Banking测试中得分为15.5%,而Inkling为23.7%;其”全知全能”评分为负数,反映了较弱的事实覆盖能力,尽管其报告的幻觉率略低。
2760亿参数为何只激活120亿
Inkling-Small是一种稀疏专家混合模型。根据Thinking Machines发布的模型卡,其42层解码器将每个token路由至256个专业专家中的6个,同时保留两个对所有token都保持活跃的共享专家。
这种架构解释了模型2760亿总参数与120亿活跃参数之间的区别。系统保留了大量已学习容量,但在每个推理步骤中只激活其中一小部分。
该模型还具有原生多模态特性。图像、音频和文本被投影到共享表示空间中,由解码器联合处理,而非通过完全独立的外部系统处理。Thinking Machines将编码助手、智能体应用、聊天机器人、检索增强生成系统和其他多模态应用列为预期用途。
模型适用场景
- 编码助手
- 工具使用系统
- 检索增强生成
- 文档分析
- 多模态工作流
公司还支持可变推理努力,允许开发者根据任务难度增加或减少模型的测试时计算量。这为工程团队提供了在不同工作负载中平衡质量、延迟和成本的直接途径。
小型并不意味着适合笔记本
尽管名称中有”Small”,但Inkling-Small并非面向消费者的模型。
Thinking Machines表示,标准BF16检查点至少需要600GB的GPU内存总和。公司列出了两种支持配置:4个NVIDIA B300 GPU或8个NVIDIA H200 GPU。
量化后的NVFP4检查点将要求降低至约180GB的VRAM总和。Thinking Machines表示,该版本可以在单个NVIDIA B300上以W4A4模式运行,或在两个H200 GPU上以W4A16模式运行。
这排除了普通笔记本电脑、MacBook、游戏PC和大多数开发工作站。即使配置较高的本地系统通常也远低于所需的内存要求。
实际的部署目标是企业GPU服务器、云集群和专门的推理服务提供商。因此,”小型”标签是相对于Inkling而言,而非相对于更广泛的本地模型生态系统。
尽管如此,这种缩减仍然意义重大。一款性能接近Inkling但所需内存显著减少的模型可以降低托管成本,简化容量规划,并扩大能够自行托管该模型的组织范围。
Apache 2.0许可证助力企业应用
许可证可能与基准测试同样重要。
Inkling-Small采用Apache 2.0许可证发布,这是软件行业最熟悉的宽松许可证之一。它通常允许组织使用、修改、微调、重新分发和商业化该模型,包括在专有产品中,只要遵守许可证的通知和署名要求即可。
这为企业提供了比许多定制”开放”AI许可证更大的法律灵活性,后者可能包含收入门槛、品牌义务、使用限制或大规模商业部署的单独条件。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!