微软自研AI模型降本89% 挑战OpenAI

微软推出自研AI模型 成本较OpenAI降低89%
微软人工智能部门于周三正式发布两款自主研发的模型并开放公测,分别是迄今最高保真度的图像生成器MAI-Image-2.5-Pro,以及专为高负载企业工作流设计的语音模型MAI-Voice-2-Flash。此次发布伴随着详实的生产数据,构成了微软迄今为止最强有力的论据,证明其产品能够依靠自身模型驱动,而不必依赖OpenAI的前沿模型。
此次公告由微软AI超级智能团队发布,距离公司承诺构建专用内部模型大约已过去一年。此次发布的一个显著特点是,微软明确指出了这些模型当前运行的多个平台:必应(Bing)、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot以及Azure。这一信息传递给企业客户,也间接传递给OpenAI:微软自主研发的模型不再是研究项目,而是服务于数百万用户的实际生产基础设施。
“这些每项改进都朝着同一个目标迈进:由微软模型驱动的微软产品,”微软在官方博客中写道。
MAI-Image-2.5-Pro与MAI-Voice-2-Flash在AI成本曲线的两端布局
两款新发布的产品占据了微软所谓的”质量-速度-成本”曲线的两端,这种定位是经过深思熟虑的。MAI-Image-2.5-Pro瞄准高端市场:主视觉图像、精细编辑以及图像内精确文本渲染——后者一直是图像生成模型众所周知的薄弱环节。微软将该模型的定价定为每百万文本输入token 5美元,每百万图像输入token 8美元,每百万图像输出token 106美元。基础版MAI-Image-2.5模型最近在Arena社区排行榜上位列图像编辑第二名,该排行榜已成为生成式媒体的官方计分板。
创意行业似乎已经注意到了这一进展。广告巨头WPP的全球首席创意官罗布·雷利在微软公告中引用他的评价称:”Pro模型是生成媒体工具的一大飞跃”,并补充道:”微软已在生成式AI领域确立了自身作为领导者的地位。”
相比之下,MAI-Voice-2-Flash则走向了另一个方向。该模型首次在微软Build大会上亮相,运行速度比MAI-Voice-2快两倍,成本降低32%,定价为每百万字符15美元。它专为量大但缺乏 glamour 的语音市场设计——呼叫中心、语音智能体以及对实时语音应用,在这些场景中,延迟和每次通话的成本比表达力的边际提升更为重要。两款模型共同反映了一种构建模型家族而非单一旗舰模型的战略,正如公司所言,追求最大保真度的创意工作室与每天处理数百万通话的客服运营有着截然不同的需求。
微软生产数据显示内部模型可降低GPU成本高达89%
严格来说,模型发布本身可能不如微软随其发布的部署指标那样具有新闻价值——这些数据读起来像是一个系统性案例,旨在证明在其产品组合中替换第三方前沿模型的合理性。
现在,Bing图像生成器完全由MAI-Image-2.5端到端驱动,标志着这款消费者图像工具首次完全实现自主研发。在PowerPoint中,微软称MAI-Image-2.5与OpenAI的图像模型GPT-Image-2相比,GPU成本降低了最多84%。在OneDrive中,MAI-Image-2.5现在已成为关键图像编辑场景的默认选择,公司报告称保存率提高了26%,P95延迟降低了约25%,在中等利用率的生产工作负载下效率提高了2.5倍。
在语音方面,MAI-Voice-2-Flash现在为Dynamics 365联系中心提供支持——该平台被包括T-Mobile和EasyJet在内的客户使用——微软声称GPU成本降低了最多89%。该模型还已集成到Azure Voice Live中,供开发构建语音到语音智能体的开发者使用。
也许最具影响力的部署在医疗领域。微软的Dragon Copilot被17万医疗提供商使用,上季度处理了2800万次患者问诊,现在已运行在MAI-Transcribe-1.5上,支持58种语言的多语言工作流。微软内部评估显示,在大多数语言中,转录和语言识别错误率相对降低了50%——在转录错误可能直接影响临床记录的领域中,这一说法具有重要意义。
“爬山”战略:小模型如何在Excel中超越GPT-5.6
在同一天发布的另一篇文章中,微软详细介绍了这些成果背后的方法——公司称之为”爬山机器”,这是一个由数据、模型及围绕它们的产品” harness”组成的集成飞轮。
最清晰的例子是MAI-Code-1-Flash,这是六月在GitHub Copilot中发布的轻量级编码模型。微软称,该模型在VS Code中的代码接受率比GPT-5.4 Mini和Claude Haiku 4.5高出约10%,同时使用的中间token少10%。开发者留存率也呈现出类似趋势:用户多天内回访的可能性比使用GPT-5.4 Mini高出6%,比使用Claude Haiku 4.5高出11%。
随后,微软做了更有趣的事情。他们取了MAI-Code-1-Flash的检查点,并在Excel强化学习环境中进一步训练它,使一个编码模型掌握电子表格知识工作的工具和工作流。根据生产用户反馈,结果表明该模型在最常见的Excel任务上与GPT-5.6相当——同时其规模足够小,可以在英伟达较旧的H100甚至A100 GPU上运行,而不需要最新一代的加速器。
这一硬件细节值得强调。每家主要AI公司都在争夺尖端芯片的分配,而能在两代旧硅片上提供接近前沿质量的模型从根本上改变了部署经济学。这也使最新的硬件——包括微软现已投入使用的GB200集群——可以用于训练而非推理。
关注微信公众号:智享开源,及时了解更新信息。

公众号:智享开源
还没有任何评论,你来说两句吧!