微软语音识别新模型:价格速度双领先
微软人工智能部门近日发布了MAI-Transcribe-2语音识别模型,该公司宣称该模型在速度、准确度和成本方面均优于OpenAI、Google和ElevenLabs等竞争对手当前销售的产品。令人惊讶的是,这款模型的定价仅为每小时音频处理仅需10美分。
这个价格令人瞩目。就在五个月前,微软发布的首款同类模型每小时收费36美分,而最新发布的早期优惠价格降低了约72%。对于一家每年处理10万小时呼叫中心音频的企业——这相当于一家大型银行或电信公司的中等规模业务——费用将从36,000美元降至10,000美元。在这一价格水平上,语音转录服务已不再是企业预算中需要争议的项目。

此次发布正值微软执行一项两年前看似难以置信的战略:通过一种模态一种模态地构建自己的前沿模型,然后逐步替换那些曾经运行在OpenAI技术上的产品。语音识别是这项计划推进最快的领域,而MAI-Transcribe-2则是其迄今为止最明确的证明。这也为全球最有价值的软件公司如何在人工智能领域竞争提供了预览——在不依赖其花费130亿美元培养的合作伙伴的前提下。
MAI-Transcribe-2的功能特点及其对企业用户的价值
该模型能够处理60种语言的音频转录,较六月份发布的MAI-Transcribe-1.5支持的43种语言,以及四月份最初版本支持的25种语言有了显著提升。该模型运行在微软的Foundry平台(公司面向开发者的模型市场)以及MAI Playground(测试环境)上。微软表示,他们构建此模型是为了应对真实企业环境中产生的复杂音频——包括背景噪音、低质量录音和重叠语音——而非录音棚般的理想条件。
比语言数量更重要的是微软将哪些功能整合到了基础产品中。说话人分离功能能够在多人录音中区分不同发言者,这使文本从无序堆砌变为可用的会议记录。词级时间戳为每个词添加精确的时间标记,支持搜索、编辑以及与视频的同步。关键词偏差功能允许开发者向模型提供药物名称、产品代码或员工姓名列表,从而避免模型混淆专业术语。自动语言识别功能使用户无需预先声明语言类型。
有两项功能因其特殊性而尤为突出。可配置的输出风格提供”逐字记录”模式,保留”嗯”、开头犹豫和口吃等细节,以满足合规和法律团队的需求;同时提供”简洁”模式,去除填充词以生成可读的标题和笔记。代码切换功能能够处理句子中间在不同语言之间转换的对话;微软特别提到了印式英语和西班牙式英语,这反映了在印度和美国西班牙裔市场中,单次客户服务电话可能会在语言间切换十多次的情况。专业供应商过去通常为这些功能中的每一项收取额外费用,而微软如今只需10美分即可提供所有这些功能。
解读微软的FLEURS和Artificial Analysis基准测试声明
微软提出了三项性能声明,每项基于不同的衡量标准,技术买家应当理解每个标准所捕捉的内容及其局限性。
多语言识别能力领先
微软声称MAI-Transcribe-2在60种语言的FLEURS基准测试中排名第一,平均词错误率为5.2%。FLEURS是谷歌研究人员在2022年发布的基准测试,由102种语言的母语者各朗读约2000个句子构成——每种语言约12小时的语音。它是多语言语音识别的标准衡量工具,因为它允许在相同内容上比较模型在不同语言上的表现。其指标词错误率简单计算与人类参考相比的替换、插入和删除错误;5.2%意味着大约每20个单词中有一个错误。但FLEURS测试的是朗读语音而非对话,且微软的平均错误率实际上从六月份报告的MAI-Transcribe-1.5的3.7%有所上升。这几乎肯定反映了覆盖范围的扩大而非性能退步——从43种语言扩展到60种语言意味着包含了所有模型都难以处理的低资源语言——但买家应要求获得各语言的详细数据。
准确性与速度的平衡优势
微软的第二项声明是,该模型在Artificial Analysis的词错误率排行榜上排名第二,并定义了该公司的准确性与延迟帕累托前沿。Artificial Analysis是一家独立的基准测试机构,通过模型的公共API进行测试,衡量客户实际获得的效果。其指数融合了模拟智能体对话、欧洲议会演讲和企业财报电话会议,并高度偏向英语商务演讲。六月份,该机构将MAI-Transcribe-1.5评为第三,词错误率为2.4%,落后于阿里巴巴的Fun-Realtime-ASR-preview和ElevenLabs的Scribe v2,同时称其为前十名中最快的模型。跃升至第二名表明微软已超越ElevenLabs。”帕累托前沿”是从业者应注意的术语:这意味着没有竞争对手能在不降低速度的情况下提高准确率,也没有能在不降低准确率的情况下提高速度的模型。
处理速度优势明显
第三项声明是原始处理速度——根据Artificial Analysis的评估,比OpenAI的GPT-Transcribe快10倍,比ElevenLabs的Scribe v2快7倍,比谷歌的Gemini 3.5 Transcribe快5倍。在批量转录中,速度的重要性不在于减少等待时间,而在于提高吞吐量即降低成本。一个以300倍实时速度运行的模型所需的GPU时间仅为以30倍实时速度运行的模型的零头。这种效率使微软能够以10美分的定价提供服务,并 presumably 仍然盈利。
五个月内三个语音模型:解析微软AI的快速发布节奏
发布速度本身就是这个故事的关键。4月2日,MAI-Transcribe-1发布,支持25种语言,每小时收费36美分。6月2日,MAI-Transcribe-1.5推出,支持43种语言,增加了关键词偏差功能,并在Artificial Analysis排行榜上获得第三名。如今,MAI-Transcribe-2问世,支持60种语言,准确率进一步提升,并在FLEURS测试中占据首位。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!