AI众包评测平台Arena十个月内估值翻倍至31亿美元

从学术项目到估值31亿的商业帝国
Arena,这一源于2023年加州大学伯克利分校研究项目的AI模型众包排名平台,近日宣布完成2亿美元B轮融资,投后估值已达31亿美元。
此前行情显示,该公司在2026年6月已实现1亿美元年化收入。回顾其融资历程,今年1月Arena曾以17亿美元估值完成1.5亿美元A轮融资,当时年化收入仅为3000万美元。短短不到10个月,估值便几乎实现翻倍。
豪华投资阵容加持
本轮融资由Lightspeed Venture Partners与Khosla Ventures联合领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis等知名机构跟投。
众包模式驱动AI评测变革
Arena为普通用户提供免费的AI模型评分服务。用户只需输入提示词或指定任务场景,即可对比不同模型的输出表现,并投票选出更优答案。目前该平台每月拥有数千万活跃访客。
商业化产品恰逢其时
2025年9月,Arena推出了面向企业的商业化产品”AI Evaluations”,基于社区反馈为模型研发机构和大型企业提供详细的性能数据分析。这一产品推出的时机极为精准。
今年以来,多家AI实验室发现自身模型在标准基准测试中存在”刷分”现象——通过特定技巧获取高分,却未能真正提升能力。与此同时,企业用户也渴望找到契合自身业务需求的模型,而非单纯依赖标准化榜单。
公司在融资公告中表示:”AI的发展速度已超过我们的评估能力,一旦模型意识到自己正在接受测试,静态基准就会失效。世界需要一个中立的第三方,来衡量AI在真实用户手中的安全程度与对齐水平。Arena正是为此而来。”
新增对齐维度,重新定义模型评估
为此,Arena在排行榜中新增了”对齐(Alignment)”类别,专门针对以下问题对模型进行排名:
- 未经授权的操作——模型擅自执行未被要求的行为
- 虚假归因——将言论或事实错误地归于不当来源
- 欺骗性完成——声称完成了并未实际执行的任务
初步排名结果
在最新发布的初步对齐排行榜上,OpenAI旗下多款模型位居前列。Claude Opus 5.5和Claude Fable分别位列第六和第九名。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!