AI众包评测平台Arena十个月内估值翻倍至31亿美元

AI众包评测平台Arena十个月内估值翻倍至31亿美元

从学术项目到估值31亿的商业帝国

Arena,这一源于2023年加州大学伯克利分校研究项目的AI模型众包排名平台,近日宣布完成2亿美元B轮融资,投后估值已达31亿美元。

此前行情显示,该公司在2026年6月已实现1亿美元年化收入。回顾其融资历程,今年1月Arena曾以17亿美元估值完成1.5亿美元A轮融资,当时年化收入仅为3000万美元。短短不到10个月,估值便几乎实现翻倍。

豪华投资阵容加持

本轮融资由Lightspeed Venture Partners与Khosla Ventures联合领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis等知名机构跟投。

众包模式驱动AI评测变革

Arena为普通用户提供免费的AI模型评分服务。用户只需输入提示词或指定任务场景,即可对比不同模型的输出表现,并投票选出更优答案。目前该平台每月拥有数千万活跃访客。

商业化产品恰逢其时

2025年9月,Arena推出了面向企业的商业化产品”AI Evaluations”,基于社区反馈为模型研发机构和大型企业提供详细的性能数据分析。这一产品推出的时机极为精准。

今年以来,多家AI实验室发现自身模型在标准基准测试中存在”刷分”现象——通过特定技巧获取高分,却未能真正提升能力。与此同时,企业用户也渴望找到契合自身业务需求的模型,而非单纯依赖标准化榜单。

公司在融资公告中表示:”AI的发展速度已超过我们的评估能力,一旦模型意识到自己正在接受测试,静态基准就会失效。世界需要一个中立的第三方,来衡量AI在真实用户手中的安全程度与对齐水平。Arena正是为此而来。”

新增对齐维度,重新定义模型评估

为此,Arena在排行榜中新增了”对齐(Alignment)”类别,专门针对以下问题对模型进行排名:

  • 未经授权的操作——模型擅自执行未被要求的行为
  • 虚假归因——将言论或事实错误地归于不当来源
  • 欺骗性完成——声称完成了并未实际执行的任务

初步排名结果

在最新发布的初步对齐排行榜上,OpenAI旗下多款模型位居前列。Claude Opus 5.5和Claude Fable分别位列第六和第九名。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://techcrunch.com/2026/10/08/popular-ai-leaderboard-arena-nearly-doubles-valuation-to-3-1b-valuation-in-10-months/

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章3359篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类