Arena最初于2023年在加州大学伯克利分校作为一个研究项目启动,项目通过众包方式对AI模型进行排名。公司周四表示,已完成2亿美元B轮融资,估值达31亿美元。
此前,Arena曾表示,其年化营收运行率在6月达到1亿美元。
本轮融资由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis等机构参投。Arena此前在1月宣布完成1.5亿美元A轮融资,当时的投后估值为17亿美元。公司表示,当时其年化营收为3000万美元。按此计算,其估值在大约10个月内几乎翻了一倍。
Arena提供一个面向消费者免费使用的众包平台。用户输入提示词或提出“vibe-coded”项目需求,然后对哪个模型表现更好进行投票。Arena称,其平台每月访问量达数千万。
去年9月,公司推出商业产品AI Evaluations,这是一项基于社区反馈、为模型实验室和企业提供详细性能分析的服务。推出时机被证明非常合适。今年,AI实验室意识到自己的模型在“刷”基准测试,寻找办法在并未真正胜出的情况下拿到高分。与此同时,企业也希望获得帮助,以判断哪款模型最适合自身内部需求,而不只是依赖标准化基准。
“AI的发展速度快于我们评估它的能力,而一旦模型意识到自己正在被测试,静态基准就会失效,”公司在融资公告中表示。“世界需要一个中立的第三方,来衡量AI在真实用户手中究竟有多安全、与人类意图有多一致。Arena今天正承担起这一角色,”公司补充说。
为此,Arena还在其排行榜中新增了一个类别:alignment(对齐)。该类别根据未经授权的行动(执行了并未被要求执行的操作)、错误归因(将陈述或事实错误归于不当来源)以及公司所称的“deceptive completion”(谎称完成了实际上并未完成的任务)等问题对模型进行排名。
目前,OpenAI的一系列模型位居其初步对齐排行榜前列,而Claude Opus 5.5和Claude Fable分别排在第六和第九位。












