竞技场该排行榜起源于2023年,是UC Berkeley的一项研究项目,通过众包方式对AI模型进行排名,它已在B轮融资中筹集2亿美元,估值为31亿美元,它 表示 于星期四。
此消息发布之前,该公司曾表示 达到100百万美元 6月的年化运行率收入。
本轮融资由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis等参投。Arena此前于1月宣布了1.5亿美元的A轮融资,投后估值为17亿美元。该公司表示,当时其年化收入为 3000万美元。这意味着其估值在大约10个月里几乎翻了一番。
Arena提供一个对消费者免费的众包平台。人们输入提示词或请求vibe-coded项目,然后评价哪个模型做得更好。Arena声称其每月拥有数千万访客。
去年9月,它推出了商业化产品 AI Evaluations,这是一项基于其社区反馈为模型实验室和企业提供详细性能分析的服务。时机证明是无懈可击的。今年,AI实验室意识到 它们的模型在钻基准测试的空子 ,想办法刷出高分而并非真正名副其实。与此同时,企业希望获得帮助,以确定哪个模型最适合其自身内部需求,而不是仅依赖标准化基准。
“AI的进步速度超过了我们评估它的能力,而一旦模型意识到自己正在被测试,静态基准就会失效,”该公司在其融资公告中表示。“世界需要一个中立的第三方来衡量AI在真正落入普通人手中之后实际上的安全性和对齐程度。Arena今天正是在承担这一角色,”它补充道。
为此,Arena还在其排行榜上新增了一个类别: 对齐性。在这一类别中,它根据未授权行动(采取未被要求执行的行动)、错误归因(将陈述或事实错误地归功于错误的来源)以及它所说的“欺骗性完成”(谎称完成了实际上没有完成的任务)等问题对模型进行排名。
目前,OpenAI的一系列模型位居其 初步对齐排行榜 榜首,Claude Opus 5.5和Claude Fable分别位列第六和第九。
