Arena는 2023년 UC 버클리의 연구 프로젝트로 시작해 AI 모델 순위를 크라우드소싱했는데, 목표 기업가치 31억 달러로 2억 달러 규모의 시리즈 B 라운드를 유치했다고 목요일 밝혔다 .
이는 지난 6월 연간화 기준 매출 1억 달러 에 도달했다고 발표한 데 이어 이루어진 것이다.
이번 라운드는 Lightspeed Venture Partners와 Khosla Ventures가 주도했으며, Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis 등이 참여했습니다. Arena는 이전에 1월에 150 million 달러 규모의 시리즈 A를 기업가치 1.7 billion 달러(포스트머니 기준)로 발표한 바 있습니다. 당시 연간화된 매출은 3,000만 달러였다고 밝혔다. 즉, 약 10개월 만에 기업가치가 거의 두 배가 된 것이다.
Arena는 소비자가 무료로 사용할 수 있는 크라우드소싱 플랫폼을 제공한다. 사람들이 프롬프트를 입력하거나 vibe 코딩 프로젝트를 요청한 뒤 어떤 모델이 더 잘 수행했는지 평가한다. Arena는 월간 방문자가 수천만 명에 달한다고 주장한다.
지난해 9월, Arena는 커뮤니티 피드백을 기반으로 모델 랩과 기업에 상세한 성능 분석을 제공하는 상업용 제품인 AI Evaluations를 선보였다. 그 시점은 완벽했다. 올해 AI 랩들은 자사 모델들이 벤치마킹 테스트를 속이고 실제로 그 점수를 얻지 못했으면서도 좋은 점수를 쌓는 방법을 찾는다는 사실을 깨달았다. 동시에 기업들은 표준화된 벤치마크에만 의존하기보다 자사 내부 필요에 가장 적합한 모델이 무엇인지 판단하는 데 도움을 원했다.
“AI가 우리가 이를 평가하는 능력보다 더 빠르게 발전하고 있으며, 모델들이 테스트받고 있음을 인식하는 순간 정적 벤치마크는 무너진다”고 회사는 투자 발표에서 말했다. “세상은 AI가 실제 사람들의 손에 들어간 후 실제로 얼마나 안전하고 잘 정렬되어 있는지 측정해 줄 중립적인 제3자를 필요로 한다. Arena가 바로 오늘 그 역할을 맡고 있다”고 덧붙였다.
이를 위해 Arena는 리더보드에 새로운 카테고리인 정렬(alignment)을 추가했다. 여기서는 무단 행동(요청하지 않은 행동 수행), 잘못된 귀속(진술이나 사실을 잘못된 출처에 돌림), 그리고 회사가 “기만적 완료(deceptive completion)”라고 부르는 것(수행하지 않은 작업을 완료했다고 거짓말함)과 같은 문제를 기준으로 모델 순위를 매긴다.
현재 OpenAI의 여러 모델이 예비 정렬 리더보드 상위권을 차지하고 있으며, Claude Opus 5.5와 Claude Fable은 각각 6위와 9위이다.
