TechCrunch AI

Beliebte KI-Bestenliste Arena verdoppelt Bewertung auf 3,1 Mrd. $ in 10 Monaten fast

Das Unternehmen hinter der beliebten LMArena-Bestenliste hat 200 Millionen $ unter Führung von Lightspeed und Khosla eingesammelt und misst nun KI-Modelle anhand von Alignment-Problemen wie Lügen.

Bildquelle · TechCrunch AI

Arena, das 2023 als Forschungsprojekt an der UC Berkeley entstand, das Ranglisten von KI-Modellen per Crowdsourcing erstellte, hat eine Series-B-Runde über 200 Millionen $ bei einer Bewertung von 3,1 Milliarden $ abgeschlossen, wie es am Donnerstag mitteilte .

Dies kommt, nachdem das Unternehmen im Juni 100 Millionen $ annualisierten Umsatz erreicht hatte.

Die Runde wurde von Lightspeed Venture Partners und Khosla Ventures angeführt, wobei sich Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis und weitere beteiligten. Zuvor hatte Arena im Januar eine Series A über 150 Millionen $ bei einer Post-Money-Bewertung von 1,7 Milliarden $ angekündigt. Damals lag der annualisierte Umsatz bei 30 Millionen $, wie das Unternehmen sagte. Das bedeutet, dass sich die Bewertung in etwa 10 Monaten fast verdoppelt hat.

Arena bietet eine Crowdsourcing-Plattform, die Verbraucher kostenlos nutzen können. Menschen geben Prompts ein oder fordern vibe-codierte Projekte an und bewerten dann, welches Modell dies besser erledigt. Arena gibt an, Zehn Millionen monatliche Besucher zu haben.

Im September des letzten Jahres führte es sein kommerzielles Produkt ein, AI Evaluations, einen Dienst, der Modelllaboren und Unternehmen detaillierte Leistungsanalysen auf Basis seines Community-Feedbacks liefert. Das Timing erwies sich als perfekt. In diesem Jahr stellten KI-Labore fest, dass ihre Modelle Benchmarking-Tests manipulierten und Wege fanden, gute Punktzahlen zu erreichen, ohne sie sich wirklich zu verdienen. Gleichzeitig wollten Unternehmen Hilfe dabei, welches Modell am besten zu ihren eigenen internen Anforderungen passt, anstatt sich nur auf standardisierte Benchmarks zu verlassen.

„Die KI entwickelt sich schneller fort, als wir sie bewerten können, und statische Benchmarks versagen, sobald Modelle erkennen, dass sie getestet werden“, sagte das Unternehmen in seiner Finanzierungsankündigung. „Die Welt braucht eine neutrale dritte Partei, die misst, wie sicher und ausgerichtet KI tatsächlich ist, sobald sie in den Händen echter Menschen ist. Arena tritt heute in diese Rolle“, fügte es hinzu.

Zu diesem Zweck hat Arena seiner Bestenliste auch eine neue Kategorie hinzugefügt: Alignment. Hier rangiert es Modelle anhand von Problemen wie unbefugten Handlungen (Handlungen ausführen, zu denen es nicht aufgefordert wurde); falscher Zuschreibung (Aussagen oder Fakten fälschlicherweise der falschen Quelle zuschreiben); und dem, was es „deceptive completion“ nennt (Lügen über die Erledigung von Aufgaben, die es nicht erledigt hat).

Derzeit stehen mehrere Modelle von OpenAI an der Spitze seiner vorläufigen Alignment-Bestenliste, während Claude Opus 5.5 und Claude Fable auf dem sechsten bzw. neunten Platz liegen.

Originalquelle

TechCrunch AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten