IT之家 Meldung vom 9. Oktober: Am 8. Ortszeit gab die KI-Modell-Bewertungsplattform Arena die erfolgreiche Series-B-Finanzierungsrunde über 200 Millionen US-Dollar bekannt (IT之家-Hinweis: zum aktuellen Wechselkurs etwa 1,343 Milliarden Yuan),wodurch die Bewertung auf 3,1 Milliarden US-Dollar stieg(zum aktuellen Wechselkurs etwa 20,817 Milliarden Yuan). Arena begann ursprünglich 2023 als Forschungsprojekt der University of California, Berkeley, das KI-Modelle durch öffentliche Abstimmungen rankt.
Arena hatte zuvor mitgeteilt, dass der annualisierte Umsatz im Juni dieses Jahres 100 Millionen US-Dollar erreichte (zum aktuellen Wechselkurs etwa 672 Millionen Yuan).
Die aktuelle Finanzierungsrunde wurde gemeinsam von Lightspeed Venture Partners und Khosla Ventures angeführt; weitere beteiligte Investoren sind Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis und weitere Institutionen.
Im Januar dieses Jahres hatte Arena bereits eine Series-A-Finanzierung über 150 Millionen US-Dollar abgeschlossen (zum aktuellen Wechselkurs etwa 1,007 Milliarden Yuan)bei einer Bewertung nach der Investition von 1,7 Milliarden US-Dollar(zum aktuellen Wechselkurs etwa 11,416 Milliarden Yuan); der annualisierte Umsatz lag damals bei 30 Millionen US-Dollar (zum aktuellen Wechselkurs etwa 201 Millionen Yuan). In nur etwa 10 Monaten hat sich Arenas Bewertung nahezu verdoppelt.

Arenas Bewertungsplattformist für Privatnutzer kostenlos zugänglich. Nutzer können Prompts eingeben oder die KI nach ihren Anforderungen Programme schreiben oder Projekte entwickeln lassen und dann die Ergebnisse verschiedener Modelle vergleichen und bewerten. Laut Arena zieht die Plattform monatlich zig Millionen Besucher an.
Im September letzten Jahres führte Arena den kommerziellen Dienst AI Evaluations für KI-Entwicklungseinrichtungen und Unternehmen ein, der mithilfe von Feedbackdaten der Community-Nutzer detaillierte Analysen der Modellleistung bietet.
In diesem Jahr haben KI-Entwicklungseinrichtungen festgestellt, dass ihre Modelle hohe Punktzahlen erreichen können, indem sie sichan die Regeln von Benchmark-Tests anpassen,ohne dass ihnen die entsprechende tatsächliche Fähigkeit zwingend zukommt. Unternehmen sind zudem nicht mehr mit standardisierten Testerergebnissen zufrieden und möchten wissen, welches Modell besser zu ihren Geschäftsanforderungen passt.
Arena erklärte in ihrer Finanzierungsankündigung: „Die Geschwindigkeit der KI-Entwicklung hat bereits unsere Fähigkeit zur Bewertung überholt. Sobald ein Modell merkt, dass es getestet wird, verlieren feste Benchmark-Tests ihre Wirksamkeit. Die Welt braucht eine neutrale dritte Partei, die prüft, ob KI im praktischen Einsatz sicher ist und ob ihr Verhalten den menschlichen Erwartungen entspricht. Arena hat begonnen, diese Rolle zu übernehmen.“
Zu diesem Zweck hat Arena in ihrer Ranglisteneue Bewertungen der Alignment-Fähigkeiten hinzugefügt,die besonders untersuchen, ob Modelle eigenmächtig vom Nutzer nicht angeforderte Aktionen ausführen, ob sie Zuordnungen verwechseln und Aussagen oder Fakten falschen Quellen zuschreiben, sowie ob sie fälschlich behaupten, eine Aufgabe erledigt zu haben. Arena bezeichnet das letztgenannte Verhalten als „deceptive completion“ (täuschende Aufgabenerfüllung).
Auf der vorläufig veröffentlichten Alignment-Rangliste belegen mehrere Modelle von OpenAI vordere Plätze, Claude Opus 5.5 rangiert auf dem sechsten Platz, Claude Fable auf dem neunten.
