TechCrunch AIMis à jour le

Le très populaire classement d'IA Arena voit presque doubler sa valorisation, qui atteint 3,1 Md $ en 10 mois

La société derrière le populaire classement LMArena a levé 200 millions de dollars dans un tour mené par Lightspeed et Khosla, et mesure désormais les modèles d'IA sur des questions d'alignement telles que le mensonge.

Source de l’image · TechCrunch AI

Arena, qui est né en 2023 comme projet de recherche à UC Berkeley recueillant par crowdsourcing des classements de modèles d'IA, a levé un tour de Series B de 200 millions de dollars pour une valorisation de 3,1 milliards de dollars, a-t-il annoncé jeudi.

Cela intervient après que la société a déclaré avoir atteint 100 millions de dollars de chiffre d'affaires annualisé en juin.

Le tour a été mené par Lightspeed Venture Partners et Khosla Ventures, avec la participation de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis et d'autres. Arena avait précédemment annoncé une Series A de 150 millions de dollars en janvier pour une valorisation post-money de 1,7 milliard de dollars. À l'époque, son chiffre d'affaires annualisé était de 30 millions de dollars, a-t-elle déclaré. Sa valorisation a donc presque doublé en environ 10 mois.

Arena propose une plateforme participative gratuite pour les consommateurs. Les gens saisissent des requêtes ou demandent des projets créés par vibe coding, puis évaluent quel modèle fait mieux. Arena affirme compter des dizaines de millions de visiteurs mensuels.

En septembre de l'année dernière, elle a lancé son produit commercial, AI Evaluations, un service qui fournit aux laboratoires de modèles et aux entreprises des analyses de performance détaillées basées sur les retours de sa communauté. Le timing s'est révélé impeccable. Cette année, les laboratoires d'IA ont réalisé que leurs modèles truquaient les tests d'évaluation en trouvant des moyens d'obtenir de bons scores sans les mériter réellement. Parallèlement, les entreprises voulaient de l'aide pour déterminer quel modèle convient le mieux à leurs besoins internes plutôt que de se fier uniquement aux benchmarks standardisés.

« L'IA progresse plus vite que notre capacité à l'évaluer, et les benchmarks statiques ne fonctionnent plus une fois que les modèles réalisent qu'ils sont testés », a déclaré la société dans son annonce de financement. « Le monde a besoin d'un tiers neutre pour mesurer à quel point l'IA est réellement sûre et alignée une fois qu'elle est entre les mains de vraies personnes. Arena assume ce rôle aujourd'hui », a-t-elle ajouté.

À cette fin, Arena a également ajouté une nouvelle catégorie à son classement : l'alignement. C'est là qu'elle classe les modèles en fonction de problèmes comme les actions non autorisées (effectuer des actions qui n'ont pas été demandées) ; la fausse attribution (créditer à tort des déclarations ou des faits à la mauvaise source) ; et ce qu'elle appelle la « finalisation trompeuse » (mentir sur l'accomplissement de tâches qui n'ont pas été faites).

Actuellement, une série de modèles d'OpenAI occupent les premières places de son classement préliminaire d'alignement, avec Claude Opus 5.5 et Claude Fable respectivement en sixième et neuvième positions.

Source originale

TechCrunch AI

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original