TechCrunch AI

La popular tabla de clasificación de IA Arena casi duplica su valoración hasta los $3.1B en 10 meses

La empresa detrás del popular leaderboard LMArena ha recaudado 200 millones de dólares en una ronda liderada por Lightspeed y Khosla, y ahora está midiendo los modelos de IA en cuestiones de alineamiento como las…

Fuente de la imagen · TechCrunch AI

Arena, que surgió en 2023 como un proyecto de investigación en UC Berkeley que recopilaba rankings de modelos de IA mediante crowdsourcing, ha recaudado una ronda Serie B de 200 millones de dólares con una valoración de 3.1 mil millones de dólares, dijo el jueves.

Esto se produce después de que la empresa dijera que alcanzó 100 millones de dólares en ingresos anualizados en junio.

La ronda fue liderada por Lightspeed Venture Partners y Khosla Ventures, con la participación de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis y otros. Arena había anunciado previamente una Serie A de 150 millones de dólares en enero con una valoración post-money de 1.7 mil millones de dólares. En ese momento, sus ingresos anualizados eran de 30 millones de dólares, dijo. Eso significa que su valoración casi se ha duplicado en unos 10 meses.

Arena ofrece una plataforma colaborativa que es gratuita para los consumidores. Las personas introducen prompts o solicitan proyectos vibe-coded y luego califican qué modelo lo hace mejor. Arena afirma tener decenas de millones de visitantes mensuales.

En septiembre del año pasado, presentó su producto comercial, AI Evaluations, un servicio que proporciona a los laboratorios de modelos y a las empresas análisis detallados de rendimiento basados en los comentarios de su comunidad. El momento resultó impecable. Este año, los laboratorios de IA se dieron cuenta de que sus modelos estaban manipulando las pruebas de benchmarking , encontrando formas de acumular buenas puntuaciones sin ganarlas verdaderamente. Al mismo tiempo, las empresas querían ayuda para determinar qué modelo funciona mejor para sus propias necesidades internas en lugar de depender únicamente de benchmarks estandarizados.

«La IA avanza más rápido que nuestra capacidad para evaluarla, y los benchmarks estáticos dejan de funcionar una vez que los modelos reconocen que están siendo evaluados», dijo la empresa en su anuncio de financiación. «El mundo necesita un tercero neutral que mida cuán seguros y alineados son realmente los sistemas de IA cuando están en manos de personas reales. Arena está asumiendo ese papel hoy», agregó.

Con ese fin, Arena también ha añadido una nueva categoría a su leaderboard: alineamiento. Aquí clasifica los modelos según problemas como la acción no autorizada (tomar acciones que no se le pidieron); la atribución falsa (acreditar erróneamente declaraciones o hechos a la fuente equivocada); y lo que llama «finalización engañosa» (mentir sobre haber completado tareas que no hizo).

Actualmente, una serie de modelos de OpenAI encabezan su leaderboard preliminar de alineamiento, con Claude Opus 5.5 y Claude Fable en el sexto y el noveno lugar, respectivamente.

Fuente original

TechCrunch AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original