IT之家 AI

En solo 10 meses casi se duplica: la plataforma de evaluación de modelos de IA Arena alcanza una valoración de 3.100 millones de dólares

IT之家, noticia del 9 de octubre: el día 8, hora local, la plataforma de evaluación de modelos de IA Arena (Arena Competitive Arena) anunció que completó una ronda de financiación serie B de 200 millones de dólares (nota…

Fuente de la imagen · IT之家 AI

IT之家 Noticia del 9 de octubre: el día 8, hora local, la plataforma de evaluación de modelos de IA Arena (Arena Competitive Arena) anunció que completó una ronda de financiación serie B de 200 millones de dólares (nota de IT之家: al tipo de cambio actual, unos 1.343 millones de yuanes),con una valoración de 3.100 millones de dólares(al tipo de cambio actual, unos 20.817 millones de yuanes). Arena comenzó en 2023 como un proyecto de investigación de la Universidad de California en Berkeley, que clasifica los modelos de IA mediante votos del público.

Arena había revelado previamente que en junio de este año sus ingresos anualizados alcanzaron los 100 millones de dólares (al tipo de cambio actual, unos 672 millones de yuanes).

Esta ronda fue coinvertida por Lightspeed Venture Partners y Khosla Ventures, con la participación de inversores como Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z y Felicis.

En enero de este año, Arena había completado una ronda serie A de 150 millones de dólares (al tipo de cambio actual, unos 1.007 millones de yuanes),con una valoración post-money de 1.700 millones de dólares(al tipo de cambio actual, unos 11.416 millones de yuanes), y sus ingresos anualizados en ese momento eran de 30 millones de dólares (al tipo de cambio actual, unos 201 millones de yuanes). En apenas unos 10 meses, la valoración de Arena casi se ha duplicado.

La plataforma de evaluación de Arenaes gratuita para usuarios individuales. Los usuarios pueden introducir indicaciones o pedir a la IA que escriba programas o desarrolle proyectos según sus requisitos, y luego comparar los resultados de los distintos modelos y puntuarlos. Arena afirma que la plataforma atrae decenas de millones de visitantes al mes.

En septiembre del año pasado, Arena lanzó AI Evaluations, un servicio comercial dirigido a organizaciones de desarrollo de modelos de IA y empresas, que utiliza datos de retroalimentación de usuarios de la comunidad para ofrecer análisis detallados del rendimiento de los modelos.

Este año, las organizaciones de desarrollo de IA descubrieron que sus modelos podían obtener puntuaciones altasadaptándose a las reglas de los benchmarkssin poseer necesariamente las capacidades reales correspondientes. Las empresas ya no se conforman con las puntuaciones de pruebas estandarizadas y desean saber qué modelo se adapta mejor a sus necesidades comerciales.

Arena señaló en su comunicado de financiación: "El desarrollo de la IA ya ha superado nuestra capacidad de evaluación. En cuanto un modelo detecta que está siendo evaluado, los benchmarks fijos dejan de ser válidos. El mundo necesita un tercero neutral que verifique si la IA es segura en el uso real y si su comportamiento se ajusta a las expectativas humanas. Arena ha comenzado a asumir este papel".

Por ello, Arena añadió en su clasificaciónuna evaluación de capacidad de alineación, centrada en examinar si los modelos realizan acciones no solicitadas por el usuario, si atribuyen erróneamente declaraciones o hechos a fuentes incorrectas, y si afirman falsamente haber completado una tarea. Arena llama a este último comportamiento "finalización engañosa".

En la clasificación preliminar de capacidad de alineación, varios modelos de OpenAI encabezan la lista, Claude Opus 5.5 ocupa el sexto puesto y Claude Fable el noveno.

Fuente original

IT之家 AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original