量子位

Recién ahora, Hinton publicó su primer artículo sobre RSI

La IA ha comenzado verdaderamente a entrar en la línea de producción de «crear la próxima generación de IA»

Fuente de la imagen · 量子位

Por Mengyao, desde Aofeisi

Quantum Bit | Cuenta oficial de WeChat: QbitAI

Cuando la IA empieza a participar en el desarrollo de la siguiente generación de IA, la humanidad podría estar ya al umbral de la «explosión de inteligencia».

¡Guau! La reciente y súper súper súper popular auto-mejora recursiva (RSI), hasta el padrino de la IAHinton¿¡Han bajado al terreno personalmente!?

Nuestro Hinton, ganador del Premio Nobel de Física y del Premio Turing,El primer artículo sobre el RSIy arrancan investigando una pregunta francamente explosiva:

¿Y si la IA empieza a participar a gran escala en la creación de la próxima generación de IA?

Y luego, esa próxima generación de IA regresa para seguir acelerando la investigación.

Si esto rueda ronda tras ronda… ¿no podría salir directamente una curva de explosión de inteligencia?

El artículo se titula《¿Qué pasaría si automatizar la R&D de la IA desencadena una explosión de inteligencia?》。

Los autores que participaron en la redacción del artículo son, además, un auténtico plantel de estrellas de la academia de la IA:

De los 22 autores figuran dos de los padrinos de la IA, Geoffrey Hinton y Yoshua Bengio, el pionero del aprendizaje por refuerzo Andrew Barto, el científico jefe de OpenAI Jakub Pachocki, entre otros muchos investigadores.

Con tantos pesos pesados de la IA reunidos, el tema de discusión es precisamente la «explosión de inteligencia», la ciencia ficción más antigua del campo de la IA; echemos ya un primer vistazo a las ideas centrales del artículo:

  • Una vez que la IA pueda participar por completo encrear la próxima generación de IA, la auto-mejora recursiva podría cerrar realmente el bucle.
  • En cuanto la automatización de la investigación en IA cruce cierto punto crítico, los avances en IA que hoy requieren años podrían llegar a comprimirse enunos pocos meses, o incluso menos.
  • La escala de investigación de los laboratorios de IA del futuro podría, en teoría, saltar de unos pocos miles de personas amillonesde investigadores.
  • Los avances en IA que hoy se logran en un año, en el caso extremo, en el futuro podrían requerir solo unas5 semanas。
  • ; la explosión de inteligencia no necesariamente exige que la IA se convierta primero en superinteligencia, basta con que la investigación en IAEficiencia de la automatizaciónsuficientemente alta, el bucle de retroalimentación podría arrancar primero.

Entonces… Hinton… el anciano… los grandes genios… qué es exactamente lo que han dicho sobre RSI… ¡urgente…!

La IA ya ha empezado a entrar de verdad en la cadena de producción de «crear la próxima generación de IA».

Explosión de inteligenciaEste término es en realidad bastante antiguo.

Ya en 1965, el matemático I.J. Good concibió una máquina superinteligente.

Si una máquina ya es mejor que los humanos diseñando máquinas, entonces puede seguir diseñando una versión más inteligente.

La nueva versión participa a su vez en la siguiente ronda de mejoras, una ronda tras otra, formando al final un bucle de retroalimentación autorreforzado.

El juicio central de Good en su época era en realidad muy simple:

si la tarea de «mejorar máquinas» puede también ser realizada cada vez mejor por las propias máquinas, el crecimiento de la capacidad podría, a su vez, seguir acelerando el crecimiento de la capacidad.

Esta idea se convirtió después en la fuente teórica más clásica de la «explosión de inteligencia», y en realidad guarda una misma línea con la mejora recursiva automática (RSI), tan de moda este año.

Solo que hoy, el foco de la discusión sobre RSI ha cambiado silenciosamente.

Lo que ya no preocupa a todos es simplemente si una IA puede modificar su propio código o ajustar parámetros, sino una cuestión más realista:

¿puede la IA entrar verdaderamente en todo el proceso de I+D de la próxima generación de IA, y hacer que ese propio proceso de I+D sea cada vez más rápido?

Y el juicio clave que Hinton y otros dan en este artículo es precisamente este:

La IA ha empezado a entrar de verdad en la cadena de producción de la investigación en IA, y a una velocidad un tanto descabellada...

Se dice esto porque el artículo cita un conjunto de datos internos de laboratorios punteros como Anthropic.

En enero (mes 1) de 2025, el porcentaje de código aprobado generado por IA era de apenas un dígito bajo.

Tan solo un año después, en mayo (mes 5) de 2026, esa proporción ya superaba80%。

Lo que ha cambiado aún más es la proporción de trabajo de investigación que la IA completa de forma «autónoma».

En marzo (mes 3) de 2026, Claude podía completar de manera autónoma alrededor del 1% del trabajo de investigación y desarrollo recibiendo solo supervisión humana de alto nivel.

Para agosto (mes 8) del mismo año, esta cifra ya había subido a26%。

Es decir, en unos seis meses, directamente se multiplicó por más de veinte.

Eso sí, esta cifra no debe interpretarse como que Claude haya completado automáticamente un cuarto de toda la investigación de Anthropic.

Lo que mide principalmente es la proporción del trabajo interno de I&D en IA que puede ser asumido de forma autónoma por la IA bajo supervisión humana de alto nivel.

El propio Anthropic también subraya que, por ahora, Claude no ha alcanzado un nivel completamente sin supervisión en ninguna categoría de trabajo de investigación en IA evaluada, pero en cualquier caso, la tendencia ya es muy clara.

El artículo también menciona que, a fecha de septiembre (mes 9) de 2026, los sistemas de IA internos de OpenAI ya podían completar con frecuencia tareas de investigación y desarrollo que originalmente requerían varios días de trabajo de un empleado humano.

Un cambio muy clave aquí es quela longitud de las tareas que la IA puede gestionar de forma independiente no ha dejado de crecer.。

Lo que realmente determina si la IA puede trabajar como un investigador no es solo lo alta que sea una puntuación en algún benchmark.

Lo más importante es si puede encadenar de forma continua decenas de pasos, avanzando hacia un mismo objetivo de investigación durante horas, días o incluso más tiempo.

El artículo, combinando las tendencias de los benchmarks y los avances internos de los laboratorios, sostiene queen los próximos años, la IA podría automatizar la mayor parte del trabajo de investigación en IA, e incluso completar la automatización total.

Escribir código es solo una parte de la investigación en IA; el I&D completo en IA incluye aquí proponer hipótesis de investigación, diseñar experimentos, implementar experimentos, analizar resultados, localizar las causas de los fallos, ajustar el rumbo y volver a empezar.

Si cualquiera de estos eslabones se automatiza por separado, solo cuenta como investigación asistida por IA; el punto verdaderamente sensible es cuando empiezan a encadenarse en una larga cadena.

Una vez que estos pasos puedan ser encadenados por un sistema de IA durante largos periodos de tiempo, el papel que asume empieza a acercarse cada vez más al de un investigador de verdad.

Y por si fuera poco, la investigación en IA resulta ser especialmente adecuada para este tipo de automatización...

La IA se desarrolla en gran medida en entornos digitales: el código puede ejecutarse directamente, los resultados de los experimentos se devuelven rápidamente, y las capacidades del modelo pueden verificarse de inmediato mediante métricas como benchmark, loss, reward, etc.

En comparación con la química, la biología o la manufactura, la investigación en IA tiene muchos menos eslabones en los que hay que esperar retroalimentación del mundo real.

Precisamente por eso, el bucle que I. J. Good describió en su día como algo muy lejano empieza hoy por primera vez a tener una vía de ingeniería relativamente concreta:

la IA participa en el desarrollo de la siguiente generación de IA, la siguiente generación de IA es más capaz, la IA más capaz vuelve a participar en la siguiente ronda de desarrollo, el bucle continúa, y la propia capacidad de investigación comienza a impulsar el crecimiento de la capacidad de investigación.

El artículo denomina a este tipo de vía software-driven intelligence explosion, es decir,una explosión de inteligencia impulsada por mejoras del software.

Cabe señalar que esto difiere un poco de fabricar chips más rápidos.

El diseño de chips, la fabricación de obleas y la construcción de fábricas tienen ciclos largos, mientras que los algoritmos, los métodos de entrenamiento, los flujos de trabajo de Agentes y las estrategias de datos sintéticos, una vez validados como eficaces, pueden en teoría desplegarse rápidamente en la siguiente ronda de investigación.

Por eso lo que de verdad preocupa a los autores es si el ciclo de retroalimentación del progreso de la IA se irá acortando cada vez más, y esta es también la razón por la que hoy se vuelve a discutir la auto-mejora recursiva:

Mientras la IA pueda hacerse cargo de manera cada vez más completa del desarrollo de la próxima generación de modelos, el bucle de retroalimentación de auto-mejora ya habrá surgido.

¿Miles de investigadores se convierten en millones, y ¿un año de progreso en IA podría reducirse a solo 5 semanas??

A continuación viene la parte más «dramática» de todo el artículo.

La participación de la IA en la I+D por sí sola no basta para constituir una explosión de inteligencia; lo realmente importante es que existe una diferencia muy grande respecto a los investigadores humanos normales:los investigadores de IA pueden copiarse.

Supongamos que un laboratorio tiene hoy 1000 investigadores de primer nivel y que en el futuro desarrolla un agente con la capacidad de un investigador humano de élite en IA.

A partir de ese momento, las reglas del juego cambian por completo en lo que respecta a expandir el equipo de investigación.

Formar a un investigador humano de primer nivel puede requerir cinco años de doctorado y años adicionales de experiencia científica; un investigador de IA simplemente abre otra instancia~

Además puede trabajar 24 horas, con miles de instancias ejecutando tareas simultáneamente. Cuando se actualiza el modelo subyacente, todo el equipo de investigación de IA se actualiza en sincronía.

Esto elude directamente la capa más dura de restricción de crecimiento de la ciencia humana:la velocidad de formación de talento.。

Para que la humanidad convierta 1000 investigadores de élite en 1 millón, se trata prácticamente de una obra de escala generacional.

Un sistema de IA, en teoría, puede expandirse en un tiempo mucho más corto aumentando la potencia de cómputo de inferencia y el número de instancias.

Al respecto, el artículo introduce expresamente un concepto:

effective R&D workforce, es decir,fuerza laboral efectiva de I+D.

Los autores estiman que, si la IA alcanza el nivel de los mejores investigadores en IA y los costos de inferencia se mantienen en un orden de magnitud similar al de los modelos frontera de hoy,

entonces la capacidad de cómputo existente de una empresa líder en IA podría, en teoría, sosteneruna fuerza laboral de I+D en IA equivalente a al menos varios millones de investigadores humanos de primer nivel.

Hay que recordar que hoy el equipo de investigación de un laboratorio frontera de IA está apenas en el orden de miles de personas; entre ambos hay varios órdenes de magnitud de diferencia...

Y esos millones de investigadores tienen además una característica muy difícil de replicar en organizaciones humanas: sus capacidades pueden actualizarse en sincronía.

Una vez que se actualiza el modelo subyacente, no hace falta reentrenar a millones de personas; en teoría todas las instancias pueden adquirir juntas las nuevas capacidades.

Cabe señalar que aquí es fácil caer en un malentendido: 100 miríadas (un millón) de investigadores de IA no traerán automáticamente una velocidad de I+D 1000 veces mayor.

La ciencia tiene de forma natural rendimientos marginales decrecientes: 10 personas investigando un problema pueden ser mucho más rápidas que 1.

Si 1 millón de personas investiga el mismo problema a la vez, lo más probable es que haya mucho trabajo duplicado, disputas por los recursos experimentales, y que las buenas ideas sean cada vez más difíciles de encontrar.

Por eso lo que el artículo realmente intenta calcular es otra cosa: si el beneficio aportado por la nueva fuerza laboral de I+D en IA puede, o no, superar el hecho de que la investigación sea cada vez más difícil.

Así llegamos a la variable clave de todo el artículo: returns to research effort, denotada como r.

En términos simples, mide cuánto puede aumentar la velocidad del progreso tecnológico cuando se incrementa la inversión en investigación.

Cuando r es bajo, tras aumentar mucho la inversión en investigación, los rendimientos decrecen rápidamente.

Cuando este número es lo bastante alto, el progreso aportado por la nueva capacidad de I+D genera a su vez mejores investigadores de IA, y solo entonces el bucle de retroalimentación comienza a acelerarse.

El artículo cita un estudio con datos históricos de tres subcampos de investigación en IA, cuya estimación central de r se sitúa en torno a1.2—1.9。

Suponiendo que la automatización total de la I+D en IA se logre, que rendimientos de investigación similares se mantengan, y que a corto plazo no aparezcan nuevos cuellos de botella de cómputo o datos que bloqueen de golpe todo el sistema, el resultado que obtiene el modelo es:

la velocidad del progreso en IA podría multiplicarse por 10 en aproximadamente 1.5 años.

Para dimensionarlo: un avance en IA que hoy requiere un año, en esa etapa necesitaría solo alrededor de5 semanas。

El artículo además hizo otro cálculo.

Si la investigación y desarrollo de IA se automatizara por completo, manteniendo solo la tendencia actual de mejora de la eficiencia del software, la fuerza laboral automatizada de investigación y desarrollo de IA podría expandirse en un plazo de meses a años100 veces。

Y este crecimiento podría además provenir de dos líneas avanzando simultáneamente.

Por un lado, aumenta el número de investigadores de IA; por otro, cada investigador de IA individual sigue haciéndose más fuerte.

Así es como surge lo verdaderamente contraintuitivo de la explosión de inteligencia.

Una limitación natural del crecimiento tecnológico en el pasado era que formar investigadores es lento: formar a un investigador verdaderamente excelente requiere más de una década de educación y entrenamiento.

Los investigadores de IA no tienen esta restricción: una vez alcanzada la capacidad suficiente, el paso de formación puede convertirse en copiar modelos y asignar potencia de cómputo.

Así, la investigación científica podría enfrentar por primera vez una crisis de oferta sumamente extraña: la propia capacidad de investigación se convierte en software.

Y una vez que la capacidad de investigación se convierte en software, las dos variables —cantidad de investigadores y capacidad de los investigadores— pueden ser impulsadas simultáneamente por el avance tecnológico.

Este es el verdadero punto peligroso de lo que el artículo llama explosión de inteligencia: la propia fuente de la aceleración también está siendo acelerada.

RSI ya ha asomado la cabeza, pero la explosión de inteligencia aún no ha cerrado el círculo

Al leer hasta aquí, es fácil llegar a una conclusión especialmente emocionante: ya está, la explosión de inteligencia ha comenzado. (llanto)

Pero el tono general que este artículo de Hinton mantiene de principio a fin es que la evidencia actual está lejos de ser suficiente para demostrar que la explosión de inteligencia ya ha ocurrido. (risa)

Porque la mejora de productividad que trae la automatización de la investigación y desarrollo de IA todavía no ha superado claramente el umbral necesario para desencadenar una aceleración explosiva.

Los autores incluso advierten directamente que entre la automatización de la I+D de IA y la explosión de inteligencia se interpone todavía una larga cadena de condiciones.

Primero, la IA debe ser lo bastante confiable para trabajar de manera autónoma durante largos períodos; en segundo lugar, debe aumentar realmente el rendimiento de la I+D; y después, esos nuevos logros de investigación deben, a su vez, reforzar de manera evidente la propia capacidad de investigación de la IA.

Además, incluso si en el futuro aparecieran millones de investigadores de IA, frente a ellos seguirían habiendo varios muros muy reales.

El primero: la potencia de cómputo.

Los investigadores de IA pueden copiarse, pero las GPU no pueden copiarse de la nada; si un gran número de experimentos clave requiere ejecutar modelos grandes, por muchos agentes que haya, al final podrían acabar haciendo cola esperando tarjetas gráficas.

En particular, entrenar una sola vez un modelo realmente de vanguardia ya puede requerir meses; ni un millón de investigadores de IA sentados frente al ordenador podrían comprimir a cinco minutos una tarea de entrenamiento que físicamente necesita 100 días.

Esta es una de las mayores restricciones reales para una explosión de inteligencia impulsada por software: la iteración del software puede ser extremadamente rápida, pero la expansión de la infraestructura computacional subyacente sigue estando limitada por el mundo físico.

El segundo: los datos.

Los datos naturales de internet no crecen al ritmo de la cantidad de investigadores de IA.

Según las tendencias discutidas en el artículo, es probable que los datos naturales de alta calidad existantes sean cada vez más insuficientes para satisfacer las necesidades de entrenamiento en continua expansión.

Si en el futuro se podrá seguir proporcionando señales de entrenamiento de alta calidad mediante datos sintéticos, tareas verificables, interacción con entornos y otros medios, sigue siendo una cuestión sin resolver.

El tercero: el tiempo de experimentación.

Algunas cosas simplemente son difíciles de paralelizar infinitamente: entrenar modelos lleva tiempo, fabricar chips lleva tiempo y construir nuevos centros de datos también lleva tiempo.

Incluso si 1 millón de agentes propusieran planes experimentales al mismo tiempo, al final tendrían que compartir recursos limitados de GPU, clústeres de experimentación y ventanas de entrenamiento.

Y queda un último problema aún más fundamental: la investigación científica será cada vez más difícil.

Las mejoras algorítmicas fáciles de encontrar pueden agotarse primero, y a partir de ahí, cada pequeño aumento de capacidad requerirá inversiones cada vez mayores.

El artículo llama a esto diminishing returns (rendimientos decrecientes):

cuanto más avanza la investigación, más cara puede ser la siguiente brecha; si la dificultad de la ciencia sube más rápido que la capacidad de I+D de la IA, la explosión de inteligencia naturalmente no podrá despegar.

En resumen, aunque el artículo no tiene evidencia suficiente para demostrar que la explosión de inteligencia ocurrirá con certeza, la evidencia existente ya basta para convertirla de una cuestión de ciencia ficción en un problema real que exige preparación anticipada.

Y la mejora recursiva automática, en efecto, está cada vez más lejos de ser un «escenario de ciencia ficción».

Incluso puede que, mirando atrás en el futuro, el verdadero hito memorable de 2026 no sea que algún modelo ganó unos puntos más.

Sino que, probablemente, sea la primera vez que la humanidad empieza a darse cuenta en serio de que el Scaling más potente de la IA podría ocurrir en la propia tarea de «investigar la IA».

Enlace de referencia:

[1] https://x.com/geoffreyhinton/status/2106122709285368061?s=20

Fuente original

量子位

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original