Microsoft Research

¿Qué errores comete la IA y qué fracasos nos enseña?

Jennifer Neville no quería dedicarse a la informática, pero es precisamente allí donde llegó. Neville analiza los inicios y los finales que la llevaron al punto óptimo profesional y su trabajo de identificar “fracasos…

Fuente de la imagen · Microsoft Research

Jennifer Neville es una gerente de investigación asociada en Microsoft que ha construido su carrera en torno a la comprensión y el avance de la IA para su uso en la vida real. Al igual que las interacciones entre humanos y IA que estudia, su camino inicial en la carrera fue multifacético: matemáticas, luego física; ciencias cognitivas, luego trabajo; y finalmente informática—a pesar de sus esfuerzos por evitar este campo.

En esta conversación con el científico aplicado principal Chad Atalla, ella explora el papel que desempeña la evaluación del rendimiento en el avance de los sistemas de IA actuales para satisfacer las necesidades de los usuarios, así como los “fracasos sorprendentes” que surgen cuando los modelos se prueban más allá de los estándares tradicionales. Neville también compartirá consejos prácticos para trabajar con sistemas de IA actuales y discutirá por qué es importante examinar detenidamente los datos cuando los resultados desafían las expectativas, y qué han enseñado las décadas de progreso en IA sobre cómo predecir lo que vendrá después.

De una trayectoria profesional inesperada hasta la frontera de la interacción y el aprendizaje en IA, este episodio plantea una pregunta más amplia: ¿qué podemos aprender cuando el camino —ya sea humano o artificial— no se desarrolla como esperamos?

Suscríbase al Podcast de Microsoft Research:

Transcripción

[MÚSICA]

JENNIFER NEVILLE: Hubo momentos en los que sentía como si estuviera haciendo el vacío. Las cosas no funcionaban. Me sentía un poco desanimada. Luego llegábamos a un punto en el que realmente aprendíamos algo, y justo ese emoción emocional era lo que realmente me atraía. La capacidad de entender algo que nadie más había entendido todavía…

CHAD ATALLA: Claro…

NEVILLE: … porque está justo en la frontera de lo que sabemos sobre las cosas.

INTRODUCCIÓN ESTÁNDAR: Esta es el Podcast de Investigación de Microsoft, en el que los investigadores de Microsoft —que impulsan el progreso a través de la investigación en ciencia y tecnología fundamental— exploran quiénes son, cómo lo hacen y qué sigue en el área del computamiento y la IA.

[MUSIC ENDS]

CHAD ATALLA: Hola, bienvenido. Soy Chad Atalla, un científico aplicado en Microsoft Research.

Hoy, estoy acompañado por Jennifer Neville, una gerente de investigación asociada en Microsoft Research y profesora titular de ciencias informáticas y estadística en Purdue, bajo el nombre de Samuel D. Conte.

Su investigación examina el aprendizaje automático y la IA para dominios interactivos y datos estructurados, analizando cómo los puntos de datos sobre los que se entrena los sistemas de IA afectan su comportamiento y cómo esto se alinea con lo que los usuarios realmente desean.

En esa investigación, ha publicado más de 130 artículos con más de 10,000 citas y ha recibido reconocimientos como un Premio CAREER de la National Science Foundation, una plaza en Lista de “10 a seguir” de IA de IEEE (se abre en pestaña nueva), y los mejores premios de artículos de la Conferencia Internacional sobre Minería de Datos (se abre en nueva pestaña) y el Conferencia Internacional sobre Representaciones de Aprendizaje. 

Lo que más me sorprende en el trabajo de Jen es su visión anticipada y su capacidad para mantener una línea coherente a medida que se desarrolla el campo del IA. Estoy emocionado de escuchar más sobre cómo llegó al punto en el que se encuentra hoy.

Jen, gracias por unirse a mí.

JENNIFER NEVILLE: Gracias por invitarme.

ATALLA: Genial. Bueno, me gustaría aprender cómo llegaste aquí hoy. Vamos a retroceder mucho atrás. Cuando era niño, quería ser astrofísico, pero, por supuesto, hoy estoy con un background en informática. ¿Cuándo tú supiste que querías estudiar informática?

NEVILLE: Es una buena pregunta. Yo… cuando era niño, quería hacer cualquier cosa menos ciencia informática, porque ese era el campo en el que trabajaba mi padre. También quería hacer cualquier cosa menos lo que hacía mi padre. Así que, cuando fui a la universidad, primero me especialicé en matemáticas y luego en física, pero realmente no me sentía cómodo con esas especializaciones.

Así que dejé la universidad por un tiempo, y cuando volví a estudiar, me decidí especializar en ciencia cognitiva, que también era muy limitada para mí. No tenía suficiente matemática. En ese momento, si alguien me hubiera dicho: “La IA es algo que deberías hacer porque combina la ciencia cognitiva con las matemáticas y el pensamiento computacional”, creo que habría ahorrado mucho tiempo, [RIEVE] pero eso no ocurrió.

Y así trabajé durante un tiempo. Luego, cuando volví a la escuela, decidí especializarme en informática, porque lo que quería hacer era pensar en trabajar con datos y manejarlos. Fue entonces cuando encontré la IA. Simplemente por casualidad. Ni siquiera me di cuenta de que formaba parte de la informática.

ATALLA: Genial. Bueno, es una cosa entrar en ciencias de la computación y querer trabajar en datos o IA, pero es otra cosa querer participar en investigaciones en ese campo. Entonces, ¿qué tipo de preguntas o ideas importantes impulsaron tu motivación para la investigación?

NEVILLE: Sí, en realidad es una historia interesante también. Me involucré en la investigación porque estaba en el programa de honores de mi grado en informática, y como parte del programa de honores, se debe hacer un proyecto de investigación [RISA].

ATALLA: Es obligatorio, sí.

NEVILLE: Es obligatorio. Así que cuando hablé con los profesores sobre qué debería ser el proyecto de investigación, ellos dijeron en realidad: “Bueno, ustedes tienen que decidir en qué tema quieren trabajar”.

Y en ese momento, me interesaron los datos y me interesó la IA; pensé mucho al respecto. Leí mucha literatura. Y lo que decidí investigar fue cómo realizar el minería de datos en datos web interconectados. Cuando decidí que esa era la cuestión en la que quería trabajar, me señalaron a un miembro específico del faculty…

ATALLA: Bien.

NEVILLE: … quien acababa de comenzar a trabajar en este campo emergente en el momento en que se llamaba aprendizaje relacional estadístico. Y usamos eso para mi proyecto: pubiqué un artículo en un taller, y me sentí, en cierto modo, fascinado.

ATALLA: Está bien, sí.

NEVILLE: Así que no tenía intención de ir a la universidad, pero esa experiencia…

ATALLA: Sí.

NEVILLE: … me hizo querer continuar en la universidad para seguir adelante.

ATALLA: Bien. ¿Qué parte de eso te atrapó? ¿Fue, por ejemplo, la emoción de hacer la investigación? ¿O fue el ambiente de la conferencia y cómo son las publicaciones académicas?

NEVILLE: Realmente fue la emoción y el proceso de hacer investigación. Era un proyecto muy largo. Hubo momentos en los que sentía como si estuviera perdiendo el tiempo; las cosas no funcionaban. Me sentía un poco desanimada. Pero mi asesor era, más o menos, de apoyo y positivo, diciendo: “No, sigue adelante. Estamos aprendiendo algo”. Luego llegábamos a un punto en el que realmente aprendíamos algo, y justo esa emoción emocional era lo que me atraía realmente. La capacidad de entender algo que nadie más había entendido aún…

ATALLA: Claro.

NEVILLE: … porque está justo en la frontera de lo que sabemos sobre las cosas, eh, es como una droga, ¿verdad? [RISA] Así que me ha mantenido investigando durante tanto tiempo, siguiendo ese mismo sentimiento.

ATALLA: Entendido. Bueno, me gusta. Sí, te uniste a Microsoft en 2021 desde el ámbito académico. De hecho, sigues siendo profesor y has estado enseñando y dando consejos durante 20 años. ¿Qué motivó tu cambio hacia la investigación en la industria como parte de tu vida profesional? ¿Y cómo describirías la diferencia entre la investigación en la industria y la investigación académica?

NEVILLE: Mi investigación abarca, de alguna manera, todo el espectro desde la teoría hasta la aplicación. Cuando tuve mi primera vacación sabática después de obtener mi titulación, muchos colegas que tenía en… que estaban en el mismo punto de su carrera se fueron a laboratorios industriales para su vacación sabática y nunca volvieron a Purdue. Pensé en hacia dónde quería ir: más teoría o más aplicación. En ese momento de mi carrera, pensé que sería mejor explorar el lado teórico, porque así podría realmente volver a Purdue.

Y así fui al Instituto Simons en Berkeley para mi vacación académica, y fue muy teórica. Fue una gran experiencia, pero fue bastante fluida el regreso a la academia. En mi segunda vacación académica, tomé otro camino: vine a MSR [Microsoft Research] y hice una vacación académica allí. Y, por supuesto, poder ver cómo los algoritmos, en teoría, funcionan de cierta manera; pero cómo se comportan en la práctica, en sistemas reales, con usuarios reales y datos reales, es algo difícil de revertir. Por eso es por lo que sigo aquí.

ATALLA: Entendido.

NEVILLE: Creo que la diferencia entre la investigación en el ámbito académico y en la industria depende de… realmente está influenciada por el objetivo, es decir, hacia dónde se dirige la investigación. En esencia, me parece muy similar las preguntas que se plantean en ambos ámbitos, pero en la industria, tu capacidad para aplicarla a gran escala en sistemas reales con datos reales es muy diferente a la del ámbito académico. En el ámbito académico, creo que se plantean preguntas más abstractas que abarcan aplicaciones en muchos dominios diferentes al mismo tiempo. Y así se obtiene financiación de instituciones como DARPA [Defense Advanced Research Projects Agency] y NSF [National Science Foundation].

Pero en la industria, es un poco más fácil simplemente, ya sabes, realmente ensuciarse las manos y hacerlo en los sistemas reales. Y entonces, tu objetivo es los productos y los intereses de la empresa. Así que, a medida que… ese tipo de cambios ocurren, quizás también cambian los tipos de preguntas que harías o investigarías. Así que creo que es realmente genial estar…

ATALLA: Sí.

NEVILLE: … en ambos lugares, ¿verdad? Por ejemplo, hay muchas sinergias entre los dos, y creo que hay muchas oportunidades para ir a la industria y volver al ámbito académico, o para comenzar en la industria y luego pasar al ámbito académico. Pero ahora, si estás trabajando en sistemas de IA, creo que la industria es realmente el lugar adecuado.

ATALLA: Entendido. Sí. Quizás sea un consejo útil para quienes estén decidiendo qué camino tomar en su carrera en este momento.

He estado en Microsoft desde un poco más de seis años y he trabajado en la evaluación de IA durante gran parte de ese tiempo. Por supuesto, hay una serie de preguntas y desafíos fundamentales que son realmente intimidantes en este campo.

Y al principio me encontré con su trabajo y me di cuenta de él porque parte de su trabajo propone algunas soluciones para algunos de estos problemas y ayuda a señalarlos. Mi reacción inmediata fue alivio por tener a alguien maravilloso como usted trabajando en estas cosas, y usted se encargará de ello por nosotros. Y realmente aprecio cómo equilibra la crítica a la evaluación de la IA y también proporciona soluciones en el proceso.

Pero entiendo que eso es solo un pequeño fragmento de su agenda de investigación más amplia. Entonces, ¿cómo describiría el carta de investigación actual del equipo que lidera?

NEVILLE: Nuestro equipo se llama el equipo de Interacción y Aprendizaje de IA. Lo que realmente nos enfocamos en hacer es intentar trascender los límites del comportamiento de estos sistemas de IA en entornos de trabajo realistas. Esto implica estudiar dónde se encuentra el límite del rendimiento de los sistemas actuales, cómo los usuarios lo experimentan en la práctica con flujos de trabajo reales, y luego cómo mejorar eso y mejorar el rendimiento de los modelos para este tipo de tareas—tareas complejas—en las que los usuarios trabajan.

La razón por la que nos enfocamos en la evaluación es que encontramos que la forma estándar en la que las personas que trabajan en ML y IA evalúan los sistemas es a través de puntos de referencia bastante simples, en relación con cómo realmente se utilizarían en la práctica. Por lo tanto, descubrimos que lo primero que realmente necesitas hacer es preguntarte: ¿qué queremos obtener de estos sistemas? Y diseñar evaluaciones prácticas para poner los sistemas en esos tipos de entornos. Así que eso significa cosas como el comportamiento de múltiples giros, entornos colaborativos y tareas de largo alcance que los usuarios realizan.

Y luego, una vez que podamos identificar dónde se encuentran las brechas de rendimiento o los problemas que ocurren en esas evaluaciones, eso también nos proporciona conocimientos sobre dónde, de alguna manera, teóricamente o algorítmicamente, necesitamos mejorar estos sistemas.

Así que comenzamos con la evaluación, pero en última instancia, lo que intentamos hacer es desarrollar algoritmos, modelos y métodos de estimación mejorados…

ATALLA: Claro.

NEVILLE: … para mejorar el rendimiento de los modelos.

ATALLA: Sí, es una puerta de entrada para la comprensión y, por lo tanto, para poder superar los límites y mejorar estos sistemas.

NEVILLE: Sí.

ATALLA: Entonces mencionaste interacciones de múltiples turnos y entornos colaborativos. Tienes algunos artículos recientes que analizan específicamente estos temas, como cómo los LLMs pueden perderse en conversaciones de múltiples turnos o cómo pueden dañar los documentos en estos escenarios de trabajo basados en conocimiento agente. ¿Puedes contarme un poco más sobre esos proyectos de investigación?

NEVILLE: Claro. Nosotros… esos son ejemplos de casos en los que tuvimos que, de alguna manera, tener ideas innovadoras sobre cómo establecer la evaluación para poder controlar y probar el comportamiento del modelo en esas situaciones.

Así que, para las conversaciones de varios turnos, lo que hicimos fue tomar los estándares de un solo turno. Quizás debería aclarar que una de las cosas que observamos en los usuarios en la práctica es que a menudo subespecifican lo que intentan hacer. No saben cómo dar una especificación completa desde el principio. A veces olvidamos esto como científicos informáticos y ingenieros de software, pero los usuarios comunes podrían no ser capaces de especificar todo en el primer turno. Por lo tanto, ellos, de alguna manera, descubren lo que están haciendo a lo largo de varios turnos y, de algún modo, añaden condiciones y aclaraciones a lo largo de los turnos.

Así que lo que hicimos fue tomar conjuntos de datos de prueba de un solo turno que son públicos, y cambiamos las instrucciones complejas de un solo turno completamente especificadas, y tuvimos modelos que simulan a usuarios que proporcionan esa aclaración en múltiples turnos, y luego estudiamos cómo se comportan los modelos —cómo se comportan todos los modelos actuales que tenemos— cuando se presenta este tipo de tarea especificada en múltiples turnos.

Y descubrimos que el rendimiento que observamos en escenarios de un solo giro —que es muy alto, porque, por supuesto, lo optimizamos como constructores de modelos— en realidad se degrada significativamente con múltiples giros. Así que fue una conclusión bastante sorprendente, ya que nadie había evaluado esto antes…

ATALLA: Claro.

NEVILLE: … de esa manera antes. Pero cuando compartimos ese estudio con el mundo, todos los usuarios de los sistemas estuvieron de acuerdo con él, …

ATALLA: Claro… sí.

NEVILLE: … “Bueno, esa es mi experiencia. Sabía que eso estaba sucediendo. ¿Cómo, cómo podemos solucionarlo?” Y uno de los… así que estamos trabajando en métodos de aprendizaje reforzado para ayudar a los modelos a aprender mejor en estos entornos, de alguna manera, para corregir ese comportamiento.

Pero una solución práctica de la que hablamos en el artículo es: si al final tienes el modelo, y te confundes un poco, si especificaste algo en varias conversaciones, simplemente detén la charla, borra todo, vuelve atrás y, dado lo que sabes, da una sola conversación completamente especificada…

ATALLA: Entiendo, sí.

NEVILLE: … y entonces se comportará mejor en ese tipo de interacción.

Así que quizás esto indica que, aunque en esencia buscamos mejoras algorítmicas en los modelos, a veces en estos proyectos terminamos llegando a comprender cómo los usuarios podrían cambiar su comportamiento…

ATALLA: Claro. Sí.

NEVILLE: … para obtener mejores resultados de los modelos, como, en el caso de lo que están haciendo ahora…

ATALLA: Sí…

NEVILLE: … con su rendimiento.

ATALLA: Sí. Bueno, notamos que uno de los temas de su investigación es cómo podemos mejorar estos sistemas para que estén más alineados con lo que los usuarios realmente desean. Usted mencionó un caso en el que, “Bueno, sabemos que, en la realidad, los usuarios a menudo no especifican completamente lo que quieren en su primera conversación, y tenemos estas interacciones de múltiples turnos”. Después de que publicó este artículo, expresaron comprensión por esta frustración de perderse en las conversaciones de múltiples turnos.

¿Cómo piensas en comprender los deseos, necesidades y experiencias de los usuarios, y cómo se relaciona eso con lo que haces, como dijiste, simulando a un usuario, por ejemplo, para realizar estas evaluaciones multitanalizadas más largas?

NEVILLE: Sí, eso… poder ver a gran escala qué intentan hacer los usuarios y qué tipo de fracasos y éxitos tienen en los sistemas es uno de los beneficios que se obtienen si estás en un laboratorio industrial y puedes observar datos de esa magnitud.

Así que hemos hecho mucho trabajo interno en Microsoft con los grupos de productos, analizando registros de consumidores a gran escala para descubrir qué son los principales patrones de fallos que experimentan los usuarios. Y eso es… proporciona ese tipo de conocimiento o inspiración para mucho del trabajo que realizamos. También hay muchos grupos de productos que están analizando los éxitos que han tenido los usuarios, lo que permitiría recomendarles a los usuarios qué… qué tipo de tareas podrán realizar con éxito en los sistemas que tenemos ahora.

Creo que si piensas en cuando los motores de búsqueda comenzaron por primera vez, las personas tenían que aprender cómo interactuar con ellos…

ATALLA: Claro.

NEVILLE: … de una manera que permita obtener efectivamente la información que buscan. Quizás haya olvidado que esto ocurrió antes, porque formaba parte de lo que todos hacían antes de que aparecieran estos sistemas de IA. Pero ahora creo que hay una transición desde los motores de búsqueda hacia estos sistemas basados en chat, y creo que también habrá que aprender algo de los usuarios…

ATALLA: Correcto, sí.

NEVILLE: … en este nuevo entorno. Y creo que analizar las cosas que tienen éxito en términos de lo que hacen los usuarios es una gran forma de comenzar a recomendar…

ATALLA: Sí.

NEVILLE: … y la tutoría o la enseñanza a los usuarios de la misma manera.

ATALLA: Me gusta cómo señalas la utilidad de observar datos reales, pero ¿qué significa eso realmente? ¿Estás realmente observando datos reales? ¿Cómo entra en juego la privacidad? ¿Qué tipo de procesos tienes para aprovechar los datos de manera responsable en la vida real?

NEVILLE: Oh, sí, ese es un buen punto. Gracias por mencionarlo. En realidad no estamos mirando los datos directamente. Estamos analizando los datos a gran escala para extraer patrones de fallos o éxitos de una manera que respete la privacidad. También hay muchas restricciones que, en realidad, no podemos ver con los ojos. Solo podemos, de alguna manera, probar métodos para procesar los datos en entornos muy restringidos. Y luego, esos insights de nivel superior que respetan la privacidad son lo que, posteriormente, alimenta lo que haríamos algoríticamente.

Así que para dejarlo claro: no estamos realizando ajustes finos en sus datos ni en sus respuestas. Pero cuantos más detalles pueda proporcionar en sus respuestas, ya sea a través de información donada, cuando indique que no y proporcione una descripción del mismo, o si es parte de la interacción de chat que tiene con los modelos, todo eso podrá eventualmente convertirse en algo que mejorará a los modelos, no a través de personas que realmente observen lo que ha hecho.

ATALLA: Y señalaste este cambio de que la búsqueda sea la modalidad dominante a estas interacciones de chat multifacéticas. Pero ahora también estamos viendo cómo las tareas de trabajo colaborativo basadas en agentes se vuelven aún más relevantes, y también noté que hiciste algunos trabajos al respecto. ¿Hay algún otro punto interesante que te gustaría compartir con nuestros oyentes?

NEVILLE: Sí. Por lo tanto, tenemos tanto trabajo teórico que intenta caracterizar los tipos de tareas que son fundamentalmente difíciles para los transformadores calcular dentro del modelo, como también más trabajo basado en simulación, donde analizamos tareas complejas que se realizan en flujos de trabajo de larga duración. En este tipo de trabajos, por ejemplo, se toman documentos y se realizan ediciones repetidas sobre esos documentos.

En esos entornos, la complejidad de la tarea para los modelos o incluso para los agentes consiste en rastrear no solo lo que el usuario pretende hacer durante esta actividad de trabajo a largo plazo, sino también comprender el estado actual, qué información es relevante, qué no lo es, y cómo han cambiado las cosas. Y estas son cosas en las que los agentes están empezando a ser bastante buenos, pero hay tipos de tareas en particular que son más fáciles que otras.

ATALLA: Claro.

NEVILLE: Así que lo que nos ocupa es: ¿cuáles son los tipos de tareas en las que la complejidad se vuelve demasiado para los agentes actuales y cómo resolverlo? ¿Cuál es la mejor forma de utilizar la herramienta con los agentes? ¿Es mejor involucrar a un ser humano? ¿Cómo podemos saber si algo ha salido mal? Por lo tanto, incluso teniendo a los agentes, de alguna manera, que se monitoren a sí mismos y evalúen si han respondido correctamente o si deberían volver a un estado anterior. Creo que todas estas son preguntas abiertas en este momento.

Pero tenemos… sí tenemos algún trabajo que demuestra de nuevo que experimentamos fallos sorprendentes a medida que nos adentramos más y más en estos flujos de trabajo, porque los errores, si no se detectan, pueden acumularse…

ATALLA: Sí.

NEVILLE: … y comienza a confundir a la IA aún más, ya que tienen que llevar a cabo la tarea a través de interacciones repetidas.

ATALLA: Sí, esa frase “fracasos sorprendentes” me parece interesante. Implica una expectativa de que “Oye, esto debería funcionar mejor, y me sorprende que haya fallado de esta manera específica”. ¿Cree que ve más de estos errores sorprendentes, o muchos de los errores, como es de esperar, podrían entenderse como algo que fallaría de esa forma o de otra?

NEVILLE: Sí, creo que, definitivamente, se esperan fallos, porque… bueno, por supuesto, hay menos fallos esperados, ya que trabajamos para mejorar los sistemas cada vez más.

ATALLA: Correcto. Si podemos esperarlos, entonces podremos arreglarlos.

NEVILLE: Es correcto. Pero cosas como las alucinaciones son los tipos de fallos que han sido caracterizados durante mucho tiempo en la comunidad, y existen puntos de referencia y métodos específicos para intentar reducirlos.

Creo que mi equipo termina buscando cosas que aparecen como fracasos casi sorprendentes, ya que no son los fracasos tradicionales y a menudo es difícil aislarlas y demostrar que están ocurriendo, debido a que son muy sutiles y no se manifiestan simplemente como una respuesta incorrecta a un problema matemático o como un caso ilusorio en un juicio, ya sabes, una opinión legal. Pero se trata de este tipo de pérdida sutil de contenido semántico en los documentos. Y creo que, si miro hacia atrás a lo que hemos investigado con el equipo, tenemos una especie de hipótesis: creemos que, como seres humanos, las cosas que son difíciles para nosotros serán también las cosas difíciles para el modelo. De hecho, esto no sucede con frecuencia, porque tenemos que pensar en lo que es difícil para los transformadores calcular, y en lo que es difícil para sus sistemas de recuperación…

ATALLA: Correcto.

NEVILLE: … del contenido subyacente.

Y así pienso que la razón por la que hay algo “sorprendente” es porque podríamos pensar, como seres humanos, que las cosas son muy simples de hacer o que si antes se realizaba correctamente una tarea, ahora creemos con certeza que la misma tarea debería realizarse correctamente también. Pero en realidad, eso no es necesariamente el caso con los LLM. Así que lo sorprendente, en cierto modo, surge de nuestras propias expectativas basadas en la inteligencia humana sobre lo que es difícil o lo que es fácil.

ATALLA: Sí. Entre esa confusión que puede existir entre los usuarios, basada en lo que esperan que estos sistemas sean capaces de hacer, quizás basándose en la inteligencia humana y todo el espectáculo y marketing que hay por ahí, ¿qué quieres que los usuarios reales aprendan de esto? O cómo los advertirías para que piensen en las capacidades y expectativas que podrían tener para los sistemas de IA, dado tu trabajo aquí? ¿Cómo pueden cortar ese ruido y tener expectativas más claras?

NEVILLE: Oh, esa es una buena pregunta. Creo que los sistemas de IA actuales tienen muchas capacidades que serán muy útiles para las personas en entornos laborales ahora mismo. Creo que la conclusión de nuestro trabajo es que no se debe esperar que sean 100% exitosos en todos los casos. Se debe revisar las respuestas que se obtienen. Y si se obtiene algo que se considera incorrecto, no hay necesidad de asumir que el modelo no puede hacerlo. Pero se debe pensar en preguntar de nuevo o en hacerlo de una manera diferente, y es posible obtener una respuesta mejor la próxima vez.

Eso es difícil de incorporar en la forma en que trabajamos ahora, porque creo que no se puede… no están listos para que todo sea 100% delegado a ellos. Pero si logran encontrar la manera de usarlos en un flujo de trabajo junto con ustedes, con supervisión y verificación, creo que pueden ser muy útiles para hacer cosas, mejorar, ya saben, la productividad y la velocidad con la que se realizan las tareas.

Así que… y quizá lo otro que hay que decir es: por favor, tenga paciencia con nosotros, porque en tiempo real estamos desarrollando estos sistemas mientras se lanzan. Y así, su uso nos ayuda a superar los límites de los modelos, ya que nos proporciona ejemplos de cosas que se pueden y no se pueden hacer.

Tal vez otra cosa que me gustaría decir es que algo que quizás los usuarios no entienden es que, en el pasado, con los sistemas basados en búsqueda o los sistemas de recomendación, el tipo de retroalimentación que podíamos dar como usuarios era simplemente, como un pulgar hacia arriba o hacia abajo. Pero ahora estamos en un entorno donde realmente podemos dar retroalimentación con mucha mayor fidelidad, lo cual puede ser muy útil para mejorar los modelos a posteriori.

Así que si estás trabajando en un entorno de chat con una modelo, debes entender que, si algo ha salido mal, es útil decir cómo ocurrió ese problema, para… y en tu interacción textual o verbal, para transmitir realmente exactamente qué falló, lo que esperabas y lo que realmente obtuviste. Porque eso se utilizará cuando actualicemos los modelos. Y así, puedes considerarlo como usuarios: tu papel puede ser entrenar los modelos para que hagan las cosas que te habrías deseado que hicieran, pero que ahora no pueden hacer.

ATALLA: Genial. Es una llamada a la acción interesante.

Y simplemente estoy curioso. Hablaste sobre el paradigma del transformador en el que nos encontramos ahora para este tipo de sistemas de lenguaje grande. ¿Dónde veías que se dirige la ciencia de los grandes sistemas de IA? En general, quizás sea una pregunta muy difícil, pero al menos en tus intereses y direcciones de investigación, ¿dónde ves que se dirige la ciencia de estos sistemas?

NEVILLE: Eso es, es una pregunta muy grande. [LAUGHTER] Creo que estamos… la comunidad de investigación está tratando al mismo tiempo de averiguar si la arquitectura de transformador es el modelo subyacente adecuado a utilizar, porque existen ciertas limitaciones conocidas sobre cómo funciona la computación en los transformadores. Muchas de esas limitaciones pueden resolverse mediante el paquete que rodea los modelos—los sistemas agentic que tenemos actualmente alrededor de los modelos—y el razonamiento que ocurre en el backend.

Así que creo que una pregunta abierta es: ¿cuánto podemos lidiar con las limitaciones de la arquitectura del transformador con esta base de envoltura alrededor de ella, y qué necesita ser abordado con algo fundamentalmente diferente…

ATALLA: Claro.

NEVILLE: … ¿arquitectura subyacente a las cosas? Creo que veremos un desarrollo rápido de, por así decirlo, arquitecturas y modelos alternativos, así como envolturas elaboradas alrededor de los modelos actuales que tenemos.

Creo que en la próxima generación de trabajos tendremos que centrarnos en las interacciones a más largo plazo con los modelos y lograr que los modelos comprendan el mundo en el que operan de una manera mucho más tangible que ahora. Pero creo que estoy muy optimista respecto a la investigación que está teniendo lugar. Creo que, como saben, tendremos éxito en esto.

Tal vez cuando comencé, mi primera pasantía fue en AT&T Labs, en el año 2000. Recuerdo muy claramente que, durante la hora del almuerzo en mi pasantía, jugaba go y hablaba sobre cómo podríamos hacer que los modelos de IA pudieran jugar este juego, y cómo era más difícil que el ajedrez, y qué podíamos hacer.

Y, en ese momento, estaba aprendiendo cómo jugar go. Estaba aprendiendo en un tablero de 9 por 9. No sé si alguna vez has aprendido a jugar go,…

ATALLA: No he hecho nada.

NEVILLE: … pero no aprendes a jugar en el tablero grande …

ATALLA: Vaya.

NEVILLE: … porque es, es demasiado difícil incluso para los humanos, correcto. Así que comienzas en este tablero de 9 por 9.

Y yo, de alguna manera, observaba cómo aprendía a jugar y cómo pensaba en cómo los algoritmos aprenderían a jugar. Mientras lo hacíamos, supongo que conjetrábamos sobre cuánto tiempo tomaría la IA para poder hacerlo. Así que es curioso mirar atrás, porque, ya sabes, en AT&T Labs, había muchos de los destacados en investigación de aprendizaje automático y IA. La gente decía: “Oh, llevará 50 años poder hacer esto”. Algunos dicen 100 años. Pero, por supuesto, ahora eso es ya un problema resuelto (se abre en nueva pestaña).

ATALLA: Sí.

NEVILLE: Y así, mirando hacia adelante, hay cosas que podría pensar como investigador, porque es muy difícil para nosotros superar este tipo de límites que vemos en el comportamiento ahora. Hay una tendencia a pensar: “Oh, llevará 10 años”, o “Llevará 25 años”.

Pero creo que, teniendo en cuenta el ritmo de la investigación y el número de personas que investigan en este campo, así como la escala en la que se ejecutan estos modelos, creo que realmente ocurrirá mucho más rápido de lo que habría pensado, como esa persona, ya sabes, ese nuevo estudiante de IA en el año 2000. Así que…

ATALLA: Vaya. Bueno, en ese espíritu, mirando hacia el año 2000, imaginemos ahora saltar 20 años hacia el futuro o simplemente 10, porque las cosas se mueven muy rápido.

NEVILLE: [Risas] Sí.

ATALLA: ¿Qué marca desearías dejar en la investigación en este espacio?

NEVILLE: Creo que las cosas que realmente han sido el hilo común en mi carrera de investigación son pensar en sistemas complejos y cómo hacer que la IA y el aprendizaje automático funcionen en esos sistemas. Así que, incluso ahora, eso es lo en lo que nos enfocamos con la colaboración, y estamos pensando en interacciones multinórdicas entre humanos y IA. Creo… si considero los resultados típicos de la ciencia ficción, creo que tendríamos éxito si, en el entorno laboral, comenzáramos a ver organizaciones formadas por humanos y IA trabajando juntos en equipos para lograr cosas e innovar. Y si podemos hacer que eso funcione correctamente, entonces sentiré que mi investigación ha tenido éxito.

ATALLA: Genial. Bueno, al finalizar aquí, pensé que sería divertido hacer un cuestionario rápido, lo que significa preguntas rápidas y respuestas de bajo riesgo, simplemente lo que se venga a la mente. ¿Te parece bien?

NEVILLE: Claro.

ATALLA: Genial. ¿Qué consejo te ha quedado en la mente o ha cambiado tu perspectiva?

NEVILLE: Um, está bien. Pero dijiste que las respuestas serían breves. [RISA]

Cuando comencé por primera vez en ciencias de la computación, en realidad, Doina Precup (se abre en una pestaña nueva) era la tutora en mi primer curso de ciencias de la computación. Cuando me sentía abrumada y pensaba que no sabía nada, ella me dijo: “Entiende, no tengas miedo de hacer preguntas, porque algunas personas pueden parecer saber lo que está pasando, pero en realidad no saben nada. De hecho, realmente apreciarán que seas lo suficientemente valiente para hacer una pregunta, porque probablemente piensen lo mismo. Y, además, ayudaría tanto a ti como a ellos si, si decides hacer la pregunta”.

Y así, he tomado eso en serio a lo largo de mi carrera. Es muy difícil, ya sabes, tener miedo y sentir que vas a parecer tonto al hacer la pregunta. Pero, sin duda, a medida que avanzaba, cada vez que tenía estos sentimientos de miedo y… pero tenía el coraje de hacer las preguntas, descubrí que la gente realmente apreciaba eso. Y, ya sabes, la gente decía después: “Oh, yo también pensaba lo mismo”. Estoy muy feliz de que hayas hecho esa pregunta. Así que, sé valiente y haz la pregunta.

ATALLA: Genial. ¿Qué lección aprendiste de forma difícil?

NEVILLE: Mira los datos. [LAUGHTER] Mira los datos.

Así que en el aprendizaje automático tenemos una tendencia: esto se aplica a los benchmarks. Tenemos un conjunto de pruebas. Ejecutamos nuestro modelo. Lo aprendemos. Lo aplicamos al conjunto de pruebas. Generalmente obtenemos un número que es nuestra métrica con la que intentamos mejorar. Así que pensamos que si el número aumenta, estamos haciendo bien. Y si el número no cambia, pensamos: “Oh, entonces el problema es demasiado difícil”.

Pero he aprendido de forma dolorosa en varias ocasiones que, cuando las cosas no funcionan, si se toma el tiempo para examinar los datos, es posible que se descubran errores en ellos. Los datos no son lo que se esperaba. Los datos son diferentes de la distribución sobre la cual se entrena el modelo. Así que, cada vez… creo que eso me hace una persona especializada en datos. [RISA] Pero a menudo, cuando las cosas no se comportan como esperamos, vamos a los datos para intentar entenderlo.

ATALLA: Sí. Tiene sentido. Es una buena. Es un desafío.

NEVILLE: [RIEDE] Es difícil recordar.

ATALLA: Sí.

NEVILLE: Y eso… quizás sea algo importante, aunque he aprendido esa lección, …

ATALLA: Claro.

NEVILLE: … He tenido que volar de nuevo esa lección al menos medio dúo veces durante mi carrera.

ATALLA: Sí. Bueno, por otro lado, ¿cuál es una logro del que estás más orgulloso?

NEVILLE: Creo que diría que el hecho de haber logrado obtener un cargo permanente y criar a un niño pequeño al mismo tiempo.

ATALLA: Vaya, sí.

NEVILLE: Tuve a mi hijo justo antes de que empezáramos; el esposo de mi hijo también es profesor, así que antes de establecer los cargos de profesor. Creo que el hecho de haber conseguido un cargo permanente, mi hijo estaba sano y feliz, y logré seguir casada [RIEVE]…

ATALLA: Sí, de hecho.

NEVILLE: … es probablemente el mayor logro que, eh, sí…

ATALLA: Una gran logro, sí. Y la última pregunta: ¿Cuál es una forma en que el arte o la naturaleza ha influido en su trabajo?

NEVILLE: Hmm, no estoy segura de si esto realmente podría considerarse naturaleza, pero una cosa que siempre he observado como persona de IA es cómo los niños, las personas, los animales y los insectos parecen aprender sobre el mundo y el entorno, y cambiar su comportamiento. Así que admito completamente que fui muy interesada, como madre de un niño pequeño. Tomaría, ya sabes, las ideas que obtenemos del aprendizaje automático e intentaría ver si podía ayudar a mi hijo a aprender mejor.

Por ejemplo, si está aprendiendo a intentar, tipo, darle la vuelta cuando era bebé, diría: “Está bien, déjame darte un ejemplo de entrenamiento positivo. [RISA] Como, aquí, toma tus piernas y haz esto”, y…

ATALLA: Sí, sí.

NEVILLE: … y luego observar el efecto en cómo aprendió, pero también observarlo aprender y, además, pensar en cómo eso podría integrarse en los algoritmos y modelos que desarrollamos. Probablemente esa sea la interacción más importante a la que he vuelto constantemente a lo largo de mi carrera.

ATALLA: Es hermoso. Sí.

NEVILLE: Gracias.

ATALLA: Bueno, Jen, gracias por compartir tu historia y tus perspectivas. Ha sido un placer tenerte aquí.

Y a nuestro público, gracias por sintonizarse. Si desea conocer más sobre el trabajo de mis colegas en Microsoft, visite la página de Microsoft Research en aka.ms/research o [MUSIC], consulte también los otros episodios de este podcast. Gracias.

[MUSIC ENDS]


Aprenda más:

El artículo ¿Qué falla hace el IA y qué nos enseña el fracaso apareció primero en Microsoft Research.

Fuente original

Microsoft Research

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original