Microsoft Research

Quels erreurs l’IA commet et quelles échecs nous enseignent-ils

Jennifer Neville ne voulait pas se lancer dans les sciences informatiques — mais c’est précisément là qu’elle est arrivée. Neville explique les étapes qui l’ont menée vers son domaine professionnel idéal, ainsi que son…

Source de l’image · Microsoft Research

Jennifer Neville est une manageuse de recherche associée chez Microsoft qui a construit sa carrière autour de la compréhension et du développement de l’IA pour son utilisation dans la vie réelle. Tout comme les interactions entre humains et IA qu’elle étudie, son parcours initial était plurifacétique : mathématiques, puis physique ; sciences cognitives, puis travail ; et enfin informatique — malgré ses efforts pour éviter ce domaine.

Dans cette conversation avec le Principal Applied Scientist Chad Atalla, elle explore le rôle de l’évaluation des performances qui permet d’étendre les limites du rendement des systèmes d’IA actuels afin de répondre aux besoins des utilisateurs, ainsi que les « échecs surprenants » qui surviennent lorsque les modèles sont testés au-delà des critères traditionnels. Neville partage également des conseils pratiques pour travailler avec les systèmes d’IA actuels, et discute de la raison pour laquelle il est important d’examiner attentivement les données lorsque les résultats dépassent les attentes, ainsi que de ce que les décennies de progrès en IA lui ont appris sur la prédiction de ce qui vient.

D’une trajectoire professionnelle inattendue jusqu’aux frontières de l’interaction et de l’apprentissage en intelligence artificielle, cet épisode pose une question plus large : que pouvons-nous apprendre lorsque le chemin – que ce soit humain ou artificiel – ne se déroule pas comme nous l’espérons ?

Inscrivez-vous au Microsoft Research Podcast :

Transcript

[MUSIQUE]

JENNIFER NEVILLE : Il y avait des moments où j’avais l’impression de tourner en rond. Les choses ne fonctionnaient pas. Je me sentais un peu déçue. Puis nous arrivions à un point où nous apprenions quelque chose, et c’était juste le plaisir émotionnel de cela qui m’attirait vraiment. Le fait de pouvoir comprendre quelque chose que personne d’autre ne comprenait encore…

CHAD ATALLA : Oui…

NEVILLE : … car elle se trouve juste à la frontière de ce que nous savons sur les choses.

Introduction standard : C’est le Podcast de Microsoft Research, où les chercheurs de Microsoft – en promouvant l’avancement grâce à la recherche en science fondamentale et en technologie – explorent qui, comment et ce qui va suivre dans les domaines de l’informatique et de l’IA.

[MUSIQUE FINIE]

CHAD ATALLA : Bonjour, bienvenue. Je suis Chad Atalla, scientifique appliqué au sein de Microsoft Research.

Aujourd’hui, je suis accompagné par Jennifer Neville, responsable de recherche chez Microsoft Research, et professeure titulaire de la chaire Samuel D. Conte en informatique et statistiques à Purdue.

Sa recherche examine l’apprentissage automatique et l’IA pour des domaines interactifs et des données structurées, en examinant comment les points de données sur lesquels sont entraînés les systèmes d’IA influencent leurs comportements, et comment cela correspond à ce que les utilisateurs souhaitent réellement.

Dans le cadre de cette recherche, elle a publié plus de 130 articles, avec plus de 10 000 citations, et a reçu des distinctions telles qu’un prix CAREER de la National Science Foundation, une place dans la liste « 10 to Watch » en intelligence artificielle de IEEE, ainsi que des prix pour les meilleurs articles lors de la Conférence Internationale sur l’Étiquetage de Données et de la Conférence Internationale sur les Représentations Apprentissées.

Ce qui m’étonne le plus dans le travail de Jen, c’est sa prévision et sa capacité à maintenir une ligne de pensée cohérente au fur et à mesure que le domaine de l’IA se développe. J’ai hâte d’entendre davantage sur la manière dont elle a atteint son niveau actuel.

Jen, merci de m’accompagner.

JENNIFER NEVILLE : Merci de m’avoir invitée.

ATALLA: Super. Eh bien, j’aimerais beaucoup savoir comment tu es arrivé ici aujourd’hui. Revenons en arrière. Quand j’étais enfant, je voulais devenir astrophysicien, mais bien sûr, je suis ici avec une formation en informatique. Quand ? vous Sais-tu que tu voulais entrer dans les sciences informatiques ? 

NEVILLE : C’est une bonne question. Quand j’étais enfant, je voulais faire n’importe quoi, sauf la science informatique, car c’était ce que faisait mon père. Je ne voulais pas non plus faire ce qu’il faisait. Alors, quand je suis allée à l’université, j’ai d’abord choisi les mathématiques, puis la physique, mais en réalité, je ne me sentais pas à ma place dans ces filières.

Alors je ai quitté l’université pendant un moment, et quand je suis retourné à l’université, j’ai choisi de me spécialiser en sciences cognitives, qui était également trop compliquée pour moi. Il n’y avait pas assez de mathématiques dans ce domaine. À ce moment-là, si quelqu’un m’avait dit : « L’IA est ce que vous devriez faire, car elle combine les sciences cognitives avec les mathématiques et la pensée computationnelle », je pense que j’aurais économisé beaucoup de temps, [Rires] mais cela n’est pas arrivé.

Et donc, j’ai travaillé pendant un certain temps. Ensuite, lorsque je suis retourné à l’université, j’ai décidé de faire des études en informatique, car ce que je voulais, c’était travailler avec des données et m’occuper des données. C’est alors que j’ai découvert l’IA. Par hasard. Je ne m’étais même pas rendu compte qu’elle faisait partie de l’informatique.

ATALLA : Super. Eh bien, c’est une chose d’entrer dans les sciences informatiques et de vouloir travailler sur les données ou l’IA, et c’est une autre chose de vouloir participer à la recherche dans ce domaine. Alors, quels types de questions ou de grandes idées ont stimulé votre motivation de recherche ?

NEVILLE : Oui, c’est en fait aussi une histoire intéressante. J’ai commencé mes recherches parce que je suivais un programme d’excellence dans mon diplôme de informatique. Et comme partie intégrante de ce programme d’excellence, vous… a Pour mener un projet de recherche [LAUGHTER]. 

ATALLA : C’est obligatoire, oui.

NEVILLE: C’est obligatoire. Alors, lorsque j’ai parlé aux professeurs du projet de recherche à suivre, ils ont dit en réalité : « Eh bien, vous, c’est vous qui devez décider sur quel sujet vous voulez travailler. »

Et à ce moment-là, j’étais intéressé par les données et par l’IA. J’y ai beaucoup réfléchi. J’ai beaucoup lu. Et ce que j’ai décidé de examiner, c’était comment effectuer le mining de données sur des données web interconnectées. Alors, lorsque j’ai compris que c’était la question sur laquelle je voulais travailler, on m’a orienté vers un membre du corps professoral en particulier…

ATALLA : Bonne chose.

NEVILLE : … qui venait de commencer à travailler dans ce domaine naissant, appelé apprentissage relationnel statistique. Et nous avons utilisé cela pour mon projet : j’ai publié un article lors d’un atelier, et j’étais, en quelque sorte, fasciné.

ATALLA : OK, oui.

NEVILLE : Donc, je n’avais pas prévu d’aller à l’université pour poursuivre mes études, mais cette expérience…

ATALLA : Oui.

NEVILLE: … m’a donné envie d’aller à l’université pour continuer.

ATALLA : Bonne idée. Quelle partie de cela vous a le plus captivé ? C’était peut-être l’excitation de la recherche ? Ou plutôt l’ambiance de la conférence et l’aspect de la publication académique ?

NEVILLE : C’était vraiment l’excitation et le processus de recherche. C’était donc un projet long. Il y avait des moments où je me sentais perdue, les choses ne fonctionnaient pas. J’étais un peu déçue. Mais mon conseiller était plutôt bienveillant et positif, en disant : « Non, continuez. Nous apprenons quelque chose. » Et puis, nous arrivions à un point où nous apprenions vraiment quelque chose, et c’était justement l’excitation émotionnelle de cela qui m’attirait. Le pouvoir de comprendre quelque chose que personne d’autre ne comprenait encore…

ATALLA: Oui.

NEVILLE : … parce qu’il se trouve juste à la frontière de ce que nous savons sur les choses, euh… c’est presque comme une drogue, n’est-ce pas ? [Rires] C’est pour cela que cela m’a amené à poursuivre la recherche pendant si longtemps, pour continuer à chercher cette même sensation.

ATALLA : Bien sûr. J’aime ça. Oui, vous avez rejoint Microsoft en 2021 depuis votre travail académique. En fait, vous êtes toujours professeur et vous enseignez et conseillez depuis 20 ans. Quelle a été la motivation pour passer à la recherche dans l’industrie dans votre vie professionnelle ? Et comment décrirait‑vous la différence entre la recherche industrielle et la recherche académique ?

NEVILLE : Ma recherche s’étend, d’une certaine manière, du domaine théorique au domaine appliqué. Lors de ma première vacance académique après avoir obtenu une tenure, beaucoup de collègues que j’avais à … qui se trouvaient au même point dans leur carrière sont allés dans des laboratoires industriels pour leur vacance académique et ne sont jamais revenus à Purdue. J’ai réfléchi à la direction que je voulais prendre, soit davantage en théorie, soit davantage en application. À ce stade de ma carrière, il me semblait plus judicieux d’explorer le côté théorique, car cela pourrait m’amener à revenir à Purdue.

Et donc, je suis allé au Simons Institute à Berkeley pour ma période de retraite académique, et c’était très théorique. C’était une expérience merveilleuse, mais la transition vers l’université était plutôt fluide. Lors de ma deuxième période de retraite académique, j’ai choisi l’autre direction : je suis venu au MSR [Microsoft Research] pour y effectuer une période de retraite académique. Et bien sûr, pouvoir voir comment les algorithmes en théorie se comportent, et comment ils se confronteront en pratique, dans des systèmes réels, avec des utilisateurs réels et des données réelles, c’est difficile à revenir de là. C’est pourquoi je suis encore ici.

ATALLA : Gotcha.

NEVILLE : Je pense que la différence entre la recherche en milieu académique et dans l’industrie dépend… réellement, du but visé, c’est-à-dire de l’endroit où se concentre la recherche. En fait, les questions que l’on pose en milieu académique et dans l’industrie sont très similaires. Mais dans l’industrie, votre capacité à appliquer ces connaissances à grande échelle dans des systèmes réels utilisant des données réelles est bien différente de celle en milieu académique. En milieu académique, on se demande souvent des questions plus abstraites qui couvrent plusieurs domaines différents en même temps. C’est ainsi qu’on obtient des financements auprès de organismes comme DARPA [Defense Advanced Research Projects Agency] ou NSF [National Science Foundation].

Mais dans l’industrie, il est un peu plus facile de se mettre vraiment au travail et de le faire dans les systèmes réels. Ensuite, votre objectif est les produits et les intérêts de l’entreprise. Ainsi, à mesure que ces changements se produisent, peut-être que les types de questions que vous posez ou que vous explorez changent aussi. Je pense donc qu’il est en fait très bien d’être…

ATALLA : Oui.

NEVILLE: … dans les deux cas, n’est-ce pas ? En fait, il y a beaucoup de synergies entre les deux, et je pense qu’il y a de nombreuses opportunités pour aller dans l’industrie avant de revenir à l’université, ou pour commencer dans l’industrie avant de retourner à l’université. Mais pour l’instant, si vous travaillez sur des systèmes d’IA, je pense que l’industrie est vraiment le bon endroit.

ATALLA : Compris. Oui. C’est peut-être un conseil utile pour ceux qui décident de la direction à prendre dans leur carrière en ce moment.

J’ai travaillé chez Microsoft depuis un peu plus de six ans, et j’ai été impliqué dans l’évaluation de l’IA pendant la majeure partie de cette période. Il existe, bien sûr, une multitude de questions fondamentales et de défis épineux dans ce domaine.

Et au début, j’ai découvert votre travail et je me suis rendu compte de son importance, car une partie de votre travail propose des solutions à certains problèmes et aide à identifier ces problèmes. Ma réaction immédiate a été de soulagement : nous avons quelqu’un remarquable comme vous qui travaille sur ces choses, et vous allez vous occuper de tout cela pour nous. Je apprécie vraiment la manière dont vous équilibrez la critique de l’évaluation des IA avec la fourniture de solutions.

Mais je comprends que cela ne représente qu’une petite partie de votre programme de recherche plus large. Alors, comment décrivez-vous le charter de recherche actuel pour l’équipe que vous dirigez ici ?

NEVILLE : Notre équipe s’appelle l’équipe AI Interaction and Learning. Ce sur quoi nous nous concentrons vraiment, c’est de tenter d’aller au-delà des limites du comportement de ces systèmes IA dans des environnements de travail réels. Cela implique l’étude de la frontière des performances des systèmes actuels, de la manière dont les utilisateurs en ressentent les effets dans des workflows réels, et ensuite de comment améliorer ces performances et accroître les performances des modèles pour ce type de tâches — des tâches complexes — sur lesquelles les utilisateurs travaillent.

La raison pour laquelle nous nous concentrons sur l’évaluation est que nous constatons que la manière standard utilisée par les spécialistes du ML et de l’IA consiste en des benchmarks assez simples, en fonction de la manière dont les gens les utilisent réellement dans la pratique. Par conséquent, nous avons trouvé que la première chose à faire est de se demander : qu’est-ce que nous voulons obtenir de ces systèmes ? Et de concevoir des évaluations pratiques pour mettre les systèmes dans de tels environnements. Ainsi, cela inclut des comportements de multi-tour, des environnements collaboratifs et des tâches à long terme que les utilisateurs accomplissent.

Et ensuite, dès que nous pouvons identifier les écarts de performance ou les problèmes qui surviennent dans ces évaluations, cela nous permet également de savoir où, en quelque sorte, théoriquement ou algorithmiquement, nous devons améliorer ces systèmes.

Alors, nous commençons par l’évaluation, mais en fin de compte, ce que nous essayons de faire est développer de meilleurs algorithmes, modèles et méthodes d’estimation…

ATALLA: Oui.

NEVILLE: … pour améliorer les performances des modèles.

ATALLA : Oui, c’est un point de passage vers la compréhension, et donc vers la capacité d’étendre les limites et d’améliorer ces systèmes.

NEVILLE : Oui.

ATALLA : Vous avez mentionné des interactions multiroll et des environnements collaboratifs. Vous avez quelques articles récents qui étudient ces sujets en détail, comme comment les LLM peuvent se perdre dans des conversations multiroll ou comment ils peuvent corrompre les documents dans ces scénarios de travail basés sur la connaissance agentique. Pouvez-vous m’en dire plus sur ces projets de recherche en particulier ?

NEVILLE : Oui. Nous… ce sont des exemples de cas où il fallait, en quelque sorte, avoir des idées innovantes pour organiser l’évaluation afin de pouvoir contrôler et tester le comportement du modèle dans ces scénarios.

Ainsi, pour les conversations à plusieurs turns, nous avons utilisé des benchmarks pour un seul turn. Peut-être devrais-je préciser que l’une des observations faites auprès des utilisateurs en pratique est que ceux-ci underspecifient souvent ce qu’ils cherchent à faire. Ils ne savent pas comment donner une spécification complète. Nous, en tant que scientifiques informatiques et ingénieurs logiciels, oublions parfois cela, mais les utilisateurs ordinaires ne peuvent peut-être pas spécifier pleinement les choses dès le premier turn. Ainsi, ils comprennent progressivement ce qu’ils font au fil des turns, et ajoutent des conditions et des clarifications au cours de tous les turns.

Alors, ce que nous avons fait, c’est de prendre des ensembles de données de benchmark à une seule tournée qui sont publiques, et de modifier les instructions complexes d’une seule tournée spécifiées de manière complète. Nous avons ensuite utilisé des modèles qui simulent les utilisateurs en fournissant cette clarification sur plusieurs tours, puis nous avons étudié comment ces modèles – tous les modèles actuels que nous avons – se comportent lorsque l’on reçoit une telle tâche spécifiée sur plusieurs tours.

Et nous avons constaté que les performances observées dans les scénarios à une seule tour – qui sont très élevées, car bien sûr, nous optimisons cela en tant que constructeurs de modèles – diminuent considérablement lors de plusieurs tours. C’est donc une découverte assez surprenante, car personne n’avait évalué cela auparavant…

ATALLA: Oui.

NEVILLE : … de cette manière auparavant. Mais lorsque nous avons rendu cette recherche accessible au monde entier, les utilisateurs des systèmes ont tous réagi en conséquence, …

ATALLA : Oui… exactement.

NEVILLE: … « Eh bien, c’est mon expérience. Je savais que cela se produisait. Comment, comment pouvons-nous corriger cela ? » Et l’un des… donc nous travaillons sur des méthodes d’apprentissage renforcé pour aider les modèles à apprendre mieux dans ces environnements, afin de corriger ce comportement.

Mais une solution pratique dont nous avons parlé dans le papier est la suivante : si vous finissez par avoir le modèle, et que vous vous sentez confus – si vous avez spécifié quelque chose au cours de plusieurs turns – alors, comme par exemple, arrêtez la conversation, effacez tout, revenez en arrière, et maintenant, compte tenu de ce que vous savez, donnez-lui une seule turne complètement spécifiée…

ATALLA : Je vois, oui.

NEVILLE : … et ensuite, il se comportera mieux dans ce type d’interaction.

Donc, cela montre peut-être que, bien que nous cherchions fondamentalement des améliorations algorithmiques pour les modèles, parfois dans ces projets, nous finissons par obtenir des idées sur la manière dont les utilisateurs pourraient changer leur comportement…

ATALLA : Oui. Exactement.

NEVILLE : … pour obtenir de meilleurs résultats des modèles, comme par exemple, où ils se trouvent actuellement …

ATALLA : Oui…

NEVILLE: … avec leurs performances.

ATALLA : Oui. Nous avons noté qu’un des thèmes de votre recherche est la manière de améliorer ces systèmes afin de les aligner mieux avec ce que les utilisateurs désirent réellement. Vous avez mentionné un cas où les utilisateurs, en réalité, ne précisent souvent pas complètement ce qu’ils veulent lors de leur première interaction, et nous avons des interactions longues à plusieurs tours. Après la publication de cet article, ils ont exprimé une résonance avec cette frustration liée à l’incapacité de se perdre dans les conversations à plusieurs tours.

Comment pensez-vous comprendre les besoins, les désirs et l’expérience des utilisateurs, et en quoi cela se rapporte-t-il à ce que vous faites, comme vous l’avez dit, en simulant un utilisateur, par exemple, pour effectuer ces évaluations multitanalyse plus longues ?

NEVILLE: Oui, c’est… pouvoir voir à grande échelle ce que les utilisateurs essaient de faire et quels sont leurs échecs et succès dans les systèmes est l’un des avantages que l’on obtient si on travaille dans un laboratoire industriel et que l’on aperçoit de tels données à grande échelle.

Ainsi, nous avons effectué beaucoup de travail en interne chez Microsoft sur les groupes de produits, en analysant des données de consommation à grande échelle pour déterminer quels sont les principaux schémas de dysfonctionnements que les utilisateurs rencontrent. Cela… offre une sorte d’insight ou de motivation pour beaucoup du travail que nous effectuons. De plus, il y a de nombreux groupes de produits qui analysent également les succès des utilisateurs, ce qui permet de recommander aux utilisateurs quelles tâches ils pourront accomplir avec succès dans les systèmes que nous avons actuellement.

Je pense que si vous reprenez en mémoire le temps où les moteurs de recherche ont commencé, les gens devaient apprendre à interagir avec eux…

ATALLA: Oui.

NEVILLE : … d’une manière qui permet de récupérer efficacement les informations qu’ils cherchent. Nous avons peut-être oublié que cela s’est produit, car c’était une partie intégrante de ce que tout le monde faisait avant l’apparition de tous ces systèmes d’IA. Mais maintenant, je pense qu’il y a un passage vers des systèmes basés sur la conversation plutôt que vers les moteurs de recherche, et je pense qu’il faudra aussi apprendre de les utilisateurs…

ATALLA : Oui, exactement.

NEVILLE: … dans cet nouvel environnement. Et je pense que analyser les choses qui fonctionnent en termes de ce que font les utilisateurs est une excellente façon de commencer à recommander…

ATALLA : Oui.

NEVILLE: … et donner des cours ou enseigner aux utilisateurs de la même manière.

ATALLA : J’aime que vous souligniez l’utilité de consulter des données réelles, mais qu’est-ce que cela signifie vraiment ? Visez-vous vraiment des données réelles ? Comment la confidentialité est-elle impliquée ? Quels sont vos processus pour utiliser les données de manière responsable dans la réalité ?

NEVILLE : Oh, oui, c’est un bon point. Merci de le souligner. En réalité, nous ne regardons pas les données directement. Nous analysons les données à grande échelle afin d’extraire des schémas de dysfonctionnements ou de succès, de manière qui respecte la confidentialité. Il y a aussi beaucoup de restrictions que nous ne pouvons pas voir directement. Nous ne pouvons que tester des méthodes pour traiter les données dans des environnements très restreints. Et ensuite, ces insights de niveau supérieur, qui respectent la confidentialité, sont ce qui permettra, plus tard, d’appliquer des algorithmes.

Donc, pour être clair, nous ne sommes pas en train de faire un ajustement fin sur vos données ou vos réponses. Cependant, plus de détails vous fournissez dans vos réponses – que ce soit par des informations données, en donnant une description lorsque vous indiquez un “non” ou lors d’une interaction de chat avec les modèles – ces éléments peuvent finalement être transformés en éléments qui amélioreront les modèles, sans que les personnes ne doivent vraiment regarder ce que vous avez fait.

ATALLA : Vous avez noté ce changement, où la recherche devient une modalité dominante, au lieu de ces interactions de chat multitrésoraires. Mais nous observons également que les tâches de travail intellectuel collaboratif et agentique deviennent encore plus pertinentes. Vous avez également travaillé sur ce sujet. Y a-t-il d’autres points intéressants que vous aimeriez partager avec nos auditeurs ?

NEVILLE : Oui. Nous avons donc à la fois du travail théorique qui cherche à caractériser les types de tâches fondamentalement difficiles pour les transformateurs au sein du modèle, ainsi que du travail basé sur la simulation, où nous étudions des tâches complexes réalisées dans des workflows à long terme. Par exemple, on prend des documents et on effectue des modifications répétées sur ceux-ci.

Dans ces environnements, la complexité de la tâche pour les modèles ou même les agents consiste à suivre non seulement ce que l’utilisateur a l’intention de faire au cours de cette activité à long terme, mais aussi à comprendre l’état actuel, quelles informations sont pertinentes, quelles ne le sont pas, et comment les choses ont changé. Et ces sont des aspects que les agents commencent à maîtriser relativement bien, mais certains types de tâches sont plus faciles que d’autres.

ATALLA: Oui.

NEVILLE : Alors, ce que nous examinons est : quels sont les types de tâches dont les complexités deviennent trop grandes pour les agents actuels, et comment y remédier ? Quelle est la meilleure façon d’utiliser l’outil avec les agents ? Est-il préférable d’impliquer une personne humaine ? Comment pouvons-nous savoir si quelque chose ne va pas bien ? Ainsi, même les agents peuvent se surveiller et évaluer s’ils ont répondu correctement ou s’ils doivent revenir à un état précédent. Je pense que tout cela reste des questions ouvertes pour l’instant.

Mais nous avons… nous avons effectivement quelques exemples montrant que encore une fois, nous rencontrons des échecs surprenants à mesure que les workflows deviennent plus longs, car les erreurs, si on ne les détecte pas, peuvent se accumuler…

ATALLA : Oui.

NEVILLE: … et commencer à confondre encore plus l’IA, car celle-ci doit accomplir la tâche à travers des interactions répétées.

ATALLA : Oui, cette expression « échecs surprenants » m’intéresse. Elle implique une expectation de : « Hé, cela devrait fonctionner mieux, et je suis surpris qu’il échoue de cette manière en particulier. » Pensez-vous que vous observez plus de ces erreurs surprenantes, ou est-ce que beaucoup des erreurs, comme on s’y attendait, auraient pu être comprises comme une défaillance de cette nature ?

NEVILLE: Oui, je pense qu’il y a certainement des échecs attendus, car… en fait, bien sûr, les échecs attendus sont moins nombreux, car nous nous efforçons de rendre les systèmes de mieux en mieux.

ATALLA : C’est vrai. Si nous pouvons les attendre, alors nous pouvons les réparer.

NEVILLE: C’est vrai. Mais des phénomènes comme les hallucinations sont des types de problèmes qui ont été identifiés depuis longtemps au sein de la communauté, et il existe des critères et des méthodes spécifiques pour tenter de les réduire.

Je pense que mon équipe finit par chercher des choses qui apparaissent comme des échecs presque surprenants, car ils ne sont pas des échecs traditionnels et sont souvent difficiles à isoler et à montrer qu’ils se produisent. Ils sont très subtils et ne se manifestent pas simplement comme une réponse incorrecte à un problème mathématique ou comme un cas halluciné en droit, c’est-à-dire une opinion juridique. Mais il s’agit plutôt d’une perte subtile de contenu sémantique dans les documents. Et je pense que si je regarde en arrière ce que nous avons exploré avec l’équipe, nous avons une sorte de hypothèse : selon nous, en tant qu’humains, les choses qui sont difficiles pour nous seront également difficiles pour le modèle. En réalité, cela n’est pas souvent le cas, car nous devons penser à ce qui est difficile pour les transformateurs de calculer, et à ce qui est difficile pour leurs systèmes de recherche…

ATALLA : Correct.

NEVILLE : … du contenu sous-jacent.

Et donc, je pense que l’aspect « surprenant » provient de ces choses que nous pourrions penser, en tant qu’humains, être très simples à faire ou de cette idée que, si une tâche a été réussie auparavant, nous pensons qu’elle sera également réussie cette fois-ci. Mais en réalité, ce n’est pas nécessairement le cas pour les LLM. C’est ainsi que l’aspect surprenant apparaît, je pense, grâce à nos propres attentes basées sur l’intelligence humaine concernant ce qui est difficile ou facile.

ATALLA : Oui. Alors, entre cette confusion qui peut exister chez les utilisateurs en fonction de ce qu’ils attendent des systèmes, basée peut-être sur l’intelligence humaine et tout le hype et le marketing qui existe, que voulez-vous que les utilisateurs réels retiennent de cela ? Ou comment les avertir de réfléchir aux capacités et aux attentes qu’ils peuvent avoir pour les systèmes d’IA, étant donné votre travail ici ? Comment peuvent-ils, dans ce bruit, faire preuve de clarté et avoir de meilleures attentes ?

NEVILLE: Oh, c’est une bonne question. Je pense que les systèmes d’IA actuels possèdent de nombreuses capacités qui seront très utiles aux personnes dans les environnements de travail en ce moment. Je pense que la conclusion de notre travail est que l’on ne devrait pas attendre qu’ils soient 100 % efficaces à tous points de vue. Il faut vérifier les réponses qu’on reçoit. Et si on obtient une réponse qui semble incorrecte, on ne doit pas nécessairement supposer que le modèle ne peut rien faire. Mais il faut penser à reformuler la question ou à demander différemment, et on pourrait obtenir une meilleure réponse la prochaine fois.

C’est difficile de le intégrer dans la manière dont nous travaillons actuellement, car je pense qu’on ne peut pas… ils ne sont pas prêts pour que tout soit 100 % délégué à eux. Mais si vous trouvez comment les utiliser dans un flux de travail avec vous, avec supervision et vérification, je pense qu’ils peuvent être très utiles pour effectuer des tâches, améliorer, vous savez, la productivité et la rapidité avec laquelle on accomplit les choses.

Alors… et peut-être autre chose à dire, c’est que vous devez patienter avec nous, car [RIRE] nous développons ces systèmes en temps réel au moment où ils sont mis en ligne. Ainsi, votre utilisation nous aide vraiment à dépasser les limites des modèles, car elle nous fournit des exemples de ce qui est possible et de ce qui ne l’est pas.

Peut-être une autre chose que je voudrais dire est que ce que les utilisateurs ne comprennent peut-être pas, c’est que par le passé, avec les systèmes basés sur la recherche ou les systèmes de recommandation, le type de retour d’information que nous pouvions fournir aux utilisateurs était simplement, en quelque sorte, un « pouce en haut » ou « pouce en bas ». Mais aujourd’hui, nous sommes dans un environnement où nous pouvons fournir des retours d’information beaucoup plus fiables, ce qui est très utile pour améliorer les modèles par la suite.

Donc, si vous travaillez dans un environnement de conversation avec une modèle, comprenez que si quelque chose ne se passe pas bien, il est utile de décrire précisément comment cela s’est passé, afin de… et dans votre interaction textuelle ou verbale, de montrer clairement ce qui a mal tourné, ce que vous attendiez et ce que vous avez obtenu en réalité. Car cela sera utilisé lors de l’mise à jour des modèles. Et donc, vous pouvez considérer cela comme des utilisateurs : votre rôle est de former les modèles pour qu’ils fassent ce que vous auriez voulu qu’ils fassent, mais qu’ils ne peuvent pas faire pour l’instant.

ATALLA : Super. C’est une action incroyable.

Et je suis juste curieux. Vous avez parlé du paradigme du transformer que nous utilisons actuellement pour ce type de systèmes de langage grandeur nature. Où voyez-vous l’évolution de la science des grands systèmes d’IA ? De manière générale, c’est peut-être une question très difficile, mais au moins dans vos intérêts et directions de recherche, où voyez-vous l’évolution de la science de ces systèmes ?

NEVILLE : C’est une question très importante. [RIRE] Je pense que nous… la communauté de recherche essaie simultanément de déterminer si l’architecture Transformer est le modèle sous-jacent approprié à utiliser, car il existe certaines limites connues liées au fonctionnement des calculs dans les transformers. Beaucoup de ces limitations peuvent être résolues par les wrappers autour des modèles – les outils agents que nous avons actuellement autour des modèles – ainsi que par le raisonnement qui se déroule en arrière-plan.

Donc je pense qu’une question ouverte est : jusqu’où pouvons-nous faire face aux limites de l’architecture du transformer avec cette base de wrapper autour d’elle, et quelles nécessités doivent être traitées avec une approche fondamentalement différente…

ATALLA: Oui.

NEVILLE : … une architecture sous-jacente aux choses ? Je pense que nous verrons un développement rapide d’architectures et de modèles alternatifs, ainsi que de coûts externes complexes autour des modèles actuels.

Je pense que dans la prochaine génération de travaux, nous devrons nous concentrer sur des interactions à long terme avec les modèles, et faire en sorte que les modèles comprennent le monde dans lequel ils travaillent d’une manière beaucoup plus tangible qu’actuellement. Mais je suis très optimiste quant aux recherches en cours. Je pense que nous réussirons dans cette direction.

Peut-être en revenant au début de ma carrière, mon premier stage a eu lieu chez AT&T Labs en l’an 2000. Je me souviens très clairement de m’asseoir pendant le déjeuner lors de mon stage pour jouer Go et discuter de la manière dont nous pouvions faire en sorte que les modèles d’IA puissent jouer ce jeu, et que c’était plus difficile que au chess. Je me demande ce que nous pouvions faire.

Et, à ce moment-là, je apprenais à jouer au go. Je m’apprenais sur un plateau de 9 par 9. Je ne sais pas si vous avez déjà appris à jouer au go, …

ATALLA : Je n’ai pas.

NEVILLE : … mais vous ne apprenez pas à jouer sur le grand plateau de jeu …

ATALLA : Wow.

NEVILLE : … car c’est trop difficile même pour les humains, n’est-ce pas ? Alors vous commencez avec cette grille de 9 par 9.

Et je regardais, d’une certaine manière, moi-même apprendre à jouer et réfléchir aux façons dont les algorithmes apprendraient à jouer. Pendant que nous faisions cela, nous devinions, vous savez, combien de temps il faudrait à l’IA pour pouvoir faire ça. C’est amusant de regarder en arrière, car, vous savez, au AT&T Labs, beaucoup des personnalités importantes dans la recherche en apprentissage automatique et en IA étaient présentes. Les gens disaient : « Oh, il faudra 50 ans pour pouvoir faire ça. » Certains disent 100 ans. Mais bien sûr, aujourd’hui, c’est un problème déjà résolu (ouvre dans une nouvelle fenêtre).

ATALLA : Oui.

NEVILLE: Ainsi, en regardant vers l’avenir, il y a des choses auxquelles je pourrais penser en tant que chercheur. Parce qu’il est très difficile pour nous de dépasser ces limites que nous observons actuellement dans le comportement. On a tendance à penser : « Oh, cela va prendre 10 ans », ou « Cela va prendre 25 ans ».

Mais je pense que, compte tenu du rythme de la recherche et du nombre de personnes qui étudient dans ce domaine, ainsi que de l’échelle à laquelle ces modèles sont exécutés, cela va se produire beaucoup plus rapidement que je ne l’aurais imaginé, comme cette personne, vous savez, cet étudiant en IA nouvellement diplômé en 2000. Alors…

ATALLA : Wow. Eh bien, dans cet esprit, en regardant en arrière vers l’année 2000, imaginons maintenant sauter 20 ans vers l’avenir, ou simplement 10, car les choses avancent si vite.

NEVILLE : [Rires] Oui.

ATALLA : Quelle marque souhaiteriez-vous laisser sur la recherche dans cet espace ?

NEVILLE : Je pense que les éléments qui ont vraiment constitué le fil commun de ma carrière de recherche sont la réflexion sur les systèmes complexes et la manière de faire fonctionner l’IA et l’apprentissage automatique dans ces systèmes. Aujourd’hui encore, c’est ce sur quoi nous nous concentrons en collaboration, et nous pensons à l’interaction entre humains et IA. Je pense… si je me plais à imaginer les résultats de la science-fiction, nous réussirions si, dans un environnement de travail, nous voyions des organisations composées de humains et d’IA travailler ensemble en équipes pour accomplir des choses et innover. Et si nous pouvons faire en sorte que cela fonctionne correctement, alors je me sentirai comme si ma recherche avait réussi.

ATALLA : Super. Eh bien, en terminant ici, j’ai pensé qu’il serait amusant de faire un tour rapide, c’est-à-dire des questions rapides et des réponses sans grande importance, tout ce qui vient à l’esprit. Ça vous semble bon ?

NEVILLE : Oui.

ATALLA : Super. Quel est le seul conseil qui vous a marqué ou qui a changé votre perspective ?

NEVILLE : Euh, d’accord. Mais vous avez dit de réponses courtes, non ? [Rires]

Lorsque j’ai commencé mes études en informatique, en fait, Doina Precup (s’ouvre dans une nouvelle fenêtre) était la TA de ma première classe d’informatique. Quand je me sentais submergé et que j’avais l’impression de ne rien savoir… tout le monde connaissait tout, tandis que moi, je ne savais rien, elle m’a dit : « Ne soyez pas timide, posez des questions. Certains pourraient sembler savoir ce qui se passe, mais en réalité, ils ne savent pas vraiment. Ils apprécieront vraiment que vous soyez assez courageux pour poser une question, car ils pensent probablement la même chose. Et cela aidera vous et eux si vous voulez poser la question. »

Et donc, j’ai pris cela en compte au cours de ma carrière. C’est très difficile, vous comprenez, de craindre et de se sentir stupide en posant des questions. Mais sans aucun doute, à chaque fois que j’avais ces sentiments de peur… mais que j’avais le courage de poser les questions, j’ai constaté que les gens étaient vraiment reconnaissants. Et, vous savez, les gens disaient ensuite : « Oh, je pensais la même chose. » Je suis tellement heureuse que vous ayez posé cette question. Alors, soyez courageux et posez la question.

ATALLA : Super. Quelle leçon avez-vous apprise par la douleur ?

NEVILLE : Regardez les données. [LAUGHTER] Regardez les données.

Ainsi, dans le apprentissage automatique, nous avons une tendance – c’est valable pour les benchmarks. Nous disposons d’un ensemble de test. Nous exécutons notre modèle. Nous l’apprenons. Nous l’appliquons à cet ensemble de test. En général, nous obtenons un nombre qui constitue notre métrique, que nous essayons d’améliorer. Si ce nombre augmente, nous pensons que nous avons réussi. Si le nombre ne varie pas, nous pensons : « Oh, alors le problème est trop difficile. »

Mais j’ai appris à plusieurs reprises par la douleur que, lorsque les choses ne fonctionnent pas, si on prend le temps d’examiner les données, on peut réellement découvrir qu’il y a des erreurs dans les données. Les données ne sont pas ce que l’on attendait. Elles diffèrent de la distribution sur laquelle on entraîne le modèle. Ainsi, tout fois… je suppose que cela fait de moi une personne qui s’intéresse aux données. [RIRE] Mais souvent, lorsque les choses ne se passent pas comme nous l’espérons, on va examiner les données pour essayer de comprendre.

ATALLA : Oui. Ça fait sens. C’est une bonne épreuve. C’est une épreuve difficile.

NEVILLE : [RIRES] Difficile à retenir.

ATALLA : Oui.

NEVILLE : Et c’est… peut-être que c’est une chose importante, même si j’ai appris cette leçon, …

ATALLA: Oui.

NEVILLE : … J’ai dû reapprendre cette leçon au moins une demi-douzaine de fois au cours de ma carrière.

ATALLA : Oui. Eh bien, d’un autre côté, quelle réalisation vous fait le plus plaisir ?

NEVILLE : Je pense que je dirais que c’est le fait d’avoir réussi à obtenir une tenure et de prendre soin d’un petit enfant en même temps.

ATALLA : Wow, oui.

NEVILLE : J’ai eu mon fils juste avant que nous commencions – le mari de ma fille est également enseignant – donc avant que nous n’établissions les postes de professeur. Je pense que le fait d’avoir obtenu une tenure, mon fils étant en bonne santé et heureux, et moi ayant réussi à rester mariée [RIEUSE]…

ATALLA: Oui, en effet.

NEVILLE : … est probablement la plus grande réalisation, euh… oui…

ATALLA : Une grande réalisation, oui. Et dernière question : quelle est une manière dont l’art ou la nature a influencé votre travail ?

NEVILLE : Hmm, je ne suis pas sûre que cela puisse vraiment être considéré comme de la nature, mais une chose que j’ai toujours remarquée en tant qu’IA, c’est comment les enfants, les gens, les animaux et les insectes semblent apprendre sur le monde et l’environnement, et changer leur comportement. J’admettons donc pleinement que j’étais très intéressée, en tant que parent d’un petit enfant, par les idées que nous avons issues du apprentissage automatique, afin de voir si je pouvais aider mon fils à apprendre mieux.

Par exemple, si, lorsqu’il était bébé, il apprenait à essayer de se retourner, je dirais : « OK, laissez-moi vous donner un exemple de formation positive. [Rires] Comme ça, ici, prenez vos jambes et faites ceci », et…

ATALLA: Oui, oui.

NEVILLE : … et ensuite observer l’effet sur la manière dont il a appris, mais aussi en le regardant apprendre, et ensuite réfléchir à comment cela pourrait être intégré dans les algorithmes et les modèles que nous avons développés. C’est probablement l’interaction la plus importante à laquelle je me suis référencé constamment au cours de ma carrière.

ATALLA : C’est beau. Oui.

NEVILLE : Merci.

ATALLA : Eh bien, Jen, merci de partager votre histoire et vos observations. C’est un plaisir d’avoir vous ici.

Et à notre public, merci d’être là. Si vous souhaitez en savoir plus sur le travail de mes collègues chez Microsoft, consultez la page de Microsoft Research à aka.ms/research ou [MUSIC] pour écouter les autres épisodes de ce podcast. Merci.

[MUSIQUE FINIE]


Apprendre plus :

La publication « Ce que l’IA fait de mal et ce que les échecs nous enseignent » a été publiée en premier dans Microsoft Research.

Source originale

Microsoft Research

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original