Jennifer Neville ist eine Partner-Research-Managerin bei Microsoft, die ihre Karriere darauf aufgebaut hat, KI für den realen Einsatz zu verstehen und voranzutreiben. Genau wie die menschliche-KI-Interaktionen, die sie untersucht hat, war auch ihr Berufsweg in der Anfangsphase mehrfach umschlagbar: Mathematik, dann Physik; kognitive Wissenschaften, dann Arbeit; und schließlich Informatik – obwohl sie alles tat, um dieses Feld zu meiden.
In dieser Unterhaltung mit dem leitenden angewandten Wissenschaftler Chad Atalla untersucht sie die Rolle der Bewertung von Leistungen bei der Erhöhung der Leistungsgrenzen heutiger KI-Systemen, um den Bedürfnissen der Nutzer gerecht zu werden, sowie die „überraschenden Fehler“, die entstehen, wenn Modelle über traditionelle Benchmarks getestet werden. Neville teilt auch praktische Ratschläge für die Arbeit mit aktuellen KI-Systemen und diskutiert, warum es wichtig ist, Daten genau zu betrachten, wenn die Ergebnisse überraschen, und was die Jahrzehnte des Fortschritts in der KI ihr vermittelt haben, was als Nächstes kommen könnte.
Von einer unerwarteten Karriereentwicklung bis zur Grenze der AI-Interaktion und -Lernung stellt dieses Kapitel eine größere Frage: Was können wir lernen, wenn der Weg – sei er menschlich oder künstlich – nicht so verläuft, wie wir es erwarten?
Abonnieren Sie den Microsoft Research Podcast:
Transkript
[MUSIK]
JENNIFER NEVILLE: Es gab Zeiten, in denen ich das Gefühl hatte, nur vorherigen Schritten zu folgen. Die Dinge funktionierten nicht. Ich wurde etwas enttäuscht. Dann kamen wir an einen Punkt, an dem wir wirklich etwas lernten – und gerade die emotionale Freude darüber war es, was mich faszinierte. Die Möglichkeit, etwas zu verstehen, das noch niemand anders verstanden hatte …
CHAD ATALLA: Sicher …
NEVILLE: … weil es gerade an der Grenze dessen liegt, was wir über Dinge wissen.
Standard-Einführung: Dies ist das Microsoft Research Podcast, auf dem Microsoft-Forscher – durch Grundlagenforschung und Technologie-Entwicklung voranschreitend – untersuchen, wer, wie und was als Nächstes in der Informatik und KI kommt.
[MUSIK ENDE]
CHAD ATALLA: Hallo, willkommen. Ich bin Chad Atalla, ein angewandter Wissenschaftler bei Microsoft Research.
Heute bin ich von Jennifer Neville begleitet, einer Partner-Research-Managerin bei Microsoft Research und Professorin für Informatik und Statistik an der Purdue University.
Ihre Forschung untersucht maschinelles Lernen und KI für interaktive Bereiche und strukturierte Daten, und sie untersucht, wie die Datenpunkte, auf denen die KI-Systeme trainiert werden, deren Verhalten beeinflussen und wie dies mit dem übereinstimmt, was die Benutzer tatsächlich wollen.
In diesem Forschungsbereich hat sie mehr als 130 Artikel veröffentlicht, die über 10.000 Zitate erhalten haben, und erhielt Auszeichnungen wie den National Science Foundation CAREER Award, einen Platz in der IEEE’s „10 to Watch“-Liste im Bereich Künstliche Intelligenz (öffnet in neuem Tab) sowie Auszeichnungen für den besten Artikel von der International Conference on Data Mining (öffnet in neuem Tab) und der International Conference on Learning Representations.
Was mich am meisten an Jen’s Arbeit beeindruckt, ist ihre Voraussicht und ihre Fähigkeit, eine klare Linie zu behalten, die während der Entwicklung des Bereichs Künstlicher Intelligenz konstant bleibt. Ich bin gespannt darauf, mehr über ihre Wege zu erfahren, auf denen sie heute steht.
Jen, danke, dass du mit mir zusammen bist.
JENNIFER NEVILLE: Danke, dass Sie mich eingeladen haben.
ATALLA: Wahnsinn. Nun, ich würde gerne erfahren, wie du heute hier angekommen bist. Und lass uns zurückgehen. Als ich noch ein Kind war, wollte ich Astrophysiker werden, aber natürlich bin ich jetzt mit einem Hintergrund in Informatik. Wann hast du erfahren, dass du in die Informatik gehen wolltest?
NEVILLE: Das ist eine gute Frage. Ich … als ich aufwuchs, wollte ich alles anders machen als Informatik – schließlich war das das, was mein Vater tat – und ich wollte alles anders machen als das, was mein Vater machte. Als ich an der Universität war, studierte ich zunächst Mathematik und dann Physik, aber ich fühlte mich wirklich nicht wohl bei diesen Studiengängen.
Also habe ich eine Zeit lang die Universität abgebrochen, und als ich wieder zurückkehrte, entschied ich mich stattdessen für Wissenschaft der kognitiven Erkenntnisse – auch das war für mich zu schwierig. Es gab nicht genug Mathematik dazu. In diesem Moment, wenn jemand mir gesagt hätte: „KI ist etwas, was man tun sollte, weil sie die Wissenschaft der kognitiven Erkenntnisse mit Mathematik und computergestütztem Denken verbindet“, glaube ich, hätte ich viel Zeit sparen können [LAUGHTER], aber das geschah nicht.
Und so arbeitete ich eine Weile. Als ich dann wieder zur Schule zurückkehrte, beschloss ich, Informatik zu studieren, denn das, was ich tun wollte, war, mit Daten zu arbeiten und mit Daten umzugehen. Und da fand ich AI – einfach zufällig. Ich erkannte nicht einmal wirklich, dass es Teil der Informatik war.
ATALLA: Großartig. Nun, es ist eine Sache, Informatik zu studieren und an Daten oder KI zu arbeiten, aber eine andere Sache ist, an der Forschung in diesem Bereich teilzunehmen. Welche Arten von Fragen oder großen Ideen haben Ihre Forschungsmotivation ausgelöst?
NEVILLE: Ja, das ist auch eine interessante Geschichte. Ich habe mit der Forschung begonnen, weil ich im Hochschulschwerpunktprogramm meines Studiums der Informatik war. Als Teil des Hochschulschwerpunktprogramms… haben für ein Forschungsprojekt [LAUGHTER].
ATALLA: Es ist zwingend erforderlich, ja.
NEVILLE: Es ist obligatorisch. Als ich mit den Professoren über das Forschungsprojekt sprach, sagten sie tatsächlich: „Nun, du musst selbst entscheiden, worauf du arbeiten möchtest.“
Und in diesem Moment war ich an Daten interessiert und auch an KI. Ich dachte viel nach. Ich las viel. Und was ich beschloss, zu untersuchen, war, wie man Datenminen mit vernetzten Webdaten durchführt. Als ich entschied, dass dies die Frage war, auf die ich arbeiten wollte, wurde ich auf einen bestimmten Professor hingewiesen…
ATALLA: Gut.
NEVILLE: … der zu dieser Zeit gerade mit der Arbeit in diesem neuen Bereich begonnen hatte, der als statistisches relationales Lernen bekannt war. Und ich verwendete das für mein Projekt – ich veröffentlichte eine Arbeit auf einem Workshop und war einfach fasziniert.
ATALLA: Okay, ja.
NEVILLE: Ich hatte nicht vor, nach dem Studium weiterzubilden, aber diese Erfahrung…
ATALLA: Ja.
NEVILLE: … machte mich dazu, an einer Graduate School weiterzumachen und fortzufahren.
ATALLA: Gut. Welcher Teil davon hat dich beeindruckt? War es vielleicht die Freude am Forschungsprozess? Oder die Atmosphäre der Konferenz und wie akademische Publikationen aussehen?
NEVILLE: Es war wirklich die Aufregung und der Prozess des Forschens. Es war also ein langer Projekt. Es gab Zeiten, in denen ich das Gefühl hatte, nur Dampf abzulassen – die Dinge funktionierten nicht. Ich wurde etwas enttäuscht. Aber mein Berater war eher unterstützend und positiv, sagte: „Nein, mach weiter. Wir lernen etwas.“ Und dann kamen wir zu einem Punkt, an dem… hatte Etwas zu lernen – und gerade die emotionale Erfahrung daran war es, die mich wirklich faszinierte. Die Möglichkeit, etwas zu verstehen, was noch niemand anders verstanden hat…
ATALLA: Klar.
NEVILLE: … weil es genau an der Grenze liegt, was wir über Dinge wissen – äh, es ist fast wie ein Medikament, oder? [LAUGHTER] Deshalb hat mich das lange Zeit in die Forschung gehalten, immer wieder, immer wieder … nach diesem Gefühl zu suchen.
ATALLA: Gut gemacht. Ja, ich liebe das. Du bist 2021 aus der akademischen Welt bei Microsoft eingestiegen. Tatsächlich bist du immer noch Professor und hast seit 20 Jahren Unterricht und Beratung gelebt. Was die Veränderung in deinem beruflichen Leben motivierte, war die Forschung. in der IndustrieUnd wie würden Sie den Unterschied zwischen Industrieforschung und akademischer Forschung beschreiben?
NEVILLE: Meine Forschung umfasst etwas das Spektrum von Theorie bis Anwendung. Als ich meine erste Sabbatzeit nach der Ernennung hatte, gingen viele Kollegen, die ich am … hatte, in Industrielabore für ihre Sabbatzeit und kamen nie wieder nach Purdue zurück. Ich dachte darüber nach, in welche Richtung ich gehen möchte – mehr Theorie oder mehr Anwendung – und ich dachte, dass es besser wäre, die Theorieseite zu erkunden, denn dann könnte ich vielleicht tatsächlich nach Purdue zurückkehren.
Und so ging ich zum Simons Institute in Berkeley für meine Sabbatzeit, und das war sehr theoretisch. Es war eine großartige Erfahrung, aber die Rückkehr zur akademischen Arbeit war etwas reibungslos. Bei meiner zweiten Sabbatzeit ging ich in die andere Richtung – ich kam zu MSR [Microsoft Research] und hatte dort eine Sabbatzeit. Und natürlich ist es schwierig, zu sehen, wie Algorithmen in der Theorie eigentlich funktionieren – und wie sie in der Praxis, in echten Systemen, mit echten Benutzern und echten Daten verhalten sind. Deshalb bin ich auch noch hier.
ATALLA: Erkannt.
NEVILLE: Ich denke, der Unterschied zwischen Forschung in der Wissenschaft und in der Industrie hängt davon ab, wohin die Forschung gerichtet ist. Das beeinflusst tatsächlich den Ansatz. Grundlegend sind die Fragen, die man in beiden Bereichen stellt, aber in der Industrie ist die Fähigkeit, diese auf großer Skala in realen Systemen und mit echten Daten anzuwenden, sehr anders als in der Wissenschaft. In der Wissenschaft stellen man eher abstrakte Fragen, die viele verschiedene Bereiche gleichzeitig abdecken. So bekommt man Finanzmittel von Institutionen wie DARPA [Defense Advanced Research Projects Agency] und NSF [National Science Foundation].
Aber in der Industrie ist es etwas einfacher, sich einfach die Hände schmutzig zu machen und das in den echten Systemen zu tun. Dann ist das Ziel eher die Produkte und die Interessen des Unternehmens. Und so, als … ändern sich auch die Arten der Fragen, die man stellt oder untersucht. Ich finde es also wirklich großartig, dass man …
ATALLA: Ja.
NEVILLE: … an beiden Orten, richtig? Es gibt viele Synergien zwischen den beiden Bereichen, und ich denke, es gibt viele Möglichkeiten, in der Industrie zu arbeiten und anschließend wieder in die Wissenschaft zurückzukehren – oder in der Wissenschaft zu starten und dann in die Industrie zu gehen. Aber im Moment, wenn man an AI-Systemen arbeitet, denke ich, dass die Industrie wirklich der richtige Ort ist.
ATALLA: Verstanden. Ja. Vielleicht eine nützliche Empfehlung für diejenigen, die jetzt entscheiden müssen, welchen Weg sie in ihrer Karriere einschlagen sollen.
Ich bin seit etwas mehr als sechs Jahren bei Microsoft und habe die meiste Zeit damit verbracht, die Bewertung von KI-Systemen zu bearbeiten. Natürlich gibt es in diesem Bereich eine Reihe schwieriger grundlegender Fragen und Herausforderungen.
Und zunächst stieß ich auf Ihre Arbeit und wurde über deine Arbeit informiert, weil ein Teil deiner Arbeit Lösungen für bestimmte Probleme vorschlägt und dabei hilft, diese Probleme aufzuzeigen. Meine sofortige Reaktion war Erleichterung, dass es jemanden Wunderbaren wie Sie gibt, der an diesen Dingen arbeitet – und dass Sie sich um das kümmern werden. Ich schätze wirklich, wie Sie die Kritik an der AI-Evaluation mit der Bereitstellung von Lösungen in Einklang bringen.
Aber ich verstehe, dass das nur ein kleiner Teil des umfassenderen Forschungsplans ist. Wie würden Sie also den aktuellen Forschungsplan der Team, das Sie hier leiten, beschreiben?
NEVILLE: Unser Team wird als AI Interaction and Learning-Team bezeichnet. Was uns wirklich beschäftigt, ist es, die Grenzen des Verhaltens dieser AI-Systeme in realistischen Arbeitsumgebungen zu erweitern. Das bedeutet, die Grenzen der Leistung der aktuellen Systeme zu untersuchen, wie die Benutzer dies in der Praxis mit echten Arbeitsabläufen erleben, und wie wir diese Leistung verbessern können, um die Leistung der Modelle für solche komplexen Aufgaben – Aufgaben, mit denen Benutzer arbeiten – zu steigern.
Der Grund, warum wir uns auf die Bewertung konzentrieren, ist, dass wir festgestellt haben, dass die Standardmethode, mit der Menschen aus ML und AI bewertet werden, durch Benchmarks erfolgt, die im Vergleich zur tatsächlichen Anwendung recht einfach sind. Deshalb finden wir, dass das Erste, was man wirklich tun muss, ist zu fragen: Was wollen wir von diesen Systemen? Und anschließend sollen praktische Bewertungen entwickelt werden, um die Systeme in solchen Umgebungen einzusetzen. Das bedeutet also Dinge wie das Multiturn-Verhalten, kooperative Umgebungen und langfristige Aufgaben, die die Benutzer erledigen.
Und dann, sobald wir erkennen können, wo die Leistungsunterschiede oder Probleme in diesen Evaluierungen auftreten, haben wir auch die Kenntnis darüber, wo – theoretisch oder algorithmisch – wir diese Systeme verbessern müssen.
Also beginnen wir mit der Bewertung, aber letztendlich versuchen wir, bessere Algorithmen, Modelle und Schätzungsmethoden zu entwickeln…
ATALLA: Klar.
NEVILLE: … um die Leistung der Modelle zu verbessern.
ATALLA: Ja, es ist ein Tor zur Verständnisfähigkeit und somit auch dazu, die Grenzen zu überschreiten und diese Systeme zu verbessern.
NEVILLE: Ja.
ATALLA: Sie haben also über Multiturn-Interaktionen und kollektive Umgebungen gesprochen. Es gibt einige aktuelle Artikel, die sich speziell mit diesen Themen beschäftigen, wie zum Beispiel wie LLMs in Multiturn-Gesprächen verloren gehen können oder wie sie in solchen, in gewisser Weise agentischen Wissensarbeit-Szenarien Dokumente verfälschen können. Können Sie mir etwas mehr über diese Forschungsprojekte erzählen?
NEVILLE: Sicher. Wir … das sind Beispiele für Fälle, in denen wir innovative Ideen haben mussten, wie man die Bewertung einrichtet, um das Verhalten des Modells in diesen Szenarien tatsächlich kontrollieren und testen zu können.
Für mehrfachwörtliche Gespräche haben wir also einzelwörtliche Benchmarks verwendet – vielleicht sollte ich noch hinzufügen: Einer der Beobachtungen, die wir bei Nutzern in der Praxis machen, ist, dass sie oft unausführlich beschreiben, was sie versuchen zu tun. Sie wissen nicht einmal, wie man eine vollständige Beschreibung geben sollte. Wir als Computerwissenschaftler und Softwareentwickler vergessen das manchmal, aber normale Nutzer können es vielleicht nicht in der ersten Runde vollständig beschreiben. Deshalb versuchen sie, im Laufe mehrerer Runden herauszufinden, was sie tun wollen, und fügen während der Gespräche immer wieder Bedingungen und Erklärungen hinzu.
Also haben wir Datenmengen für einzelne Durchgänge verwendet, die öffentlich verfügbar sind, und die vollständig spezifizierten einzelnen komplexen Durchgänge von Anweisungen geändert. Anschließend haben wir Modelle entwickelt, die Benutzer, die diese Klarstellung über mehrere Durchgänge erbringen, simulieren, und untersucht haben, wie diese Modelle – wie alle der aktuellen Modelle – sich verhalten, wenn eine solche Aufgabe über mehrere Durchgänge gestellt wird.
Und wir stellten fest, dass die Leistung, die wir in Szenarien mit einem einzigen Durchgang beobachten – die sehr hoch ist, weil wir natürlich als Modellbauer darauf optimieren – tatsächlich über mehrere Durchgänge stark abnimmt. Das war also eine ziemlich überraschende Erkenntnis, denn bisher hatte niemand dies untersucht…
ATALLA: Klar.
NEVILLE: … auf diese Weise zuvor. Aber als wir diese Forschung der Welt offenlegten, reagierten die Benutzer der Systeme alle darauf …
ATALLA: Klar … ja.
NEVILLE: … „Nun, das ist meine Erfahrung. Ich wusste, dass das passiert. Wie können wir das beheben?“ Und eines davon ist … also arbeiten wir mit Methoden des Verstärkungslernens, um den Modellen zu helfen, in diesen Umgebungen besser zu lernen und dieses Verhalten zu korrigieren.
Aber eine praktische Lösung, über die wir in dem Artikel gesprochen haben, ist: Wenn man am Ende das Modell hat und irgendwie verwirrt wird – wenn man etwas über mehrere Gesprächssitzungen angegeben hat – dann einfach das Chat stoppen, alles löschen, zurückkehren und anschließend, basierend auf dem, was man weiß, eine vollständig spezifizierte einzige Sitzung starten…
ATALLA: Ich verstehe, ja.
NEVILLE: … und dann wird es in solcher Interaktion besser verhalten.
Vielleicht zeigt das also, dass wir zwar im Grunde nach algorithmischen Verbesserungen für die Modelle suchen, aber manchmal in diesen Projekten zu Einsichten kommen, wie Benutzer ihr Verhalten verändern könnten…
ATALLA: Klar. Ja.
NEVILLE: … um bessere Ergebnisse aus den Modellen zu erzielen, wie zum Beispiel die aktuellen Ergebnisse …
ATALLA: Ja …
NEVILLE: … mit ihrer Leistung.
ATALLA: Ja. Wir haben festgestellt, dass eines der Themen Ihrer Forschung darin besteht, wie wir diese Systeme verbessern können, damit sie besser mit dem übereinstimmen, was die Benutzer tatsächlich wollen. Sie erwähnten einen Fall: „Hey, wir wissen, dass Benutzer in der Realität oft nicht vollständig beschreiben, was sie wollen, als sie das erste Mal etwas sagen – und wir haben diese langen, mehrmalige Interaktionen.“ Nachdem Sie diesen Artikel veröffentlicht haben, zeigten die Leute Resonanz mit dieser Frustration bezüglich des Verlusts im mehrfachgesprachten Dialog.
Wie denkt man über das Verstehen der Wünsche, Bedürfnisse und Erfahrungen der Benutzer nach, und wie hängt das mit dem zusammen, was man tut – wie Sie sagten, indem man einen Benutzer simuliert, um beispielsweise diese längeren Mehrfachantwort-Evaluierungen durchzuführen?
NEVILLE: Ja, es ist eine der Vorteile, wenn man in einem Industrielabor arbeitet und so viele Daten in großer Größe sehen kann – nämlich zu erkennen, was die Nutzer versuchen zu tun und welche Fehler sowie Erfolge sie in den Systemen haben.
Wir haben also viel Arbeit mit den Produktgruppen hier im Inneren von Microsoft geleistet – wir analysieren in großem Umfang Verbraucherdaten, um herauszufinden, welche Hauptmuster von Fehlern es gibt, die die Benutzer erleben. Und das … vermittelt die Art von Erkenntnissen oder Motivation für den Großteil der Arbeit, die wir verrichten. Es gibt auch viele großartige Produktgruppen, die die Erfolge der Benutzer analysieren – dadurch können wir den Benutzern sogar empfehlen, welche Aufgaben sie in den Systemen, die wir jetzt haben, erfolgreich erledigen können.
Ich denke, wenn man zurückdenkt, als die Suchmaschinen erst begannen, mussten die Menschen lernen, wie sie mit den Suchmaschinen interagieren können…
ATALLA: Klar.
NEVILLE: … auf eine Weise, die es ermöglicht, die Informationen effektiv zu erhalten, nach denen sie suchen. Wir haben vielleicht vergessen, dass das früher der Fall war, weil es einfach ein Teil dessen war, was alle vor den AI-Systemen taten. Aber jetzt glaube ich, dass es eine Übergangsphase von Suchmaschinen zu diesen chatbasierten Systemen gibt, und ich denke, es wird auch eine Art Lernen seitens der Nutzer geben …
ATALLA: Richtig, ja.
NEVILLE: … in dieser neuen Umgebung. Und ich denke, die Analyse der Dinge, die erfolgreich sind, was die Benutzer tun, ist eine großartige Möglichkeit, Empfehlungen zu geben …
ATALLA: Ja.
NEVILLE: … und das Unterrichten oder Lehren der Benutzer auf dieselbe Weise.
ATALLA: Ich mag es, wie du die Nützlichkeit des Betrachts von echten Daten hervorhebst – aber was bedeutet das eigentlich? Betrachtest du wirklich echte Daten? Wie ist dabei die Privatsphäre beteiligt? Welche Prozesse hast du, um Daten in der Realität verantwortungsvoll zu nutzen?
NEVILLE: Oh, ja, das ist eine gute Punkt. Danke, dass du das ansprechen hast. Wir betrachten eigentlich nicht die Daten. Wir analysieren die Daten auf großer Skala, um Muster von Fehlern oder Erfolgen auf eine Weise zu extrahieren, die die Privatsphäre schützt. Es gibt auch viele Einschränkungen, die wir nicht direkt sehen können. Wir können nur bestimmte Methoden verwenden, um die Daten in sehr eingeschränkten Umgebungen zu verarbeiten. Und dann sind es diese höheren-Ebene-Erkenntnisse, die die Privatsphäre schützen, die wiederum die Grundlage für das, was wir später algorithmisch tun werden, bilden.
Also, nur zur Klarstellung: Wir führen keine Feinjustierung an Ihren Daten oder Ihren Antworten durch. Stattdessen können Sie in Ihren Antworten mehr Details liefern – sei es durch gespendete Informationen, wenn Sie eine negative Antwort geben und eine Beschreibung geben, oder im Zusammenhang mit der Interaktion mit den Modellen. Diese Daten können letztendlich zu etwas werden, das dazu beiträgt, die Modelle zu verbessern – und zwar nicht dadurch, dass Menschen tatsächlich sehen, was Sie getan haben.
ATALLA: Und Sie haben diesen Wandel von der Suche als dominanter Modus zu diesen mehrschichtigen Chat-Interaktionen festgehalten. Aber jetzt sehen wir auch, dass agentische und kooperative Wissensarbeit-Tasks noch wichtiger werden – und Sie haben dort auch Arbeit geleistet. Gibt es noch andere interessante Erkenntnisse, die Sie gerne mit unseren Zuhörern teilen würden?
NEVILLE: Ja. Wir haben also sowohl theoretische Arbeiten, die versuchen, die Arten von Aufgaben zu beschreiben, die für Transformer grundlegend schwierig sind, innerhalb des Modells zu berechnen, als auch mehr simulationsbasierte Arbeiten, bei denen wir komplexe Aufgaben betrachten, die in langfristigen Arbeitsabläufen durchgeführt werden. Dabei nehmen Sie beispielsweise Dokumente und führen wiederholte Bearbeitungen an diesen Dokumenten durch.
In diesen Umgebungen ist die Komplexität der Aufgabe für die Modelle oder sogar die Agenten darin besteht, nicht nur zu verfolgen, was der Benutzer im Rahmen dieser langfristigen Arbeitsaktivität vorhat, sondern auch zu verstehen, welcher Zustand aktuell ist, welche Informationen relevant sind, welche nicht relevant sind und wie sich die Situation verändert hat. Und das sind Dinge, bei denen Agenten zunehmend ziemlich gut sind – aber es gibt bestimmte Arten von Aufgaben, die einfacher sind als andere.
ATALLA: Klar.
NEVILLE: Und was wir untersuchen ist: Welche Arten von Aufgaben sind so komplex, dass die aktuellen Agenten nicht mehr zurechtkommen – und wie können das gelöst werden? Wie ist die beste Art, den Tools mit den Agenten zu nutzen? Ist es besser, eine Person einzubeziehen? Wie können wir erkennen, ob etwas schiefgegangen ist? Es gibt also auch die Möglichkeit, dass die Agenten sich selbst überwachen und beurteilen, ob sie etwas richtig beantwortet haben oder ob sie in einen vorherigen Zustand zurückkehren sollten. Ich denke, das sind alle noch offene Fragen.
Aber wir haben … wir haben tatsächlich einige Arbeiten, die zeigen, dass wieder erstaunliche Fehler auftreten, je länger wir in diesen Workflows vordringen, weil Fehler, wenn man sie nicht erkennt, anhäufen können …
ATALLA: Ja.
NEVILLE: … und beginnt, das AI noch mehr zu verwirren, da es durch wiederholte Interaktionen die Aufgabe ausführen muss.
ATALLA: Ja, dieser Ausdruck „überraschende Fehler“ ist für mich interessant. Er impliziert die Erwartung: „Hey, das sollte besser funktionieren, und ich bin überrascht, dass es auf diese spezielle Weise fehlschlug.“ Fühlst du dich eher als jemanden, der mehr solcher überraschenden Fehler sieht, oder sind viele der Fehler so, wie man erwarten würde – man würde verstehen, dass sie auf diese oder jene Weise fehlschlagen?
NEVILLE: Ja, ich denke, es sind definitiv erwartete Fehler vorhanden, weil… zwar, natürlich gibt es weniger erwartete Fehler, da wir uns bemühen, die Systeme immer besser zu machen.
ATALLA: Richtig. Wenn wir sie erwarten können, dann können wir sie reparieren.
NEVILLE: Richtig. Aber Dinge wie Halluzinationen sind die Art von Fehlern, die seit langem in der Gemeinschaft bekannt sind. Es gibt spezifische Benchmarks und Methoden, um diese Phänomene zu verringern.
Ich denke, meine Teammitglieder suchen nach Dingen, die als fast überraschende Fehler auftreten – weil es keine traditionellen Fehler sind und sie oft schwer zu isolieren sind. Sie sind sehr subtil und zeigen sich nicht einfach als eine falsche Antwort auf ein mathematisches Problem oder als ein halluziniertes Fallbeispiel in einem Rechtsgutachten. Es handelt sich dabei um eine Art subtiler Verlust des semantischen Inhalts in den Dokumenten. Und ich denke, wenn ich zurückblicke auf das, was wir mit dem Team untersucht haben, haben wir eine Art Hypothese: Wir glauben, dass für Menschen die Dinge, die schwierig sind, auch für Modelle schwierig sein werden. Tatsächlich ist das jedoch nicht oft der Fall, denn wir müssen darüber nachdenken, was für Transformer eigentlich schwer ist zu berechnen, was für ihre Suchsysteme schwer ist zu finden …
ATALLA: Richtig.
NEVILLE: … aus dem zugrunde liegenden Inhalt.
Und daher denke ich, dass der „Überraschungseffekt“ aus den Dingen entsteht, die wir als Menschen für sehr einfach halten könnten oder von denen wir glauben, dass, wenn eine Aufgabe zuvor richtig erledigt wurde, wir jetzt wieder zuverlässig glauben, dass dieselbe Aufgabe auch richtig erledigt werden sollte. Aber in Wirklichkeit ist das bei LLMs nicht unbedingt der Fall. Und daher kommt die Überraschung, sozusagen, durch unsere eigenen Erwartungen an die menschliche Intelligenz bezüglich dessen, was schwierig oder einfach ist.
ATALLA: Ja. Und zwischen dieser Verwirrung, die die Benutzer möglicherweise haben, aufgrund dessen, was sie von diesen Systemen erwarten, vielleicht basierend auf der Betrachtung der menschlichen Intelligenz und all dem Hype und Marketing, was möchten Sie, dass die echten Benutzer daraus lernen? Oder wie würden Sie sie warnen, über die Fähigkeiten und Erwartungen nachzudenken, die sie an AI-Systeme haben könnten, basierend auf Ihrer Arbeit hier? Wie können sie durch diesen Lärm hindurchkommen und bessere Erwartungen haben?
NEVILLE: Oh, das ist eine gute Frage. Ich denke, die aktuellen KI-Systeme haben viele Fähigkeiten, die für Menschen in Arbeitsumgebungen sehr nützlich sein werden. Ich glaube, dass die Erkenntnis aus unserer Arbeit ist: Man sollte nicht erwarten, dass sie auf alle Fälle 100% erfolgreich sind. Man sollte die Antworten, die man erhält, überprüfen. Und wenn man etwas bekommt, was man für falsch hält, sollte man nicht davon ausgehen, dass das Modell das einfach nicht kann. Stattdessen sollte man darüber nachdenken, es noch einmal zu fragen oder auf eine andere Weise zu fragen – dann könnte man beim nächsten Mal eine bessere Antwort erhalten.
Das ist schwierig in die Art und Weise zu integrieren, wie wir jetzt arbeiten, denn ich denke, dass man es nicht schaffen kann … sie sind noch nicht bereit, alles 100%ig an sie zu übergeben. Aber wenn man herausfindet, wie man sie in einem Workflow mit euch verwenden kann, mit Überwachung und Verifizierung, dann können sie sehr nützlich sein, um Aufgaben zu erledigen, die Produktivität zu verbessern und die Geschwindigkeit, mit der man Dinge erledigt, zu erhöhen.
Also … und vielleicht noch etwas, was man sagen könnte: Bitte haben Sie Geduld mit uns, denn wir entwickeln diese Systeme in Echtzeit, während sie veröffentlicht werden. Und Ihre Nutzung hilft uns dabei, die Grenzen der Modelle zu überwinden, weil sie uns Beispiele dafür geben, was getan werden kann und was nicht.
Vielleicht möchte ich noch sagen, dass etwas, das die Benutzer vielleicht nicht verstehen, ist: In der Vergangenheit gaben wir mit Suchsystemen oder Empfehlungssystemen nur Feedback in Form von „Thumbs-up“ oder „Thumbs-down“. Aber jetzt befinden wir uns in einer Umgebung, in der wir tatsächlich Feedback mit viel höherer Präzision geben können – was sehr nützlich ist, um die Modelle weiterhin zu verbessern.
Wenn Sie also in einer Art Chatumgebung mit einem Modell arbeiten, sollten Sie bedenken, dass es hilfreich ist, zu erklären, wie alles schiefgegangen ist – und dabei im Text oder im Gespräch genau darzustellen, was falsch lief, was Sie erwartet hatten und was stattdessen erreicht wurde. Denn das wird von uns verwendet, wenn wir die Modelle aktualisieren. Und man kann das also als die Benutzer betrachten: Ihre Rolle besteht darin, die Modelle zu trainieren, damit sie die Dinge tun, die Sie gerne hätten, aber im Moment nicht können.
ATALLA: Großartig. Eine interessante Aktionseinladung.
Und ich bin nur neugierig. Sie sprachen über das Transformationsparadigma, in dem wir momentan stecken, für solche großen Sprachsysteme. Wohin glauben Sie, dass die Wissenschaft der großen KI-Systeme weitergehen wird? Im Großen und Ganzen, vielleicht ist das eine wirklich schwierige Frage, aber zumindest in Ihren Interessen und Forschungsrichtungen – wohin glauben Sie, dass die Wissenschaft dieser Systeme weitergehen wird?
NEVILLE: Das ist eine, eine große Frage. [LAUGHTER] Ich denke, wir … die Forschungsgemeinschaft versucht gleichzeitig herauszufinden, ob die Transformer-Architektur das richtige Grundmodell ist, da es bestimmte bekannten Einschränkungen bezüglich der Funktionsweise von Transformern gibt. Viele dieser Einschränkungen können durch die um die Modelle herumgelegten Wrapper – die agentischen Tools, die wir aktuell um die Modelle herum haben – sowie durch die Logik, die im Hintergrund abläuft, gelöst werden.
Also denke ich, dass eine offene Frage ist: Wie viel können wir mit den Einschränkungen der Transformer-Architektur mit dieser Art von Wrapper-Basis bewältigen und was muss auf einer fundamental anderen Ebene behandelt werden…
ATALLA: Klar.
NEVILLE: … Architektur, die die Dinge umgibt? Ich denke, wir werden eine rasche Entwicklung alternativer Architekturen und Modelle sehen, sowie ausgefeilte Hüllen um die aktuellen Modelle.
Ich denke, dass wir in der nächsten Generation von Arbeiten sehen werden, dass wir uns auf längerfristige Interaktionen mit den Modellen konzentrieren müssen und dass die Modelle die Welt, in der sie arbeiten, auf eine viel greifbarere Weise verstehen werden als momentan. Aber ich glaube, ich bin sehr optimistisch bezüglich der voranschreitenden Forschung. Ich denke, wir werden hier erfolgreich sein.
Vielleicht gehe ich zurück zu dem Zeitpunkt, als ich anfing: Meine erste Ausbildung war bei AT&T Labs im Jahr 2000. Ich erinnere mich sehr deutlich daran, dass ich während des Mittagessens in meiner Ausbildung Go gespielt habe und darüber gesprochen habe, wie wir AI-Modelle dazu bringen könnten, dieses Spiel zu spielen – und wie schwieriger das war als Schach. Und was hätten wir tun können.
Und zu dieser Zeit lernte ich, wie man Go spielt. Ich lernte auf einem 9-by-9-Blatt. Ich weiß nicht, ob Sie jemals gelernt haben, wie man Go spielt, …
ATALLA: Ich habe es nicht.
NEVILLE: … aber man lernt nicht, wie man auf dem großen Brett spielt …
ATALLA: Wow.
NEVILLE: … weil es zu schwierig ist, sogar für Menschen, richtig? Also beginnt man mit diesem 9-by-9-Board.
Und ich beobachtete ziemlich genau, wie ich lernte zu spielen und darüber nachdachte, wie die Algorithmen lernen würden zu spielen. Während wir das taten, vermuteten wir auch, wie lange es dauern würde, bis KI in der Lage sein würde, dies zu tun. Es ist also lustig, zurückzublicken, denn bei AT&T Labs waren viele der wichtigsten Experten für maschinelles Lernen und KI-Forschung dabei. Die Leute sagten: „Oh, es wird 50 Jahre dauern, bis das möglich ist.“ Einige sagen sogar 100 Jahre. Aber natürlich ist das jetzt bereits eine gelöste Aufgabe (öffnet in neuem Tab).
ATALLA: Ja.
NEVILLE: Und daher denke ich als Forscher manchmal, dass es so schwierig ist, diese Art von Grenzen im Verhalten zu überwinden. Es gibt die Tendenz, zu denken: „Es wird 10 Jahre dauern“ oder „Es wird 25 Jahre dauern.“
Aber ich denke, angesichts des Forschungsgeschwindigkeits und der Anzahl der Menschen, die in diesem Bereich forschen, sowie der Größe, in der diese Modelle laufen, wird es tatsächlich viel schneller geschehen, als ich es für mich erwartet hätte – als jene Person, das neue AI-Studenten im Jahr 2000. Also…
ATALLA: Wow. Nun, im Geiste davon – wenn wir zurückblicken auf das Jahr 2000 – stellen wir uns vor, dass wir jetzt 20 Jahre in die Zukunft springen oder einfach 10 Jahre, denn die Dinge entwickeln sich so schnell.
NEVILLE: [LACHT] Ja.
ATALLA: Welche Markierung möchten Sie als Erinnerung an die Forschung in diesem Bereich behalten?
NEVILLE: Ich denke, das, was wirklich die gemeinsame Leine in meiner Forschungskarriere ist, ist das Nachdenken über komplexe Systeme und wie man KI und maschinelles Lernen in solchen Systemen einsetzen kann. Auch jetzt konzentrieren wir uns auf diese Zusammenarbeit und denken an die Interaktion zwischen Menschen und KI. Ich glaube … wenn ich mich in Richtung Science-Fiction-Outcomes drehe, dann wäre es erfolgreich, wenn wir im Arbeitsumfeld sehen, dass Organisationen aus Menschen und KI zusammenarbeiten, Teams bilden und Erfolge erzielen sowie Innovationen hervorbringen. Wenn das funktioniert, werde ich das Gefühl haben, dass meine Forschung erfolgreich war.
ATALLA: Super. Nun, als wir hier zu Ende kommen, dachte ich, es wäre lustig, eine „Blitzrunde“ durchzuführen – also schnelle Fragen, schnelle, geringe Risiken, einfach das, was dir so in den Sinn kommt. Klingt gut?
NEVILLE: Klar.
ATALLA: Großartig. Welcher Ratschlag hat sich bei Ihnen eingeprägt oder hat Ihre Sichtweise verändert?
NEVILLE: Hmm, okay. Aber du hast gesagt, es sollen kurze Antworten sein. [LACHST]
Als ich zuerst in der Informatik anfing, ich, äh, tatsächlich, Doina Precup (öffnet sich in neuem Tab) War ich im ersten Computerwissenschaften-Kurs TA, und sie sagte zu mir, als ich etwas überwältigt war und das Gefühl hatte, dass ich nichts wusste – alle anderen wussten alles, und ich nicht – sie sagte: „Weißt du, hab keine Angst, Fragen zu stellen. Denn manchmal scheint es so, als ob die Leute wissen, was vor sich geht, aber in Wirklichkeit wissen sie es nicht. Sie werden wirklich dankbar sein, dass du mutig genug bist, eine Frage zu stellen.“ denke genauso. Und es würde sowohl dir als auch ihnen helfen, wenn du, wenn du wird Frage die Frage.
Und so habe ich das im Laufe meiner Karriere ernst genommen. Es ist sehr schwierig – man kann Angst haben und das Gefühl haben, dumm zu wirken, wenn man die Fragen stellt. Aber ohne Zweifel: Immer wenn ich solche Ängste hatte und … aber dennoch den Mut hatte, die Fragen zu stellen, stellte ich fest, dass die Leute wirklich dankbar waren. Und manchmal sagten die Leute später: „Oh, ich habe genauso gedacht.“ Ich bin so glücklich, dass du diese Frage gestellt hast. Also sei mutig und stelle die Frage.
ATALLA: Großartig. Was ist eine Lektion, die du auf die harte Tour gelernt hast?
NEVILLE: Schauen Sie sich die Daten an. [LAUGHTER] Schauen Sie sich die Daten an.
Also im maschinellen Lernen haben wir eine Tendenz – das gilt auch für die Benchmarks. Wir haben einen Testset. Wir führen unser Modell aus. Wir lernen daraus. Wir anwenden es auf diesen Testset. Im Allgemeinen erhalten wir eine Zahl, die unsere Metrik ist, die wir versuchen, zu verbessern. Wenn die Zahl also höher wird, denken wir, dass es gut läuft. Und wenn die Zahl sich nicht bewegt, denken wir: „Oh, dann ist das Problem zu schwierig.“
Aber ich habe mehrfach auf die harte Tour gelernt, dass, wenn etwas nicht funktioniert, wenn man Zeit nimmt, um die Daten zu betrachten, man vielleicht tatsächlich Fehler in den Daten findet. Die Daten sind nicht so, wie man es erwartet hat. Die Daten unterscheiden sich von der Verteilung, auf der das Modell trainiert wird. Und deshalb immer… Ich glaube, das macht mich zu einem Datenmensch. [LAUGHTER] Aber oft, wenn die Dinge nicht so verhalten, wie wir es erwarten, gehen wir und betrachten die Daten, um es zu verstehen.
ATALLA: Ja. Das macht Sinn. Es ist eine gute Aufgabe. Es ist eine schwierige Aufgabe.
NEVILLE: [LACHT] Schwer zu erinnern.
ATALLA: Ja.
NEVILLE: Und das … vielleicht ist das eine wichtige Sache, auch wenn ich diese Lektion gelernt habe, …
ATALLA: Klar.
NEVILLE: … Ich musste diese Lektion mindestens sechsmal während meiner Karriere wieder lernen.
ATALLA: Ja. Nun, auf der anderen Seite – was ist ein Erfolg, auf den du am meisten stolz bist?
NEVILLE: Ich denke, ich würde sagen, dass es die Tatsache ist, dass ich gleichzeitig einen Posten und ein Kleinkind aufziehen konnte.
ATALLA: Wow, ja.
NEVILLE: Ich hatte meinen Sohn kurz vor dem Beginn – auch mein Ehemann ist Dozent – also bevor wir die Dozentenpositionen antraten. Und ich denke, dass es so war, weil ich eine tenure bekam, mein Sohn gesund und glücklich war, und ich es schaffte, verheiratet zu bleiben [LACHST] …
ATALLA: Ja, wirklich.
NEVILLE: … ist wahrscheinlich das größte Erfolg, ja …
ATALLA: Eine große Leistung, ja. Und die letzte Frage: Wie hat Kunst oder Natur Ihr Werk beeinflusst?
NEVILLE: Hmm, ich bin nicht sicher, ob das wirklich als Natur zählt, aber eines habe ich als KI-Person immer beobachtet: Wie Kinder, Menschen, Tiere und Insekten scheinen die Welt und die Umwelt zu lernen und ihr Verhalten zu verändern. Deshalb gebe ich voll und ganz zu, dass ich als Elternteil eines kleinen Kindes sehr nerdig war. Ich würde Ideen, die wir durch maschinelles Lernen bekommen, nutzen und versuchen, herauszufinden, ob ich meinem Sohn helfen kann, besser zu lernen.
Zum Beispiel: Wenn er als Baby lernt, versuchen zu können, sich umzudrehen, würde ich sagen: „OK, ich gebe dir ein positives Trainingsbeispiel. [LACHEN] So, hier nimm deine Beine und mach das.“
ATALLA: Ja, ja.
NEVILLE: … und dann den Effekt darauf zu sehen, wie er lernt, aber auch dabei zuzusehen, wie er lernt, und anschließend darüber nachzudenken, wie das vielleicht in die Algorithmen und Modelle eingebaut werden könnte, die wir entwickelt haben. Das ist wahrscheinlich die größte Interaktion, an die ich im Laufe meiner Karriere immer wieder zurückgekehrt bin.
ATALLA: Das ist wunderschön. Ja.
NEVILLE: Danke.
ATALLA: Nun, Jen, danke, dass du deine Geschichte und deine Einsichten mitgeteilt hast. Es war schön, dich hier zu haben.
Und an unseren Zuschauer: Vielen Dank, dass Sie zugehört haben. Wenn Sie mehr über die Arbeit meiner Kollegen bei Microsoft erfahren möchten, besuchen Sie die Microsoft Research-Seite unter aka.ms/research oder [MUSIC] – schauen Sie sich auch die anderen Episoden dieses Podcasts an. Danke.
[MUSIK ENDE]
Erfahren Sie mehr:
- AI Interaktion und Lernen
Startseite - LLM-Modelle beschädigen Ihre Dokumente, wenn Sie sie delegieren
Veröffentlichung | April 2026 - Weitere Notizen zu unserer jüngsten Forschung über AI Delegation und Langfristige Zuverlässigkeit
- Microsoft Research Blog | Mai 2026
- LLM-Modelle verlieren sich in mehrschichtigen Gesprächen
Veröffentlichung | Mai 2025
Die Beitrag What AI gets wrong and what failure teaches us erschien zunächst in Microsoft Research.
