TechCrunch AI

OpenAIs mathematische Lösungen erfüllen die Standards des Fachgebiets noch nicht

OpenAIs Flut von Beweisen wich von den Richtlinien ab, die von einer Gruppe mathematischer Forscher festgelegt worden waren, die das Frontier-Lab konsultiert hatte.

Bildquelle · TechCrunch AI

Als OpenAI veröffentlicht hunderte beanspruchte Lösungen für einige der schwersten mathematischen Probleme der Welt in dieser Woche, sagte das Frontier-Labor, dass es eine Beratungsgruppe aus Elite-Mathematikern konsultiert habe, um zu vermeiden die Kontroverse das mit dem letzten Mal einherging, als eines seiner Modelle ein lange bestehendes Problem in diesem Bereich löste.

Aber OpenAI erreichte diese Standards nicht, insbesondere dort, wo die Mathematiker die Notwendigkeit betonten, dass ein mathematisches Ergebnis von Menschen verstanden wird. Das ist besonders besorgniserregend, nachdem ein neues Papier Lücken zwischen der Lösung in natürlicher Sprache und der formal ausgedrückten Lösung eines Million-Dollar-Problems aufgezeigt hat, das angeblich von OpenAIs Modellen gelöst wurde.

Die Advisory Group on Mathematics and Artificial Intelligence, die am Institute for Advanced Studies der Princeton University angesiedelt ist, besteht aus neun renommierten Forschern an Institutionen rund um die Welt.

Die Organisation veröffentlichte Richtlinien für Frontier-Labore, die Ende September mathematische Probleme lösen. In einer Erklärung zum neuesten Satz von Beweisen sagte die AGMAI, dass „es letztlich der mathematischen Gemeinschaft obliegt zu beurteilen, inwieweit unseren Empfehlungen erfolgreich gefolgt wurde.“

Die erste Bitte der Organisation war jedoch, „das Testen fortgeschrittener mathematischer Probleme an proprietären Modellen einzustellen“. OpenAIs Veröffentlichung sagt ausdrücklich, dass das Unternehmen seine proprietären Modelle mit offenen Forschungsproblemen aus der Mathematik evaluiert.

Die Beratungsgruppe reagierte nicht, als TechCrunch um eine gründlichere Bewertung der neuesten Beweisveröffentlichung von OpenAI bat. Das Labor hat offensichtlich einige seiner Prinzipien befolgt, darunter die Veröffentlichung der Ergebnisse so bald wie möglich und die Aufnahme von Informationen darüber, wie die Modelle zu ihren Schlussfolgerungen gelangt sind. Aber nicht bei allen: Nur zehn der 719 Manuskripte enthielten Freigaben der Gedankenkette des Modells.

Für Arbeiten, die die Menschen nicht verstehen, schlugen die Mathematiker vor, dass die Beweise formalisiert werden sollten – aber gerade 42 % der von OpenAI veröffentlichten Beweise hatten diesen Prozess nicht durchlaufen.

Letztlich ist weiterhin unklar, ob OpenAI „die Verantwortung dafür übernimmt, sicherzustellen, dass das menschliche Verständnis folgt“, wenn es seine Beweise veröffentlicht, gemäß den AGMAI-Prinzipien. Die AGMAI schlug vor, dass OpenAI helfen sollte, die Arbeit menschlicher Mathematiker zu finanzieren, die erforderlich sein werden, um die Lösungen des Labors in irgendeiner realen Weise bedeutsam zu machen.

„Probleme werden autonom von KI-Promptern gelöst, die kein Interesse an dem größeren Fachgebiet selbst haben, sobald ihr ursprüngliches Ziel ‚gelöst‘ ist, und die die KI-Ausgabe nicht gut genug verstehen, um Fragen zum Ergebnis zu beantworten, Vorträge zu halten oder anderweitig mit dem Rest des Fachgebiets zu interagieren“, schrieb Terence Tao, ein prominenter Mathematiker, der OpenAIs Vorgehen kritisiert hat, in sozialen Medien nach der Veröffentlichung.

Dieses Problem wird veranschaulicht durch ein Papier das diese Woche von Mathematikern der University of Cambridge und des King’s College in London veröffentlicht wurde und die Art und Weise in Frage stellt, wie Frontier-Labore an diese Herausforderungen herangehen.

Wenn KI-Modelle mathematische Probleme lösen, erstellen sie zunächst eine Erklärung in „natürlicher Sprache“ und versuchen dann, dieses Ergebnis in Lean auszudrücken, einer Programmiersprache, die theoretisch die Richtigkeit des Beweises bestätigt, indem sie ihn als Code kompiliert.

Es kann jedoch Probleme mit der Art und Weise geben, wie die Modelle ihre Beweise in natürlicher Sprache in Code übersetzen; dieses Papier dokumentiert mindestens zwei Diskrepanzen zwischen dem Beweis in natürlicher Sprache und dem Lean-Code hinter der Lösung, die OpenAI für ein von den Navier-Stokes-Gleichungen abgeleitetes Problem angeboten hat, welche das komplexe Verhalten von Flüssigkeiten beschreiben.

Diese Diskrepanzen widerlegen nicht unbedingt eine der Lösungen, aber sie werfen die Frage auf, ob wir uns einfach darauf verlassen können, dass Modelle ihre eigenen Lösungen ohne menschliches Zutun formalisieren. Das ist einer der Gründe, warum die AGMAI OpenAI bat, „maschinenlesbare Metadaten einzubeziehen, die die Artefakte in natürlicher Sprache und die formalen Artefakte korrelieren“, etwas, das das Frontier-Labor bei diesen Veröffentlichungen nicht getan hat.

„Wegen des Phänomens der Fehlübersetzungen – wie in diesem Papier hervorgehoben – sollte dem NL-Beweis von OpenAI und
anderen autoformalisierten Lean-Beweisen nicht ohne weiteres vertraut werden, ohne denselben Peer-Review-Prozess und dieselbe Prüfung, denen andere Beweise unterzogen werden“,
schließen die Autoren des „Lost in Translation“-Papiers.

Mathematiker betonen, dass sie, wenn neue Ergebnisse von Menschen entdeckt werden, die Verantwortung dafür übernehmen und sich durch Artikel, Vorträge und Seminare mit der breiteren Gemeinschaft austauschen. Dieser Prozess vertieft das Verständnis der Lösungen, findet Strategien, die zur Lösung anderer Probleme verwendet werden können, und ermöglicht es, das neue Wissen in praktischen Bereichen anzuwenden.

Wenn ein Modell aufgefordert wird, ein schwieriges Problem zu lösen, und eine Lösung ausspuckt, „gibt es zum Zeitpunkt der Veröffentlichung kein menschliches Verständnis davon, und jetzt beginnt die Arbeit“, sagte Melanie Wood, Mathematikprofessorin an der Harvard University, gegenüber TechCrunch.

Originalquelle

TechCrunch AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten