雷峰网 AI

Je mehr Daten ≠ desto besser die Entscheidungen: Von der Flugbahn des Drohnen bis zur Kommunikation mit mehreren Robotern – die Beziehung…

Was die maximale Intelligenz bestimmt, ist nie die absolute Größe der Daten, sondern die Qualität der Daten und die Informationsdichte. Autor | Cen Feng Unter dem Aufschwung generativer KI erlebt die Robotik-Community…

Was die maximale Grenze der Intelligenz bestimmt, ist nie die absolute Größe der Daten, sondern die Qualität der Daten und die Informationsdichte.

Autor | Cen Feng

                                                                                                       

Unter dem Aufschwung generativer KI erlebt die Robotik-Community einen großen Wandel von traditioneller Steuerung zu End-to-End-Lernen. Wie in vielen Bereichen herrscht auch hier eine Art Aberglaube bezüglich der Größe der Daten – man glaubt fest daran, dass „je mehr Daten, desto intelligenter“ ist und dass dies der einzige Weg zu universeller körperbasierten Intelligenz ist. Doch auf dem gerade abgehaltenen internationalen Kongress für intelligenten Roboter und Systeme IEEE/RSJ IROS erklärte Jen Jen Chung von der University of Queensland in seiner Leitrede, indem sie ihre mehr als zehnjährige Forschungspraxis vorstellte, eine nachdenkliche Schlussfolgerung:Nicht alle Daten sind gleichwertig. Die blinde Anhäufung von Daten kann sogar zum Systemabsturz und zur Ausführungsunfähigkeit der Strategie führen.Professor Chung stellt zu Beginn seiner Rede direkt die Kernaussagen dar:Massive Datenmengen sind nicht gleichbedeutend mit hoher InformationsdichteEs gibt viele Beispiele, in denen man große Mengen an Daten besitzt, aber nichts daraus gewinnt, denn viele Daten können uns nicht wirklich helfen, die Natur der Probleme zu verstehen. Auf dem Weg zu universellen autonomen Systemen…Was die maximale Leistung der Intelligenz bestimmt, ist nie die absolute Größe der Daten, sondern die Qualität der Daten und die Informationsdichte.Am Anfang ihrer wissenschaftlichen Karriere im Bereich des autonomen Fliegens von Drohnen erkannte Professor Chung sehr deutlich, dass „Erkundungen einen Preis haben“. Um ein Flügeldrohnen wie Vögel autonom den Aufwärtswind nutzen zu lassen, muss Energie verbraucht werden, um den unbekannten Zustand und die Bewegungsräume zu erforschen. Dies zwang sie dazu nachzudenken: Wann sollten Daten gesammelt werden? Wie sollen die Daten gesammelt werden? Blindes, gleichmäßiges Sampling verschwendet nicht nur Ressourcen, sondern kann sogar den Lernprozess verzögern. Diese Reihe früher Forschungen ließ sie erkennen:Der Wert der Daten ist nicht gleichmäßig verteilt; hochwertige Informationen, die nach Bedarf gesammelt werden, sind weitaus wertvoller als große, unterschiedslose Redundanzen.Diese tiefe Einsicht in die Unregelmäßigkeit des Wertes der Daten ist in Distributed-Multirobot-Systemen besonders wichtig. Wenn das Untersuchungsobjekt von einer einzelnen Maschine auf die Kooperation mehrerer Maschinen ausgeweitet wird und es sich um begrenzte, abfallende und mit hohem Verzögerungseffekt versehene echte Kommunikationskanäle handelt, ist es nicht nur unrealistisch, sondern kann sogar zu katastrophalen Netzwerkverkehrsspitzen führen, wenn alle Daten jederzeit und an jedem Knotenpunkt vollständig ausgegeben werden. In diesem Szenario hat Professor Chung den einzigen Goldstandard für die Bewertung des Wertes der Datenpartizipation vorgeschlagen.„Kann das Erfahren dieser Information zu einer Veränderung in der Handlungsentscheidung führen?“Auf dieser Grundlage führte ihr Team eine äußerst kreative Kernlogik ein:Übertragen die wichtigsten Informationen, nicht alle Daten. In seiner Rede zeigte Professor Chung eine Reihe von Beispielen, die perfekt zeigen, wie es möglich ist, ein exquisites Gleichgewicht zwischen Bandbreitenkosten und Datengenauigkeit zu erreichen. Am Ende der Rede wies Professor Chung auf den aktuell beliebten End-to-End-Strategie-Lernschema in der Robotik hin und stellte das große Problem direkt vor. In komplexen, hochkomplexen Montageaufgaben, bei denen dem Roboterarm riesige Mengen an multimodalen Daten (visuell, kinetisch, propriozeptiv) bereitgestellt werden, ist die Leistung nach der Implementierung äußerst mittelmäßig, und selbst in Situationen ohne Material erstellt der Roboter mechanisch die Eingriffbewegungen. Deshalb hat das Team von Professor Chung eine „Strategische Reparatur“-Lösung vorgeschlagen. Experimente haben gezeigt, dass die Methode, „reparative“ Beispiele gezielt auszuwählen, unter demselben Budget an Unterrichtsdaten, deutlich mehr Strategische Generalisierungseffizienz bietet als das blinde Ausweiten der Daten. Das bestätigt erneut das Thema dieser Rede:„Die Qualität der Daten bestimmt die Grenze“, das blinde Streben nach Datenmenge ist nur ein vergeblicher digitaler Spiel.Hier ist die Präsentation von Jen Jen Chung, die AI-Technologie-Kommentare haben sie nach dem Inhalt ihrer englischen Präsentation ohne Änderung des Originals übersetzt:

▎Vortragstitel: (Geometry Strikes Back: Scaling 3D Reconstruction und Structuring 3D Scene Generation)

Redner: Jen Jen Chung, University of Queensland

01


Von der Flugzeugdrohne aus: Die Unstimmigkeit zwischen Daten und Informationen

„Daten“ sind nicht gleichbedeutend mit „Informationen“. Einige Datenfragmente können eine sehr hohe Menge an Informationen enthalten; aber gleichzeitig kann man auch riesige Mengen an Daten haben, ohne etwas zu gewinnen. Es ist besonders bedeutsam, die Beziehung zwischen „Daten“ und „Informationen“ heute erneut zu betrachten. Inmitten der aktuellen Technologiewelle sind wir besessen davon, so viel wie möglich an Daten zu sammeln, und glauben fest daran, dass „je mehr Daten, desto mehr Probleme lässt sich lösen“. Was ich heute tun möchte, ist genau diese Denkweise herausfordern. Die Diskrepanz zwischen Daten und Informationen hat viele meiner früheren Forschungen durchdrungen. Meine Doktorarbeit befasste sich damals mit dem autonomen Gleiten von Drohnen. Die Natur hat uns wunderbare Beispiele gezeigt: Vögel wissen, wie sie Energie aus Windfeldern ziehen und durch steigende Wärmeströmungen Höhe erreichen können. Wir untersuchten damals, ob stationäre Drohnen dieselbe Funktion erreichen könnten. Aus der Perspektive der Erkundungsstrategie ist dies eine sehr interessante Aufgabe: Je länger die Flugzeit ist, desto mehr Möglichkeiten gibt es, den „Zustand-Aktion-Raum“ zu erkunden. Doch der Schlüssel liegt darin:Die Erkundung kostet einen PreisSie müssen die mit großer Anstrengung erworbenen Energien verbrauchen, um die unbekannte Zone im Raum von Zustand und Bewegung zu erforschen; und es gibt keinen Mechanismus, der sicherstellt, dass diese Reise einen Nutzen bringt. Es ist möglich, dass Sie viel Mühe auf sich nehmen und eine bestimmte Region erkunden, aber am Ende nichts gewinnen. Daher muss man, um schnell zu lernen, sehr vorsichtig das Gleichgewicht zwischen „wann Daten gesammelt werden“ und „wie Daten gesammelt werden“ halten. Wenn die Maßstäbe richtig eingestellt sind und nur wenige Trainingszyklen notwendig sind, kann man eine ziemlich effiziente Gleiten-Strategie erlernen. In den Runden 20 bis 27 haben wir eine sehr gute Steuerungsstrategie entwickelt, die es dem Drohnen ermöglicht, durch die Wärmeströmung Energie zu erhalten. Interessanter ist die Analyse des Wertfunktionraums. In diesen Diagrammen zeigen die verschiedenen Kurven die Wertfunktionen unter unterschiedlichen Fluggeschwindigkeiten. Man wird feststellen, dass der Netto-Energiegewinn nachdem die Geschwindigkeit einen kritischen Punkt erreicht hat, vollständig auf Null fällt – weil die Fluggeschwindigkeit zu hoch ist und die Drohne direkt in die Wärmeströmung gerät, ohne die Energie darin aufzunehmen. Sobald die Steuerungsstrategie dies versteht, dass es sinnlos ist, in diesem Bereich zu erkunden, wird es auch nicht besser, selbst wenn man weiterhin mehr Daten in diesem Bereich sammelt. Ein weiteres Beispiel ist die Planung des kürzesten Weges in einem unbekannten Kostenfeld. Das Problem besteht darin, den optimalen Weg zwischen zwei Punkten zu finden, während das tatsächliche Kostenfeld im oben linken Eck im Anfangszustand völlig unbekannt ist. Man muss durch lokale Sammlung erfahren, wie die Kosten für das Durchqueren der verschiedenen Bereiche sind. Man sollte dabei zwei Dinge im Hinterkopf behalten: Erstens hat das Sampling einen Kostenaufwand, und man muss eine physische Kosten erlegen, um zu erforschen und Daten zu sammeln; zweitens ist das Endziel, den kürzesten Weg zu finden, nicht die präzise Rekonstruktion des gesamten Kostenfeldes. Wenn wir diese beiden Punkte klar haben, sollten wir keine gleichmäßige Sammlung durchführen oder blindsamplen, nur um den Schätzungsfehler des Kostenfeldes zu verringern. Wie kann man die Datensammlung steuern, um die Genauigkeit der Schätzung des kürzesten Weges effizient zu verbessern? Da der Start- und Endpunkt bekannt sind, können wir zunächst eine bidirektionale Heuristische Suche durchführen. Wir stellen die Hypothese auf, dass, wenn zu diesem Zeitpunkt Daten an einem bestimmten Ort gesammelt werden, dieser Messwert unsere a posteriori Glaubwürdigkeit wie verändern würde? Wie würde er unsere Suchenebelgrenzen neu gestalten? Welche a priori Veränderungen würde er in der Art oder im numerischen Maßstab der Messung bringen? In welcher Größenordnung wäre der erwartete Wert? Und am wichtigsten: Würde dies die Entscheidung über den Weg des kürzesten Pfades verändern? Wenn Sie vorhersagen, dass dieser Messwert die Pfadabschätzung nicht verändern kann, dann ist diese Sammlung völlig unnötig. Demnach können wir gezielt auf die Datenerfassung ausgerichtet werden. Bitte beachten Sie die schnelle Explorationmethode, die wir im Jahr 2017 vorgeschlagen haben: Sobald der Algorithmus feststellt, dass eine bestimmte Region einen sehr hohen Kostenbereich darstellt, stoppt er sofort die Sammlung von Daten in diesem Zustandsraum und dem Erkundungsunterraum – denn die Wahrscheinlichkeit, dass man nach oben links geht, einen kürzeren Weg findet, ist sehr gering. Wir sollten unseren wertvollen Datenerfassungsbudget darauf ausrichten, in den rechten unteren Bereich zu verwenden, wo die Chance auf bessere Lösungen größer ist. In diesen beiden Fällen – egal ob es um die Bestimmung des kürzesten Weges oder um den autonomen Flug des Drohnen geht – erhebt die Sammlung von redundanten Daten zwar keine wesentliche Hilfe bei der Lösungsfindung, zerstört aber zumindest noch nicht die bestehende Lösung, sondern nur die Rechengeschwindigkeit.

02


Mehr-Roboter-Systeme:

Datenpartizipation war nie kostenlos

In bestimmten Bereichen führt das blinde Hinzufügen mehr Daten in das System nicht nur nicht zum Vorteil, sondern kann sogar dazu führen, dass die Gesamtleistung stark verschlechtert wird. Dieses Phänomen tritt hauptsächlich in verteilten Mehrroboter-Systemen auf. Der Grund dafür ist, dass die Datenverteilung im System vollständig von der untersten Kommunikationsinfrastruktur abhängt.Datenpartizipation war nie kostenlos„In der Realität kann man die Bandbreitenbegrenzung niemals umgehen. Kommunikationskanäle sind oft voller Einschränkungen, Abnahme und Verzögerungen. Angesichts der physikalischen Beschränkungen der Netzwerkkanäle ist es völlig unrealistisch, jederzeit und an jedem Knotenpunkt alle Daten vollständig zu senden. Außerdem ist die marginale Nützlichkeit der Daten nicht gleichmäßig verteilt; sie hängt stark von den Eigenschaften der Daten selbst, der Identität des Empfängerknotens und der zeitlichen Relevanz ab. Unter Berücksichtigung dieser drei Faktoren: Wie sollten wir die Datenverteilung zwischen den Systemen planen, damit jeder Knotenpunkt die wichtigsten Informationen erhält?“ Wir können zunächst mit „Kommunikationsziel“ und „Kommunikationszeitpunkt“ beginnen. Die eindrücklichste Anwendung ist die Verhinderung von Kollisionen zwischen mehreren Drohnen. In welcher Zeit muss eine Drohne genau wissen, welche Richtung andere Roboter haben? Stellen Sie sich eine Gruppe von Drohnen vor, deren Flugrouten miteinander kreuzen: Benötigen sie ständige Kommunikation? Oder ist Kommunikation nur notwendig, wenn sie keine ausreichend zuverlässigen Einschätzungen über das Verhalten der anderen Individuen haben? Die zentrale Frage, die Sie beantworten müssen, lautet:Führt das Erfassen dieser Information zu einer Veränderung in der Handlungsentscheidung?„Wenn die Knotenpunkte gelb leuchten, bedeutet das, dass sie kommunizieren oder den Zustand des Gegenübers abfragen; wenn sie blau leuchten, zeigt dies, dass die auf dem Flugzeug basierte Vorhersage zuverlässig ist und keine zusätzlichen Daten benötigt werden. Durch dieses sorgfältig ausgewählte Kommunikationsmechanismus haben wir die Last der Netzwerkkanäle erheblich reduziert und die Wahrscheinlichkeit erhöht, dass wertvolle Informationen genau an das Ziel gelangen. Eine weitere Dimension des Problems ist „was übermittelt wird“. Neben der direkten Übertragung von Originaldaten können wir auch nahezu repräsentative Darstellungen verwenden.“ Hier haben wir ein sehr raffiniertes mathematisches Werkzeug eingeführt – den Bloom-Filter. Stellen Sie sich eine Aufgabe vor, bei der ein Roboter gemeinsam ein Netzwerk erstellt und erkundet wird, und dabei die bereits durchquerten und beobachteten Bereiche auf dem Raster-Kartenzustand synchronisieren muss. Natürlich können Sie die detaillierten Positionen und Pfade direkt übertragen, aber es gibt eine viel effizientere Kodierungsmethode. Zum Beispiel nutzt der Bloom-Filter eine Hash-Abstimmung, um die Statusinformationen in einen hochdichten Binärsatz zu komprimieren, wodurch eine erstaunliche Datenkompression erreicht wird. Obwohl es zu einer gewissen Verringerung der Datengenauigkeit kommt, erhält man dafür eine sehr kleine Datenmenge und eine erhebliche Steigerung des erfolgreichen Transports in schwierigen Kanalen. Wenn die Informationen an den roten Roboter übermittelt werden, empfängt er die höherwertige Zeichenfolge und kann anschließend lokale Statusabfragen durchführen, um zu überprüfen, ob ein bestimmtes Rasterelement bereits identifiziert wurde. Der rote Roboter kann darauf schließen, dass das Gitter (1,7)(1,7) bereits von dem grünen Roboter beobachtet wurde; wenn bei der Abfrage eines anderen Gitters die Hash-Position 00 vorhanden ist, bedeutet dies, dass der Gegner noch nicht eingedrungen ist, und diese Region wird als potenzieller Kandidat angesehen, den man selbst erkunden sollte. Aber der Preis dieser schadstellenbasierten Komprimierung ist, wie ich bereits sagte, die Verlust von Genauigkeit. Bei der Abfrage bestimmter Gitters möglich sind falsche Positive – ein bestimmtes Gitter wird zwar nicht erkundet, aber die Hash-Abfrage zeigt, dass es bereits im Set vorhanden ist. Das ist ein unvermeidlicher Preis für einen niedrigen Kompressionsgrad. Doch das tiefe Verständnis der inneren Mechanik des Tools ermöglicht es uns, andere Ingenieurtricks geschickt einzusetzen, um die Leistungsgrenzen des ursprünglichen Tools zu überschreiten. Eine äußerst einfache und raffinierte Lösung ist das Salzen von Daten: Dabei wird eine zufällige Salzwerte mit den Daten kombiniert, dann heruntergehasht und der Salzwert zusammen mit den Daten übertragen. Auf diese Weise können wir in den kontinuierlichen Beobachtungs- und Kommunikationszyklen jede Zeit ein unterschiedlicher, unabhängiger Salzwert verwenden, und die Hash-Maps werden ebenfalls unterschiedlich sein. Das bedeutet, dass die Daten, die jede Zeit einzeln im Netzwerk übertragen werden, statistisch unabhängig sind und unabhängige Beobachtungsmessungen darstellen. Diese statistische Unabhängigkeit ermöglicht es uns, alle theoretischen Vorteile der Bayesianen Inferenz und der sequentiellen Informationenstacking zu nutzen. Dadurch kann das Empfängergerät bessere Entscheidungen treffen. Selbst wenn die durch den System-Setup vorgegebene maximale einzelne falsche Positivrate 50% beträgt – kann die instantane falsche Positivrate sehr besorgniserregend sein, wie die weißen Störpunkte im Diagramm zeigen; durch die Integration von Daten über verschiedene Zeitperioden wird der Nachverdachtfehler der Roboter deutlich reduziert, was weit besser ist als das instantane Niveau der falschen Positivrate. Dadurch können wir sowohl den Vorteil des hohen Kompressionsfaktors für den Kanalverbrauch genießen als auch eine hochwertige Entscheidungsfähigkeit aufrechterhalten. Daher bieten Mechanismen wie der Bloom-Filter uns einen Hebel, mit dem wir eine direkte Abwägung zwischen den Kommunikationsbandbreitenkosten und der Genauigkeit der Dateninformationen vornehmen können. Im Kontext von multiplarer kooperativer Erkundungstätigkeiten wird die Gesamteffizienz signifikant verbessert. Ich tendiere dazu, sie als eine quantitative Abwägung zwischen „Datengenauigkeit“ und „Zeitlichkeit“ zu betrachten – was genau den „Übertragungsinhalt“ und den „Übertragungszeitpunkt“ im Systemdatenfluss entspricht. Aber die oben genannte Lösung hat noch eine implizite Voraussetzung: Das System muss das gesamte Datapaket vollständig empfangen, bevor es mit der Dekodierung beginnen kann. Das ist genau der weitere Hindernis, den wir versuchen zu überwinden. In der aktuellen Robotik-Communikationsarchitektur gibt es eine Art Inertialdenken: Um irgendeine Information nutzen zu können, muss man warten, bis das Datapaket vollständig empfangen wurde, um es zu dekompilieren und zu analysieren. Wenn es auf eine schlechte Netzverbindung oder periodische Unterbrechungen kommt, wird die gesamte Übertragung sofort ruiniert, sobald ein Teil des Datapakets verloren geht. Könnten wir anstelle der schwarzen-weißen-Dilemmata eine höhere Datenauflösung gegen Zeit eintauschen? Können wir einen flussbasierten Übertragungsmechanismus einführen, der es uns ermöglicht, ohne auf die vollständige Datenmenge zu warten oder leichte Pakete priorisiert und sofort zu dekodieren, um zeitnahe Entscheidungen zu treffen? Auf diese Weise kann selbst wenn das blaue Roboter, das an der Grenze schwachen Signals ist, nur die Hälfte der Pakete erhält, ein Teil der erhaltenen Informationen direkt in den kooperativen Planungsprozess eingesetzt werden. Wenn Sie, wie ich, die 90er-Jahre-Internet erlebt haben, dann sind Ihnen möglicherweise die Mechanismen des Streaming-Mediums noch lebhaft in Erinnerung. Wir nutzen genau diese Idee, und sie ist im Alltag immer noch häufig zu finden: Wenn man mit einem Handy Streaming-Videos anschaut, muss man das gesamte Hochwertvideo nicht vollständig auf den Computer laden, damit es flüssig starten kann. Wir übertragen die Idee des schrittweisen Transfers auf das Roboter-System, sodass die Robotergruppe auch dann richtige Entscheidungen treffen kann, wenn die Informationen noch unvollständig sind. Mit diesem Streaming- und schrittweisen, mehrschichtigen Darstellungssystem können wir das Gleichgewicht zwischen Genauigkeit und Reaktionsfähigkeit frei anpassen, sodass die Roboter ohne große Netzwerkabhängigkeit vorzeitig Entscheidungen treffen können. Die Kartenanpassung und Konstanz zwischen den Roboten sind deutlich besser als bei traditionellen Lösungen, bei denen alles auf einmal synchronisiert wird; in größeren Umgebungen und komplexen Systemen zeigt sich die Ausweitung dieser Methode noch stärker. Eine Gruppe von quantitativen Experimentergebnissen kann unsere Kernaussage untermauern – mehr Daten sind nicht direkt gleichbedeutend mit besseren Entscheidungen. Im unteren Teil des Diagramms ist der Flussverkehr mit blauer Markierung die Methode, bei der die Gesamtzahl der Kommunikation am niedrigsten ist im Vergleich zu allen Grundlinien-Methoden, und die Menge an Daten, die das Empfängergerät erhält, ist ebenfalls am kleinsten. Dennoch erreicht die globale Synchronität des Maps den idealen Zustand, bei dem der Kanal vollständig unbeschädigt und ohne Bandbreitenbegrenzung ist. Es ist also möglich, die Daten durch vernünftige Repräsentation, Rekonstruktion und Streamkomprimierung zu verarbeiten, anstatt alle ursprünglichen Daten blind ins Netz zu schicken und zu hoffen, dass am Ende ein wunderbares Ergebnis erzielt wird.

03


Roboter-Strategie-Lernen:

Das Problem liegt nicht in einer Mangel an Daten, sondern in der Overfitting

All diese Vorbereitungen dienen dazu, das „große Elefanten im Raum“ hervorzuheben, mit dem wir in diesem Bereich aktuell konfrontiert sind – nämlich den vorherrschenden Paradigma für die Strategiewissenschaften von Robotern. Der gegenwärtige vorherrschende Forschungsparadigma versucht, das gesamte a priori Wissen der Menschheit zu komprimieren und in die Strategien der Roboter zu injizieren, in der Hoffnung, durch riesige Generalisierungsdaten allgemeine Strategien zu entwickeln, die alle komplexen Szenarien abdecken – von feinen Operationen bis hin zu autonomer Navigation und dynamischen Interaktionen mit mehreren Kontaktpunkten. In dieser Richtung haben wir auch viele Schwierigkeiten erlebt. Zuvor haben wir unser Augenmerk darauf gelegt, wie man Strategien für komplexe, voluminöse Montageaufgaben erlernt. In diesem Experiment sammelten wir Demonstrendaten durch Expertenteleopraktik und trainierten den Roboterarm, um Teile in einem chaotischen Stapelumfeld einzusetzen. Wir gaben dem Modell vollwertige Sensordaten: duale visuelle Daten mit RGB und Tiefenbildern, Lesungen der sechsfach-Trägheitssensoren des Endeffekters sowie eine umfassende Propriozeptionsstatusmeldung. Wir haben alle gesammelten Daten vollständig in das Modell eingefügt, aber die Leistung nach dem Deployment der Strategie ist äußerst mittelmäßig. Wie man sehen kann, führt der Roboterarm wiederholte mechanische Bewegungen aus – blinde Kollisionen mit Materialstücken, Störung der Szene und physische Berührungen, mechanisch das Trainingsverhalten nach den Demonstrationen im Trainingskatalog nachahmend. Angesichts dieser schlechten Leistung ist die übliche Lösung, die man vorschlägt, oft: Erhöhung der Trainingsdaten und Sammeln mehr Experten-Teleoperated-Demonstrationen. Aber wenn man genau betrachtet, wie es verhältnismäßig handelt in einem leeren Kasten-Szenario, stellt man fest: Selbst wenn der Kasten leer ist, wiederholt die Roboterarm mechanisch dieselbe Einführungsaktion. Dieses Beispiel zeigt deutlich, dass das Problem nicht darin liegt, dass es keine Daten gibt, sondern darin, dass die Strategie stark überanpassiert ist. Das Modell ignoriert die visuellen Eingaben vollkommen und lässt den Fühlsignalen keinen Raum; es verlässt sich nur auf die propriozeptiven Daten der Gelenke, um mechanisch den gelerten Pfad zu „auswendig lernen“ und wiederholen. Eine Überanpassung ist natürlich kein neues Konzept – sie existiert seit der Entstehung des maschinellen Lernens. Wir sind uns bewusst, dass dieses Problem existiert. Deshalb muss ich besonders darauf hinweisen: Bei der Erlernung von Strategien zur Lösung dieses Problems müssen wir bei dieser Engpässe aufmerksam bleiben. Das Wichtigste ist nicht, mehr Daten in das Modell einzufügen, sondern vielmehr klarer zu überdenken: Welche Daten wir wirklich ins Modell einschleifen? Nicht nur ich denke darüber nach, auch meine Kollegen bei der Australian Federal Department of Science, Industry and Energy analysieren dieses Problem. Viele Kollegen hier oben haben wahrscheinlich ähnliche Probleme erlebt: Im Fall einer Aufbausache mit Bausteinen muss der Roboterarm die grünen Steine genau auf den höchsten Punkt der gelben Steine stapeln. In einem gleichmäßig beleuchteten, ordentlichen referenziellen Umfeld, wenn die Umgebungsmerkmale der Trainingsverteilung entsprechen, ist die Strategieausführung ziemlich stabil. Doch sobald das Hintergrundbild geändert wird oder einige Störfaktoren in die Szene eingefügt werden, bricht die Strategieleistung plötzlich zusammen. Das ist nicht überraschend, denn solche kleinen Störungen sind immer das „Problem“ für Strategien, die nur mit referenziellen, ordentlichen Daten trainiert wurden. Wir können nicht behaupten, dass die Strategie tatsächlich die allgemeine Fähigkeit des „Baus von Bausteinen“ erlernt hat; höchstens können wir sagen, dass sie lediglich das „Bauen von Bausteinen unter bestimmten Beleuchtungsbedingungen und Konfigurationen der Szene“ gelernt hat. Wo liegt die Lösung? Sollen wir weiterhin blind massiv Daten sammeln? Oder sollten wir mit verschiedenen Beleuchtungskonfigurationen unermüdlich mehr Experten-Teleoperated-Trainings einführen? Oder gibt es eine etwas grundlegendere Methode, um das Problem zu lösen? Der erste Autor dieser Arbeit, Giovanni Joseph, entschied sich dafür, die mikroberühmten Veränderungen im Inneren des Strategiemodells zu untersuchen: Wie genau unterscheiden sich die Ausgaben der Strategie in zwei Eingabsszenarien? Welche Art von Abweichung gibt es bei den Handlungsausgaben? Durch den Vergleich zwischen der nominalen Szenario- und dem verzerrten Szenario bezüglich des Abweichungsverhältnisses der Strategiehandlungen erhalten wir quantifizierbare Belege, wodurch die Veränderungen in der Verteilung der Handlungsausgaben klar werden. Wir führten diesen Test auf einer großen Trainingsmenge durch und nutzten Techniken der Dateneditierung, um verschiedene Lichtverhältnisse und andere variablen Umgebungen zu simulieren. Dadurch konnte die Verteilung des Handlungsfluktuationsraums erfasst werden, der in der Schlussfolgerung dazu führt, dass solche Strategien zusammenbrechen. Diese Verteilung zeigt auf direkte Weise, wie die Leistungfluktuation klastisch verteilt ist. Demnach können wir bezüglich der Variationen in der visuellen Repräsentation gezielt eine Rückkopplungsuche durchführen: Welche spezifische Experten-Teleoperative Demonstration sollte in welcher Szene eingeführt werden, um den größtmöglichen Unterstützungsgrad im jeweiligen Featureraum zu bieten und die Strategie mit minimalem Aufwand auf den richtigen Entscheidungspfad zurückzubringen? Wir führen diese Arbeit systematisch durch den gesamten Verteilungsraum. Dies macht uns bei der Sammlung und Nutzung der Trainingsdemonstrationen sehr proaktiv und gezielt. Experimente zeigen, dass unter denselben Vorlagendatenbudgeten die Verbesserung der Endstrategieleistung durch diese Methode deutlich größer ist als durch das blinde Ausweiten der Daten. Dies beweist eindringlich, dass im Vergleich zu einem Spiel, in dem nur die Datenmenge vergrößert wird, die Qualität der gesammelten Daten entscheidend ist. Der Schlüssel liegt darin, gezielt solche Schlüsselsamples auszuwählen, die in der Lage sind, fehlerhafte Strategiemodelle präzise zu „beheben“ und blinde Bereiche zu überdecken. Ich hoffe, dass die heutige Präsentation Ihnen eine neue Sichtweise bietet, wenn Sie sich auf die neue Ära der Robotikstrategien mit End-to-End-Maschinelles Lernen bewegen. Abschließend möchte ich noch einmal meine Kerninitiative betonen: Auf unserem Weg weiterhin zu den allgemeinen autonomen Systemen müssen wir bei der Datenerfassung und -nutzung die wissenschaftlichen Prinzipien befolgen. Denken Sie immer daran: Unser ultimatives Ziel ist nie, endlos Daten in das System zu stapeln, sondern die KI mit den nützlichsten und wichtigsten Kerninformationen zu versorgen, damit sie die Probleme der realen Welt besser lösen kann. Schließlich möchte ich allen herausragenden Partnern danken, die dieses Teilen ermöglicht haben. Vielen Dank, bitte stellen Sie Ihre Fragen!

04


Q&A

▎Q: Im Vergleich zu einem 90%-igen Referenzleistung im angegebenen Umfeld gibt es trotz der umgesetzten Strategie-Reparatur immer noch einen gewissen Erfolgsunterschied, wenn es auf äußere Störungen trifft.

A: Dies ist eine sehr tiefgründige Einsicht: Sie zeigt, dass wir weiterhin die Verteilung der Bewegungsabwesenheiten im Raum detaillierter beschreiben und analysieren müssen. Im aktuellen Stadium bewerten wir bei der Bestimmung des Fallpunkts des Sammelpunkts, ob dieser im Merkmalsraum den größtmöglichen effektiven Unterstützungsgrad bietet, um die globale Raumabdeckung zu maximieren. Wenn wir eine genauere Maßzahl für die Entfernung definieren könnten, könnte es möglich sein, eine genauere a priori Schätzung der spezifischen Kosten für die Strategie-Reparatur zu erhalten. Aber das ist auch heute noch eine große Herausforderung: Der Grund dafür ist, dass der Hochdimensionale Einsatzraum im Grunde nur eine raue Annäherung an einen Maßraum ist. Wir können mathematisch nicht garantieren, dass alle klassischen Analysemethoden für Maße im Einsatzraum weiterhin streng gültig sind, denn diese Repräsentationsräume waren bei ihrer ursprünglichen Konstruktion nicht wirklich strenge Maßräume, sondern lediglich ein Mittel der Annäherung in der Ingenieurwissenschaft.

▎Q: Wenn es auf die methodologische Ebene geht, was ist die zentrale philosophische Grundlage für deine Überlegungen zum Problem der Kommunikation von Robotern?

A: Wenn ich meine grundlegende Auffassung von Kommunikation zusammenfasse, dann liegt der Kern darin: „Wird dies die Handlungsentscheidungen des anderen verändern?“ Wenn ich dir eine Information sende, die keine Veränderung in deinen nächsten Schritten bewirkt – mit anderen Worten, selbst wenn ich es dir nicht sage, wirst du dennoch genau dieselben Handlungen ausführen – warum dann die Bandbreite nutzen, um diese Daten zu teilen? Das ist meine grundlegende Prinzip.

▎Q: Ich möchte eine Frage bezüglich der Beschränkungen des Bloom-Filter-Systems klären, das im Anfang erwähnt wurde. Insbesondere bei dezentraler Kooperation zwischen Robotern wird oft eine probabilistische Methode verwendet, um Zustände zu verbinden; doch es gibt ein klassisches Problem mit der „zweiten Nutzung/kreuzführenden Zählung“ von Daten: Man kann nicht nachverfolgen, wer die aktuellen Informationen veröffentlicht hat und wie die Daten zwischen den Partnern übertragen wurden. Wie kodiert man in dieser stark komprimierten, beschädigten Darstellung die Metadaten wie „wer diese Daten erstellt hat“ und „welche Knoten diese Daten bereits integriert haben“?

A: Bei der Nutzung des Bloom-Filter zur Synchronisierung von Informationen unterscheiden wir sorgfältig zwischen den Eingangssourcen: nämlich zwischen „sequentiellen Beobachtungsreihenen desselben Roboters“ und „kontrastierenden Informationen verschiedener Roboter“. Wenn es um die Frage geht, ob ein einzelner Roboter einen bestimmten Raum beobachtet hat, handelt es sich im Grunde um eine bayesische Konfidenzsumme: Da ich kontinuierlich an diesen Roboter fragt, erhöht sich nach statistischer Unabhängigkeit die Konfidenz, dass dieser Roboter den Raum tatsächlich beobachtet hat, je mehr Male der Raum in mehreren Hashes vorhanden ist. Aber wenn mehrere unterschiedliche Roboter gleichzeitig behaupten, dass sie das Gitter beobachtet haben, verwandelt sich die mathematische Form des Problems in die Berechnung der „Summe der Wahrscheinlichkeiten“, die mindestens von einem dieser Roboter tatsächlich beobachtet wurden. Aus dieser Sicht der Wahrscheinlichkeitsinferenz ist die Vorgehensweise also völlig anders. Und sobald die Daten selbst ungleichmäßig sind – zum Beispiel „Welcher Roboter ist vertrauenswürdiger? Ist der Sensor eines bestimmten Roboters genauer? Oder hat seine Position eine höhere Signal-Rausch-Verhältnis und Präzision?“ ”——Die Komplexität der Aufgabe nimmt stark zu. Wie man die Gewichtungswerte der Zuverlässigkeit des Roboters und die Ursprungsetiketten elegant in einen kompakten Kompressionspaket einbringen kann, ist tatsächlich eine äußerst schwierige und interessante Aufgabe. Nochmals vielen Dank!

Um allen eine gemeinsame Plattform für Austausch und Kommunikation über die Konferenzen zu bieten, haben wir ein spezielles Gruppenkonto für IROS2026 aufgebaut! Welche „Vorteile“ werden Sie in diesem Gruppenkonto erhalten?

  • Konferenz-Informationen-Portal: Einreichungen DDL, Formatvorgaben, Prüfungsstand … wichtige Informationen werden sofort übermittelt – man muss keine Sorge haben, den Deadline zu verpassen. Die Vorbereitung der Einreichungen ist somit sicher.

  • Kollegium-Teegespräch: Alle Kollegen aus allen Ecken sind im Gruppenchat – wir tauschen Erfahrungen aus, besprechen Ideen und knüpfen Kontakte. Auf dem Weg der wissenschaftlichen Forschung sind wir alle gemeinsam unterwegs.

  • Frontlinien-Reservierungspunkt: Aktuellste Forschungsergebnisse und aktuelle Schwerpunkte werden in Echtzeit synchronisiert. Kombiniert mit dem Thema der Konferenz hilft es Ihnen, die Struktur Ihrer Veröffentlichung klar zu gestalten und Ihnen Inspiration für Ihre Arbeiten zu geben.

  • Standort-Support-Team: (ausschließlich während der Konferenz aktiv):Wenn du im Veranstaltungsort bist, brauchst du keine Panik zu haben——

    Route-Navigation: Verteilung der Veranstaltungsorte, wie man zum Berichtssaal kommt – fragen Sie im Gruppenchat jederzeit;

    Thema gemeinsames Lesen: beliebte Sitzungen und Keynotes können auch ohne Teilnahme verfolgt werden;

    Poster-Compilation: Zusammenführung der wichtigsten Poster vor Ort – einfach sammeln und nicht vergessen!

    Yueju Plaza: Essenabende, Interviews, Kommunikationsgruppen… Wenn man reden, zusammenarbeiten oder persönlich treffen möchte, kann das in der Gruppe einfach organisiert werden.

? Eingang zur Gruppe: Scannen Sie den Code, um in die Gruppe einzutreten, oder fügen Sie Luyoyo_2026 hinzu, und hinterlassen Sie eine Anmerkung: IROS + Einrichtung/Schule+Name+Forschungsbereich.

Bei Forschung und Technik ist Informationsvorsprung sehr wichtig.

Komm, gehen wir einen Schritt voran!

Steigen Sie ein, ich zeige Ihnen die wichtigsten Konferenzen zu Künstlicher Intelligenz auf der ganzen Welt

Exklusives Zugangssystem:

Experten-Vortrag PPT

Vollständiger Bericht der Konferenz

Interpretation der beliebten Artikel

Interview mit der neuen akademischen Stern

Scannen Sie das QR-Code oben

Oder klicken Sie auf „Originalartikel lesen“ und betreten die Spezialsseite von Leifengwang (Public Account: Leifengwang).

Artikel von Leifeng Net, ohne Genehmigung verboten mit Verbreitung. Weitere Informationen finden Sie unter Hinweise zur Verbreitung.

Originalquelle

雷峰网 AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten