Jay aus dem Inneren des Tempels
Quantenbit | Public Account QbitAI
0,2 Sekunden.
Das ist die Zeit, in der der Roboter beim Schließen der Mikrowellen Tür plötzlich durch einen Eintritt von Menschen in die Luft hing.
Es gibt noch interessantere.
Wenn eine Metalldose mit in einen Kuchenbehälter vermischt und zum Mikrowellenofen gebracht wird, holt der Roboter zunächst die Dose heraus und stellt sie beiseite. Nachdem sichergestellt ist, dass der Behälter sicher ist, wird die Dose dann in den Ofen eingeschoben.
Um ehrlich zu sein, war ich beim Ansehen dieser Demos etwas verblüfft.
Diejenigen, die sich langfristig mit Körperbasierte Technologie beschäftigen, sollten erkennen, dass viele Roboter zwar sehr cool aussehen, aber meistens falsche Aufgaben erledigen. Sobald das Licht verändert wird, etwas getreten wird oder die Anweisung eine gewisse implizite Absicht enthält, verlieren die Roboter plötzlich die Kontrolle.
Aber selbst wenn man wie im Video das Handylampe über die Augen des Robots schwenkt, ignoriert es es weiterhin...
Aber die vorhin gezeigten Bilder waren weder eine vorab aufgenommene Wiederholung von Handlungen noch eine zufällig richtige statistische Korrelation.
Angesichts ununterbrochener plötzlicher Störungen hat das System auf der Grundlage des Verständnisses der kausalen Gesetze der physikalischen Welt die Reihe der Handlungen in Echtzeit abgeleitet.
Das System, das diesen Roboter antreibt, trägt den Code CRIS-0.
Hinter ihm steht das Kausalintelligenzunternehmen – gegründet von Huang Biwei, einem Assistenzprofessor an der University of California, San Diego (UCSD) und einer Forscherin der Kausalismus-Schule an der CMU.
Aether AI.
Vor drei Monaten berichtete Quantum über den Weg der Kausalintelligenz, den die Firma gewählt hat. Damals dachte viele, dass Kausal AI noch in mathematischen Formeln und Denkspielen verharrt.
Heute hat Aether AI die offizielle Demo präsentiert.
Abschied von der mechanischen „Verwirrung“: Roboter lernen, Ursache und Wirkung zu verstehen
In den Umsetzungsszenarien von embodied Robots ist es nicht das Standardverfahren, sondern die überall vorhandenen Unfälle, das die Ingenieure am meisten belastet.
Traditionelle Roboter reagieren auf plötzliche Störungen entweder mechanisch auf alte Koordinaten, was zu Kollisionen führt, oder sie erzeugen einfach einen Fehler und bleiben stehen; während End-to-End-Schachtelmodellen bei langen Aufgaben mit mehreren Dutzend Schritten besonders anfällig für kumulierte Fehler sind, und ein falscher Schritt das gesamte System zerstört.
Die Lösung zur Lösung des Problems, die von CRIS-0 gegeben wird, ist „Kausalität“ –
Lassen Sie den Roboter von „Was man sieht“ zu „Warum etwas passiert und was verändert wird, welche Auswirkungen das hat“ gelangen.
Schauen wir uns erstmal die Notenliste an.
Im Test zur Kaffeezubereitung, bei dem es aufgrund externer plötzlicher Störungen zu Problemen kam, hatte das Roboter-System beim Greifen der Kaffeemaschine Probleme mit menschlichen Veränderungen und plötzlichen Lichtveränderungen. CRIS-0 erkannte die Veränderungen der Kausalvariablen innerhalb von mindestens 2 Sekunden durchschnittlich und führte eine Echtzeit-Neuanordnung durch, wodurch 9 Mal eine effektive Wiederherstellung in 10 zufälligen Störungen erreicht wurde.
Und es wird nicht blindlich das gesamte Prozessverfahren von vorne beginnen.
Die Kaffeemaschine wurde bewegt, und das System verfolgt die wichtige Ursache-Wirkungsvariablen „Position des Griffes“. Wenn festgestellt wird, dass der Zustand der Variablen abweicht, korrigiert es nur die Phasen der Annäherung und das Greifen, ohne zurück zu seinem Ausgangszustand zu gehen und neu zu starten.
Die Widerstandsfähigkeit gegen Störungen ist nur eine grundlegende Fähigkeit. Bei langfristigen autonomen Aufgaben zeigt sich der Vorteil des kausaler Drives noch deutlicher.
In der mehrstufigen kontinuierlichen Aufgabe „Suchen und Ordnen im Wohnzimmer“ wird das langfristige Ziel in atomare, verifizierbare Ursache-Wirkungs-Phasen aufgeteilt, und bei jedem Schritt werden Vorbedingungen sowie Nachbedingungen überprüft.
Interessanter ist die Fähigkeit von CRIS-0, allgemeines logisches Denken und physikalische Wahrnehmung zu zeigen:
Beim Aufräumen des Schreibtisches ordnet es die verstreuten gewöhnlichen Bücher auf den Couchtisch, aber die mit persönlichen Geheimnissen verbundenen Rechnungen legt es in den Schubladen ab;
Vor zwei ähnlich aussehenden Flaschen erkennt es zunächst durch Greifen und Schütteln das Gewicht der Flasche sowie den Zustand des Inhalts. Erst wenn sie leer sind, wirft es sie in den Müll. Wenn noch Getränke im Inneren sind, setzt es sie sicher wieder an ihren Platz.
Schließlich kann因果 bei der Behandlung unklarer Anforderungen die Generalisierbarkeit des Promptes erheblich verbessern, wodurch eine individuelle Verständnisfähigkeit entsteht.
Im Personal Pick and Place-Test erzielte das System bei 20 vagen Anweisungen, die implizite Schlussfolgerungen erfordern, wie „Bring mir eine Flasche Getränk, das sich nach dem Morgenlauf eignet“, 18 präzise Greif- und Platzierungsversuche.
Es basiert nicht auf dem Gedächtnis von Schlüsselwörtern, um Glück zu haben, sondern verknüpft Zeit, Benutzerzustand und Umgebungskontext, um „nach dem Training Energie zu ergänzen und hohe Zuckergehalten zu vermeiden“ als versteckte Ursachevariable herauszufiltern und entsprechende Aktionen automatisch auszurichten.
Welche Art von Technologiearchitektur steht hinter diesen Demos?
Dekomposition von CRIS-0: Die schwarze Box in eine kausale Engine umwandeln
Bevor wir diese Frage beantworten, sollten wir vielleicht erst eine andere Frage klar machen –
Warum wirkten die frühen Roboter immer „dumm“?
Die physische Welt und die reine digitale Welt sind völlig unterschiedlich. Im Computer schreibt man Code oder chatt, und wenn man einen Fehler macht kann man ihn zurücknehmen. In der realen Welt jedoch geschehen alle möglichen Ereignisse – Reibung, Schwerkraft, Kollisionen, Veränderungen der Lichtstrahlen – und das jedes Sekundenmal.
Traditionelle End-to-End-Modelle wie das VLA-System lernen zwar schnell, aber bei langfristigen Aufgaben weisen sie eine tödliche Schwäche auf: die kumulierte Fehlermenge.
Schritt 1 weist eine kleine Abweichung auf, bei Schritt 2 wird die Abweichung größer, und beim 10. Schritt könnte der gesamte Vorgang bereits vollständig verändert sein. Noch schlimmer ist, dass das einzelne Blackbox-Modell, wenn es auf Störungen trifft, nicht weiß, was genau passiert ist. Oft muss es einfach weiterhin nach dem ursprünglichen Plan voranschreiten, oder es bricht direkt zusammen und stoppt.
Und ein weiterer häufiger Agent-Plan führt zwar Schritt für Schritt durch, aber seine Denklogik bleibt im Wesentlichen bei der Wahrscheinlichkeitsrechnung von reinem Text oder Multimodalen Large Models.
Jedes Mal, wenn sich die Umgebung ändert, muss es zuerst das Bild in Text umwandeln. Dann überlegt das Modell langsam, was als Nächstes zu tun ist. Wenn du fertig gedacht hast, könnte deine Hand bereits von der Tür gefangen sein...
Wie wird hinter der Widerstandsfähigkeit gegen Störungen und der Kohärenz, die CRIS-0 zeigt, eigentlich das geschehen?
Aether AI hat eine neue Logik entwickelt:
Kausale, native Agent-Architektur.
Man kann es aus drei Dimensionen verstehen –
1. Aufgabe ist Status: Extraktion der physikalischen kausavernen Variablen
Das ist das, was ich für das wichtigste Prinzip der Erstprinzipien halte.
Im System CRIS-0 gibt es eine sehr tiefe Veränderung, die als einheitlicher Zustand und kausale Variablen bezeichnet wird.
Die früheren Roboter sahen die Welt durch dicht gepackte Bildpixel. Aber in den Augen von CRIS-0 geht es nicht darum, wie die Weltoberfläche aussieht, sondern darum, in welchem Schritt die Aufgabe steht. Die Aufgabe selbst ist ein Kausalitätsstatus-Profil.
Ein besonders praktisches Beispiel ist zum Beispiel, wie Roboter Tischdecken auslegen.
Es wird nicht dumm sein, die Koordinaten jedes Pixel des Tischdecks zu berechnen, sondern verfolgt in Echtzeit einige wichtige Ursache-Wirkungs-Variablen. Zum Beispiel, ob das Tischdeck von den Greifen tatsächlich festgehalten wird, wie viele Zentimeter der Eckpunkte des Tischdecks vom Zielpunkt entfernt sind und ob beim Ziehen eine Abnutzung stattfindet.
Sobald die Erfassung abrutscht, weiß das System sofort, dass die Kausalvariablen für „Fassen“ nicht erfüllt sind. Dann geht der Status der Aufgabe direkt zurück in die Phase des erneuten Erfassens, anstatt das gesamte Prozessverfahren neu zu starten oder blind weiterhin Luft nach unten zu ziehen.
In den offiziell veröffentlichten Tests zur Störung der Kaffeeherstellung konnte das System gegenüber den quälenden Bedingungen wie wiederholten Verschiebungen der Kaffeemaschine und plötzlichen Lichtveränderungen in durchschnittlich 2 Sekunden die Veränderungen der wichtigen Variablen erkennen und eine Neuprogrammierung durchführen. Bei 10 externen Störungen gelang es dem System 9 Mal eine effektive Wiederherstellung.
Das ist die Kraft der kausavernichten Variablen: Wenn etwas Unerwartetes passiert, weiß sie genau, in welcher Schritt der Fehler liegt und auf welchen Schritt man zurückkehren muss.
2. Einheitliche Tool-Schnittstelle: Verweigern einer einzigen Strategie, alles zu kontrollieren
Wie führt dieses System genau die Action aus?
Antwort: Tool Call, verschiedene Tools übernehmen unterschiedliche Aufgaben.
In seiner Architektur gibt es einen Planner, der für die Gesamtplanung zuständig ist, und unter seinem Kontrolle ein voll funktionsfähiges Werkzeugkasten, das verschiedene Module über die Unified Tool Interface zusammenführt.
Regelbasierte Funktionen: Kombiniert visuelle Positionierung mit inverse Kinematik, um effizient große Raumbewegungen und vordefinierte Positionen zu lösen;
Fähigkeitsstrategiemodelle (Policy models): Speziell für hochkomplexe Kontaktoperationen wie das Umfüllen und feine Greifen.
Navigationsmodul (SLAM): ist für die globale Wegweisung zuständig;
Verifier (Verifiers): Durchführen physikalischer Prüfungen an jedem Stufenpunkt;
Kausale Weltmodell (CausalWM): Verantwortlich für die Berechnung der physikalischen Folgen von Handlungen.
Darin ist das wichtigste Werkzeug der Tüchtigkeit gerade dieses Weltmodell des Zusammenhangs.
Viele Freunde sprechen über das Weltmodell und reagieren zuerst darauf, ein realistisches Video für die nächsten Sekunden zu erzeugen. Doch CausalWM in CRIS-0 konzentriert sich mehr auf den Einfluss von Handlungen auf die Umgebung.
Seine Logik besteht darin, zunächst den aktuellen Zustand zu betrachten, dann vorherzusagen, welche kausalen Variablen durch die möglichen Aktionen verändert werden könnten, und schließlich den zukünftigen Zustand abzuleiten.
Mit anderen Worten: Bevor der Roboter seine Hand ausstreckt, denkt er bereits nach, wie es aussehen wird. Zum Beispiel: Wenn ich das tue, wird meine Hand schief sein? Wird der Becher umkippen?
Es ist wie eine zusätzliche „Probe“-Schritte hinzugefügt. Das System berechnet zunächst im Weltmodell, wie sich die physikalischen Ursachenvariablen entwickeln, wenn ich Handlung B ausführe, und ruft erst nachdem sichergestellt ist, dass das Ziel erreicht wird, den Action Head abrufen, um die tiefere Steuerung auszugeben.
3. Strukturierte Schleifen und nativ integrierte Sicherheit
Und all das alles wandert im Loop immer wieder ab.
Wenn es um komplexe Aufgaben geht, teilt der Planner große Ziele in kleine Schritte auf. Zuerst ruft er eine Regelfunktion auf, um die Greifer schnell in die Nähe des Ziels zu bewegen, anschließend ruft er ein Strategiemodell auf, um einen präzisen Kontaktgreifvorgang durchzuführen. Komplexe Probleme, die mit einem einzigen Modell schwer zu lösen wären, werden in wenige sicherheitstechnisch sehr hohe kleine Schritte aufgeteilt.
Konkret handelt es sich um ein dynamisches, evolierendes Task-Graph: Zustandsidentifikation → Werkzeugauswahl → Ausführung → Überprüfung → Anpassung.
Jedes Mal, nachdem eine Schritt erfolgt ist, überprüft der Validator sofort, ob die physikalischen Bedingungen erfüllt sind. Falls nicht, verfügt das System über ein klares dreistufiges Wiederherstellungsmechanismus: Zuerst wird geprüft, ob eine direkte Wiederholung in dieser Phase möglich ist; falls nicht, wird der Weg neu geplant. Erst wenn das auch nicht möglich ist, wird angezeigt, dass eine manuelle Intervention erforderlich ist.
Sobald eine unerwartete Anpassung erfolgreich ist, wird dieser erfolgreiche Wiederherstellungspfad in die Aufgabenkarte aufgezeichnet. Beim nächsten Mal wird es leichter gehen.
Das erklärt auch, warum es bei der Aufräumaufgabe im Wohnzimmer kontinuierlich Dutzende oder sogar Hunderte von Schritten ausführen kann, ohne zu kollabieren.
Da jeder Schritt die Ursache und Wirkung verifiziert, wird der Fehler sofort gelöst, sobald er entsteht. Es gibt keine Möglichkeit, dass er sich wie eine Schneeball-Bewegung ausbreitet und zu einem globalen Zusammenbruch führt.
Ebenso ist dies der Grund, warum es eine sichere Notbremsung in 0,2 Sekunden erreichen kann.
In CRIS-0 ist die Sicherheitsprüfung direkt in jeder Kausalphase integriert.
In der Phase des Schließen sind plötzlich auftretende Mitarbeiter eine gefährliche Variable, die die Sicherheitsbedingungen des Benutzers gefährden kann. Das System kann in der Status Ebene sofort erkennen und die höchste Prioritätige Blockierung auslösen, was einen Stopp in 0,2 Sekunden bewirkt.
Aber wenn die aktuelle Aufgabe darin besteht, den Menschen ein Glas Wasser zu geben, dann ist die ausgestreckte Hand das Zielvariablen der Interaktion, und das System stürzt nicht ab.
Tatsächlich entstand die solche systemseitige Fähigkeit von CRIS-0 nicht aus dem Nichts, sondern wird von einer solideen Forschungsgrundlage unterstützt.
In der Bewertung der Agent-Fähigkeiten erreichte das Kausal-Agent-Framework von Aether AI RSIAgent vorher auf OSWorld 2.0 einen Partial Score von 78,98 %. Ohne die Modelparameter zu aktualisieren konnte es die Agent-Fähigkeiten des Open-Source-Modells verbessern und übertraf dabei geschlossene Modelle wie GPT-6 Astra.
Die erste Version des Kausale Weltmodells CausalWM erreichte auch auf dem Robotik-Weltmodell-Standard TriWorldBench den Spitzenplatz im Leaderboard und belegte Top-1.
Und diese beiden Ebenen sind die Hauptverantwortlichen für diese Demo.
Außerdem gibt es noch zwei weitere Projekte, die weiterhin vorangetrieben werden – die modulare neuronale Architektur: Jedes Modul entspricht einem verschiedenen kausalen Mechanismus und kann kombiniert oder ersetzt werden; Causation Transformer: Das Lernen von kausalen Beziehungen anstatt statistischer Abhängigkeiten.
Die physische Welt vertraut nicht auf Auswendiglernen
Wenn wir so weit gekommen sind, können wir tatsächlich aus dem konkreten Robot-Demo herauskommen und einen Blick in die Tiefe werfen.
Warum sprechen die Leute jetzt immer häufiger über kausale Intelligenz?
Ehrlich gesagt war der Aufschwung der letzten Runde großer Sprachmodelle in hohem Maße Glück. Die Sprache ist ein Modus, der von den Menschen stark symbolisiert und abstrakt verarbeitet wird. Viele Logiken und Gesetze wurden bereits von den Menschen auf der Oberfläche von Texten zusammengefasst. Man kann durch statistische Anpassungen im Zusammenhang mit Wahrscheinlichkeiten Wunder bewirken.
Aber die physische Welt akzeptiert diese Methode nicht.
Die Reibkraft ändert sich nicht, weil man hunderttausend Artikel gelesen hat. Auch die Schwerkraft verschwindet nicht plötzlich durch Wahrscheinlichkeitsstatistiken. In einer realen Welt voller komplexer Dynamik wird es früher oder später dazu kommen, dass das bloße Anpassen an oberflächliche Korrelationen gegen den Scaling Law prallt.
In einem Fall von erheblicher Mangel an physikalischen Daten muss das System, das wirklich auf komplexe physikalische Umgebungen reagieren kann, lernen, wie ein menschlicher Wissenschaftler, aus wenigen Daten die unterste Kausalmechanik herauszufinden und zu verstehen, wie Handlungen die Welt verändern können.
Diese durch „Kausalität“ als Primärprinzip strukturierte Komprimierung könnte vielleicht die biologisch ursprüngliche Scaling Law sein.
Natürlich ist dieser Weg äußerst schwierig zu bewältigen. Die Anforderungen an die Ursache-Wirkungs-Findung und das Lernen von Kausalsymbolisierung in der Mathematik und Statistiktheorie sind sehr hoch. Weltweit gibt es nur wenige Teams, die sowohl eine tiefe theoretische Ausbildung als auch die Fähigkeit zur praktischen Umsetzung haben.
Die Teilnahme von Aether AI an dem Markt hängt in hohem Maße auch mit ihrem einzigartigen akademischen Kontext zusammen.
Huang Biwei hat in diesem Bereich seit mehr als zehn Jahren intensiv gearbeitet. Sie unterrichtet von den Gründern der Kausalismus-Schule an der CMU, Clark Glymour und Peter Spirtes, sowie von den Nachfolgern der zweiten Generation, Bernhard Schölkopf und Kun Zhang. Sie ist eine der Kernmitglieder der Kausalitätsentdeckungs-Schule.
Die Theoriekonzepte der Drei Generationen-Kausalisten-Schule haben sich schließlich zu den Grundlagen der Technologie des Aether AI heute zusammengefunden.
Von den theoretischen Errungenschaften der Carnegie Mellon University und der Max Planck-Instituts bis hin zur konkreten Implementierung von CRIS-0 in einem echten Roboterarm – die kausale Intelligenz hat endlich einen entscheidenden Schritt in Richtung des physischen Universums gemacht.
Wenn ein System tatsächlich die Fähigkeit besitzt, kausale Variablen zu extrahieren, die Weltdynamik zu modellieren und vor Handlungen die Konsequenzen abzuwägen, dann ist seine Anwendung nicht nur dazu geeignet, jemandem einen Mikrowellenofen anzuschalten oder ein Glas Kaffee einzuschenken.
In Richtung weiter entfernter Bereiche – von der Vorhersage der Trends komplexer dynamischer Systemen bis zu wissenschaftlichen Entdeckungen in Bereichen wie Materialwissenschaften und Lebenswissenschaften – könnte diese Logik vielleicht auch angewandt werden.
Große Zeit, Freunde.
Wir hoffen immer darauf, dass die KI wirklich aus dem rein numerischen Chatfenster herauskommt und stabil in dieser realen, komplexen und voller Unbekannter physikalischen Welt steht.
Und die Kausalität – vielleicht ist das die wichtigste Schlüsselkarte.
— Ende —
QbitAI · Vertragspartner des Headlines
Folgen Sie uns, um sofort über aktuelle Technologieentwicklungen informiert zu werden
