雷峰网 AI

Galaxy General & Tsinghua LATENT: Mit „unvollkommenen Menschendaten“ bringen Roboter das Tennisspielen bei | IROS 2026

5 Stunden Action-Fragmente wurden am Ende zu körpereigenen Intuitionen des Roboters. Autorin: Wu Simeng Redaktion: Cen Feng, Ma Xiaoning Wenn man Mario Tennis oder TopSpin gespielt hat, wird man Tennis wahrscheinlich…

5 Stunden Action-Fragmente wurden am Ende zu körpereigenen Intuitionen des Roboters.

    Autorin: Wu Simeng

Redaktion: Cen Feng, Ma Xiaoning

                                                                                                       

Wer Mario Tennis oder TopSpin gespielt hat, wird Tennis wahrscheinlich nicht als etwas besonders Kompliziertes empfinden. Der Ball fliegt heran, man bewegt die Spielfigur, schätzt die Landestelle und drückt zur richtigen Zeit die Schlagtaste. Besonders in Mario Tennis Aces zerlegt das Spiel Tennis sogar in eine sehr intuitive Bewegungssprache: Vorhand, Rückhand, Topspin, Slice, Lob und sogar Spezialschläge, die präzises Timing erfordern. Spielbild von Mario Tennis Aces Tennis in der Realität ist natürlich weit komplexer. Was das Spiel tut, ist„Action Mapping“(action mapping). Im Wesentlichen wird eine sehr abstrakte „Tasteneingabe“ des Spielers auf einen ganzen Satz komplexer Körperbewegungen der Figur abgebildet. Der Spieler muss nicht wissen, wie diese Bewegung ausgeführt wird, denn die dazwischenliegende Bewegungssteuerung übernimmt das Spielsystem. Wann der Ball aufkommt, wann der Körper die Hüfte dreht, in welche Richtung der Fuß gehen muss, mit welcher Geschwindigkeit der Arm schwingen soll – all dies bleibt im Spiel fast vollständig verborgen. Der Spieler sieht nur eine einfache Eingabe, und die Spiel-Engine übersetzt sie in eine Kette vollständiger Körperbewegungen. Selbst wenn der Ball noch so schnell fliegt, gerät die Figur nicht ins Wanken, weil sie das Gewicht nicht rechtzeitig verlagern kann, und schon gar nicht verliert sie das Gleichgewicht, weil ihr Fuß einen Schritt zu langsam war. Ersetzt man aber diese „auf Knopfdruck schlagende“ Figur durch einen echten humanoiden Roboter, dann wird die „Verkörperung“ die Sache völlig verändern.Verkörperte Intelligenz verlangt vom Roboter, den vom Spiel verborgenen körperlichen Prozess wieder selbst zu übernehmen – also die Kluft zwischen Absicht und Bewegung.Er muss zunächst einschätzen, von wo der Ball kommt, und dann entscheiden, wann er sich bewegt und wie weit; wenn er sich dem Treffpunkt nähert, müssen Beine, Hüfte, Rumpf, Schultern, Arme und Handgelenke koordiniert zusammenwirken. Der Kontakt zwischen Schläger und Tennisball dauert vielleicht nur einen winzigen Augenblick, und in genau dieser Zeit muss der Roboter noch eine ganze Reihe von Veränderungen verarbeiten: die eigene Körperhaltung, Gelenkgeschwindigkeiten, Reibung, das Gewicht des Schlägers und die Geschwindigkeit des ankommenden Balls. Tennis ist daher ein sehr interessantes Roboterproblem. Es ist nicht wie das Greifen eines stillstehenden Bechers im Labor. Der Ball fliegt ständig, der Treffpunkt verändert sich fortwährend, und der Roboter darf eine Bewegung nicht nur einmal richtig ausführen, sondern muss sie in sich ständig verändernden Zuständen wiederholt richtig treffen. Er braucht nicht mehr nur das „Wissen, was zu tun ist“, sondern muss den ganzen Körper in wenigen hundert Millisekunden oder sogar weniger zu einer koordinierten Reaktion formen. Genau dies ist auch IROS 2026 eine Arbeit des Teams von Galaxy General (GaLbot), der Tsinghua-Universität, der Peking-Universität, des Shanghai Qi Zhi Instituts und des Shanghai Artificial Intelligence Laboratory –LATENT– die zu beantworten versucht wird. Schon der Titel der Arbeit ist interessant:Athletische Humanoid-Tennisfähigkeiten aus unvollständigen menschlichen Bewegungsdaten lernen. Das Schlüsselwort ist nicht „perfect“, sondern gerade „imperfect“. Das Forschungsteam hat dem Roboter keinen sorgfältig gefilterten, vollständigen und genauen Datensatz professioneller Tennisturniere von Menschen bereitgestellt. Stattdessen gingen sie bewusst von unvollkommenen menschlichen Bewegungsdaten aus, ließen den Roboter die grundlegendsten körperlichen Fähigkeiten des Tennissports erlernen und kombinierten diese Fähigkeiten dann durch bestärkendes Lernen und Simulation zu einer Strategie, die tatsächlich Bälle schlagen kann. Mit anderen Worten: Was sie lösen wollten, war nicht „wie man menschliche Bewegungen vollständig auf einen Roboter überträgt“, sondern eine realitätsnähere Frage:Wenn die menschlichen Demonstrationsdaten für den Roboter von vornherein unvollständig und ungenau sind – was kann er daraus dann noch lernen?

01


Fünf Stunden unvollkommener Daten

Wenn man wirklich möchte, dass ein Roboter einen menschlichen Tennisspieler lernt, ist die intuitivste Methode, diesen Spieler vollständig aufzuzeichnen. Von der Vorbereitungshaltung über Bewegung, Schwung, Schlag und Rückkehr zur Ausgangsposition bis zum nächsten Schlag. Am besten noch mit einer großen Zahl verschiedener ankommender Bälle, verschiedener Treffpunkte, verschiedener Körperhaltungen und sogar kompletten Spielsituationen. So sähe der Roboter nicht nur „wie die Hand schwingen soll“, sondern ein vollständiges Tennisverhalten. Das Problem: Solche Daten sind extrem schwer zu erheben. Ganz zu schweigen davon, dass beim Ziel eines humanoiden Roboters der menschliche Körper und der Roboterkörper strukturell nicht identisch sind. Armlänge, Gelenkbereich, Körpergewicht und Muskelkraft eines Menschen unterscheiden sich vom Roboter; selbst wenn ein Motion-Capture-System die Bewegung eines Menschen exakt aufzeichnet, ist nicht garantiert, dass der Roboter sie identisch ausführen kann. LATENT schlug einen anderen Weg ein. Das Forschungsteam holte 5 Amateurspieler und zeichnete in einem Bewegungserfassungsbereich von etwa 3×5 Metern rund 5 Stunden menschliche Bewegungsdaten auf. Dieser Raum ist nicht einmal ein kleiner Teil eines Standardtennisplatzes. Die Forscher verlangten keine kompletten Spiele, sondern konzentrierten sich auf die grundlegendsten körperlichen Bewegungen des Tennis, darunter Vorhand, Rückhand sowie Bewegungen wie seitliches Gleitschritte und Kreuzschritte. Motion Capture menschlicher Tennisbewegungen Diese Bewegungen wirken sehr kleinteilig. Jemand macht zwei Schritte zur Seite, jemand führt einen Vorhandschwung aus, jemand macht eine Rückhandbewegung. Daraus lässt sich kein vollständiges Tennismatch zusammensetzen, und erst recht kann es dem Roboter nicht sagen, „wohin der nächste Ball gespielt werden soll“. Doch das Forschungsteam ist überzeugt, dass diese Fragmente dennoch etwas sehr Wichtiges enthalten:Wie der Mensch seinen Körper beim Tennisspielen einsetzt.Das ist auch das „imperfect human motion data“ der Arbeit. Das „Unvollkommene“ hat mindestens zwei Ebenen.Erstens: Es ist nicht präzise genug.Die durch Motion Capture gewonnenen menschlichen Bewegungen bedeuten nicht, dass der Roboter sie ohne Anpassung übernehmen kann; besonders bei lokalen Bewegungen wie dem Handgelenk bestehen deutliche Unterschiede zwischen menschlichen Daten und dem Roboterkörper.Zweitens: Es ist nicht vollständig genug.Das Forschungsteam hat grundlegende Tennisbewegungen gesammelt, kein vollständiges Spielverhalten. Die Daten können dem Roboter zeigen, wie er sich bewegt und wie er schwingt, sagen ihm aber nicht direkt, welche Strategie er bei verschiedenen ankommenden Bällen wählen soll. Der klassische Ansatz würde diese Mängel leicht als Problem betrachten: Sind die Daten nicht genau genug, dann einfach weiter sammeln; sind sie unvollständig, dann noch mehr sammeln. LATENT ging stattdessen einen kleinen Schritt zur Seite. Sie versuchten nicht, diese Daten zu einem „perfekten Handbuch der menschlichen Tennisbewegung“ zu reparieren, sondern behandelten sie als Prior. Der Roboter muss nicht die Kopie eines konkreten menschlichen Athleten werden; er muss zunächst wissen, wie der Mensch seinen Körper bei einer schnellen Sportart wie Tennis ungefähr einsetzt. Dieser Unterschied ist wichtig. Denn beim bestärkenden Lernen ist es sehr kostspielig, alle möglichen Körperbewegungen von Grund auf zu erkunden. Ein humanoider Roboter mit 29 Freiheitsgraden hat nicht nur die beiden Möglichkeiten „schlagen“ und „nicht schlagen“. In jedem Moment kann er den Zustand von Beinen, Hüfte, Rumpf, Schultern und Armen verändern. Würde er völlig bei null beginnen, wüsste er nicht einmal, welche Körperbewegung überhaupt als sinnvoll gilt. Menschliche Bewegungsdaten – selbst nur Fragmente – können ihm zunächst eine grobe Grenze ziehen. Das ist wie bei jemandem, der zum ersten Mal einen Tennisschläger in die Hand nimmt. Man muss ihm nicht sofort einen kompletten Profi-Trainingskurs geben; er muss nur wissen, „wie Menschen ungefähr stehen, sich bewegen und schwingen“, und erst dann kann er im fortwährenden Trial and Error seinen eigenen Stil finden. Was LATENT tut, kann man in etwa so verstehen, dass der Roboter zunächst eine solche „Körperintuition“ erhält.

02


Was der Roboter braucht, ist eine „Körpersprache“

Das Forschungsteam hat die gesammelten menschlichen Bewegungen nicht einfach Gelenk für Gelenk in ihn hineingepresst. Die eigentliche Schwierigkeit liegt genau hier:Menschliche Bewegungen sind keine Roboterbewegungen.Wenn ein Mensch schwingt, berechnet sein Gehirn nicht explizit „um wie viele Grad das linke Knie gebeugt wird, um wie viele Grad sich die rechte Hüfte dreht, um wie viele Grad sich der Rumpf neigt“. Was entsteht, ist letztlich eine Körperkoordination. Müsste der Roboter bei jedem Schritt direkt entscheiden, wie sich die 29 Freiheitsgrade bewegen sollen, wäre der Lernraum gewaltig, und es würde beim bestärkenden Lernen leicht zu unnatürlichen oder sogar instabilen Bewegungen kommen. Abbildung des LATENT-Methodenrahmens LATENT trainierte daher zunächst einen Motion Tracker, damit der Roboter die in menschlichen Bewegungen enthaltenen körperlichen Bewegungsmuster lernen kann. Anschließend komprimierte das Forschungsteam diesen Motion Tracker weiter in einen kontinuierlichen latent action space, den sogenannten latenten Aktionsraum. Mit einer anschaulicheren Metapher: Er ähnelt einem „Bewegungswörterbuch“. Der Roboter muss nicht jedes Mal von Grund auf berechnen, wie sich die 29 Gelenke koordinieren sollen, sondern kann zunächst aus diesem Wörterbuch eine bereits gelernte Körperbewegung auswählen und sie dann an den vorliegenden Ball anpassen. Dieser Aktionsraum hat noch eine sehr wichtige Eigenschaft: Er pinnt den Roboter nicht an menschliche Bewegungen fest. Die menschlichen Demonstrationen liefern nur den Bewegungsprior; dem echten Tennisball gegenüber muss der Roboter weiterhin selbst lernen. Deshalb machte die Arbeit „Menschen imitieren“ nicht zum Endziel. Angenommen, ein menschlicher Spieler macht beim Schwung eine Handgelenkbewegung, und diese Bewegung ist für den G1 nicht zuverlässig übertragbar, dann muss der Roboter an dieser Bewegung nicht festhalten. Das Forschungsteam behandelte sogar gezielt das rechte Handgelenk: Sie verringerten seine Zuverlässigkeit in der Motion-Tracking-Phase, sodass der Roboter sich nicht übermäßig auf diese fehlerbehaftete lokale Bewegung verlassen kann, und ließen die höhere Strategie sie beim echten Schlag korrigieren. Dieses Design ist, als würde man dem Roboter absichtlich eine nicht ganz feste Schraube lassen. Kann ein System nur funktionieren, wenn diese Schraube völlig exakt sitzt, dann kann ein kleiner Fehler in der Realität die gesamte Bewegung zum Scheitern bringen. Umgekehrt, wenn der Roboter von Anfang an gezwungen ist, Bewegungen gemeinsam mit Beinen, Hüfte, Rumpf, Schultern und anderen Körperteilen auszuführen, kann er bei einer Abweichung des Handgelenks weiterhin den ganzen Körper verstellen und den Ball zurückschlagen. Das ist auch der interessante Punkt an LATENT:Die menschlichen Daten sind nicht die endgültige Antwort, die der Roboter anstrebt, sondern eher ein Ausgangspunkt, wenn der Roboter Körperbewegungen lernt.Als Nächstes musste das Forschungsteam noch ein sehr typisches Problem des bestärkenden Lernens angehen. Wenn der Roboter bereits ein „Bewegungswörterbuch“ besitzt – wird das bestärkende Lernen dann, um die Rückschlagquote zu erhöhen, beginnen, beliebig zwischen völlig verschiedenen Bewegungen im Wörterbuch zu springen? Die Antwort: Möglich. Deshalb schlug das Forschungsteam die Latent Action Barrier, also LAB, vor. Sie beschränkt die von der höheren Strategie erzeugten Bewegungen, damit die Strategie nicht leicht von der ursprünglichen Bewegungsverteilung abweicht. Latent Action Barrier Die „Barrier“ hier sperrt den Roboter nicht ein, sondern zieht beim Explorieren eine Grenze. Die Arbeit verwendet die Mahalanobis-Distanz, um das Ausmaß der Abweichung zu messen, statt der einfachen euklidischen Distanz. Der Grund ist gut nachvollziehbar: Skala und Veränderungsbereich der verschiedenen Bewegungsdimensionen sind nicht identisch; man darf Veränderungen in allen Richtungen nicht als gleichartige „Abweichung“ behandeln. Die Experimente belegen auch den Wert dieser Beschränkung. Bei der Vorhand-Aufgabe erreichte die vollständige LATENT-Strategie eine Erfolgsquote von 96,52 %; ohne LAB sank sie auf 93,12 %. Noch deutlicher war der Unterschied bei der Bewegungsqualität: Der Glattheitsindikator der Bewegungen stieg von 25,61 auf 37,64, die Gelenkmomente stiegen von 7,40 auf 12,53. Das heißt: Was LAB wirklich verbessert, ist nicht nur, „ob der Ball zurückgeschlagen werden kann“, sondern ob der Roboter bei der Erledigung der Aufgabe weniger abrupte, heftige, mechanische Bewegungen zeigt. Das ähnelt dem Unterschied beim Menschen im Sport. Auch ein Mensch kann gelegentlich den Ball zurückschlagen, aber wenn jeder Schlag auf heftiges Schleudern des Körpers, plötzliches Stoppen und fortwährende Korrektur beruht, ist eine solche Bewegung kaum dauerhaft. Eine wirklich nützliche sportliche Fähigkeit besteht nicht darin, einmal Erfolg zu haben, sondern daraus eine stabile Körpergewohnheit zu machen.

03


Roboter können auch nicht nur in einer „sauberen Welt“ lernen

An diesem Punkt hat der Roboter bereits Bewegungen und eine Strategie. Es bleibt jedoch ein größeres Problem: Die simulierte Welt und die reale Welt sind nicht identisch. In der Simulation kennen die Forscher die Masse des Balls, seine Elastizität, den Luftwiderstand sowie die Masse und die Reibungsparameter des Roboterkörpers. Woher der Ball kommt und wie schnell er fliegt, lässt sich präzise steuern. In der Realität springt ein Tennisball nie immer gleich, der Schwerpunkt eines Schlägers kann geringe Abweichungen aufweisen, und auch die Reibung des Bodens verändert sich. Ebenso unterliegen die Gelenke, Aktuatoren und Sensoren des Roboters Fehlern. Ganz zu schweigen davon, dass echte Systeme zudem Verzögerungen, Rauschen und gelegentlich verlorene Beobachtungen aufweisen. Wenn der Roboter das Spielen nur in einer „perfekten simulierten Welt“ erlernt, können die bereits erlernten Bewegungen in der Realität sofort versagen. Der Ansatz von LATENT besteht nicht darin, die simulierte Welt möglichst perfekt zu machen, sondern das Gegenteil:Unsicherheit aktiv in die simulierte Welt hineinbringen.Das Forschungsteam randomisierte Parameter des Roboters wie Körpermasse, Schwerpunkt, Fußreibung, Gelenkreibung und Antriebsträgheit, ebenso wurden dynamische Parameter des Tennisballs wie Masse, Restitutionskoeffizient und Luftwiderstand randomisiert. Figure 2(c+d):Dynamics Randomization + Observation Noise Gleichzeitig führten sie auch Beobachtungsrauschen, verlorene Frames und Verzögerungen ein. Das bedeutet: Der Roboter sieht während des Trainingssimulierens nicht eine feste Tennisball-Welt, sondern ein ganzes Feld von „möglichen realen Welten“. Manchmal ist der Ball etwas schwerer, manchmal leichter; manchmal ist die Reibung größer, manchmal kleiner; manchmal liefert der Sensor die Daten ein wenig verspätet, manchmal fehlt gleich ein ganzer Frame. Der Roboter wird gezwungen zu lernen: „Auch wenn ich nicht weiß, welche Version der Welt gerade Realität ist, sollte ich trotzdem versuchen, den Ball zurückzuspielen.“ Dies ist auch ein sehr interessanter Unterschied zwischen robotischem Lernen und herkömmlicher programmierter Steuerung. Ein Programm kann der Maschine sagen: Die Ballgeschwindigkeit ist A, die Reibung ist B, die Verzögerung ist C – dann führe die Aktion D aus. Aber die echte Welt liefert dir selten Bedingungen, die so sauber wie A, B und C sind. Deshalb versuchte LATENT nicht, die Unsicherheit zu beseitigen, sondern ließ den Roboter bereits in der Trainingsphase an die Unsicherheit gewöhnen. Die Ablationsexperimente in der Arbeit veranschaulichen dies gut. Ohne die Dynamik-Randomisierung des Tennisballs sank die Erfolgsquote der Vorhand in der realen Welt deutlich auf 16.67 %; ohne Beobachtungsrauschen fiel der Rückhand-Test sogar auf 0 %. Diese beiden Ergebnisse zeigen genau ein Problem auf:Der Grund, warum Roboter in der Realität scheitern, ist manchmal nicht, dass sie die Bewegungen nicht gelernt haben, sondern dass die Welt, die sie gelernt haben, zu sauber war.Dies ist eine der Kernschwierigkeiten von sim-to-real. Den Simulator der Realität immer ähnlicher zu machen ist natürlich wichtig, aber es gibt noch einen anderen Weg: den Roboter daran zu gewöhnen, dass die Realität niemals vollständig wie der Simulator sein wird. LATENT hat den letzteren Weg gewählt. Dieser Ansatz wurde schließlich auf einen echten Unitree G1 übertragen. Hier muss jedoch besonders klargestellt werden: Es handelt sich nicht um einen Roboter, der auf einem gewöhnlichen Tennisplatz allein mit seinen eigenen Kameras alle Experimente durchgeführt hat. Die aktuelle Validierung am echten Roboter stützt sich weiterhin auf ein Motion-Capture-System. Das Forschungsteam verwendete Motion-Capture-Kameras, um Bewegungsinformationen über den Roboter und den Ball zu erhalten; die realen Experimente nutzten eine groß angelegte Motion-Capture-Umgebung. Laut den offiziellen Projektdaten kamen mehr als 50 Motion-Capture-Kameras zum Einsatz, und das Motion-Capture-Gebiet umfasste 19 Meter × 15 Meter. Das bildet einen interessanten Kontrast zur früheren Datenerhebung. Bei der Erfassung der Körperbewegungen von 5 Amateur­spielern benötigte das Forschungsteam nur einen kleinen Bereich von 3 Metern × 5 Metern; um den Roboter in der realen Welt stabil Ball spielen zu lassen, wurde jedoch eine komplette, komplexe Motion-Capture-Infrastruktur benötigt. Das bedeutet:„Unvollkommene Daten“ bedeuten nicht, dass das gesamte Experimentiersystem einfach ist.Ganz im Gegenteil: Das Forschungsteam hat einen Teil des Problems von „wie man perfekte Daten erfasst“ auf „wie man einen Roboter aus unvollkommenen Daten stabile Fähigkeiten lernen lässt“ verlagert, aber die Validierung am echten Roboter bleibt selbst ein teures, komplexes technisches System. Die Arbeit betrachtet die Abhängigkeit vom Motion-Capture-System ausdrücklich als Limitation der aktuellen Arbeit und nennt die künftige Nutzung aktiver Visualisierung als nächsten Schritt. Das bedeutet, dass LATENT heute noch kein „autonomer Tennisroboter“ ist, der die Laborbedingungen bereits hinter sich gelassen hat. Aber es beweist zumindest eines:Unvollkommene Daten können zum Ausgangspunkt dafür werden, dass ein Roboter dynamische Bewegungsfähigkeiten erwirbt.

04


Es hat den Ball wirklich zurückgeschlagen

Am unmittelbarsten überzeugend ist am Ende doch der Ball. In den Simulationsexperimenten führte das Forschungsteam groß angelegte Tests durch und bewertete verschiedene Ankunftsbedingungen des Balls. Die Erfolgsquote der Vorhand-Rückgabe von LATENT erreichte 96,52 %, der durchschnittliche Landepunktfehler betrug 1,32 Meter. Zum Vergleich: Die Vorhand-Erfolgsquoten der Methoden AMP, ASE und PULSE betrugen 41,32 %, 63,47 % bzw. 71,85 %, und die entsprechenden durchschnittlichen Landepunktfehler waren ebenfalls deutlich größer. Diese Zahlen zeigen, dass LATENT den Roboter nicht einfach „eine Schwungbewegung ausführen lässt“. Es verbindet bereits Körperbewegungen, Ballbedingungen und Aufgabenziele miteinander. Bei Bällen aus verschiedenen Positionen und mit verschiedenen Geschwindigkeiten muss der Roboter seinen Körper bewegen, am richtigen Punkt schlagen und den Ball möglichst in das Zielgebiet zurückspielen. Und in der realen Welt blieb das Ergebnis bestehen. Die Arbeit beschreibt 20 aufeinanderfolgende Mensch-Roboter-Rallye-Experimente. Unter Vorhandbedingungen betrug die laut Arbeit berichtete Rückgabe-Erfolgsquote 90,90 %, bei der Rückhand 77,78 %; unter Vorderfeld- und Hinterfeldbedingungen jeweils 88,89 % und 81,82 %. Hier gibt es eine sehr wichtige Einschränkung: Diese Zahlen sind keine „echten Gewinnquoten im Tenniswettkampf eines Roboters“. Der Erfolgsmäßstab in den realen Experimenten war, ob der Roboter den Ball im Feld des Gegners zurückspielen konnte; der Umfang der Experimente umfasste auch nur 20 aufeinanderfolgende Rallyes. Daher ist 90,90 % genauer so zu verstehen: Unter den in der Arbeit definierten realen Experimentbedingungen kann der Roboter die Vorhand-Rückgabe recht stabil ausführen. Es beweist eine Fähigkeit, kein professionelles Wettkampfniveau. Tatsächlich ist die Aufgabe, die LATENT derzeit löst, auch noch relativ klar definiert: Der Roboter muss den ankommenden Ball an eine Zielposition zurückschlagen, nicht aber wie ein echter Tennisspieler ein komplettes Einzel- oder Doppelmatch bestreiten. Ein echtes Tennismatch enthält noch zahlreiche weit komplexere Probleme. Wann sollte man linear spielen, wann diagonal? Wo steht der Gegner? Wie sollte man sich nach diesem Schlag wieder positionieren? Wenn der Gegner die Landepunkte fortlaufend wechselt, wie passt der Roboter seine Taktik an? Und wenn der Ball nicht im erwarteten Bereich landet, was sollte beim nächsten Schlag geschehen? Diese Fragen betreffen nicht mehr nur „wie man schwingt“. Sie verlangen, dass der Roboter eine sich ständig verändernde Wettkampfwelt versteht. Das robot-robot self-play in der Arbeit bietet eine Ergänzung. In der Simulationsumgebung können zwei Roboter, die diese Politik verwenden, ein Selbstspiel bestreiten und bis zu 25 aufeinanderfolgende Rallyes absolvieren. Auch hier muss man jedoch die Grenze ziehen:Die 25 Rallyes stammen aus roboter-gegen-Roboter-Experimenten in der Simulation, nicht aus einem realen Mensch-Roboter-Match.Wenn man LATENT also in die längere Geschichte der Robotik einordnet, dann hat es eigentlich nicht „dem Roboter das Tennisspiel beigebracht“, sondern ein früher schwer lösbares Problem einen Schritt vorangebracht: Kann ein Roboter aus begrenzten Fragmenten menschlicher Bewegungen eine übertragbare körperliche Fähigkeit lernen und sie dann in einer schnellen, dynamischen, fehlerbehafteten Umgebung wirklich einsetzen? Die Antwort ist derzeit ja. Zumindest bei den in der Arbeit definierten Aufgaben kann es das bereits. Und diese Sache ist gerade deshalb bemerkenswert, nicht wegen des Tennisses selbst.

05


Tennis ist nur ein Einstieg

Über lange Zeit fanden Demonstrationen der Bewegungsfähigkeiten von Robotern meist in relativ bestimmten Umgebungen statt. Gehen, Greifen, Tragen, Türen öffnen – jede Aufgabe hatte ein klares Ziel, und die Position von Objekten änderte sich üblicherweise nicht plötzlich. Aber Sport ist nicht so. Der Ball fliegt, das Ziel bewegt sich, die Kontaktzeit ist kurz, die Bewegungen müssen fortlaufend ausgeführt werden. Der Roboter muss nicht nur seinen eigenen Körper kontrollieren, sondern auch fortlaufend auf Veränderungen der Außenwelt reagierend den nächsten Schritt neu entscheiden. Der Sport bietet daher tatsächlich ein sehr extremes Testfeld für embodied intelligence. Fußball verlangt vom Roboter zu laufen, sich zu drehen, zu schießen und die Positionen anderer Spieler zu verstehen; Badminton verlangt Fußarbeit, Schwungbewegungen und Landepunktkontrolle bei schnell ankommenden Bällen; Tennis bündelt diese Probleme weiter in einem sehr konkreten Moment: Der Roboter muss einen schnell heranfliegenden Ball an der richtigen Position, mit der richtigen Körperhaltung und zum richtigen Zeitpunkt treffen. Deshalb ist athletic humanoid robotics auf der diesjährigen IROS 2026 bereits eine separat diskutierte Richtung geworden. Der Workshop „Perception and Decision Making for Athletic Humanoid Robotics“ der IROS 2026 führt agile locomotion, sports, dynamic manipulation, real-time planning, embodied AI und mehr direkt als Diskussionsthemen auf und widmet sich genau der Frage, wie Roboter in schnellen, kontaktintensiven und unvorhersehbaren Umgebungen wahrnehmen, Entscheidungen treffen und den ganzen Körper steuern können. Der Workshop sieht zudem Vorführungen von Sportrobotern von Unitree, Phybot und Booster Robotics vor, die Aufgaben wie Laufen, Badminton und Fußball umfassen. Der Wert von LATENT liegt genau hier. Es hat nicht versucht, die menschlichen Bewegungsdaten in eine äußerst präzise Antwort zu verwandeln. Die 5 Amateur­spieler haben nur einige Bewegungsfragmente hinterlassen, und selbst diese Fragmente enthalten Fehler. Aber diese unvollkommenen Daten sagen dem Roboter dennoch etwas: wie sich Menschen in dieser Welt bewegen, wie sie das Gleichgewicht halten, wie sie ihren Körper schwingen, um ein sich schnell bewegendes Objekt zu verfolgen. Danach geht der Roboter selbst weiter. Er komprimiert menschliche Bewegungen in einen latenten Bewegungsraum und nutzt dann bestärkendes Lernen, um Bewegungskombinationen zu finden, die zu seinem Körper passen; er vertraut der Bewegung des menschlichen Handgelenks nicht vollständig und lernt daher, den ganzen Körper an der Kompensation zu beteiligen; er setzt nicht voraus, dass die Parameter der realen Welt immer korrekt sind, und fügt im Simulator daher aktiv Rauschen, Verzögerungen und Dynamikvariationen hinzu; schließlich bringt er all dies auf einen echten Roboterkörper. Er versucht, eine größere Frage zu beantworten:Wenn wir dem Roboter keine perfekte Gebrauchsanweisung der Welt geben können, kann er dann aus unvollkommenen Informationen selbst ein Verständnis von Körper und Welt aufbauen?Genau das ist das Interessante des Tennis-Testfelds für Szenarien verkörperter Intelligenz: Es verlangt, dass der Roboter in einer Welt ohne feste Antworten, die zudem von anderen Akteuren fortlaufend verändert wird, handelt, Probleme kontinuierlich aufdeckt und sich kontinuierlich optimiert. Der Ball wartet nicht auf den Roboter. Er kommt, und der Körper muss reagieren, bevor die Sprache es kann. Sensoren haben Verzögerungen, Bewegungen haben Fehler, und die ursprüngliche Trajektorie ist dann keine Anleitung mehr, der man einfach folgen kann. Am Ende steht also nicht eine Maschine auf dem Platz, die menschliche Bewegungen frame für frame kopiert. Unter seinen Füßen liegen Bewegungsfragmente von 5 Amateur­spielern, es gibt unvollkommene menschliche Körperdaten, absichtlich offengelegte Unsicherheiten sowie Körperstrategien, die durch beständiges Versuch-Irrtum-Lernen mit bestärkendem Lernen entstanden sind. Der Mensch liefert die Spuren des Wissens, aber was der Roboter erhält, ist nicht das Wissen selbst – den Rest muss sein eigener Körper vollenden.

Um den Austausch und die Weitergabe von Konferenzinformationen zu erleichtern, hat Lei Feng Wang (Öffentlicher Account: Lei Feng Wang) eigens eine IROS 2026 Teilnehmer-Austauschgruppegegründet! Beim Beitritt zur Gruppe schaltest du diese „Vorteile“ frei:

  • Konferenz-Nachrichtenstation: Einreichungs-DDL, Formatrichtlinien, Review-Fortschritt … wichtige Termine werden sofort zugestellt, damit du kein Deadline mehr verpasst – die Einreichungsvorbereitung sitzt.

  • Kollegen-Stammtisch: Kollegen aus aller Welt sind in der Gruppe – Erfahrungen austauschen, Ideen abgleichen, Kontakte knüpfen; auf dem Forschungsweg sind wir unterwegs gemeinsam.

  • Frontversorgungsstation: Neueste Forschungsergebnisse und Trendthemen in Echtzeit, kombiniert mit den Konferenzthemen hilfst dir, den Einreichungsfaden zu ordnen – volle Inspiration für deine Arbeit.

  • Vor-Ort-Supporttruppe: (ausschließlich während der Konferenz aktiv):Auch vor Ort musst du nicht nervös sein –

    Routennavigation: Hallenverteilung, wie du zu den Vortragssälen kommst – jederzeit in der Gruppe fragen;

    gemeinsame Themellektüre: beliebte Sessions und Keynote-Diskussionen – auch wenn du etwas verpasst, kannst du nachholen;

    Poster-Sammlung: kuratierte Highlights der Poster vor Ort, mit einem Klick sammeln und nichts verpassen;

    Treffpunkt-Plaza: Essen, Interviews, Austauschtreffen … etwas plaudern, kooperieren oder sich endlich treffen – einfach in der Gruppe vorschlagen.

? Gruppen-Beitritts-Link: Scanne den QR-Code, um der Gruppe beizutreten, oder füge den WeChat-Kontakt Luyoyo_2026 hinzu, mit Hinweis: ECCV + Institution/Schule + Name + Fachrichtung.

In Wissenschaft und Technik ist der Informationsvorsprung entscheidend.

Komm, lass uns einen Schritt schneller sein!

Steig ein – wir zeigen dir die Highlights der weltweiten Top-KI-Konferenzen

Exklusiv verfügbar:

Präsentationsfolien der Experten

Vollständige Texte der Konferenzvorträge

Interpretationen beliebter Fachartikel

Interviews mit aufstrebenden akademischen Talenten

Scanne den obigen QR-Code

oder klicke auf „阅读原文“, um dem Themenbereich zu folgen.

Dies ist ein Originalartikel von 雷峰网 (Lei Feng Wang). Ohne Genehmigung darf er nicht nachgedruckt werden. Details sieheHinweise zum Nachdruck。

Originalquelle

雷峰网 AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten