Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

Nach den Roboter-Sportspielen: X-Square errichtet einen „virtuellen Trainingsplatz“ für Roboter

Nach den Roboter-Sportspielen: X-Square errichtet einen „virtuellen Trainingsplatz“ für Roboter

Ich wurde nun schon eine Woche lang mit Roboter-Nachrichten überflutet.

Roboter haben den menschlichen 100-Meter-Rekord gebrochen, sind fast drei Meter hoch „an Ort und Stelle gestartet“, die „schüchterne Laufhaltung“ ging im Ausland viral, und der „Cyber-Zhang Sanfeng“ absolvierte einen 540-Grad-Sprung in der Luft...

**Die diesjährigen Welt-Sportspiele für humanoide Roboter waren noch lebhafter: 666 Teams aus 16 Ländern auf sechs Kontinenten brachten 2056 Roboter nach Peking. Die Wettbewerbe erstreckten sich von Leichtathletik und Kampfkünsten bis hin zu realen Szenarien wie Haushalt, Hotel, Industrie und Notfallrettung. Wenn Roboter auf dem Spielfeld jedoch stürzten, wurde darüber einfach gelacht. Wenn Roboter jedoch tatsächlich in Haushalte eindringen, könnten sie Wassergläser umstoßen, Möbel umfahren oder frisch aufgeräumte Kleidung wieder auf den Boden werfen – dann ist das Lachen vorbei. In der realen Welt gibt es keine festen Laufbahnen und einheitlich platzierte Requisiten. Wenn ein Glas leicht verschoben wird oder ein Putzlappen auf dem Tisch auftaucht, können die zuvor trainierten Bewegungen versagen. Diese Fehlerversuche der Roboter in eine virtuelle Welt zu verlagern, ist genau das, was aktuelle Weltmodelle (World Models) anstreben. Sie versuchen, eine physikalisch korrekte Umgebung zu rekonstruieren, damit der Roboter vor dem eigentlichen Handeln eine Generalprobe abhalten kann: Wird er ins Leere greifen, wenn die Hand etwas nach links abweicht, oder wird das Glas umgestoßen, wenn der Greifer zu früh schließt? In der Praxis können jedoch viele Weltmodelle kein zuverlässiges „virtuelles Testen“ gewährleisten. Sie verstehen vielleicht das Bild, gehorchen aber nicht wirklich den Aktionen. Je länger die Simulation dauert, desto mehr beginnen Objekte und Positionen zu driften. Eine Strategie, die in der virtuellen Welt besser abschneidet, funktioniert auf einem echten Roboter nicht zwingend. Gerade als Roboter beginnen, von der Arena in reale Szenarien überzugehen, hat X-Square Robot das autoregressive Weltmodell WALL-SS veröffentlicht.

Dieser von WALL-SS errichtete „virtuelle Trainingsplatz“ durchbricht endlich den Flaschenhals der Weltmodelle. Ob Aktionen tatsächlich Ergebnisse verändern, ob bei langen Aufgaben Konsistenz gewahrt bleibt und ob virtuelle Erfolge dem Test auf realer Hardware standhalten – all das hat nun neue Lösungen und Antworten. Es kann das Ausgießen von Wasser und das Sortieren von Gegenständen über einen Zeitraum von 60 Sekunden simulieren, um die Ergebnisse verschiedener Aktionen zu testen: Wird das Glas je nach Griffweise ins Leere gegriffen, umgestoßen oder erfolgreich aufgehoben? Das Forschungsteam hat außerdem mehrere Roboterstrategien jeweils in WALL-SS und in der realen Welt getestet. Bewegungsstrategien, die in der virtuellen Welt gut funktionieren, führen in der physischen Welt oft ebenfalls zu guten Ergebnissen. Das ist faszinierend: Die „Träume“ der Roboter können nun tatsächlich zum Üben und Filtern realer Aktionen genutzt werden.**

**Projekt-Homepage: http://x2robot.com/pages/ss Link zum Paper: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Github-Link: https://github.com/X-Square-Robot/wall-ss

Wie Roboter „träumen“, entscheidet über reale Stürze

Weltmodelle sind derzeit einer der am meisten beachteten Bereiche der Embodied AI. Man kann es sich als ein Vorab-Vorschau-System im Gehirn des Roboters vorstellen. Gibt man ihm das aktuelle Bild und eine Reihe von auszuführenden Aktionen, sagt es voraus, was als Nächstes passieren wird. Bewegt sich der Roboterarm 1 Zentimeter nach links, wird das Glas gegriffen oder umgestoßen? Ist die Schublade bereits offen, sollte im nächsten Schritt weiter entnommen oder zuerst der Handgelenkwinkel angepasst werden? Der Roboter kann mehrere Zukünfte vergleichen und dann entscheiden, welchen Aktionspfad er einschlägt.

Roboterunternehmen können auch verschiedene Versionen von Aktionsstrategien im Weltmodell testen. Die besser abschneidenden Versionen kommen dann auf die echte Hardware, was die hohen Kosten für das Testen von Bewegungseffekten in der realen Welt spart. Das Problem ist, dass viele Weltmodelle oft eher wie ein übermäßig optimistischer Regisseur agieren. Die Trainingsdaten für Roboter bestehen meist aus erfolgreichen Demonstrationen. Wenn das Modell sieht, dass auf die meisten Schließbewegungen des Greifers das Aufheben eines Objekts folgt, sucht es sich gerne eine Abkürzung: Solange der Greifer geschlossen ist, sollte das Objekt aufgehoben werden. Selbst wenn zwischen dem Greifer und dem Objekt noch eine deutliche Lücke besteht, könnte das Objekt im generierten Bild aktiv zum Greifer hingezogen werden. Das Papier bezeichnet dieses Phänomen als Fehler ähnlich eines „magnetischen Griffes“.

Solche Abweichungen fallen bei großen Bewegungen wie Laufen oder Tanzen vielleicht nicht auf, bei feinmotorischen Operationen entscheiden sie jedoch direkt über Erfolg oder Misserfolg. Fehlen nur wenige Millimeter zwischen Greifer und Glasgriff, greift der Roboter ins Leere. Ist der Winkel des Steckers minimal abweichend, lässt er sich kaum problemlos in die Buchse einführen. Der Schritt vom „Können“ zum „Tun“ scheitert bei Robotern oft an den letzten paar Millimetern. Wenn das Weltmodell diese wenigen Millimeter einfach glättet, je flüssiger die präsentierte Zukunft ausfällt, desto eher überschätzt der Roboter die Zuverlässigkeit einer Aktion. Bei längerer Simulationsdauer treten zudem neue Probleme auf. Nachdem das Weltmodell eine Sequenz generiert hat, muss es diese als Grundlage für die nächste Vorhersage verwenden. Ein anfänglich kleiner Fehler summiert sich im weiteren Verlauf. Objekte können langsam von ihrer Ursprungsposition abweichen, und die Kontaktbeziehung zwischen Greifer und Glas kann sich verändern. Behält das Modell nur die letzten paar Frames, vergisst es, was es zuvor getan hat. Behält es jedoch die gesamte Historie, steigen Rechenaufwand und Speicherbedarf kontinuierlich an. Ein realistisch aussehendes Video bedeutet nicht, dass die vom Modell gewählte Strategie tatsächlich besser ist. Die Roboterforschung muss wissen, ob der Gewinner des virtuellen Tests auf echter Hardware weiterhin führend bleibt. Das Weltmodell muss sicherstellen, dass unterschiedliche Aktionen tatsächlich zu unterschiedlichen Ergebnissen führen. Eine flüssige Bildausgabe ist nur der oberflächlichste Schritt.**

Wie sich der Roboter bewegt, so sollte sich auch die Zukunft verändern

Wenn WALL-SS das Bild der nächsten Sekunden vorhersagt, erstellt es zunächst eine „Vorschau in niedriger Auflösung“. In dieser Vorschau legt das Modell zuerst die Hauptrichtung fest: Wohin bewegt sich der Roboterarm und wie wird sich das Objekt grob bewegen? Anschließend schärft es dasselbe Bild Schicht für Schicht und ergänzt Objektkonturen, Greiferöffnungen und -schließungen sowie Kontaktpositionen. Das Papier bezeichnet diese Hierarchie von groben Konturen bis zu feinen Details als „Skala“. Die bereits generierten Bilder und stattgefundenen Aktionen werden zur Historie für die nächste Vorhersage – dies ist die „Autoregression der nächsten Skala“. Mit jeder schärferen Bildstufe beeinflussen die Aktionen die Zukunft erneut. Ob der Arm nach links oder rechts geht, verändert zuerst die Bewegungsrichtung im unscharfen Bild. Wann der Greifer schließt, beeinflusst weiterhin, ob im scharfen Bild das Glas berührt wurde oder nicht. Nachdem ein kurzer Abschnitt der Zukunft generiert wurde, geht er zusammen mit den bereits stattgefundenen Aktionen in das Gedächtnis über und wird zur Grundlage, auf der das Modell weiter... …[Originaltext zu lang, Übersetzung wurde abgeschnitten]