Xpengs neues VLA-Update im September: 30 Sekunden Erinnerung, 6 Sekunden Vorausschau – Fahren in der „Zeit“
In dem Film „Doctor Strange“ lässt Doctor Strange das Auge von Agamotto rotieren, um die Zeit vor- oder zurückzuspulen. In „Avengers: Infinity War“ sieht er vor dem Duell mit Thanos im Voraus mehrere mögliche Zukünfte.
Das ist Magie im Film, aber auch die Realität, die Xpeng bietet.
Am 27. August veranstaltete Xpeng ein Physical-AI-Seminar und präsentierte gleichzeitig eine brandneue Version der VLA-Generation 2. Das größte Schlagwort dieser Präsentation war „Zeit“.
Xpeng stattete das Modell im Auto mit einem „Auge von Agamotto“ aus: Dreht man es zurück, kann es die Welt der letzten 30 Sekunden rekapitulieren; dreht man es nach vorn, beginnt es, die nächsten 6 Sekunden vorherzusagen.
Autos haben keinen Zeitstein, aber sie werden von großen Modellen unterstützt. Basierend auf den über einen bestimmten Zeitraum gesammelten Informationen berechnet das Modell mehrere wahrscheinlichere Folgezustände und wählt dann die Aktion für den aktuellen Moment. Für das autonome Fahren bedeutet der Besitz eines „Gedächtnisses der Zeitlinie“ einen menschenähnlicheren Betrieb.
Beim Fahren betrachtet man nie nur den aktuellen Frame. Man beurteilt die Verkehrslage hinten anhand der Erinnerung der letzten Sekunden und antizipiert auch E-Scooter, die in wenigen Sekunden auftauchen könnten, basierend auf dem Abbremsen des Vordermanns und der Seitenstraße. In gewissem Sinne findet das Fahren nicht nur auf der Straße statt, sondern auch in der Zeit.
Die neueste Version 6.3.0 der zweiten VLA-Generation von Xpeng ist ein Modell, das im Zeitstrom fährt.
Die neue VLA wird ab September für alle Ultra- und Ultra SE-Modelle ausgerollt, wobei der Xpeng G9L Ultra und Ultra SE als erste ausgestattet werden. Modelle mit einem einzelnen Turing-Chip der Max-Klasse erhalten im September ebenfalls eine destillierte VLA-Lite-Version der zweiten Generation.
Fahren hat keine Einzelbild-Antwort
Der Kernansatz von Xpeng für das neue VLA besteht darin, Vergangenheit, Gegenwart und Zukunft miteinander zu verbinden.
Infini-VLA ist für das Erinnern an die Vergangenheit zuständig. Seine zugrunde liegende Architektur unterstützt längere Zeitsequenzen. Xpeng hat unter Berücksichtigung der Fahraufgabe und der Rechenleistung am Gerät das historische Gedächtnis der Serienversion auf 30 Sekunden eingestellt.
Das bedeutet, es kann sich an die Straßenverhältnisse der letzten 30 Sekunden erinnern und diese in die aktuelle Beurteilung einbeziehen.
Xpeng zeigte auf der Präsentation ein Demonstrationsvideo: Als das vordere Auto auf der Straße wendete, gab es kurzzeitig eine Lücke hinter dem Fahrzeug, durch die man hätte fahren können. Das Testfahrzeug beschleunigte nicht sofort, sondern wartete unter Berücksichtigung des bisherigen Bewegungsablaufs, bis der andere sein Wenden abgeschlossen hatte, bevor es weiterfuhr. Das Modell verstand den kontinuierlichen Vorgang „Das vordere Auto wendet“ und nicht nur das Einzelbild „Eine Lücke erscheint vorn“.
Das ähnelt dem Kurzzeitgedächtnis bei einem Gespräch, bei dem man nicht nach jedem Satz den vorherigen vergisst. Ein Fahrer vergisst auch nicht die Vorbereitungen zum Wenden des Vordermanns, nur weil dieses Auto jetzt quer auf der Straße steht.
Während Infini-VLA dafür sorgt, dass das Fahrzeug den Kontext nicht vergisst, verkürzt die „autoregressive Streaming-Inferenz“ (Streaming Inference) die Zeit, die das Fahrzeug benötigt, um die Gegenwart zu verstehen. Laut Xpeng kann das Modell Eingaben empfangen, schlussfolgern und Trajektorien ausgeben, während es parallel läuft, ohne auf das vollständige Verständnis eines historischen Abschnitts warten zu müssen, bevor es handelt. Xpengs Daten zufolge erhöht diese Streaming-Inferenz die Entscheidungsgeschwindigkeit um 300 %.
Ebenso verhält es sich wie beim menschlichen Fahren, wo Augen auf die Straße schauen, das Gehirn urteilt und Hände und Füße gleichzeitig handeln. Wenn plötzlich ein Ziel aus einer Verdeckung auftaucht, lässt diese parallele Verarbeitung weniger Lücken entstehen, in denen auf den Abschluss der Inferenz gewartet werden muss.
Sich an die Vergangenheit erinnern, die Gegenwart im Blick behalten – natürlich muss man auch in die Zukunft blicken. Daher leitet X-Foresight in der neuen VLA-Version basierend auf historischen Zuständen eine Simulation für die nächsten 6 Sekunden ab, und Flow Matching passt die Verteilung mehrerer möglicher Trajektorien an, um dem Modell bei der Auswahl der geeigneteren Aktion zu helfen.
Das Vokabular ist komplex, aber die Auswirkung ist sehr klar: Die neue VLA-Version beobachtet kontinuierlich die aktuelle Verkehrslage, trifft Vorhersagen über nicht eingetretene, aber mögliche Situationen und entscheidet über den nächsten Schritt. Das „defensive Fahren“, das erfahrene Fahrer im realen Leben oft erwähnen, ist im Wesentlichen auch eine Vorhersage.
Im Video vor Ort besetzte ein weißes Gegenverkehrsfahrzeug die Gegenfahrbahn. Das Testfahrzeug musste beurteilen, ob der andere warten, weiterfahren oder Platz machen würde, und dann simulieren, ob das eigene Vorwärtsfahren die Wege beider Autos blockieren würde. Zu sehen, wo sich der andere befindet, ist nur der erste Schritt.
Zu verstehen, was der andere tun wird, entscheidet über den nächsten eigenen Schritt.
Die Erinnerung an die Vergangenheit und die Simulation der Zukunft dienen letztendlich jedem Beschleunigen, Bremsen und Lenken und ermöglichen es der Version 6.3.0 der zweiten VLA-Generation, „in der Zeit zu fließen“.
Eintritt in die reale Welt
In den Architekturdiagrammen gibt es viele Begriffe, aber beim Produkt selbst muss sich VLA den verschiedenen Problemen auf realen Straßen stellen. Xpengs Antwort ist die Verwendung größerer Modelle. Diesmal hat Xpeng die Modellparameter um das 3,5-fache vergrößert.
In einem auf der Präsentation gezeigten Video kam das Testfahrzeug an eine Fähranlegestelle. Am Dock gab es keine klaren Fahrspuren, und der Anleger ist keine gewöhnliche Straße. Doch durch das eigenständige Denken des Modells fand das Fahrzeug den Eingang, fuhr auf die Fähre, hielt hinter dem Vordermann an und fuhr nach der Ankunft der Fähre mit dem Verkehr wieder heraus.
Ein weiteres Video spielte sich auf einer engen Bergstraße ab. Nach einer scharfen Kurve tauchte ein freihängender Ast auf der Straße auf. Das Fahrzeug hielt ihn nicht für ein gewöhnliches Straßenhindernis und blieb stehen, noch fuhr es direkt auf die scheinbar noch vorhandene Lücke zu.
Stattdessen verlangsamte es aktiv, beobachtete die Beziehung zwischen dem Ast und der Karosserie und suchte nach einem Durchfahrtsraum.
Es ist erwähnenswert, dass ein Tesla mit FSD v14.3.7 vor einigen Tagen in einem Parkhaus einer Wohnanlage in den USA vom zweiten bis zum sechsten Stock fuhr und versuchte, weiter in Richtung des Metallzauns auf dem Dach einen Weg zu finden.
Glücklicherweise übernahm der Fahrer in der Nähe des Zauns, sodass das Fahrzeug nicht abstürzte. Bei solchen extremen „Corner Cases“ trafen Xpengs VLA und FSD jedoch unterschiedliche Entscheidungen. Das Modell muss nicht nur den Raum sehen, sondern auch verstehen, ob es sich um eine Straße handelt.
Fähren und Äste gehören zu seltenen Szenarien, und genau das ist der Grund, warum Xpeng auf eine Vergrößerung des Modells besteht. Ein System, das auf festen Regeln basiert, kann auf Fähren, Schafherden, Starkregen oder jede neue...