Chinanews
Other爱范儿Thu, 27 Aug 2026 13:36:06 +0000

La nouvelle version VLA de Xpeng déployée en septembre : 30 secondes de mémoire, 6 secondes d'anticipation, conduire « dans le temps »

La nouvelle version VLA de Xpeng déployée en septembre : 30 secondes de mémoire, 6 secondes d'anticipation, conduire « dans le temps »

Dans le film *Doctor Strange*, le héros active l'Œil d'Agamotto pour faire avancer ou reculer le temps. Dans *Avengers: Infinity War*, il anticipe même de multiples futurs possibles avant d'affronter Thanos.

C'est la magie au cinéma, mais c'est aussi la réalité qu'offre Xpeng.

Le 27 août, Xpeng a organisé une session de partage sur l'IA physique, tout en dévoilant la nouvelle version de son VLA de seconde génération. Le mot clé de cette présentation était « temps ». Xpeng a doté son modèle embarqué d'un « Œil d'Agamotto » : en tournant vers l'arrière, il remonte 30 secondes dans le passé ; en tournant vers l'avant, il anticipe ce qui va se passer dans les 6 prochaines secondes.

Les voitures n'ont pas de Pierre du Temps, mais elles bénéficient de modèles de grande envergure. Le modèle calcule, à partir des informations accumulées dans un passé récent, plusieurs états futurs hautement probables, puis choisit l'action à effectuer à l'instant T. Pour la conduite intelligente, posséder une « mémoire de la chronologie » permet des manœuvres beaucoup plus anthropomorphes.

Lorsqu'un humain conduit, il ne se limite jamais à l'image instantanée : il s'appuie sur la mémoire des secondes précédentes pour évaluer la situation derrière lui, et anticipe l'apparition d'un deux-roues électrique quelques secondes plus tard en fonction du ralentissement de la voiture de devant et des intersections sur le côté. En un sens, la conduite ne se déroule pas seulement sur la route, elle se déroule aussi dans le temps.

La toute nouvelle version 6.3.0 du VLA de seconde génération de Xpeng est précisément un modèle qui conduit dans le flux temporel.

Ce nouveau VLA sera déployé à partir de septembre sur tous les modèles Ultra et Ultra SE, avec une première installation sur les Xpeng G9L Ultra et Ultra SE. Les modèles Max équipés d'une seule puce Turing recevront quant à eux la version distillée VLA Lite de seconde génération en septembre.

La conduite n'a pas de réponse à image unique

L'idée centrale de ce nouveau VLA pour Xpeng est de connecter le passé, le présent et le futur.

Infini-VLA est chargé de se souvenir du passé. Son architecture sous-jacente prend en charge des séquences temporelles plus longues. Compte tenu de la tâche de conduite et de la puissance de calcul embarquée, Xpeng a fixé la mémoire historique de la version de série à 30 secondes.

Autrement dit, il peut mémoriser les conditions de circulation des 30 dernières secondes et les intégrer au jugement actuel.

Lors de la présentation, Xpeng a diffusé une vidéo de démonstration : lorsque la voiture de devant faisait demi-tour au milieu de la route, laissant un espace pour passer, la voiture d'essai n'a pas accéléré immédiatement. Elle a plutôt pris en compte le mouvement précédent, attendant que l'autre véhicule termine son demi-tour avant d'avancer. Le modèle comprend l'action continue de « la voiture de devant est en train de faire demi-tour », au lieu de se limiter à l'image unique d'un « espace qui apparaît devant ».

Cela ressemble à la mémoire à court terme d'une personne en conversation : on n'oublie pas la phrase précédente à chaque nouvelle phrase entendue. De même, un conducteur ne va pas oublier que la voiture de devant s'était préparée à faire demi-tour simplement parce qu'elle se trouve à cet instant en travers de la route.

Si Infini-VLA empêche le véhicule d'oublier le contexte, l'inférence autorégressive en flux continu (« Streaming Inference ») sert à réduire le temps nécessaire au véhicule pour comprendre le présent. Selon Xpeng, le modèle peut acquérir des entrées, faire des déductions et générer une trajectoire simultanément, sans attendre d'avoir pleinement assimilé un historique avant d'agir. Les données fournies par Xpeng indiquent que cette inférence en flux continu accélère la vitesse de décision de 300 %.

Là encore, cela s'apparente à la conduite humaine, où les yeux regardent la route, le cerveau analyse et les mains et pieds agissent en parallèle. Lorsqu'un obstacle apparaît soudainement derrière un masque visuel, ce traitement parallèle permet d'éviter un temps mort d'attente de fin d'inférence.

Se souvenir du passé, se concentrer sur le présent, et naturellement, regarder vers l'avenir. Ainsi, le X-Foresight de la nouvelle version VLA va extrapoler les 6 prochaines secondes en fonction des états antérieurs, tandis que le Flow Matching ajustera la distribution de plusieurs trajectoires possibles pour aider le modèle à choisir l'action la plus appropriée.

Le vocabulaire est hermétique, mais les bénéfices sont très clairs. En observant continuellement la circulation, le nouveau VLA anticipe des situations non survenues mais probables, et prend sa prochaine décision. L'approche de « conduite défensive » souvent évoquée par les conducteurs expérimentés dans la vie réelle est fondamentalement une forme d'anticipation.

Dans une vidéo diffusée sur place, une voiture blanche en sens inverse empiétait sur la voie. La voiture d'essai devait déterminer si l'autre véhicule allait s'arrêter, continuer d'avancer ou céder un peu d'espace, puis déduire si avancer à cet instant bloquerait le passage des deux voitures. Voir où se trouve l'autre conducteur n'est que la première étape ; comprendre ce qu'il s'apprête à faire permet de décider de sa propre manœuvre.

La mémoire du passé et l'extrapolation du futur servent finalement chaque accélération, décélération et virage, permettant à la version 6.3.0 du VLA de seconde génération de « circuler dans le temps ».

Entrer dans le monde réel

Les noms abondent dans les schémas d'architecture, mais sur le terrain, le VLA doit faire face à divers tracas réels. La réponse de Xpeng est d'utiliser un modèle plus large : cette fois, l'entreprise a multiplié par 3,5 le nombre de paramètres du modèle.

Dans une vidéo diffusée lors de la présentation, la voiture d'essai est arrivée à un terminal de ferry. Sans marquage de voie clair, le terminal n'est pas une route classique, mais grâce à la réflexion propre du modèle, le véhicule a trouvé l'entrée par lui-même, est monté à bord, s'est arrêté derrière la voiture de devant, puis a suivi le flux de la circulation pour sortir une fois le ferry accosté.

Une autre vidéo se déroulait sur une route de montagne étroite. Après un virage serré, une branche d'arbre suspendue barrait la route. Le véhicule ne s'est pas arrêté sur place comme devant un simple obstacle, ni n'a foncé vers un interstice semblant encore libre.

Il a ralenti proactivement, observant la relation entre la branche et la carrosserie tout en cherchant un espace de passage.

Il convient de mentionner qu'il y a quelques jours, une Tesla fonctionnant sous FSD v14.3.7 est passée du deuxième au sixième étage dans un parking d'immeuble résidentiel américain, et a tenté de continuer vers le grillage métallique du dernier étage.

Heureusement, le propriétaire a repris la main près du grillage, évitant la chute du véhicule. Face à des cas extrêmes similaires, le VLA de Xpeng et le FSD ont porté des jugements différents : le modèle doit non seulement voir l'espace, mais aussi comprendre s'il s'agit ou non d'une route.

Les ferries et les branches relèvent de scènes très rares, ce qui est précisément la raison pour laquelle Xpeng insiste sur l'élargissement de ses modèles. Un système reposant sur des règles fixes peut être configuré pour les quais, les troupeaux de moutons, les pluies torrentielles ou chaque nouveau...