XPeng actualiza su VLA en septiembre: recuerda 30 segundos, predice 6 y conduce «en el tiempo»
En la película «Doctor Strange», el protagonista gira el Ojo de Agamotto para hacer que el tiempo fluya hacia adelante o hacia atrás. En «Vengadores: Infinity War», incluso llega a vislumbrar múltiples futuros posibles antes de su enfrentamiento con Thanos.
Esta es la magia del cine, pero también es la realidad que ofrece XPeng.
El 27 de agosto, XPeng celebró una sesión informativa sobre IA física, donde presentó la nueva versión de su VLA de segunda generación. La palabra clave principal de este evento fue «tiempo». XPeng ha añadido un «Ojo de Agamotto» al modelo del vehículo: girando hacia atrás, puede retroceder 30 segundos en el mundo; girando hacia adelante, comienza a predecir lo que ocurrirá en los próximos 6 segundos.
Los coches no tienen la Gema del Tiempo, pero cuentan con el respaldo de grandes modelos de IA. El modelo calcula varios estados posteriores de mayor probabilidad basándose en la información acumulada en el período reciente, y luego elige la acción para el momento actual. Para la conducción inteligente, tener una «memoria de la línea temporal» permite operaciones mucho más humanizadas.
Al conducir, las personas nunca se fijan solo en el fotograma actual; uno juzga la situación del tráfico trasero basándose en la memoria de los segundos anteriores, y también prevé la posible aparición de un patinete eléctrico en los próximos segundos según la desaceleración del coche de adelante y una bifurcación en la carretera. En cierto sentido, la conducción no solo ocurre en la carretera, sino también en el tiempo.
La última versión 6.3.0 del VLA de segunda generación de XPeng es un modelo que conduce en el flujo del tiempo.
Este nuevo VLA comenzará a implementarse en septiembre para todos los modelos Ultra y Ultra SE, con el XPeng G9L Ultra y Ultra SE siendo los primeros en equiparlo. Por su parte, los modelos Max con un solo chip Turing recibirán en septiembre la versión destilada VLA Lite de segunda generación.
La conducción no tiene una respuesta de un solo fotograma
La idea central de XPeng para el nuevo VLA es conectar el pasado, el presente y el futuro.
Infini-VLA se encarga de recordar el pasado. Su arquitectura subyacente puede soportar secuencias temporales más largas. Teniendo en cuenta la tarea de conducción y la carga computacional del dispositivo, XPeng ha establecido la memoria histórica de la versión de producción en 30 segundos.
Es decir, puede recordar las condiciones de la carretera de los últimos 30 segundos e integrarlas en el juicio actual.
XPeng mostró un vídeo de demostración en la sesión informativa: cuando el coche de adelante hizo un giro en U en medio de la carretera, dejó temporalmente un espacio por el que se podía pasar. El coche de prueba no aceleró inmediatamente, sino que, combinando el proceso de movimiento anterior, esperó a que el otro vehículo completara el giro antes de avanzar. Lo que el modelo entiende es la acción continua de «el coche de adelante está haciendo un giro en U», en lugar de solo el fotograma de «hay un espacio adelante».
Esto se parece a la memoria a corto plazo de una persona durante una conversación; uno no olvida la frase anterior cada vez que escucha una nueva, y un conductor no olvidaría la maniobra de preparación para girar del coche de adelante simplemente porque ahora está atravesado en la carretera.
Si Infini-VLA evita que el vehículo olvide el contexto, la «inferencia autorregresiva de transmisión» (Streaming Inference) se encarga de reducir el tiempo que el vehículo tarda en comprender el presente. Según la explicación de XPeng, el modelo puede adquirir entradas, inferir y generar trayectorias simultáneamente, sin tener que esperar a comprender completamente un historial antes de comenzar a actuar. Los datos proporcionados por XPeng indican que esta inferencia de transmisión aumenta la velocidad de decisión en un 300%.
Del mismo modo, esto es similar a cuando una persona conduce: los ojos miran la carretera, el cerebro juzga y las manos y los pies operan al mismo tiempo. Cuando un objetivo aparece de repente desde un punto ciego, este procesamiento en paralelo reduce el vacío de espera a que se complete la inferencia.
Recordar el pasado y centrarse en el presente implica, naturalmente, mirar al futuro. Por ello, X-Foresight en la nueva versión del VLA deducirá los próximos 6 segundos basándose en estados históricos, y Flow Matching ajustará la distribución de múltiples trayectorias posibles para ayudar al modelo a elegir la acción más adecuada.
La terminología es oscura, pero su función es muy clara: el nuevo VLA, mediante la observación continua de las condiciones actuales de la carretera, anticipa situaciones que aún no han ocurrido pero que podrían producirse, y toma la siguiente decisión. La «conducción defensiva» que los conductores experimentados suelen mencionar en la vida real es, en esencia, también un tipo de anticipación.
En un vídeo mostrado en el evento, un coche blanco en sentido contrario ocupaba el carril inverso. El coche de prueba necesitaba determinar si el otro vehículo iba a esperar, continuar avanzando o ceder una parte del espacio, para luego deducir si avanzar en ese momento bloquearía el paso de ambos coches. Ver dónde está el otro coche es solo el primer paso; comprender qué va a hacer es lo que determina la siguiente maniobra propia.
Los recuerdos del pasado y las deducciones del futuro sirven en última instancia a cada aceleración, desaceleración y giro, permitiendo que la versión 6.3.0 del VLA de segunda generación «fluya en el tiempo».
Entrando en el mundo real
Hay muchos términos en el diagrama de arquitectura, pero volviendo al producto, el VLA aún tiene que enfrentarse a diversos problemas en las carreteras reales. La respuesta de XPeng es utilizar un modelo más grande; esta vez, la empresa ha aumentado los parámetros del modelo en 3,5 veces.
En un vídeo reproducido durante la sesión, el coche de prueba llegó a un muelle de ferry. No había líneas de carril claras y el muelle no era una carretera convencional, pero gracias al razonamiento del propio modelo, el vehículo encontró la entrada por sí solo, subió al ferry y se detuvo detrás del coche de adelante. Una vez que el ferry atracó, salió siguiendo el flujo de tráfico.
Otro vídeo tuvo lugar en una carretera de montaña estrecha. Después de una curva cerrada, apareció una rama colgante en la carretera. El vehículo no se detuvo en el lugar tratándola como un obstáculo normal, ni avanzó directamente hacia un hueco que parecía tener espacio, sino que redujo activamente la velocidad, observando la relación entre la rama y la carrocería mientras buscaba un espacio para pasar.
Cabe mencionar que hace unos días, un Tesla con FSD v14.3.7 en un aparcamiento de un edificio de apartamentos en Estados Unidos condujo desde el segundo hasta el sexto piso, e intentó seguir buscando un camino hacia la malla metálica de la azotea.
Afortunadamente, el propietario tomó el control cerca de la malla y el vehículo no cayó. Ante casos extremos o «corner cases» similares, el VLA de XPeng y el FSD tomaron decisiones diferentes; el modelo no solo debe ver el espacio, sino también comprender si eso es o no una carretera.
Los transbordadores y las ramas son escenarios poco comunes, y son precisamente la razón por la que XPeng insiste en ampliar el modelo. Un sistema que depende de reglas fijas puede abordar muelles, rebaños de ovejas, lluvias torrenciales o cada nuevo...