XPeng lancia la nuova VLA a settembre: ricorda 30 secondi, prevede i successivi 6, e inizia a guidare «nel tempo»
Nel film "Doctor Strange", l'omonimo protagonista ruota l'Occhio di Agamotto per far scorrere il tempo in avanti o all'indietro; in "Avengers: Infinity War", invece, vede in anticipo molteplici futuri possibili prima dello scontro con Thanos.
Questa è magia al cinema, ma è anche la realtà offerta da XPeng.
Il 27 agosto, XPeng ha tenuto una sessione di condivisione sull'AI fisica, presentando allo stesso tempo la nuova versione della VLA di seconda generazione. La parola chiave principale di questo incontro era "tempo": XPeng ha dotato il modello a bordo dell'auto di un "Occhio di Agamotto". Ruotandolo all'indietro, può ripercorrere il mondo degli ultimi 30 secondi; ruotandolo in avanti, inizia a prevedere cosa accadrà nei successivi 6 secondi.
L'auto non ha la Gemma del Tempo, ma è supportata da un grande modello che, basandosi sulle informazioni accumulate in un certo lasso di tempo, calcola gli stati successivi con maggiore probabilità e sceglie l'azione per il momento attuale. Per la guida intelligente, possedere una "memoria della timeline" consente operazioni molto più antropomorfe.
Quando una persona guida, non guarda mai solo il fotogramma presente: si basa sulla memoria dei secondi precedenti per valutare le condizioni del traffico dietro di sé, e prevede l'improvvisa comparsa di un ciclomotore qualche secondo dopo, osservando la decelerazione dell'auto davanti e un'intersezione laterale. In un certo senso, la guida non avviene solo sulla strada, ma anche nel tempo.
L'ultima versione 6.3.0 della VLA di seconda generazione di XPeng è proprio un modello che guida nel flusso del tempo.
La nuova VLA inizierà a essere distribuita a settembre su tutti i modelli Ultra e Ultra SE, con XPeng G9L Ultra e Ultra SE che saranno i primi a equipaggiarla, mentre i veicoli Max con un singolo chip Turing riceveranno a settembre la versione Lite distillata della VLA di seconda generazione.
La guida non ha risposte a singolo fotogramma
L'idea centrale di XPeng per la nuova VLA è collegare passato, presente e futuro.
Infini-VLA si occupa di ricordare il passato. La sua architettura di base supporta sequenze temporali più lunghe; XPeng, considerando il compito di guida e il carico di calcolo lato dispositivo, ha impostato la memoria storica della versione di produzione a 30 secondi. Ciò significa che può ricordare le condizioni della strada degli ultimi 30 secondi e integrarle nel giudizio attuale.
Durante l'incontro, XPeng ha mostrato un video dimostrativo: quando l'auto davanti faceva un'inversione a U a metà strada, si creava momentaneamente uno spazio dietro di essa in cui sarebbe stato possibile passare. L'auto di test non ha accelerato immediatamente, ma, combinando il processo di movimento precedente, ha aspettato che l'altra vettura completasse l'inversione prima di procedere. Il modello comprende l'azione continua di "l'auto davanti sta facendo un'inversione", invece di limitarsi al singolo fotogramma di "c'è uno spazio davanti".
Questo è un po' come la memoria a breve termine di una persona durante una conversazione: non si dimentica la frase precedente ogni volta che ne ascolta una nuova, e un guidatore non dimentica le manovre preparatorie all'inversione dell'auto davanti solo perché in quel momento si trova di traverso sulla strada.
Se Infini-VLA evita che il veicolo dimentichi il contesto precedente, lo "Streaming Inference" (inferenza autoregressiva in flusso) si occupa di ridurre il tempo necessario al veicolo per comprendere il presente. Secondo XPeng, il modello può acquisire gli input, fare inferenza e generare la traiettoria contemporaneamente, senza dover aspettare di aver compreso un intero storico prima di iniziare a muoversi. I dati forniti da XPeng indicano che questa inferenza in flusso ha aumentato la velocità decisionale del 300%.
Anche in questo caso, la situazione è simile a quella di un essere umano alla guida, dove gli occhi guardano la strada, il cervello giudica e le mani e i piedi operano simultaneamente. Quando un ostacolo nascosto compare improvvisamente, questo tipo di elaborazione parallela riduce il vuoto di attesa per il completamento dell'inferenza.
Ricordare il passato, concentrarsi sul presente e, naturalmente, guardare al futuro. Così, l'X-Foresight nella nuova versione VLA deduce i successivi 6 secondi in base allo stato storico, mentre il Flow Matching adatta la distribuzione delle molteplici traiettorie possibili, aiutando il modello a scegliere l'azione più appropriata.
Il lessico può risultare oscuro, ma l'effetto è molto chiaro: la nuova VLA, osservando continuamente le condizioni stradali attuali, prevede situazioni non ancora verificatesi ma possibili, e prende la decisione successiva. La "guida difensiva", spesso menzionata dai guidatori esperti nella vita reale, è essenzialmente anch'essa una previsione.
Nel video mostrato sul posto, un'auto bianca in direzione opposta occupava la corsia inversa. L'auto di test doveva valutare se l'altra vettura intendesse aspettare, procedere o cedere parte dello spazio, per poi dedurre se avanzare in quel momento avrebbe bloccato il passaggio di entrambe. Vedere dove si trova l'altra auto è solo il primo passo; comprendere cosa sta per fare permette di decidere la manovra successiva.
La memoria del passato e la deduzione del futuro servono infine a ogni accelerazione, frenata e sterzata, consentendo alla versione 6.3.0 della VLA di seconda generazione di "scorrere nel tempo".
Entrare nel mondo reale
Nell'architettura ci sono molti termini tecnici, ma tornando al prodotto, la VLA deve affrontare i vari problemi delle strade reali. La risposta di XPeng è utilizzare un modello più grande: questa volta l'azienda ha aumentato i parametri del modello di 3,5 volte.
In uno dei video riprodotti durante la presentazione, l'auto di test è arrivata a un terminal per traghetti. All'imbarco non c'erano linee di corsia chiare e il molo non era una strada convenzionale, ma grazie al ragionamento del modello, il veicolo ha trovato da solo l'ingresso, è salito sul traghetto e si è fermato dietro l'auto precedente; una volta attraccato, è uscito seguendo il flusso del traffico.
Un altro video è ambientato su una strada di montagna stretta: dopo una curva stretta, un ramo sospeso sbarrava la strada. Il veicolo non lo ha trattato come un comune ostacolo stradale fermandosi sul posto, né è avanzato direttamente verso uno spazio apparentemente libero, ma ha rallentato attivamente, osservando la relazione tra il ramo e la carrozzeria mentre cercava uno spazio per passare.
Vale la pena ricordare che, pochi giorni fa, una Tesla con FSD v14.3.7 negli Stati Uniti ha percorso un parcheggio di un condominio dal secondo al sesto piano, cercando di continuare verso la rete metallica sul tetto.
Fortunatamente, il proprietario ha preso il controllo vicino alla rete, evitando che l'auto cadesse. Di fronte a casi limite simili, XPeng VLA e FSD hanno preso decisioni diverse: il modello non deve solo vedere lo spazio, ma anche capire se si tratta di una strada percorribile.
I traghetti e i rami appartengono a scenari rari, ed è proprio questo il motivo per cui XPeng insiste nell'ingrandire il modello. Un sistema basato su regole fisse può gestire moli, greggi di pecore, piogge torrenziali o ogni nuova...