Xpeng atualiza VLA em setembro: lembra 30 segundos do passado, prevê 6 segundos do futuro e começa a "dirigir no tempo"
No filme "Doutor Estranho", o herói gira o Olho de Agamotto, permitindo que o tempo flua para a frente ou para trás. Em "Vingadores: Guerra Infinita", ele antecipa múltiplos futuros possíveis antes do confronto com Thanos.
Esta é a magia do cinema, mas também é a realidade oferecida pela Xpeng.
No dia 27 de agosto, a Xpeng realizou uma sessão de partilha sobre IA física, onde revelou a nova versão da sua segunda geração VLA. A grande palavra-chave deste evento foi o "tempo". A Xpeng adicionou um "Olho de Agamotto" ao modelo do veículo: girando para trás, consegue reconstituir o mundo dos últimos 30 segundos; girando para a frente, começa a prever o que acontecerá nos próximos 6 segundos.
Os carros não possuem a Joia do Tempo, mas contam com o suporte de grandes modelos. Com base na informação acumulada num determinado período, o modelo calcula os estados subsequentes de maior probabilidade e, em seguida, escolhe a ação para o momento presente. Para a condução inteligente, ter a "memória de uma linha do tempo" permite operações muito mais antropomórficas.
Ao conduzir, uma pessoa nunca olha apenas para o quadro atual. Julga a situação da estrada com base na memória dos segundos anteriores e prevê o aparecimento de uma trotineta elétrica alguns segundos depois, com base na desaceleração do veículo da frente e numa saída lateral. Numa certa medida, a condução não acontece apenas na estrada, mas também no tempo.
A mais recente versão 6.3.0 da segunda geração VLA da Xpeng é um modelo que dirige num fluxo temporal.
A nova VLA começará a ser implementada em setembro para todos os modelos Ultra e Ultra SE, com o Xpeng G9L Ultra e Ultra SE a serem os primeiros a recebê-la. Os modelos Max com um único chip Turing receberão a versão destilada VLA Lite de segunda geração em setembro.
A condução não tem respostas de quadro único
A ideia central da nova VLA da Xpeng é ligar o passado, o presente e o futuro.
A Infini-VLA é responsável por lembrar o passado. A sua arquitetura base suporta sequências temporais mais longas. Tendo em conta a tarefa de condução e a carga computacional do dispositivo, a Xpeng definiu a memória histórica da versão de produção em 30 segundos.
Ou seja, consegue lembrar-se das condições da estrada dos últimos 30 segundos e integrá-las no julgamento atual.
Na sessão de comunicação, a Xpeng exibiu um vídeo de demonstração. Quando o veículo da frente fez uma inversão de marcha no meio da estrada, deixou momentaneamente um espaço atrás que parecia permitir a passagem. O carro de teste não acelerou imediatamente; em vez disso, combinou o processo de movimento anterior e esperou que o outro veículo concluísse a manobra antes de avançar.
O modelo compreende o comportamento contínuo de "o carro da frente está a inverter a marcha", em vez de se focar apenas no quadro de "há um espaço à frente".
Isto é semelhante à memória de curto prazo de uma pessoa durante uma conversa: não esquece a frase anterior ao ouvir a próxima, nem o condutor se esquece de que o carro da frente se preparou para inverter a marcha só porque, neste momento, está atravessado na estrada.
Se a Infini-VLA garante que o veículo não esquece o contexto, a "inferência autorregressiva em fluxo" (Streaming Inference) é responsável por reduzir o tempo que o veículo leva a compreender o presente. Segundo a Xpeng, o modelo pode adquirir inputs, fazer inferências e gerar trajetórias simultaneamente, sem precisar de compreender totalmente um histórico antes de agir. Os dados da Xpeng indicam que esta inferência em fluxo aumentou a velocidade de decisão em 300%.
Da mesma forma, isto assemelha-se a como uma pessoa conduz: os olhos observam a estrada, o cérebro julga e as mãos e pés operam em simultâneo. Quando um alvo aparece subitamente de uma zona oculta, este processamento paralelo reduz o período de espera pela conclusão da inferência.
Lembrar o passado e focar o presente significa, naturalmente, que também é preciso olhar para o futuro. Assim, o X-Foresight na nova versão VLA fará a dedução dos próximos 6 segundos com base no estado histórico, enquanto o Flow Matching ajustará a distribuição de várias trajetórias possíveis, ajudando o modelo a escolher a ação mais adequada.
A terminologia é densa, mas o impacto é muito claro. Através da observação contínua das condições de trânsito atuais, a nova VLA antecipa situações que ainda não ocorreram, mas que podem surgir, e toma a próxima decisão. A "condução defensiva", frequentemente referida por condutores experientes na vida real, é, essencialmente, também uma forma de antecipação.
No vídeo apresentado, um carro branco em sentido contrário ocupava a via inversa. O carro de teste teve de julgar se a outra parte tencionava esperar, continuar a avançar ou ceder uma parte do espaço, e depois deduzir se avançar naquele momento bloquearia o caminho de ambos os veículos. Ver onde a outra parte está é apenas o primeiro passo; compreender o que ela fará a seguir é o que determina a próxima manobra.
A memória do passado e a dedução do futuro servem, em última análise, cada aceleração, travagem e viragem, permitindo que a versão 6.3.0 da segunda geração VLA "flua no tempo".
Entrar no mundo real
Há muitos termos nos diagramas de arquitetura, mas, ao nível do produto, a VLA ainda tem de lidar com vários problemas em estradas reais. A resposta da Xpeng é usar modelos maiores, tendo desta vez aumentado os parâmetros do modelo em 3,5 vezes.
Num dos vídeos exibidos, o carro de teste chegou a um terminal de ferry. O porto não tinha linhas de via claras e não era uma estrada convencional, mas, graças ao raciocínio do próprio modelo, o veículo encontrou a entrada, subiu a bordo do ferry e parou atrás do carro da frente. Quando o ferry atracou, o carro saiu com o fluxo de trânsito.
Outro vídeo decorreu numa estrada de montanha estreita. Após uma curva fechada, apareceu um ramo de árvore suspenso sobre a estrada. O veículo não o tratou como um obstáculo normal e parou no local, nem avançou diretamente para uma fenda que parecia ter espaço.
Em vez disso, abrandou proativamente, observando a relação entre o ramo e a carroçaria, enquanto procurava um espaço para passar.
Vale a pena mencionar que, dias atrás, um Tesla a operar o FSD v14.3.7 nos Estados Unidos dirigiu-se do segundo para o sexto andar num parque de estacionamento de um condomínio e tentou continuar a procurar um caminho em direção à rede metálica do topo.
Felizmente, o proprietário assumiu o controlo perto da rede e o veículo não caiu. Perante casos extremos ("corner cases") semelhantes, a VLA da Xpeng e o FSD tomaram decisões diferentes: o modelo não precisa apenas de ver o espaço, mas também de compreender se aquilo é ou não uma estrada.
Ferry e ramos de árvore são cenários raros, o que é precisamente a razão pela qual a Xpeng insiste em expandir o modelo. Um sistema que depende de regras fixas pode lidar com portos, rebanhos de ovelhas, chuvas torrenciais ou cada novo...