Chinanews
Other爱范儿Thu, 27 Aug 2026 13:36:06 +0000

XPeng VLA Baru Hadir September: Ingat 30 Detik Lalu, Prediksi 6 Detik ke Depan, Mulai 'Berkendara dalam Waktu'

XPeng VLA Baru Hadir September: Ingat 30 Detik Lalu, Prediksi 6 Detik ke Depan, Mulai 'Berkendara dalam Waktu'

Dalam film "Doctor Strange", Doctor Strange memutar Mata Agamotto untuk membuat waktu mengalir maju atau mundur, dan dalam "Avengers 3", ia bahkan melihat berbagai kemungkinan masa depan sebelum pertarungannya melawan Thanos.

Ini adalah sihir di film, tetapi juga realitas yang ditawarkan oleh XPeng.

Pada 27 Agustus, XPeng mengadakan sesi berbagi AI fisik, sekaligus memamerkan versi baru dari VLA generasi kedua. Kata kunci terbesar dalam sesi komunikasi ini adalah "waktu". XPeng menambahkan "Mata Agamotto" pada model di dalam mobil: diputar ke belakang, dapat menelusuri kembali dunia 30 detik lalu; diputar ke depan, mulai memprediksi apa yang akan terjadi dalam 6 detik ke depan.

Mobil tidak memiliki Batu Waktu, tetapi memiliki dukungan model besar. Model menghitung beberapa kemungkinan kondisi berikutnya dengan probabilitas yang lebih tinggi berdasarkan informasi yang terakumulasi selama periode waktu sebelumnya, lalu memilih tindakan untuk momen saat ini. Bagi pengemudian cerdas, memiliki "memori garis waktu" dapat membawa operasi yang lebih mirip manusia.

Saat berkendara, manusia tidak pernah hanya melihat satu bingkai saat ini. Anda akan menilai kondisi jalan di belakang berdasarkan ingatan beberapa detik sebelumnya, dan juga memprediksi sepeda motor yang mungkin muncul beberapa detik kemudian berdasarkan perlambatan mobil di depan dan persimpangan di pinggir jalan. Dalam arti tertentu, berkendara tidak hanya terjadi di permukaan jalan, tetapi juga terjadi di dalam waktu.

Versi 6.3.0 terbaru dari VLA generasi kedua XPeng adalah model yang berkendara dalam aliran waktu.

VLA baru ini akan mulai didorong ke semua model Ultra dan Ultra SE pada bulan September, dengan XPeng G9L Ultra dan Ultra SE menjadi yang pertama mengadopsinya, sementara model Max dengan chip Turing tunggal juga akan mendapatkan versi distilasi VLA Lite generasi kedua pada bulan September.

Berkendara Tidak Memiliki Jawaban Bingkai Tunggal

Ide inti XPeng untuk VLA baru kali ini adalah menghubungkan masa lalu, masa kini, dan masa depan.

Infini-VLA bertugas mengingat masa lalu. Arsitektur dasarnya dapat mendukung urutan waktu yang lebih panjang. XPeng, dengan mempertimbangkan tugas berkendara dan beban komputasi sisi perangkat, menetapkan memori historis versi massal menjadi 30 detik.

Artinya, ia dapat mengingat kondisi jalan yang terjadi dalam 30 detik terakhir dan membawanya ke dalam penilaian saat ini.

XPeng memamerkan video demonstrasi dalam sesi komunikasi. Ketika mobil di dean berputar balik di tengah jalan, ruang kosong yang bisa dilewati sempat terbuka di belakang bodi mobil tersebut. Mobil uji tidak langsung mempercepat, melainkan menggabungkan proses pergerakan sebelumnya, menunggu mobil di depan menyelesaikan putar balik sebelum maju.

Yang dipahami model adalah tindakan berkelanjutan "mobil di dean sedang berputar balik", bukan lagi hanya satu bingkai gambar "ruang kosong muncul di depan".

Ini agak seperti memori jangka pendek manusia saat berbicara dengan orang lain. Manusia tidak akan melupakan kalimat sebelumnya setiap kali mendengar kalimat baru, dan pengemudi juga tidak akan lupa bahwa mobil di depan telah membuat gerakan bersiap untuk berputar balik hanya karena saat ini mobil tersebut melintang di tengah jalan.

Jika Infini-VLA membuat kendaraan tidak melupakan konteks sebelumnya, maka "Streaming Inference" atau "inferensi autoregresif streaming" bertugas mempersingkat waktu kendaraan dalam memahami momen saat ini. Menurut penjelasan XPeng, model dapat memperoleh input, melakukan inferensi, dan menghasilkan lintasan secara bersamaan, tanpa harus menunggu pemahaman lengkap atas一段 sejarah sebelum mulai bertindak. Data yang diberikan XPeng menunjukkan bahwa inferensi streaming ini meningkatkan kecepatan pengambilan keputusan sebesar 300%.

Hal ini juga mirip dengan saat manusia berkendara, di mana mata melihat jalan, otak menilai, serta tangan dan kaki beroperasi secara bersamaan. Ketika target muncul tiba-tiba dari area tertutup, pemrosesan paralel seperti ini dapat mengurangi kekosongan waktu tunggu inferensi selesai.

Mengingat masa lalu, fokus pada masa kini, dan tentu saja melihat ke masa depan. Oleh karena itu, X-Foresight dalam versi VLA baru akan melakukan deduksi untuk 6 detik ke depan berdasarkan status historis, dan Flow Matching akan menyesuaikan distribusi berbagai lintasan yang mungkin terjadi, membantu model memilih tindakan yang lebih tepat.

Kosakatanya memang sulit dipahami, tetapi dampak yang ditimbulkannya sangat jelas. VLA versi baru terus mengamati kondisi jalan saat ini, memprediksi situasi yang belum terjadi tetapi mungkin muncul, dan membuat keputusan langkah selanjutnya. Sedangkan "defensive driving" yang sering disebut oleh pengemudi berpengalaman dalam kehidupan nyata, pada dasarnya juga merupakan semacam prediksi.

Dalam video di lokasi, sebuah mobil putih dari arah berlawanan menempati jalur berlawanan. Mobil uji perlu menilai apakah pihak lain bersiap menunggu, terus maju, atau memberikan sebagian ruang, lalu mendeduksi apakah maju pada saat ini akan menyumbat jalan kedua mobil. Melihat di mana pihak lain berada hanya merupakan langkah pertama; memahami apa yang akan dilakukan pihak lain dapat menentukan operasi langkah selanjutnya.

Ingatan masa lalu dan deduksi masa depan pada akhirnya melayani setiap akselerasi, deselerasi, dan belokan, juga memungkinkan versi VLA generasi kedua 6.3.0 untuk "mengalir dalam waktu".

Memasuki Dunia Nyata

Ada banyak istilah dalam diagram arsitektur, tetapi kembali ke produk, VLA masih harus menghadapi berbagai masalah di jalan nyata. Jawaban XPeng adalah menggunakan model yang lebih besar, dan kali ini XPeng memperbesar parameter model sebanyak 3,5 kali lipat.

Dalam video yang diputar pada sesi komunikasi, mobil uji tiba di dermaga kapal feri. Tidak ada garis lajur yang jelas di dermaga, dan dermaga bukanlah jalan biasa, tetapi dengan mengandalkan pemikiran model itu sendiri, kendaraan tetap menemukan pintu masuk, naik ke kapal feri, dan berhenti mengikuti mobil di depan. Setelah feri bersandar, ia keluar mengikuti arus lalu lintas.

Video lain terjadi di jalan pegunungan yang sempit. Setelah tikungan tajam, cabang pohon menggantung muncul di depan jalan. Kendaraan tidak memperlakukannya sebagai rintangan jalan biasa dan berhenti di tempat, juga tidak langsung maju ke arah celah yang tampak masih ada ruang.

Sebaliknya, ia secara aktif memperlambat laju, mengamati hubungan antara cabang dan bodi mobil sambil mencari ruang yang bisa dilewati.

Patut dicatat, beberapa hari lalu, sebuah Tesla yang menjalankan FSD v14.3.7 di sebuah gedung parkir apartemen di Amerika Serikat menyetir dari lantai dua ke lantai enam, dan mencoba terus mencari jalan menuju jaring kawat logam di lantai atas.

Untungnya, pemilik mengambil alih kendali saat mendekati jaring kawat, sehingga kendaraan tidak jatuh. Untuk "corner case" atau kasus ekstrem yang serupa, XPeng VLA dan FSD membuat penilaian yang berbeda. Model tidak hanya harus melihat ruang, tetapi juga harus dapat memahami apakah itu sebuah jalan.

Dermaga dan cabang pohon termasuk skenario yang sangat jarang terlihat, dan inilah alasan XPeng bersikeras memperbesar model. Sistem yang mengandalkan aturan tetap dapat ditargetkan untuk dermaga, kawanan domba, hujan lebat, atau setiap jenis...