小鵬の新VLAが9月実装:過去30秒を記憶し、未来6秒を予測、「時間の中」で運転を開始
映画『ドクター・ストレンジ』において、ストレンジはアゴモットの目を回すことで時間を前後に流すことができ、『アベンジャーズ/インフィニティ・ウォー』では、サノスとの対決前に複数の可能な未来をあらかじめ見通していた。
これは映画の中の魔法であり、小鵬(Xpeng)が提供する現実でもある。
8月27日、小鵬は物理AIに関する説明会を開き、第2世代VLAの新バージョンを同時に披露した。この説明会で最大のキーワードとなったのは「時間」だ。小鵬は車載モデルに「アゴモットの目」を追加した。後ろに回せば過去30秒間の世界を遡及し、前に回せば未来6秒間に何が起こるかを予測し始める。
自動車にはタイムストーンはないが、大規模モデルによる支援がある。モデルは過去一定時間に蓄積された情報に基づき、確率の高い後続状態をいくつか計算し、現在の瞬間に対するアクションを選択する。自動運転にとって、「タイムラインの記憶」を持つことは、より人間に近い操作をもたらすことができる。
人が運転する際、決して目の前の1コマだけを見ているわけではない。あなたは数秒前の記憶に基づいて後方の路况を判断し、前車の減速や路肩の分岐に基づいて数秒後に現れるかもしれない小型電動バイクを予測する。ある意味で、運転は路面だけでなく、時間の中でも発生しているのだ。
最新の小鵬第2世代VLAの全新6.3.0バージョンは、まさに時間の流れの中で運転するモデルである。新VLAは9月からすべてのUltraおよびUltra SE車種への提供を開始し、小鵬G9L UltraとUltra SEが先行搭載される。また、シングルチューリングチップ搭載のMax車種も9月に第2世代VLA Liteの蒸留版を入手する。
運転に単一コマの答えはない
小鵬が今回新VLAで掲げる核心的なアプローチは、過去、現在、未来を繋げることだ。
Infini-VLAが過去を記憶する役割を担う。その基盤アーキテクチャはより長い時系列をサポートでき、小鵬は運転タスクとエッジ側の計算量を考慮し、量産版の歴史記憶を30秒に設定した。つまり、過去30秒間に発生した路面状況を記憶し、それを現在の判断に持ち込むことができるのだ。
小鵬は説明会で演示動画を公開した。前車が路中央でUターンする際、車体後方に通り抜け可能なスペースが一時的に現れたが、テスト車はすぐに加速せず、以前の運動プロセスと照らし合わせて、相手がUターンを完了するのを待ってから前進した。モデルが理解したのは「前車がUターンしている」という継続的に発生している行動であり、「前方にスペースが現れた」という1コマの画面だけではなかった。
これは人が他者と会話する際の短期記憶に少し似ている。人は一文聞くごとに前の文を忘れることはないし、運転者も前車が今まさに路中に横たわっているからといって、その前にUターンの準備動作を行ったことを忘れることはない。
Infini-VLAが車両に文脈を忘れさせないとすれば、Streaming Inference「ストリーミング自己回帰推論」は車両が現在を理解する時間を短縮する役割を担う。小鵬の説明によると、モデルは入力を取得しながら、推論し、軌跡を出力することができ、履歴を完全に理解してから動作を開始する必要はない。小鵬が提示したデータによれば、このストリーミング推論により意思決定速度が300%向上したという。
これも同様に、人が運転する際に目で道を見、脳で判断し、手足で操作を同時に行うことに似ている。遮蔽物から突然対象が現れた際、このような並列処理により、推論の完了を待つ空白時間を減らすことができる。
過去を記憶し、現在に目を向け、当然未来も展望する必要がある。そこで新バージョンVLAのX-Foresightは、履歴状態に基づき未来6秒間を推演し、Flow Matchingがさらに複数の可能な軌跡分布をフィッティングして、モデルがより適切なアクションを選択できるよう支援する。
用語は難解だが、もたらされる効果は非常に明確だ。新VLAは現在の路况を継続的に観察することで、未発生だが起こり得る状況を予測し、次の意思決定を行う。現実生活でベテランドライバーがよく口にする「防御運転」も、本質的には予測である。
現場の動画では、対向する白い車が逆走車線を占拠していた。テスト車は、相手が待機するのか、前進し続けるのか、それとも空間の一部を譲るのかを判断し、さらに自分が今前進すれば2台の進路を塞ぐことになるかを推演する必要があった。相手がどこにいるかを見極めるのは第一歩にすぎず、相手が次に何をするかを理解して初めて、自分の次の操作を決定できるのだ。
過去の記憶と未来の推演は、最終的に毎回の加減速とステアリングに役立ち、第2世代VLA 6.3.0バージョンが「時間の中を流れる」ことを可能にする。
現実世界へ
アーキテクチャ図には多くの専門用語が並んでいるが、製品に戻ると、VLAが直面するのはやはり現実の道路上の様々な問題であり、小鵬の答えはより大きなモデルを使用することだ。今回小鵬はモデルのパラメータ数を3.5倍に拡大した。
説明会で再生された動画の中で、テスト車はカーフェリーの乗り場に到着した。渡し場には明確な車線ラインがなく、埠頭は通常の道路ではないが、モデル自身の思考により、車両は自ら入口を見つけ、フェリーに乗り込み、前車に続いて停止した。フェリーが岸に着くと、再び車列に従って走り出した。
別の動画は狭い山道での出来事だった。急カーブの後、道路の前方に宙に浮いた木の枝が現れた。車両はそれを一般的な路面障害物とみなしてその場に停止することも、空間があるように見える隙間に向かってそのまま前進することもなく、自ら減速し、枝と車体の関係を観察しながら通過可能な空間を探した。
特筆すべきは、先日アメリカのマンション駐車場で、FSD v14.3.7を作動させていたテスラが2階から6階まで走り抜け、さらに最上階の金属金網に向かって進路を探そうとしたことだ。幸いにもオーナーが金網に接近した際に車両を接管したため、転落は免れた。これと似た「コーナーケース」という極端な事例において、小鵬VLAとFSDは異なる判断を下した。モデルは空間を認識するだけでなく、そこが道路かどうかを理解できなければならないのだ。
フェリーや木の枝はめったにないシーンであり、それこそが小鵬がモデルの拡大にこだわる理由でもある。固定ルールに依存するシステムは、埠頭、羊の群れ、豪雨、あるいはそれぞれの新しい状況に対して個別の対応ができるかもしれないが…