Chinanews
Other爱范儿Thu, 27 Aug 2026 13:36:06 +0000

샤오펑 새 VLA 9월 탑재…과거 30초 기억, 미래 6초 예측하며 '시간 속'에서 주행

샤오펑 새 VLA 9월 탑재…과거 30초 기억, 미래 6초 예측하며 '시간 속'에서 주행

영화 '닥터 스트레인지'에서 닥터 스트레인지는 아가모토의 눈을 돌려 시간을 앞뒤로 흐르게 할 수 있었고, '어벤져스: 인피니티 워'에 이르러서는 타노스와의 대결 전 다양한 가능한 미래를 미리 보았다.

이는 영화 속 마법이자, 샤오펑이 제공하는 현실이다.

8월 27일, 샤오펑은 물리 AI 공유 회의를 열고 2세대 VLA의 새로운 버전을 선보였다. 이번 커뮤니케이션 행사의 가장 핵심적인 키워드는 '시간'이었다. 샤오펑은 차량의 모델에 '아가모토의 눈'을 추가했다. 뒤로 돌리면 30초 전의 세계를 거슬러 올라가고, 앞으로 돌리면 향후 6초 동안 일어날 일을 예측하기 시작한다.

자동차에는 타임 스톤은 없지만 대규모 모델의 지원이 있다. 모델은 과거 일정 시간 동안 축적된 정보를 바탕으로 확률이 더 높은 몇 가지 후속 상태를 계산한 뒤, 현재 순간에 맞는 동작을 선택한다. 자율주행에게 '타임라인의 기억'을 갖는 것은 더욱 인간에 가까운 조작을 가능하게 한다.

사람이 운전할 때는 단지 눈앞의 한 장면만 보지 않는다. 당신은 몇 초 전의 기억을 바탕으로 후방 도로 상황을 판단하고, 앞차의 감속과 길가의 갈림길을 근거로 몇 초 후에 나타날 수 있는 전동 킥보드를 예측하기도 한다. 어떤 의미에서 운전은 도로면에서만 일어나는 것이 아니라 시간 속에서도 일어난다.

최신 샤오펑 2세대 VLA의全新 6.3.0 버전은 시간의 흐름 속에서 운전하는 모델이다. 새로운 VLA는 9월부터 모든 Ultra 및 Ultra SE 차량에 푸시될 예정이며, 샤오펑 G9L Ultra와 Ultra SE가 최초로 탑재된다. 단일 튜링 칩을 장착한 Max 차량 역시 9월에 2세대 VLA Lite 증류 버전을 받게 된다.

주행에는 단일 프레임의 정답이 없다

샤오펑이 이번 새 VLA에 적용한 핵심 아이디어는 과거, 현재, 미래를 하나로 연결하는 것이다.

Infini-VLA가 과거를 기억하는 역할을 맡는다. 그 기반 아키텍처는 더 긴 시퀀스를 지원할 수 있으며, 샤오펑은 주행 과업과 엣지 단의 연산량을 고려하여 양산 버전의 과거 기억을 30초로 설정했다. 즉, 과거 30초 동안 발생한 노면 상황을 기억하고 이를 현재의 판단에 반영할 수 있다.

샤오펑은 커뮤니케이션 행사에서 시연 영상을 공개했다. 앞차가 도로 한가운데에서 유턴을 할 때, 차량 후방에 잠시 통과할 수 있는 공간이 드러났음에도 테스트 차량은 즉시 가속하지 않고 이전의 이동 과정과 결합하여 상대방이 유턴을 마친 후에야 앞으로 나아갔다. 모델이 이해한 것은 '앞차가 유턴하고 있다'는 지속적으로 발생하는 행동이지, '전방에 공간이 생겼다'는 단일 프레임의 장면만이 아니다.

이는 사람이 다른 사람과 대화할 때의 단기 기억과 약간 비슷하다. 사람은 매 문장을 들을 때마다 이전 문장을 잊어버리지 않으며, 운전자 역시 앞차가 지금 도로를 가로막고 있다고 해서 그 차가 직전에 유턴을 준비하는 동작을 취했다는 사실을 잊지 않는다.

Infini-VLA가 차량이 문맥을 잊지 않게 해준다면, Streaming Inference '스트리밍 자기 회귀 추론'은 차량이 현재를 이해하는 시간을 단축하는 역할을 담당한다. 샤오펑의 설명에 따르면, 모델은 입력을 받으면서 동시에 추론하고 궤적을 출력할 수 있어, 과거 기록 전체를 완전히 이해한 후에야 동작을 시작할 필요가 없다. 샤오펑이 제시한 데이터에 따르면, 이 스트리밍 추론은 의사결정 속도를 300% 향상시켰다.

마찬가지로 이는 사람이 운전할 때 눈으로 도로를 보고, 뇌로 판단하며, 손발로 조작하는 일이 동시에 진행되는 것과도 같다. 가려진 곳에서 갑자기 대상이 나타날 때, 이러한 병렬 처리는 추론이 완료되기를 기다리는 공백을 줄여준다.

과거를 기억하고 현재에 주목하며, 자연스럽게 미래도 내다봐야 한다. 그리하여 새 버전 VLA의 X-Foresight는 과거 상태를 바탕으로 향후 6초를 시뮬레이션하고, Flow Matching이 다양한 가능한 궤적 분포를 피팅하여 모델이 더 적절한 동작을 선택하도록 돕는다.

용어는 난해하지만, 그 효과는 매우 명확하다. 새 버전 VLA는 현재 도로 상황을 지속적으로 관찰하여 아직 발생하지 않았지만 나타날 수 있는 상황을 예측하고 다음 동작을 결정한다. 현실 생활에서 노련한 운전자들이 자주 언급하는 '방어 운전' 역시 본질적으로 일종의 예측이다.

현장 영상에서 맞은편의 흰색 차량이 역차선을 침범했다. 테스트 차량은 상대방이 대기할 것인지, 계속 앞으로 갈 것인지, 아니면 공간의 일부를 양보할 것인지 판단해야 했고, 이어서 자신이 지금 전진하면 두 차량의 통로를 막아버릴지 시뮬레이션해야 했다. 상대방이 어디에 있는지 파악하는 것은 첫 번째 단계일 뿐이며, 상대방이 무엇을 할지 이해해야만 자신의 다음 동작을 결정할 수 있다.

과거의 기억과 미래의 시뮬레이션은 궁극적으로 매번의 가감속 및 조향에 활용되며, 이를 통해 2세대 VLA 6.3.0 버전은 '시간 속에서 흐르듯' 주행할 수 있다.

현실 세계로 진입하다

아키텍처 도면에는 명사가 많지만, 제품으로 돌아오면 VLA가 직면해야 하는 것은 여전히 현실 도로의 각종 성가신 문제들이다. 샤오펑의 해답은 더 큰 모델을 사용하는 것이며, 이번에 샤오펑은 모델 파라미터 수를 3.5배 늘렸다.

커뮤니케이션 행사에서 재생된 한 영상에서, 테스트 차량은 페리 선착장에 도착했다. 선착장에는 명확한 차선이 없었고, 부두는 일반적인 도로가 아니었지만, 모델 자체의 사고에 힘입어 차량은 스스로 입구를 찾아 페리에 올라탔고, 앞차를 따라 멈춰 섰으며, 페리가 접안한 후에는 차량 흐름을 따라 빠져나왔다.

또 다른 영상은 좁은 산길에서 촬영되었다. 급커브 길 이후 도로 전방에 공중에 떠 있는 나뭇가지가 나타났다. 차량은 이를 일반적인 노면 장애물로 취급해 제자리에 멈추지도 않았고, 공간이 남아 있는 틈새로 보이는 곳을 향해 직진하지도 않았다. 대신 능동적으로 감속하며 나뭇가지와 차체의 관계를 관찰하는 동시에 통과할 수 있는 공간을 찾았다.

특히 얼마 전, FSD v14.3.7을 운영 중이던 한 테슬라가 미국의 한 아파트 주차장에서 2층부터 6층까지 올라간 뒤, 계속해서 최상층 금속 철망 방향으로 길을 찾으려 시도한 바 있다. 다행히 차주가 철망에 가까이 갔을 때 차량을 인수하여 추락을 면했다. 이와 유사한 '코너 케이스' 극단적 사례에 대해 샤오펑 VLA와 FSD는 다른 판단을 내렸다. 모델은 공간을 보는 것뿐만 아니라 그곳이 길인지 아닌지도 이해할 수 있어야 한다.

페리 선착장과 나뭇가지는 매우 드문 장면에 속하며, 이는 바로 샤오펑이 모델 확대를 고집하는 이유이기도 하다. 고정 규칙에 의존하는 시스템은 부두, 양 떼, 폭우 또는 각각의 새