Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

로봇 운동회 폐막 후, 자변량이 로봇을 위한 '가상 훈련장' 구축

로봇 운동회 폐막 후, 자변량이 로봇을 위한 '가상 훈련장' 구축

일주일 내내 로봇 소식으로 화면이 가득했다.

로봇이 인류 100m 기록을 갱신하고, 제자리에서 3미터 가까이 날아올랐고, '수줍은 달리기' 자세가 해외로 퍼졌으며, 사이버 장삼풍이 공중에서 540도 바깥돌기를 했다….

올해 세계 휴머노이드 로봇 운동회는 더욱 흥미로웠다. 6개 대륙 16개국 666개 팀이 2,056대의 로봇을 베이징으로 가져왔고, 육상과 무술 등 경기에서 가정, 호텔, 산업 및 비상 구조 등 실제 시나리오로 확장되었다. 하지만 경기장에서 로봇이 넘어지는 모습은 사람들이 웃고 지나갈 수 있다. 그러나 로봇이 가정에 진입한 후 물컵을 엎지르거나, 가구를 들이받거나, 방금 정리한 옷을 다시 바닥으로 끌어내리면 웃을 수 없을 것이다. 현실 세계에는 고정된 트랙이나 통일된 소품이 없다. 컵이 조금 옮겨지거나, 테이블 위에 행주가 추가되면 원래 훈련된 동작이 실패할 수 있다. 로봇의 이러한 시행착오를 가상 세계로 옮기는 것이 바로 현재 월드 모델이 하고자 하는 일이다. 물리 법칙을 따르는 환경을 재현하여 로봇이 실제로 움직이기 전에 미리 예행연습을 하게 한다: 손을 왼쪽으로 조금 옮기면 빈손으로 잡을지, 그리퍼가 일찍 닫히면 컵을 쓰러뜨릴지 등을 시뮬레이션한다. 하지만 실제로 많은 월드 모델은 신뢰할 수 있는 '가상 테스트'를 구현하지 못한다. 영상을 이해할 수는 있지만, 동작에 진정으로 따르지 않는다. 추론 시간이 길어지면 물체와 위치가 어긋나기 시작한다. 가상 세계에서 더 나은 전략이 실제 로봇에서도 효과적이지 않을 수 있다. 로봇이 경기장에서 실제 시나리오로 나아가기 시작할 때, 자변량 로봇은 자회귀 월드 모델 WALL-SS를 발표했다.

WALL-SS가 구축한 이 '가상 훈련장'은 마침내 월드 모델의 병목을 돌파했다. 동작이 결과를 진정으로 바꿀 수 있는지, 긴 작업에서 일관성을 유지할 수 있는지, 가상 성적이 실제 로봇 검증을 견딜 수 있는지에 대한 새로운 해법과 답이 나왔다. 60초 동안 지속되는 물 따르기 및 물건 정리 작업을 추론하여 다양한 동작의 결과를 테스트할 수 있다: 다른 방식으로 물컵을 잡을 때, 빈손이 될지, 컵을 쓰러뜨릴지, 아니면 성공적으로 잡을지를 말이다. 연구팀은 여러 로봇 전략을 WALL-SS와 실제 세계에서 각각 테스트했다. 가상 세계에서 잘 실행된 동작 전략은 물리 세계로 옮겨도 좋은 결과를 보였다. 이것은 흥미롭다. 로봇이 꾸는 '꿈'이 실제 동작 연습과 필터링에 사용되기 시작한 것이다.

관련 프로젝트 홈페이지: http://x2robot.com/pages/ss 논문 링크: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Github 링크: https://github.com/X-Square-Robot/wall-ss

로봇이 '꿈꾸는' 방식이 현실에서의 실패를 결정한다

월드 모델은 현재 구현 지능에서 가장 주목받는 방향 중 하나이다. 로봇 뇌 속의 예행연습 시스템으로 이해할 수 있다. 현재 화면과 실행할 동작 세트를 주면, 다음에 일어날 일을 예측한다. 로봇 팔이 1cm 왼쪽으로 이동하면 컵을 잡을지 쓰러뜨릴지? 서랍이 열렸다면, 계속 물건을 꺼낼지, 먼저 손목 각도를 조정할지? 로봇은 여러 미래를 비교하고 어떤 동작 경로를 채택할지 결정할 수 있다.

로봇 회사는 다른 버전의 동작 전략을 월드 모델에 테스트할 수 있다. 더 나은 버전을 실제 로봇에 적용하여, 실제 세계 테스트 비용을 절감한다. 문제는 많은 월드 모델이 지나치게 낙관적인 감독처럼 작동한다는 것이다. 로봇 훈련 데이터는 주로 성공적인 시범으로 구성된다. 모델이 보는 대부분의 그리퍼 닫기 동작 후 물체가 들어 올려지면, 쉬운 길을 택한다: 그리퍼만 닫히면 물체는 들어 올려져야 한다. 그리퍼와 물체 사이에 빈 공간이 있어도, 생성된 화면 속 물체가 능동적으로 그리퍼에 붙을 수 있다. 논문은 이를 '자석식 파지' 오류라 부른다.

이런 편차는 달리기, 춤 등 큰 동작에서는 눈에 띄지 않지만, 정밀 조작에서는 성패를 직접 결정한다. 그리퍼와 컵 손잡이가 몇 mm 차이가 나면 로봇은 빈손이 될 수 있다. 플러그 각도가 조금 틀어지면 인터페이스에 순조롭게 꽂기 어렵다. 로봇이 '할 수 있다'에서 '성공한다'로 가는 것은 마지막 몇 mm에서 막힌다. 월드 모델이 이 몇 mm를 평탄하게 만들면, 미래가 더 매끄러울수록 로봇은 동작의 신뢰성을 과대평가한다. 추론 시간이 길어지면 새로운 문제가 생긴다. 월드 모델이 한 화면을 생성한 후, 다음 예측의 근거로 삼는다. 앞선 작은 오차가 후속에서 누적된다. 물체가 원래 자리에서 천천히 벗어나고, 그리퍼와 컵의 접촉 관계도 변한다. 최근 몇 프레임만 유지하면 모델은 이전에 한 일을 잊지만, 전체 기록을 유지하면 연산량과 메모리 사용량이 계속 증가한다. 비디오가 사실처럼 보인다고 해서 모델이 선택한 전략이 진짜 더 나은 것은 아니다. 로봇 연구는 가상 테스트의 승자가 실제 로봇에서도 계속 앞설 수 있는지 알아야 한다. 월드 모델은 다른 동작이 확실히 다른 결과로 이어지게 해야 하며, 매끄러운 화면은 가장 표면적인 단계만 완료한 것이다.

로봇이 어떻게 움직이느냐에 따라 미래도 그렇게 변해야 한다

WALL-SS는 다음 몇 초의 화면을 예측할 때, 먼저 '저해상도 미리보기'를 만든다.

이 미리보기에서 모델은 먼저 큰 방향을 정한다: 로봇 팔이 어디로 갈지, 물체가 대략 어떻게 움직일지. 그 후 같은 화면을 한 층씩 선명하게 만들어 물체 윤곽, 그리퍼 개폐와 접촉 위치를 채운다.

논문은 이런 큰 윤곽에서 작은 디테일로의 계층을 '스케일'이라 부른다. 이미 생성된 화면과 발생한 동작은 다음 예측의 기록이 되며, 이것이 '다음 스케일 자회귀'이다.

화면이 조금씩 선명해질 때마다, 동작도 다시 한번 미래에 영향을 미친다.

로봇 팔이 왼쪽으로 갈지 오른쪽으로 갈지는 먼저 저해상도 화면의 이동 방향을 바꾼다. 그리퍼가 언제 닫힐지는 선명한 화면에서 컵을 부딪쳤는지 여부에 계속 영향을 미친다.

작은 미래 조각이 생성되면, 이미 발생한 동작과 함께 기억에 들어가 모델이 계속...