Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

После окончания роботоспортивных соревнований компания Zibianliang создала для роботов «виртуальный тренировочный полигон»

После окончания роботоспортивных соревнований компания Zibianliang создала для роботов «виртуальный тренировочный полигон»

Всю неделю моя лента новостей заполнена сообщениями о роботах.

Роботы побили человеческий рекорд в беге на сто метров, «взлетели» почти на три метра, их застенчивый бег стал вирусным за рубежом, а кибер-Чжан Саньфэн выполнил прыжок с вращением на 540°…

**В этом году Всемирные соревнования человекоподобных роботов прошли еще более масштабно: 666 команд из 16 стран шести континентов привезли в Пекин 2056 роботов. Соревнования охватили не только легкую атлетику и боевые искусства, но и реальные сценарии — быт, гостиницы, промышленность и аварийно-спасательные операции. Однако неудачи роботов на арене вызывают лишь смех. Но когда роботы действительно войдут в наши дома и начнут опрокидывать стаканы, сбивать мебель или стаскивать на пол аккуратно сложенную одежду, будет уже не до смеха. В реальном мире нет фиксированных дорожек и стандартно расставленного реквизита. Чуть сдвинутый стакан или лишняя тряпка на столе — и отработанные в ходе тренировки движения могут оказаться бесполезными. Именно перенос этих проб и ошибок роботов в виртуальный мир — то, к чему стремятся современные мировые модели. Они пытаются воссоздать среду, подчиняющуюся законам физики, чтобы роботы могли репетировать перед реальными действиями: промахнется ли рука, сдвинувшись влево, или опрокинет стакан, если схват преждевременно закроется. Но на деле многие мировые модели не способны обеспечить надежное «виртуальное тестирование». Они могут понимать изображение, но не подчиняются действиям. При длительном моделировании объекты и их позиции начинают смещаться. Стратегии, показавшие лучшие результаты в виртуальном мире, не всегда работают на реальных машинах. И вот, когда роботы начали переходить с竞技ной арены в реальные сценарии, компания Zibianliang выпустила авторегрессионную мировую модель WALL-SS.

Построенный WALL-SS «виртуальный тренировочный полигон» наконец-то преодолел узкие места мировых моделей. Появились новые решения и ответы на вопросы о том, могут ли действия действительно изменять результат, сохраняется ли согласованность при выполнении длительных задач и выдерживают ли виртуальные достижения проверку на реальных машинах. Модель способна симулировать задачи по наливанию воды и сортировке предметов продолжительностью до 60 секунд, тестируя результаты различных действий: схватить стакан по-разному — промахнуться, опрокинуть его или успешно удержать? Исследовательская группа также поместила несколько наборов роботизированных стратегий в WALL-SS и реальный мир для тестирования. Стратегии действий, которые отлично работали в виртуальном мире, зачастую давали хорошие результаты и в физическом мире. Что самое интересное, «сны» роботов теперь можно использовать для отработки и отбора реальных действий.**

Связанные **страницы проекта: http://x2robot.com/pages/ss Ссылка на статью: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Ссылка на Github: https://github.com/X-Square-Robot/wall-ss

То, как роботы «видят сны», определяет, потерпят ли они неудачу в реальности

Мировые модели — одно из самых обсуждаемых направлений в сфере воплощенного искусственного интеллекта. Их можно представить как систему репетиции в мозгу робота. Задайте текущее изображение и набор действий для выполнения, и модель предскажет, что произойдет дальше. Если механическая рука сдвинется на 1 сантиметр влево, стакан будет схвачен или опрокинут? Ящик открыт, нужно продолжать доставать предметы или сначала изменить угол наклона запястья? Робот может сравнить несколько вариантов будущего и решить, какой путь действий выбрать.

Робототехнические компании также могут тестировать различные версии политик действий в мировой модели. Лучшие версии затем загружаются в реальных роботов, что экономит огромные средства на тестирование действий в реальном мире. Проблема в том, что многие мировые модели часто напоминают слишком оптимистичного режиссера. Данные для обучения роботов обычно состоят из успешных примеров. Если модель видит, что за закрытием схвата в большинстве случаев следует поднятие объекта, она склонна идти по пути наименьшего сопротивления: как только схват закрывается, объект должен быть схвачен. Даже если между схватом и объектом есть очевидный зазор, на сгенерированном изображении объект может сам прилипнуть к схвату. В статье это явление названо ошибкой типа «магнитного захвата».

Такие отклонения могут быть незаметны при крупных движениях, таких как бег или танцы, но в точных манипуляциях они напрямую определяют успех или провал. Схват может промахнуться мимо ручки стакана на несколько миллиметров. Если угол вилки немного отклонен, ее будет трудно вставить в разъем. Переход робота от «умения делать» к «успешному выполнению» часто застревает на этих последних нескольких миллиметрах. Если мировая модель просто сглаживает эти миллиметры, чем более плавное будущее она рисует, тем больше робот переоценивает надежность своих действий. При длительном моделировании возникают новые трудности. После генерации фрагмента изображения мировая модель должна использовать его как основу для следующего прогноза. Небольшая начальная ошибка будет постоянно накапливаться. Объект может постепенно смещаться с исходной позиции, изменится и контакт между схватом и стаканом. Если сохранять только последние несколько кадров, модель забудет, что делала ранее, но если сохранять всю историю, вычислительная нагрузка и потребление видеопамяти будут постоянно расти. Реалистичное видео не означает, что выбранная моделью стратегия действительно лучше. Разработчикам роботов необходимо знать, сможет ли победитель виртуального тестирования сохранить лидерство на реальной машине. Мировая модель должна обеспечивать, чтобы разные действия приводили к разным результатам, а плавное изображение — это лишь самый поверхностный шаг.**

Как движется робот, так и должно меняться будущее

При прогнозировании изображения на следующие несколько секунд WALL-SS сначала создает «предварительный просмотр в низком разрешении».

В этой версии модель сначала определяет общее направление: куда движется механическая рука и как примерно будут перемещаться объекты. Затем она слой за слоем повышает четкость того же изображения, добавляя контуры объектов, раскрытие и закрытие схвата, а также точки контакта.

В статье эта иерархия от общих контуров до мелких деталей называется «масштабом». Уже сгенерированное изображение и выполненные действия становятся историей для следующего прогноза — это и есть «авторегрессия следующего масштаба».

С каждым повышением четкости изображения действия снова влияют на будущее.

Движение руки влево или вправо сначала изменит направление движения на изображении в низком разрешении. Время закрытия схвата продолжит влиять на то, столкнется ли он со стаканом на четком изображении.

После генерации небольшого фрагмента будущего он вместе с уже выполненными действиями попадает в память, становясь основой для продолжения моделирования...