Après les Jeux olympiques des robots, Zibianliang construit un « terrain d'entraînement virtuel » pour les robots
Cela fait une semaine que mon fil d'actualité est inondé de robots.
Les robots ont battu le record du monde du 100 mètres, ont fait un « décollage sur place » de près de trois mètres, la posture de la « course timide » est devenue virale à l'étranger, et le « Zhang Sanfeng cybernétique » a réalisé un saut extérieur de 540° en l'air……
**Les Jeux mondiaux des robots humanoïdes de cette année ont été encore plus animés. Des 666 équipes venues de 16 pays répartis sur six continents, accompagnées de 2056 robots, se sont rendues à Pékin. Les épreuves sont passées de l'athlétisme et des arts martiaux à des scénarios du monde réel, tels que le foyer familial, les hôtels, l'industrie et les secours d'urgence. Cependant, lorsque les robots font des faux pas sur le terrain de compétition, tout le monde en rit et passe à autre chose. Mais une fois que les robots entrent réellement dans nos foyers, s'ils renversent un verre d'eau, heurtent des meubles ou tirent sur le sol des vêtements fraîchement pliés, il n'y aura plus de quoi rire. Dans le monde réel, il n'y a ni piste fixe ni accessoires disposés de manière uniforme. Un verre légèrement déplacé, un chiffon supplémentaire sur la table, et les actions initialement bien entraînées peuvent échouer. Transposer ces essais et erreurs des robots dans un monde virtuel est précisément ce que les modèles mondiaux s'efforcent de faire à l'heure actuelle. Ils tentent de recréer un environnement respectueux des lois de la physique, permettant aux robots de simuler leurs actions avant de les exécuter : si la main se déplace légèrement vers la gauche, ratera-t-elle sa cible ? Si la pince se ferme trop tôt, renversera-t-elle le verre ? Mais en réalité, de nombreux modèles mondiaux ne parviennent pas à offrir des « tests virtuels » fiables. Ils peuvent comprendre l'image, mais ne pas obéir véritablement aux actions. Sur de longues périodes de simulation, les objets et leurs positions commencent à dériver. Une stratégie performante dans le monde virtuel ne fonctionne pas nécessairement sur un robot réel. Alors que les robots commencent à passer de l'arène de compétition aux scénarios réels, Zibianliang Robotics a publié son modèle mondial autorégressif WALL-SS.
Ce « terrain d'entraînement virtuel » construit par WALL-SS a enfin permis de surmonter les goulets d'étranglement des modèles mondiaux. La capacité des actions à modifier véritablement le résultat, la cohérence sur de longues tâches, et la validation des performances virtuelles sur des machines réelles ont trouvé de nouvelles solutions et réponses. Il peut simuler des tâches continues de 60 secondes, comme verser de l'eau et ranger des objets, afin de tester les résultats de différentes actions : selon la manière dont le verre est saisi, la pince attrape-t-elle dans le vide, renverse-t-elle le verre, ou réussit-elle à le saisir ? L'équipe de recherche a également testé plusieurs ensembles de stratégies robotiques dans WALL-SS et dans le monde réel. Les stratégies d'action qui s'exécutent bien dans le monde virtuel donnent souvent de bons résultats lorsqu'elles sont transférées dans le monde physique. C'est ce qui est fascinant : les « rêves » des robots commencent à pouvoir servir à s'entraîner et à filtrer des actions réelles.**
Page d'accueil du **projet associé : http://x2robot.com/pages/ss Lien vers l'article : https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Lien Github : https://github.com/X-Square-Robot/wall-ss
La façon dont les robots « rêvent » détermine s'ils échouent dans la réalité
Les modèles mondiaux sont actuellement l'une des directions les plus suivies dans le domaine de l'intelligence incarnée. On peut les considérer comme un système de simulation dans le cerveau du robot. En lui fournissant l'image actuelle et un ensemble d'actions à exécuter, le modèle prédit ce qui va se passer ensuite. Si le bras robotisé se déplace d'un centimètre vers la gauche, le verre sera-t-il attrapé ou renversé ? Le tiroir est ouvert, faut-il continuer à en sortir le contenu ou ajuster d'abord l'angle du poignet ? Le robot peut comparer plusieurs futurs possibles avant de décider du chemin d'action à emprunter.
Les entreprises de robotique peuvent également tester différentes versions de leurs stratégies d'action dans le modèle mondial. Les versions les plus performantes sont ensuite déployées sur des robots réels, ce qui permet d'économiser les coûts exorbitants des tests d'actions dans le monde physique. Le problème est que, bien souvent, de nombreux modèles mondiaux ressemblent à un réalisateur excessivement optimiste. Les données d'entraînement des robots sont généralement dominées par des démonstrations réussies. Si le modèle observe que la fermeture de la pince est suivie, dans la plupart des cas, par le soulèvement de l'objet, il aura tendance à prendre un raccourci : dès que la pince se ferme, l'objet doit être saisi. Même s'il y a un espace visible entre la pince et l'objet, l'objet généré dans l'image peut se rapprocher activement de la pince. L'article qualifie ce phénomène d'erreur de type « saisie magnétique ».
Ces déviations peuvent ne pas être flagrantes lors de mouvements de grande envergure comme la course ou la danse, mais dans les opérations de précision, elles déterminent directement la réussite ou l'échec. Un écart de quelques millimètres entre la pince et l'anse du verre, et le robot peut saisir dans le vide. Un léger mauvais angle de la fiche, et il sera difficile de l'insérer correctement dans la prise. Le passage du « savoir-faire » à la « réussite » pour un robot se joue souvent à quelques millimètres près. Si le modèle mondial lisse directement ces quelques millimètres, plus le futur qu'il génère est fluide, plus le robot aura tendance à surestimer la fiabilité d'une action. À mesure que le temps de simulation s'allonge, de nouveaux problèmes apparaissent. Après avoir généré une séquence d'images, le modèle doit l'utiliser comme base pour la prédiction de la séquence suivante. Une petite erreur initiale s'accumule continuellement par la suite. L'objet peut s'éloigner lentement de sa position d'origine, et la relation de contact entre la pince et le verre peut changer. Si l'on ne conserve que les dernières images, le modèle oublie ce qu'il a fait précédemment, mais si l'on conserve tout l'historique, la charge de calcul et l'utilisation de la mémoire vidéo augmentent continuellement. Le fait qu'une vidéo paraisse réaliste ne signifie pas que la stratégie sélectionnée par le modèle soit réellement meilleure. La recherche en robotique a besoin de savoir si le gagnant des tests virtuels maintiendra son avance sur une machine réelle. Les modèles mondiaux doivent s'assurer que différentes actions mènent effectivement à différents résultats ; une image fluide ne constitue que l'étape la plus superficielle.**
Comment le robot se meut, ainsi le futur doit-il changer
Lorsque WALL-SS prédit les images des prochaines secondes, il génère d'abord une « version d'aperçu en basse résolution ».
Dans cet aperçu, le modèle détermine d'abord la direction générale : où va le bras robotisé, comment l'objet va probablement se déplacer. Ensuite, il clarifie la même image couche par couche, en ajoutant les contours de l'objet, l'ouverture et la fermeture de la pince, ainsi que les points de contact.
L'article nomme cette hiérarchie, allant du contour général aux petits détails, l'« échelle ». Les images déjà générées et les actions effectuées deviendront l'historique de la prochaine prédiction, c'est ce qu'on appelle l'« autorégression à l'échelle suivante ».
À chaque fois que l'image gagne en clarté, l'action influence une fois de plus le futur.
Que le bras aille vers la gauche ou vers la droite modifiera d'abord la direction du mouvement dans l'image en basse résolution. Le moment où la pince se ferme continuera d'influencer la présence ou non de contact avec le verre dans l'image en haute résolution.
Une fois qu'un court segment du futur est généré, il entre dans la mémoire avec les actions qui se sont produites, devenant ainsi la base pour que le modèle continue de...