Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

ロボット運動会閉幕後、自変量がロボットのための「仮想訓練場」を構築

ロボット運動会閉幕後、自変量がロボットのための「仮想訓練場」を構築

ここ一週間、私のフィードはロボットの話題で埋め尽くされている。

ロボットが人類の100メートル走の記録を塗り替え、3メートル近く「その場で飛び立ち」、「恥ずかしそうに走る」姿が海外で話題になり、サイバー張三豊が空中で540°の外摆を見せた……。

**今年の世界ヒューマノイドロボット競技会はさらに盛り上がりを見せた。6つの大陸・16カ国から666のチームが2056台のロボットを連れて北京を訪れ、競技種目も陸上や武術から、家庭、ホテル、工業、応急救助などの現実のシーンへと広がった。 しかし、競技場でのロボットの失敗は、みんなが笑って済ませられる。だが、ロボットが実際に家庭に入り込んだ後、コップをひっくり返したり、家具にぶつかったり、あるいはきれいに片付けたばかりの服を再び床に引きずり落としたりしたら、もはや笑ってはいられない。 現実世界には決まった走路や統一して配置された小道具はない。コップが少し動かされたり、テーブルに雑巾が増えたりしただけで、元々訓練された動作は失效する可能性がある。 ロボットのこうした試行錯誤を仮想世界に移すこと、それこそが現在の世界モデルが成し遂げようとしていることだ。物理法則に合致した環境を再現し、ロボットが実際に動き出す前にリハーサルを行わせようとする。手を少し左にずらせば空振りするか、グリッパーを早めに閉じればコップを倒すか。 しかし実際には、多くの世界モデルは信頼できる「仮想テスト」を実現できていない。画像を理解していても、動作に従っていない。推論時間が長くなると、物体や位置のズレが生じ始める。仮想世界でより良い成績を収めた戦略も、実機では必ずしも機能するとは限らない。 ロボットが競技場から現実のシーンへと歩みを進める中、自変量ロボットは自己回帰世界モデル「WALL-SS」を発表した。

WALL-SSが構築したこの「仮想訓練場」は、ついに世界モデルのボトルネックを突破した。動作が本当に結果を変えられるか、長時間タスクで一貫性を保てるか、仮想での成績が実機での検証に耐えられるか、これらに新たな解決策と答えが出た。 60秒間持続する水汲みや物品整理のタスクを推論し、異なる動作の結果をテストできる。異なる方法でコップを掴んだ際、空振りするか、コップを倒すか、それとも成功して掴み上げるか。 研究チームはさらに、複数のロボット戦略をそれぞれWALL-SSと現実世界でテストした。仮想世界で良い実行効果を示した動作戦略は、物理世界に移しても往々にして良い結果をもたらした。 これは興味深い。ロボットが見る「夢」が、現実の動作の練習と選別に使えるようになったのだ。**

関連 **プロジェクトページ: http://x2robot.com/pages/ss 論文リンク: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Github リンク: https://github.com/X-Square-Robot/wall-ss

ロボットが「夢を見る」方法が、現実での失敗を左右する

世界モデルは現在、身体知能(Embodied AI)において最も注目される方向の一つである。 ロボットの脳内にあるリハーサルシステムとして理解できる。現在の画像と実行予定の一連の動作を与えれば、次に何が起こるかを予測する。 マニピュレータが左に1センチメートル移動したら、コップは掴めるか、それとも倒れるか?引き出しは開いている、次は取り出しを続けるか、それとも手首の角度を調整するか?ロボットは複数の未来を比較し、どの動作ルートを採用するかを決定できる。

ロボット企業も異なるバージョンの動作戦略を世界モデルに入れてテストできる。より良い成績を収めたバージョンを実機に載せることで、現実世界で動作効果をテストする高額なコストを節約できる。 問題は、多くの世界モデルが多くの場合、楽観的すぎる監督のようになっていることだ。 ロボットの訓練データは通常、成功例のデモが中心となる。モデルが見たグリッパーの閉鎖動作の後に物体が持ち上げられる場面が多ければ、近道をしてしまう。グリッパーを閉じさえすれば、物体は持ち上げられるべきだと思い込むのだ。 グリッパーと物体の間に明らかな隙間があっても、生成された画像の中の物体が自らグリッパーに寄っていくことがある。論文ではこのような現象を「磁石式把持」のようなエラーと呼んでいる。

このような偏差は、走る、踊るといった大きな動きの中では目立たないかもしれないが、精密な操作においては成功・失敗を直接左右する。グリッパーとコップの取っ手が数ミリ違えば、ロボットは空振りするかもしれない。プラグの角度が少しでもずれれば、スムーズに差し込むのは難しい。 ロボットが「できる」から「やり遂げる」へと移行する際、往々にして最後の数ミリで行き詰まる。 世界モデルがこの数ミリを直接平準化してしまえば、提示する未来がスムーズであるほど、ロボットは一連の動作の信頼性を過大評価しやすくなる。 推論時間が長くなると、新たなトラブルも発生する。 世界モデルは一段落の画像を生成した後、それを次の予測の根拠にしなければならない。最初の小さな誤差が、その後どんどん蓄積されていく。物体は徐々に元の位置からずれ、グリッパーとコップの接触関係も変化してしまう。 直近の数フレームだけを保持すると、モデルは以前に行った操作を忘れてしまうが、全ての履歴を保持すると、計算量とメモリ使用量が増大し続ける。 動画がリアルに見えても、モデルが選んだ戦略が本当に優れているとは限らない。ロボットの研究開発においては、仮想テストでの勝者が、実機でも引き続き優位に立てるかを知る必要がある。 世界モデルは、異なる動作が確実に異なる結果につながるようにしなければならない。スムーズな画像は最も表面的なステップを完了したに過ぎない。**

ロボットの動かし方次第で、未来もそう変わるべき

WALL-SSは次の数秒間の画像を予測する際、まず「低解像度のプレビュー」版を作成する。

このプレビューの中で、モデルはまず大まかな方向性を決定する。マニピュレータがどこへ向かうか、物体が大体どう動くか。その後、同じ画像をレイヤーごとに鮮明にし、物体の輪郭、グリッパーの開閉、接触位置を補っていく。

論文ではこの大きな輪郭から細かなディテールへの階層を「スケール」と呼んでいる。すでに生成された画像と過去の動作が、次の予測の履歴となる。これが「次スケール自己回帰」である。

画像が鮮明になるにつれて、動作も再び未来に影響を与える。

アームを左にするか右にするかは、まず低解像度画像の動きの方向を変える。グリッパーをいつ閉じるかは、鮮明な画像の中でコップにぶつかったかどうかに引き続き影響を与える。

短い未来の生成が完了すると、それはすでに起こった動作と共にメモリに入り、モデルが継続する…