Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

Dopo i Giochi dei Robot, Zibianliang costruisce un "campo di addestramento virtuale"

Dopo i Giochi dei Robot, Zibianliang costruisce un "campo di addestramento virtuale"

Sono ormai giorni che la mia schermata è invasa dai robot.

I robot hanno battuto il record umano dei 100 metri, sono "decollati" sul posto per quasi tre metri, la loro "corsa timida" è diventata virale all'estero, e il "cyber Zhang Sanfeng" ha eseguito un salto esterno con rotazione di 540° in aria…

Quest'anno i World Humanoid Robot Games sono stati ancora più animati: 666 squadre provenienti da 16 paesi di sei continenti hanno portato 2056 robot a Pechino. Le competizioni si sono estese dall'atletica e dalle arti marziali a scenari reali come case, hotel, industria e soccorso di emergenza. Tuttavia, quando i robot falliscono in arena, la gente ci ride sopra e passa oltre. Ma quando i robot entreranno davvero nelle nostre case, potrebbero rovesciare bicchieri d'acqua, abbattere mobili o tirare giù i vestiti appena piegati, e allora non ci sarà più da ridere. Nel mondo reale non esistono piste fisse e oggetti disposti in modo uniforme. Se un bicchiere viene spostato di poco o compare uno straccio in più sul tavolo, i movimenti originariamente addestrati potrebbero fallire. Spostare questi tentativi ed errori dei robot in un mondo virtuale è esattamente ciò che i modelli mondiali (world models) cercano di fare oggi. Cercano di ricreare un ambiente conforme alle leggi della fisica, permettendo ai robot di provare prima di agire davvero: se la mano si sposta a sinistra mancherà la presa? Se la pinza si chiude in anticipo urterà il bicchiere? In realtà, molti modelli mondiali non riescono a garantire "test virtuali" affidabili. Potrebbero comprendere l'immagine, ma non obbedire davvero all'azione. Più lungo è il tempo di simulazione, più oggetti e posizioni iniziano a divergere. Le strategie che performano meglio nel mondo virtuale non sempre funzionano sui robot reali. Proprio mentre i robot iniziano a passare dall'arena agli scenari reali, Zibianliang Robotics ha rilasciato il modello mondiale autoregressivo WALL-SS.

Questo "campo di addestramento virtuale" costruito da WALL-SS ha finalmente superato il collo di bottiglia dei modelli mondiali. Se le azioni possono davvero cambiare i risultati, se la coerenza può essere mantenuta in task lunghi e se i punteggi virtuali possono resistere al test sui robot reali, ora hanno nuove soluzioni e risposte. Può simulare compiti continui di 60 secondi come versare l'acqua e riordinare oggetti, per testare i risultati di diverse azioni: afferrare il bicchiere in modi diversi porterà a mancarlo, a rovesciarlo o a prenderlo con successo? Il team di ricerca ha anche testato diverse strategie robotiche inserendole sia in WALL-SS che nel mondo reale; le strategie di movimento che funzionano bene nel mondo virtuale spesso producono buoni risultati anche nel mondo fisico. Questo è interessante: i "sogni" dei robot stanno iniziando a essere utilizzati per esercitarsi e filtrare movimenti reali.

Pagina web del progetto correlato: http://x2robot.com/pages/ss Link all'articolo (paper): https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Link Github: https://github.com/X-Square-Robot/wall-ss

Il modo in cui i robot "sognano" determina se falliranno nella realtà

I modelli mondiali sono attualmente una delle direzioni più seguite nell'intelligenza incarnata. Possono essere intesi come un sistema di anteprima nel cervello del robot. Dando loro l'immagine corrente e un set di azioni da eseguire, prevedono cosa accadrà dopo. Se il braccio robotico si sposta a sinistra di 1 centimetro, il bicchiere verrà afferrato o urtato? Il cassetto è già aperto, il passo successivo dovrebbe essere continuare a prendere oggetti o prima regolare l'angolo del polso? Il robot può confrontare più futuri e poi decidere quale percorso d'azione adottare.

Le aziende di robotica possono anche inserire diverse versioni di strategie di movimento nei modelli mondiali per testarle. Le versioni migliori vanno poi sui robot reali, risparmiando gli elevati costi dei test sugli effetti dei movimenti nel mondo reale. Il problema è che molti modelli mondiali, spesso, sembrano più un regista eccessivamente ottimista. I dati di addestramento dei robot sono generalmente dominati da dimostrazioni di successo. Se il modello vede che la maggior parte delle chiusure della pinza è seguita dall'oggetto che viene sollevato, tenderà a prendere una scorciatoia: fintantoché la pinza si chiude, l'oggetto dovrebbe essere afferrato. Anche se c'è un evidente spazio tra la pinza e l'oggetto, l'oggetto nell'immagine generata potrebbe avvicinarsi attivamente alla pinza. L'articolo definisce questo fenomeno un errore simile a una "presa magnetica".

Queste deviazioni potrebbero non essere evidenti in movimenti ampi come correre o ballare, ma nelle operazioni di precisione determinano direttamente il successo o il fallimento. Se la pinza dista pochi millimetri dal manico del bicchiere, il robot potrebbe mancarlo. Se l'angolo della spina è leggermente scostato, sarà difficile inserirla nella presa. Il passaggio del robot dal "saper fare" al "fare con successo" spesso si blocca negli ultimi pochi millimetri. Se il modello mondiale liscia direttamente questi pochi millimetri, più fluido sarà il futuro presentato e più il robot tenderà a sopravvalutare l'affidabilità di un'azione. Quando il tempo di simulazione si allunga, emergono nuovi problemi. Dopo che il modello mondiale ha generato un segmento video, deve usarlo come base per la previsione successiva. Un piccolo errore iniziale si accumulerà continuamente nelle fasi successive. L'oggetto potrebbe spostarsi lentamente dalla sua posizione originale e la relazione di contatto tra pinza e bicchiere potrebbe cambiare. Se conserva solo gli ultimi frame, il modello dimenticherà cosa ha fatto prima, ma se conserva tutta la cronologia, il carico computazionale e l'uso di memoria continueranno a crescere. Il fatto che un video sembri realistico non significa che la strategia selezionata dal modello sia effettivamente migliore. La ricerca e sviluppo robotica ha bisogno di sapere se il vincitore dei test virtuali può mantenere il vantaggio sui robot reali. Il modello mondiale deve far sì che azioni diverse portino effettivamente a risultati diversi; un'immagine fluida completa solo il passaggio più superficiale.

Come si muove il robot, così dovrebbe cambiare il futuro

Quando WALL-SS prevede l'immagine dei secondi successivi, costruisce prima una "anteprima a bassa risoluzione".

In questa anteprima, il modello determina prima la direzione generale: dove va il braccio robotico, come si muoveranno approssimativamente gli oggetti. Successivamente, affina la stessa immagine strato per strato, aggiungendo i contorni degli oggetti, l'apertura e chiusura della pinza e le posizioni di contatto.

L'articolo definisce questa gerarchia, dai contorni generali ai piccoli dettagli, come "scala". Le immagini già generate e le azioni già compiute diventeranno la cronologia per la previsione successiva: questo è l'"autoregressione alla prossima scala".

Man mano che l'immagine diventa più nitida, l'azione influenzerà nuovamente il futuro.

Se il braccio va a sinistra o a destra, cambierà prima la direzione del movimento nell'immagine a bassa risoluzione. Quando la pinza si chiude, continuerà a influenzare se urterà il bicchiere nell'immagine nitida.

Una volta generato un piccolo segmento di futuro, questo entrerà nella memoria insieme alle azioni già compiute, diventando la base per il modello per continuare...