Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

Após os Jogos de Robótica, a Zibianliang constrói um "campo de treinamento virtual" para robôs

Após os Jogos de Robótica, a Zibianliang constrói um "campo de treinamento virtual" para robôs

Minhas redes sociais foram inundadas por robôs durante toda a semana.

Robôs quebraram o recorde humano dos 100 metros, "decolaram" quase três metros no lugar, a postura de "corrida tímida" viralizou no exterior, e o ciborgue Zhang Sanfeng executou um chute externo de 540° no ar…

Os Jogos Mundiais de Robôs Humanoides deste ano foram ainda mais movimentados, com 666 equipes de 16 países de seis continentes trazendo 2.056 robôs para Pequim. As competições se expandiram do atletismo e artes marciais para cenários reais como lares, hotéis, indústria e resgate de emergência. No entanto, quando os robôs falham na arena, as pessoas apenas riem. Mas quando entram de fato nos lares, podem derrubar copos de água, colidir com móveis ou arrastar roupas recém-dobradas de volta ao chão, e aí não há motivo para risadas. No mundo real, não há pistas fixas nem adereços dispostos de forma padronizada. Se um copo for movido um pouco ou houver um pano extra na mesa, as ações treinadas podem falhar. Transferir esses erros e acertos dos robôs para um mundo virtual é exatamente o que os modelos mundiais atuais tentam fazer. Eles buscam recriar um ambiente que obedeça às leis da física, permitindo que o robô ensaie antes de agir: se a mão se deslocar um pouco para a esquerda, ela perderá o objeto? Se a garra fechar cedo demais, derrubará o copo? Na prática, muitos modelos mundiais não conseguem realizar "testes virtuais" confiáveis. Eles podem entender a imagem, mas não obedecer verdadeiramente às ações. Com o tempo, os objetos e suas posições começam a se deslocar. As estratégias com melhor desempenho no mundo virtual podem não funcionar nos robôs reais. Justo quando os robôs começam a sair das arenas competitivas para cenários reais, a Zibianliang Robotics lançou o modelo mundial autorregressivo WALL-SS. O "campo de treinamento virtual" construído pelo WALL-SS finalmente superou o gargalo dos modelos mundiais. Se as ações podem realmente alterar os resultados, se a coerência pode ser mantida em tarefas longas e se o desempenho virtual sobrevive ao teste em máquinas reais, agora há novas soluções e respostas. Ele pode simular tarefas contínuas de 60 segundos, como despejar água e organizar itens, para testar os resultados de diferentes ações: ao segurar o copo de várias maneiras, a mão falha, derruba o copo ou pega com sucesso? A equipe de pesquisa também colocou múltiplas estratégias de robôs para teste tanto no WALL-SS quanto no mundo real. As estratégias de ação com ótimo desempenho no mundo virtual frequentemente apresentam bons resultados quando transferidas para o mundo físico. Isso é fascinante: os "sonhos" dos robôs estão começando a ser usados para praticar e filtrar ações reais.

**Página do projeto relacionada: http://x2robot.com/pages/ss Link do artigo: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf Link do Github: https://github.com/X-Square-Robot/wall-ss

A forma como os robôs "sonham" determina se eles falharão na realidade

O modelo mundial é atualmente uma das direções mais observadas na inteligência encarnada. Pode ser entendido como um sistema de ensaio na mente do robô. Dada a imagem atual e um conjunto de ações a serem executadas, ele prevê o que acontecerá a seguir. Se o braço robótico se mover 1 centímetro para a esquerda, o copo será pego ou derrubado? Se a gaveta já está aberta, o próximo passo deve ser continuar pegando coisas ou ajustar o ângulo do pulso primeiro? O robô pode comparar múltiplos futuros e então decidir qual caminho de ação seguir.

As empresas de robótica também podem colocar diferentes versões de estratégias de ação no modelo mundial para testes. As versões com melhor desempenho vão para as máquinas reais, economizando os custos elevados de testar os efeitos das ações no mundo real. O problema é que muitos modelos mundiais muitas vezes se parecem mais com um diretor excessivamente otimista. Os dados de treinamento de robôs geralmente consistem principalmente em demonstrações de sucesso. Se o modelo vir que a maioria das ações de fechamento da garra é seguida pelo objeto sendo levantado, ele tende a pegar atalhos: contanto que a garra feche, o objeto deve ser levantado. Mesmo que haja uma lacuna óbvia entre a garra e o objeto, o objeto na imagem gerada pode se mover ativamente em direção à garra. O artigo chama esse fenômeno de erro de "agarramento magnético".

Esses desvios podem não ser óbvios em movimentos amplos como correr ou dançar, mas em operações refinadas, determinam diretamente o sucesso ou fracasso. Se a garra errar a alça do copo por alguns milímetros, o robô pode falhar. Se o ângulo do plugue estiver um pouco errado, será difícil inseri-lo na tomada. Para os robôs, passar de "saber fazer" para "fazer com sucesso" muitas vezes fica preso nos últimos milímetros. Se o modelo mundial simplesmente elimina esses milímetros, quanto mais fluido for o futuro apresentado, mais o robô tenderá a superestimar a confiabilidade de uma ação. Com o tempo de simulação, novos problemas surgem. Depois que o modelo mundial gera um segmento de imagem, ele deve usá-lo como base para a próxima previsão. Um pequeno erro inicial se acumulará continuamente depois. O objeto pode se desviar lentamente de sua posição original, e a relação de contato entre a garra e o copo também mudará. Se apenas os últimos quadros forem mantidos, o modelo esquecerá o que fez antes, mas se todo o histórico for mantido, a carga computacional e o uso de memória continuarão a crescer. O vídeo parecer realista não significa que a estratégia selecionada pelo modelo seja realmente melhor. Os desenvolvedores de robôs precisam saber se o vencedor dos testes virtuais pode continuar liderando nas máquinas reais. O modelo mundial precisa garantir que diferentes ações levem a diferentes resultados; uma imagem fluida completa apenas a etapa mais superficial.**

Como o robô se move é como o futuro deve mudar

Ao prever a imagem dos próximos segundos, o WALL-SS primeiro constrói uma "pré-visualização em baixa resolução".

Nesta versão de pré-visualização, o modelo primeiro determina a direção geral: para onde o braço robótico vai e como os objetos se moverão aproximadamente. Em seguida, ele afia a mesma imagem camada por camada, preenchendo os contornos dos objetos, a abertura e fechamento da garra e as posições de contato.

O artigo chama essa hierarquia, do contorno geral aos pequenos detalhes, de "escala". A imagem já gerada e as ações que ocorreram se tornarão o histórico para a próxima previsão, o que é chamado de "autorregressão da próxima escala".

À medida que a imagem fica mais nítida, a ação afeta o futuro mais uma vez.

Se o braço vai para a esquerda ou para a direita, isso primeiro mudará a direção do movimento na imagem em baixa resolução. Quando a garra fecha, isso continuará afetando se o copo será tocado na imagem nítida.

Depois que um pequeno segmento do futuro é gerado, ele entra na memória junto com as ações que já ocorreram, tornando-se a base para o modelo continuar...