Chinanews
Other爱范儿Thu, 27 Aug 2026 10:34:37 +0000

หลังจบงานแข่งขันหุ่นยนต์ Zibianliang สร้าง 'สนามฝึกเสมือนจริง' ให้กับหุ่นยนต์

หลังจบงานแข่งขันหุ่นยนต์ Zibianliang สร้าง 'สนามฝึกเสมือนจริง' ให้กับหุ่นยนต์

ผมถูกหุ่นยนต์ครองหน้าจอมาตลอดทั้งสัปดาห์แล้ว

หุ่นยนต์ทำลายสถิติวิ่ง 100 เมตรของมนุษย์ 'บินขึ้นจากพื้น' ได้เกือบ 3 เมตร ท่าวิ่ง 'เขินอาย' ดังไปถึงต่างประเทศ หรือเซียนไทเก๊ะไซเบอร์กระโดดหมุนตัวกลางอากาศ 540 องศา……

**งาน World Humanoid Robot Games ปีนี้คึกคักกว่าทุกปี โดยมีทีมจาก 16 ประเทศบน 6 ทวีป จำนวน 666 ทีม พาหุ่นยนต์กว่า 2,056 ตัวมาที่กรุงปักกิ่ง และการแข่งขันก็ขยายขอบเขตจากกรีฑา ศิลปะการต่อสู้ ไปจนถึงสถานการณ์จำลองในชีวิตจริงอย่างบ้าน โรงแรม โรงงานอุตสาหกรรม และการกู้ภัยฉุกเฉิน อย่างไรก็ตาม เมื่อหุ่นยนต์ล้มเหลวในสนามแข่ง ทุกคนก็แค่หัวเราะแล้วผ่านไป แต่ถ้าหุ่นยนต์เข้าไปอยู่ในบ้านจริงๆ มันอาจจะเผลอทำแก้วน้ำหก ชนเฟอร์นิเจอร์ หรือดึงเสื้อผ้าที่เพิ่งพับเก็บไว้เรียบร้อยทิ้งกับพื้น ซึ่งตอนนั้นคงจะหัวเราะไม่ออกแล้ว ในโลกแห่งความเป็นจริง ไม่มีรันเวย์ที่ถูกกำหนดไว้ตายตัวหรืออุปกรณ์ประกอบฉากที่จัดวางในตำแหน่งเดียวกันเสมอ แค่แก้วถูกขยับไปนิดเดียว หรือบนโต๊ะมีผ้าเช็ดมือเพิ่มขึ้นมา ท่าทางที่ฝึกฝนมาเป็นอย่างดีก็อาจใช้การไม่ได้ การนำการทดลองและความผิดพลาดเหล่านี้ของหุ่นยนต์เข้าสู่โลกเสมือนจริง คือสิ่งที่ World Model ในปัจจุบันกำลังพยายามทำ มันพยายามสร้างสภาพแวดล้อมที่สอดคล้องกับกฎทางกายภาพขึ้นมา เพื่อให้หุ่นยนต์ได้ซ้อมท่าทางล่วงหน้าก่อนลงมือทำจริง: หากเอื้อมมือไปทางซ้ายอีกนิดจะพลาดเป้าหรือไม่ หากหุ่นคีบปิดเร็วเกินไปจะชนแก้วหรือไม่ แต่ในความเป็นจริง World Model จำนวนมากไม่สามารถทำ 'การทดสอบเสมือนจริง' ที่เชื่อถือได้ พวกมันอาจจะเข้าใจภาพที่เห็น แต่กลับไม่ได้ทำตามคำสั่งเคลื่อนไหวจริงๆ เมื่อเวลาการจำลองผ่านไปนานเท่าไหร่ ตำแหน่งของวัตถุก็จะเริ่มเบี่ยงเบนไป กลยุทธ์ที่ให้ผลลัพธ์ดีในโลกเสมือนจริง ก็ไม่จำเป็นว่าจะใช้ได้ผลกับตัวจริงเช่นกัน ในขณะที่หุ่นยนต์กำลังเริ่มก้าวจากสนามแข่งไปสู่สถานการณ์จริง Zibianliang Robotics ก็ได้เปิดตัว World Model แบบ Autoregressive ที่มีชื่อว่า WALL-SS

'สนามฝึกเสมือนจริง' ที่ WALL-SS สร้างขึ้นนี้ สามารถฝ่าฟันอุปสรรคของ World Model ได้ในที่สุด ไม่ว่าจะเป็นเรื่องการที่การเคลื่อนไหวสามารถเปลี่ยนแปลงผลลัพธ์ได้จริงหรือไม่ การรักษาความต่อเนื่องในภารกิจระยะยาว หรือความสามารถในการนำผลการทดสอบเสมือนจริงไปใช้กับตัวจริง ล้วนมีคำตอบและแนวทางแก้ไขใหม่ๆ แล้ว มันสามารถจำลองภารกิจการเทน้ำและการจัดระเบียบวัตถุที่ใช้เวลาต่อเนื่องนานถึง 60 วินาที เพื่อทดสอบผลลัพธ์ของการเคลื่อนไหวที่แตกต่างกัน: การจับแก้วน้ำด้วยวิธีที่ต่างกัน จะทำให้จับพลาด ชนแก้วล้ม หรือสามารถจับได้สำเร็จ? ทีมวิจัยยังได้นำกลยุทธ์ของหุ่นยนต์หลายชุดไปทดสอบทั้งใน WALL-SS และในโลกแห่งความเป็นจริง ผลปรากฏว่า กลยุทธ์การเคลื่อนไหวที่ให้ผลลัพธ์ดีในโลกเสมือนจริง มักจะให้ผลลัพธ์ที่ดีเช่นกันเมื่อนำไปใช้ในโลกทางกายภาพ เรื่องนี้น่าสนใจมาก 'ความฝัน' ของหุ่นยนต์ เริ่มสามารถนำมาใช้ฝึกฝนและคัดกรองการเคลื่อนไหวจริงได้แล้ว**

ลิงก์โครงการที่เกี่ยวข้อง: http://x2robot.com/pages/ss ลิงก์บทความวิจัย: https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf ลิงก์ Github: https://github.com/X-Square-Robot/wall-ss

วิธีที่หุ่นยนต์ 'ฝัน' จะเป็นตัวกำหนดว่ามันจะล้มเหลวในความเป็นจริงหรือไม่

World Model เป็นหนึ่งในทิศทางที่ได้รับความสนใจมากที่สุดในด้าน Embodied AI ในปัจจุบัน มันสามารถเข้าใจได้ว่าเป็นระบบจำลองสถานการณ์ล่วงหน้าในสมองของหุ่นยนต์ เมื่อให้ภาพปัจจุบันและชุดคำสั่งการเคลื่อนไหวที่กำลังจะทำ มันจะทำนายว่าจะเกิดอะไรขึ้นต่อไป แขนกลเคลื่อนไปทางซ้าย 1 เซนติเมตร แก้วจะถูกจับได้หรือจะถูกชนล้ม? ลิ้นชักเปิดออกแล้ว ขั้นตอนต่อไปควรจะหยิบของต่อ หรือปรับมุมของข้อมือก่อน? หุ่นยนต์สามารถเปรียบเทียบอนาคตที่เป็นไปได้หลายๆ แบบ แล้วค่อยตัดสินใจเลือกเส้นทางการเคลื่อนไหวที่จะใช้

บริษัทหุ่นยนต์สามารถนำกลยุทธ์การเคลื่อนไหวเวอร์ชันต่างๆ ไปทดสอบใน World Model ได้ เวอร์ชันที่ทำผลงานได้ดีกว่า ค่อยนำไปทดสอบบนตัวจริง ช่วยประหยัดค่าใช้จ่ายอันมหาศาลในการทดสอบประสิทธิภาพการเคลื่อนไหวในโลกแห่งความเป็นจริง แต่ปัญหาคือ World Model หลายตัวมักจะทำตัวเหมือนผู้กำกับที่มองโลกในแง่ดีเกินไป ข้อมูลการฝึกอบรมหุ่นยนต์มักจะประกอบด้วยตัวอย่างความสำเร็จเป็นหลัก หากโมเดลเห็นว่าการปิดหุ่นคีบส่วนใหญ่มักตามด้วยวัตถุที่ถูกยกขึ้น มันก็จะหาทางลัด: แค่ปิดหุ่นคีบ วัตถุก็ควรจะถูกจับขึ้นมา แม้ว่าจะมีช่องว่างระหว่างหุ่นคีบและวัตถุอย่างชัดเจน ในภาพที่สร้างขึ้น วัตถุอาจจะขยับเข้ามาติดหุ่นคีบเอง บทความวิจัยเรียกปรากฏการณ์นี้ว่า ข้อผิดพลาดแบบ 'การจับแบบแม่เหล็ก'

ความคลาดเคลื่อนเหล่านี้อาจไม่เด่นชัดนักในการเคลื่อนไหวใหญ่ๆ เช่น การวิ่งหรือการเต้น แต่ในการปฏิบัติงานที่ต้องการความละเอียดอ่อน มันกลับเป็นตัวกำหนดความสำเร็จหรือความล้มเหลวโดยตรง หุ่นคีบห่างจากด้ามแก้วไปไม่กี่มิลลิเมตร หุ่นยนต์อาจจะจับพลาด หรือหากมุมของปลั๊กเอียงไปเล็กน้อย ก็ยากที่จะเสียบเข้าช่องได้สำเร็จ การที่หุ่นยนต์จะก้าวจาก 'ทำได้' ไปสู่ 'ทำสำเร็จ' มักจะติดขัดอยู่ที่มิลลิเมตรสุดท้ายนั่นเอง หาก World Model ลบเลือนมิลลิเมตรเหล่านี้ออกไปโดยตรง ยิ่งอนาคตที่มันสร้างขึ้นดูสมจริงและลื่นไหลเท่าไหร่ หุ่นยนต์ก็จะยิ่งประเมินความน่าเชื่อถือของชุดการเคลื่อนไหวนั้นสูงเกินจริงเท่านั้น เมื่อเวลาการจำลองผ่านไปนานขึ้น ปัญหาใหม่ก็จะตามมา หลังจากที่ World Model สร้างภาพตอนหนึ่งเสร็จ มันยังต้องนำภาพนั้นมาเป็นข้อมูลพื้นฐานสำหรับการทำนายในตอนต่อไป ความคลาดเคลื่อนเล็กน้อยในช่วงแรก จะค่อยๆ สะสมตัวขึ้นเรื่อยๆ วัตถุอาจจะค่อยๆ เลื่อนออกจากตำแหน่งเดิม ความสัมพันธ์การสัมผัสระหว่างหุ่นคีบและแก้วก็จะเปลี่ยนไป หากเก็บเฉพาะเฟรมล่าสุดไม่กี่เฟรม โมเดลจะลืมว่าก่อนหน้านี้ได้ทำอะไรลงไป แต่ถ้าเก็บประวัติทั้งหมด ปริมาณการคำนวณและการใช้หน่วยความจำก็จะเพิ่มขึ้นอย่างต่อเนื่อง วิดีโอที่ดูสมจริง ไม่ได้แปลว่ากลยุทธ์ที่โมเดลเลือกออกมาจะดีกว่าจริงๆ การวิจัยและพัฒนาหุ่นยนต์จำเป็นต้องรู้ว่า ผู้ชนะจากการทดสอบเสมือนจริง จะสามารถรักษาความเป็นผู้นำไว้ได้ต่อเมื่อไปทดสอบบนตัวจริงหรือไม่ World Model จำเป็นต้องทำให้การเคลื่อนไหวที่แตกต่างกันนำไปสู่ผลลัพธ์ที่แตกต่างกันจริงๆ ภาพที่ลื่นไหลเป็นเพียงการทำขั้นตอนที่อยู่บนพื้นผิวสุดเท่านั้น**

หุ่นยนต์เคลื่อนไหวอย่างไร อนาคตก็ควรเปลี่ยนแปลงไปอย่างนั้น

เมื่อ WALL-SS ทำนายภาพในอีกไม่กี่วินาทีข้างหน้า มันจะสร้าง 'พรีวิวความละเอียดต่ำ' ขึ้นมาก่อน

ในพรีวิวนี้ โมเดลจะกำหนดทิศทางใหญ่ก่อน: แขนกลจะเคลื่อนไปทางไหน วัตถุจะเคลื่อนที่อย่างไรโดยประมาณ จากนั้น มันจะค่อยๆ ปรับความคมชัดของภาพเดียวกันนั้นทีละชั้น เติมเต็มรายละเอียดโครงร่างของวัตถุ การเปิด-ปิดของหุ่นคีบ และตำแหน่งการสัมผัส

บทความวิจัยเรียกลำดับชั้นจากโครงร่างใหญ่ไปสู่รายละเอียดเล็กนี้ว่า 'สเกล' ภาพที่สร้างขึ้นแล้วและการเคลื่อนไหวที่เกิดขึ้น จะกลายเป็นประวัติศาสตร์สำหรับการทำนายในช่วงถัดไป นี่คือ 'Next-Scale Autoregression' หรือการถดถอยอัตโนมัติในสเกลถัดไป

ทุกครั้งที่ภาพคมชัดขึ้น การเคลื่อนไหวก็จะส่งผลกระทบต่ออนาคตอีกครั้ง

ว่าแขนจะเคลื่อนไปทางซ้ายหรือทางขวา จะเปลี่ยนทิศทางการเคลื่อนที่ในภาพความละเอียดต่ำก่อน ส่วนการที่หุ่นคีบจะปิดเมื่อไหร่ จะยังคงส่งผลต่อภาพความละเอียดสูงว่าจะชนแก้วหรือไม่

เมื่อการสร้างอนาคตในช่วงสั้นๆ เสร็จสิ้น มันจะถูกนำเข้าสู่หน่วยความจำพร้อมกับการเคลื่อนไหวที่เกิดขึ้นแล้ว เพื่อกลายเป็นข้อมูลให้โมเดลดำเนินการต่อไป…