Chinanews
Other爱范儿Thu, 27 Aug 2026 13:36:06 +0000

Xpeng VLA รุ่นใหม่ ติดตั้งกันยายน: จดจำอดีต 30 วินาที พยากรณ์อนาคต 6 วินาที เริ่มขับขี่ 'ในกระแสเวลา'

Xpeng VLA รุ่นใหม่ ติดตั้งกันยายน: จดจำอดีต 30 วินาที พยากรณ์อนาคต 6 วินาที เริ่มขับขี่ 'ในกระแสเวลา'

ในภาพยนตร์เรื่อง Doctor Strange นั้น ดอกเตอร์สเตรนจ์สามารถหมุนตาแห่งอาโกโมโตเพื่อให้เวลาไหลไปข้างหน้าหรือย้อนกลับได้ และเมื่อถึงเรื่อง Avengers 3 เขาก็สามารถมองเห็นความเป็นไปได้ของอนาคตได้ล่วงหน้าก่อนที่จะเผชิญหน้ากับธานอส

นี่คือเวทมนตร์ในภาพยนตร์ แต่ก็เป็นความจริงที่ Xpeng นำเสนอ

วันที่ 27 สิงหาคม Xpeng ได้จัดการแชร์เกี่ยวกับ Physical AI และพร้อมกันนั้นก็ได้เปิดตัวเวอร์ชันใหม่ของ VLA รุ่นที่ 2 คำสำคัญที่ใหญ่ที่สุดในการสื่อสารครั้งนี้คือ 'เวลา' Xpeng ได้เพิ่ม 'ตาแห่งอาโกโมโต' ให้กับโมเดลบนรถยนต์ หมุนย้อนกลับไปก็สามารถย้อนระลึกโลกใน 30 วินาทีที่ผ่านมา หมุนไปข้างหน้าก็จะเริ่มพยากรณ์ว่าอนาคตในอีก 6 วินาทีจะเกิดอะไรขึ้น

รถยนต์ไม่มีอัญมณีเวลา แต่มีโมเดลขนาดใหญ่คอยสนับสนุน โมเดลจะคำนวณสถานะถัดไปที่มีความน่าจะเป็นสูงจากข้อมูลที่สะสมมาในช่วงเวลาที่ผ่านมา แล้วจึงเลือกการกระทำสำหรับช่วงเวลาปัจจุบัน สำหรับการขับขี่อัจฉริยะแล้ว การมี 'ความทรงจำเส้นเวลา' จะสามารถนำมาซึ่งการปฏิบัติการที่เป็นมนุษย์มากขึ้น

เมื่อคนขับรถ เราไม่เคยมองเพียงเฟรมภาพตรงหน้าเท่านั้น คุณจะตัดสินสภาพถนนด้านหลังจากความทรงจำในไม่กี่วินาทีที่ผ่านมา และยังคาดการณ์รถจักรยานยนต์ไฟฟ้าที่อาจปรากฏตัวในอีกไม่กี่วินาทีจากการชะลอความเร็วของรถคันหน้าและทางแยกข้างทาง ในความหมายบางอย่าง การขับขี่ไม่ได้เกิดขึ้นเพียงบนพื้นผิวถนน แต่ยังเกิดขึ้นในกระแสเวลาอีกด้วย

Xpeng VLA รุ่นที่ 2 เวอร์ชัน 6.3.

การขับขี่ไม่มีคำตอบจากเฟรมเดียว

แนวคิดหลักของ Xpeng ที่มีต่อ VLA ใหม่ในครั้งนี้คือการเชื่อมต่ออดีต ปัจจุบัน และอนาคตเข้าด้วยกัน

Infini-VLA ทำหน้าที่จดจำอดีต สถาปัตยกรรมพื้นฐานสามารถรองรับลำดับเวลาที่ยาวขึ้นได้ Xpeng ได้พิจารณาภารกิจการขับขี่และปริมาณการคำนวณบนอุปกรณ์ปลายทาง จึงตั้งค่าความจำประวัติของเวอร์ชันผลิตจริงไว้ที่ 30 วินาที กล่าวคือ มันสามารถจดจำสภาพถนนที่เกิดขึ้นใน 30 วินาทีที่ผ่านมา และนำมาประกอบเข้ากับการตัดสินใจในปัจจุบัน

Xpeng ได้เปิดตัววิดีโอสาธิตในงานสื่อสาร โดยเมื่อรถคันหน้ากลับรถกลางถนน ด้านหลังตัวรถได้เผยช่องว่างที่สามารถฝ่าไปได้ชั่วขณะหนึ่ง แต่รถทดสอบไม่ได้เร่งความเร็วทันที ทว่าได้นำกระบวนการเคลื่อนไหวก่อนหน้านี้มาประกอบเข้าด้วยกัน รอจนรถอีกคันกลับรถเสร็จก่อนแล้วจึงค่อยเคลื่อนที่ไปข้างหน้า สิ่งที่โมเดลเข้าใจคือพฤติกรรมต่อเนื่องที่ว่า 'รถคันหน้ากำลังกลับรถ' ไม่ใช่แค่เฟรมภาพที่ว่า 'ด้านหน้ามีช่องว่าง' เท่านั้น

สิ่งนี้คล้ายกับความจำระยะสั้นเมื่อคนพูดคุยกัน คนเราไม่ได้ลืมประโยคก่อนหน้าทุกครั้งที่ได้ยินประโยคใหม่ และผู้ขับขี่ก็ไม่ได้ลืมว่ารถคันหน้าได้เตรียมท่ากลับรถมาก่อนหน้านี้ เพียงเพราะตอนนี้รถคันนั้นกำลังขวางอยู่กลางถนน

หาก Infini-VLA ทำให้รถไม่ลืมบริบทก่อนหน้า Streaming Inference หรือ 'การอนุมานแบบอัตโนมัติแบบสตรีมมิ่ง' ก็จะรับผิดชอบในการลดเวลาที่รถต้องใช้ในการทำความเข้าใจสถานการณ์ปัจจุบัน ตามคำอธิบายของ Xpeng โมเดลสามารถรับข้อมูล ทำการอนุมาน และส่งออกเส้นทางได้พร้อมกัน โดยไม่ต้องรอจนเข้าใจประวัติทั้งหมดอย่างสมบูรณ์ก่อนแล้วจึงเริ่มทำงาน ข้อมูลที่ Xpeng ระบุคือ การอนุมานแบบสตรีมมิ่งนี้ช่วยเพิ่มความเร็วในการตัดสินใจถึง 300%

เช่นเดียวกัน สิ่งนี้ก็คล้ายกับเวลาที่คนขับรถ ซึ่งดูถนน สมองตัดสินใจ และมือเท้าควบคุมรถไปพร้อมๆ กัน เมื่อมีเป้าหมายปรากฏตัวขึ้นกะทันหันจากจุดที่ถูกบดบัง การประมวลผลแบบขนานเช่นนี้จะช่วยลดช่วงเวลาว่างที่ต้องรอให้การอนุมานเสร็จสิ้นลงได้

จดจำอดีต มองปัจจุบัน และย่อมต้องมองไปยังอนาคต ดังนั้น X-Foresight ใน VLA เวอร์ชันใหม่จะทำการคาดการณ์อนาคต 6 วินาทีตามสถานะในอดีต จากนั้น Flow Matching จะทำการปรับแต่งการกระจายตัวของเส้นทางที่เป็นไปได้หลายเส้นทาง เพื่อช่วยให้โมเดลเลือกการกระทำที่เหมาะสมที่สุด

คำศัพท์อาจจะดูเข้าใจยาก แต่ผลลัพธ์ที่เกิดขึ้นชัดเจนมาก VLA เวอร์ชันใหม่จะคาดการณ์สถานการณ์ที่ยังไม่เกิดแต่อาจเกิดขึ้นได้ผ่านการสังเกตสภาพถนนปัจจุบันอย่างต่อเนื่อง และตัดสินใจขั้นต่อไป ซึ่งในชีวิตจริง 'การขับขี่แบบระมัดระวัง' ที่คนขับรถเก๋ามักพูดถึง โดยพื้นฐานแล้วก็เป็นการคาดการณ์เช่นกัน

ในวิดีโอที่ถ่ายทำ รถยนต์สีขาวคันหนึ่งจากเลนตรงข้ามได้บุกเข้ามาในเลนทวนทิศ รถทดสอบจำเป็นต้องตัดสินใจว่าอีกฝ่ายกำลังจะรอ ขับต่อไปข้างหน้า หรือจะเบี่ยงให้พื้นที่บางส่วน แล้วจึงคำนวณต่อว่าหากตนขับไปข้างหน้าในตอนนี้จะตัดทางเดินของรถทั้งสองคันหรือไม่ การมองเห็นว่าอีกฝ่ายอยู่ที่ไหนเป็นเพียงก้าวแรก การเข้าใจว่าอีกฝ่ายจะทำอะไรต่อไป จึงจะสามารถกำหนดการกระทำในขั้นต่อไปของเราได้

ความทรงจำในอดีตและการคาดคะเนในอนาคต ท้ายที่สุดแล้วจะรับใช้การเร่งเครื่อง การเบรก และการหักพวงมาลัยในแต่ละครั้ง และทำให้ VLA รุ่นที่ 2 เวอร์ชัน 6.3.0 สามารถ 'ไหลในกระแสเวลา' ได้

ก้าวเข้าสู่โลกแห่งความเป็นจริง

ในแผนภาพสถาปัตยกรรมมีคำศัพท์มากมาย แต่เมื่อกลับมาที่ผลิตภัณฑ์ สิ่งที่ VLA ต้องเผชิญยังคงเป็นปัญหาต่างๆ บนถนนจริง คำตอบของ Xpeng คือการใช้โมเดลที่ใหญ่ขึ้น โดยในครั้งนี้ Xpeng ได้ขยายพารามิเตอร์ของโมเดลเพิ่มขึ้น 3.5 เท่า

ในวิดีโอที่เล่นในงานสื่อสาร รถทดสอบมาถึงท่าเรือข้ามฟาก ที่ท่าเรือไม่มีเส้นจราจรที่ชัดเจน และไม่ใช่ถนนธรรมดาทั่วไป แต่ด้วยการคิดของโมเดลเอง รถยนต์ก็ยังคงหาทางเข้าได้ด้วยตนเอง ขับขึ้นเรือข้ามฟาก และหยุดตามรถคันหน้า หลังจากเรือเทียบท่า มันก็ขับออกมาตามกระแสรถยนต์

อีกวิดีโอหนึ่งเกิดขึ้นบนถนนบนภูเขาที่แคบ หลังโค้งหักศอก มีกิ่งไม้ที่ห้อยลงมากลางอากาศบนถนนด้านหน้า รถยนต์ไม่ได้ถือว่ามันเป็นเพียงสิ่งกีดขวางบนถนนธรรมดาแล้วหยุดอยู่กับที่ และไม่ได้ขับตรงไปยังช่องว่างที่ดูเหมือนจะยังพอมีพื้นที่ แต่ได้ลดความเร็วลงอย่างกระตือรือร้น สังเกตความสัมพันธ์ระหว่างกิ่งไม้และตัวรถไปพร้อมๆ กัน และคอยหาพื้นที่ที่จะสามารถผ่านไปได้

ที่น่ากล่าวถึงคือ เมื่อไม่กี่วันก่อน รถยนต์ Tesla ที่รันระบบ FSD v14.3.

ท่าเรือข้ามฟากและกิ่งไม้เป็นสถานการณ์ที่พบได้น้อยมาก และนี่คือเหตุผลที่ Xpeng ยืนกรานที่จะขยายขนาดโมเดล ระบบที่พึ่งพากฎเกณฑ์ตายตัวอาจจะสามารถรับมือกับท่าเรือ ฝูงแกะ พายุฝน หรือสถานการณ์ใหม่ๆ แต่ละอย่างได้...