Chinanews
Other爱范儿Thu, 27 Aug 2026 10:15:44 +0000

ทำไมคอมพิวเตอร์ AI ของ Apple และ Xiaomi ถึงต้องเอาเป็นเอาตายกับ 'กำแพงหน่วยความจำ' | บันทึกอุปกรณ์ AI

ทำไมคอมพิวเตอร์ AI ของ Apple และ Xiaomi ถึงต้องเอาเป็นเอาตายกับ 'กำแพงหน่วยความจำ' | บันทึกอุปกรณ์ AI

สมาร์ทโฟนครองระบบนิเวศดิจิทัลมาตลอดกว่าสิบกว่าปีที่ผ่านมา มันคือหลุมดำดึงดูดความสนใจ และเป็นสิ่งของส่วนตัวที่เราพกติดตัวมากที่สุด แต่สมาร์ทโฟนได้รับการออกแบบมาตั้งแต่ต้นเพื่อให้ 'ผู้คนจ้องมองมัน' ตรรกะทั้งหมดของมันจึงจำกัดอยู่แค่บนหน้าจอ

แต่ความต้องการของ AI กลับตรงกันข้ามโดยสิ้นเชิง: มันจำเป็นต้องรับรู้โลกทางกายภาพอย่างต่อเนื่อง มองเห็นสิ่งที่คุณเห็น ได้ยินสิ่งที่คุณได้ยิน และอยู่กับคุณตลอดเวลา แทนที่จะรอให้คุณปลดล็อกหน้าจอแล้วค่อยตื่นขึ้นมา

เมื่อ AI กลายเป็นความสามารถพื้นฐานอย่างแท้จริง ไม่ช้าก็เร็วมันย่อมต้องทะลุทะลวงออกจากหน้าจอ เพื่อค้นหารูปแบบที่เป็นของมันเอง นี่จะเป็นกระบวนการสำรวจและวิวัฒนาการที่ยาวนาน

คอลัมน์ 'บันทึกอุปกรณ์ AI' กำเนิดขึ้นมาจากเหตุผลนี้ ifanr ต้องการชวนคุณสังเกตต่อเนื่องว่า: AI จะเปลี่ยนแปลงการออกแบบฮาร์ดแวร์อย่างไร ปรับโฉมการโต้ตอบระหว่างมนุษย์กับคอมพิวเตอร์อย่างไร และที่สำคัญที่สุดคือ—AI จะเข้าสู่ชีวิตประจำวันของเราในรูปแบบใด

นี่คือบทความที่ 23 ของ 'บันทึกอุปกรณ์ AI'

Mac รุ่นใหม่ที่ Apple เพิ่งปล่อยออกมาไม่นานนี้ ได้สร้างมาตรฐานความคาดหวังด้านประสิทธิภาพของ 'คอมพิวเตอร์ AI' ขึ้นมาใหม่อีกครั้ง Mac mini ขนาดกะทัดรัดถูกกำหนดโดยตรงจากทางการว่าเป็นเครื่องมือเพิ่มผลผลิตที่ทำงาน Agent ตลอด 24 ชั่วโมง ส่วน Mac Studio ระดับมืออาชีพ ยิ่งไปกว่านั้นด้วยการมอบหน่วยความจำรวมสูงสุดถึง 512GB

อย่างไรก็ตาม จุดที่มัน 'แข็งแกร่ง' อย่างแท้จริง ซ่อนอยู่ในพารามิเตอร์ที่ผู้คนไม่ค่อยใส่ใจนักในอดีตนั่นคือ—แบนด์วิดท์หน่วยความจำ

แบนด์วิดท์หน่วยความจำรวมของ M6 เวอร์ชันมาตรฐาน มาที่ 170GB/s, เวอร์ชัน M5 Pro ถูกผลักไปที่ 307GB/s และ M5 Ultra สเปกสูงสุด กลับก้าวข้ามระดับ TB ไปอย่างเต็มตัว ทำได้ถึง 1.2TB/s

เพื่อประกอบกับสินค้าใหม่นี้ Apple ยังได้ถ่ายโฆษณา 'ควายหลาย' ให้กับ Mac mini โดยให้กล่องสี่เหลี่ยมสีเงินขนาดเล็กมีแขนกล้ามเนื้อใหญ่โตขึ้นมา

ไม่ได้มีเพียงแค่นั้น ก่อนหน้าที่ Mac Studio รุ่นใหม่จะถูกปล่อยเพียงวันเดียว ชิปเร่ง AI ปลายทาง Xuanjie O100 ของ Xiaomi ที่เพิ่งเปิดตัว ก็ทำแบนด์วิดท์หน่วยความจำได้ถึง 1.22TB/s เช่นกัน ส่วนการ์ดจอเรือธงระดับผู้บริโภครุ่นใหม่ล่าสุดอย่าง RTX 5090 ของ NVIDIA ด้วยหน่วยความจำ GDDR7 32GB แบนด์วิดท์ยิ่งถูกดันไปแตะเกือบ 1.

เส้นทางสถาปัตยกรรมของ SoC บนเดสก์ท็อป, NPU เฉพาะทางปลายทาง และ GPU แบบแยกส่วน แตกต่างกันอย่างสิ้นเชิง แต่ไม่ว่าจะเป็นผู้ผลิตคอมพิวเตอร์ ผู้ผลิตชิปโทรศัพท์ หรือผู้ผลิตการ์ดจอ ทุกคนต่างพร้อมใจกันทำสิ่งเดียวกันโดยไม่นัดหมายก่อน นั่นคือ—ทำให้ข้อมูลในหน่วยความจำวิ่งได้เร็วยิ่งขึ้น

AI คำนวณเร็วขึ้นเรื่อยๆ และก็ยิ่งง่ายที่จะ 'กินไม่อิ่ม'

โรงงานผลิตชิปต้องใช้ความพยายามอย่างหนักเพื่อแข่งขันด้านแบนด์วิดท์ สุดท้ายแล้วก็เพราะ AI ในปัจจุบันสามารถคำนวณได้มากขึ้น และในขณะเดียวกันก็มีแนวโน้มที่จะถูกหน่วยความจำ 'ทำให้หิว' ได้ง่ายขึ้น

ที่นี่ปฏิกิริยาแรกของหลายคนมักจะเป็น: หน่วยความจำก็แค่ดูที่ความจุไม่ใช่หรือ? ใหญ่ก็คือดี ดีก็คือใหญ่!

ที่จริงแล้วความจุกับแบนด์วิดท์เป็นคนละเรื่องกันโดยสิ้นเชิง ความจุเป็นตัวกำหนดว่าคอมพิวเตอร์เครื่องนี้จะบรรจุโมเดลที่ใหญ่แค่ไหนได้ ส่วนแบนด์วิดท์เป็นตัวกำหนดว่าข้อมูลเหล่านี้จะสามารถป้อนให้แก่แกนประมวลผลได้เร็วแค่ไหนในแต่ละวินาที

เมื่อโมเดลภาษาขนาดใหญ่เริ่มทำงาน สิ่งที่ใช้ทรัพยากรมากที่สุดมักไม่ใช่การคำนวณล้วนๆ แต่เป็นการ 'ย้ายข้อมูล' ที่ดำเนินอยู่ตลอดเวลา

ภาพ | ภาพประกอบ LLM Prefill-Decode | NVIDIA

เวลาที่เราเห็นตัวอักษรโผล่ออกมาทีละตัวในกล่องแชท ในขั้นตอนการสร้างแบบอัตโนมัติ (Decode) ทุกครั้งที่หน่วยประมวลผลสร้าง token ใหม่ขึ้นมา มันจะต้องอ่านพารามิเตอร์น้ำหนักที่มีอยู่หลายพันล้านหรือหลายร้อยพันล้านตัวในหน่วยความจำให้ครบถ้วนทั้งหมด

มันก็เหมือนกับเชฟมือฉมังในครัวที่ทอดผัดได้แค่สองนาที แต่พ่อครัวที่คอยเตรียมวัตถุดิบกลับใช้เวลาครึ่งวันถึงจะส่งจานวัตถุดิบที่หั่นเสร็จมาให้ พ่อครัวทอดเร็วสักแค่ไหน ส่วนใหญ่ของเวลาก็ยังคงต้องถือตะหลิวรออยู่หน้าเตาไฟ้เฉยๆ

ไม่ว่าจะเป็น CPU, GPU หรือ NPU ตอนนี้ต่างติดอยู่กับขีดจำกัดนี้เหมือนกัน พลังการประมวลผลก้าวกระโดดไปข้างหน้าอย่างรวดเร็ว แต่ความเร็วในการขยายช่องทางหน่วยความจำกลับตามไม่ทัน ตอนที่โมเดลยังเล็กก็ยังพอเอาตัวรอดได้ แต่พอขึ้นไปใช้โมเดลภาษาขนาดใหญ่หลายสิบ B หรือหลายร้อย B การที่จะคายคำหนึ่งออกมาทุกครั้งต้องมีการดึงและส่งข้อมูลจำนวนมหาศาล

หน่วยประมวลผลจะสามารถคำนวณได้ดีแค่ไหน ก็ยังคงต้องเสียเวลาไปกับการรอให้หน่วยความจำป้อนข้อมูลให้อยู่ดี ปรากฏการณ์นี้ในสถาปัตยกรรมระบบเรียกว่า memory-bound (ถูกจำกัดด้วยหน่วยความจำ)

ภาพ | รวบรวมจากข้อมูลสาธารณะบนอินเทอร์เน็ต

หน่วยความจำที่เร็วขึ้น ก็แพงขึ้นด้วย

หลายคนเวลามองราคาหน่วยความจำ มักจะรู้สึกตามสัญชาตญาณว่า '32GB ย่อมแพงกว่า 16GB และ 512GB ก็ย่อมแพงกว่า 32GB' แต่ถ้าหันมามองในมุมของห่วงโซ่อุปทานเซมิคอนดักเตอร์ กฎเกณฑ์ที่แท้จริงกลับเป็นว่า: หน่วยความจำที่ใหญ่กว่าย่อมแพงกว่า แต่หน่วยความจำที่เร็วกว่า ราคาจะแพงขึ้นแบบทวีคูณ

เพื่อให้ข้อมูลจำนวนมหาศาลวิ่งได้เร็วขึ้น ไม่สามารถพึ่งพาแค่การเพิ่มชิปหน่วยความจำเพียวๆ แต่ยังต้องใช้ความกว้างบิตที่มากขึ้น อินเทอร์เฟซที่ความถี่สูง ตลอดจนการบรรจุภัณฑ์ขั้นสูงและการเรียงซ้อนแนวตั้งที่ซับซ้อนอย่างยิ่ง ขอยกตัวอย่าง HBM (หน่วยความจำแบนด์วิดท์สูง) ซึ่งเป็นอุปกรณ์มาตรฐานของเซิร์ฟเวอร์ AI ในปัจจุบัน มันจะทำการเจาะรูและซ้อนชิป DRAM หลายชั้นในแนวตั้ง (TSV) ความยากในการผลิตและพื้นที่ชิปมีค่ามากกว่าหน่วยความจำแบบดั้งเดิมอย่างมาก

ความกระหายอย่างสุดขีดต่อแบนด์วิดท์ระดับสูงเช่นนี้ กำลังก่อให้เกิด 'การย้ายถิ่นกำลังการผลิต' ระดับโลกขึ้นในวงการอุปสาค์ต้นน้ำ

ข้อมูลจาก TrendForce ระบุว่า จากความต้องการ HBM และหน่วยความจำ DDR5 สำหรับเซิร์ฟเวอร์สเปกสูงจากศูนย์ข้อมูล AI ที่เพิ่มขึ้นอย่างรุนแรง สามยักษ์ใหญ่ด้านการจัดเก็บข้อมูลอย่าง Samsung, SK Hynix และ Micron กำลังทุ่มเททรัพยากรเวเฟอร์ขั้นสูงที่มีอยู่อย่างจำกัดไปยังตลาดระดับองค์กรอย่างเต็มกำลัง

สิ่งนี้ส่งผลกระทบโดยตรงต่อพื้นที่การจัดหา DRAM สำหรับพีซีระดับผู้บริโภคที่เหลืออยู่ แม้จะอยู่ในช่วงฤดูซบเซาตามปกติ ราคาสัญญาซื้อขายก็ยังคงปรับตัวเพิ่มขึ้นเมื่อเทียบเป็นรายไตรมาสอย่างต่อเนื่อง

ช่วงปลายปีที่แล้ว Micron ได้ประกาศอย่างเป็นทางการถึงการถอนตัวจากธุรกิจหน่วยความจำสำหรับผู้บริโภคของแบรนด์ Crucial อย่างค่อยเป็นค่อยไป เพื่อโอนทรัพยากรในห่วงโซ่อุปทานไปยังลูกค้าเชิงกลยุทธ์ที่มีขนาดใหญ่กว่าและทำกำไรได้สูงกว่าอย่างเต็มรูปแบบ ส่วนการที่ร้านค้าที่ได้รับอนุญาตจากแบรนด์บุคคลที่สามของ SK Hynix ในประเทศจีนปิดให้บริการลงล่าสุด ก็สะท้อนให้เห็นว่าผู้ผลิตต้นน้ำเริ่มทอดทิ้งช่องทางจัดจำหน่ายระดับผู้บริโภค

ภาพ | Micron

เมื่อผู้ที่ประกอบคอมพิวเตอร์ทั่วไปกำลังลังเลอยู่กับราคา เมื่อแหงนมองขึ้นไปจึงพบว่า: งบประมาณสำหรับการเพิ่มแรมเพียงไม่กี่แท่งของตนเอง กำลังแข่งขันชิงเวเฟอร์ขั้นสูงชุดเดียวกันกับศูนย์ข้อมูล AI ทั่วโลกโดยที่ไม่รู้ตัว

เพื่อไม่ให้พลังการประมวลผลติดขัดอยู่กับการย้ายข้อมูล,