Chinanews
Other爱范儿Thu, 27 Aug 2026 10:15:44 +0000

Vì sao PC AI của Apple và Xiaomi đều khao khát phá vỡ 'bức tường băng thông bộ nhớ' | Ký sự vật dụng AI

Vì sao PC AI của Apple và Xiaomi đều khao khát phá vỡ 'bức tường băng thông bộ nhớ' | Ký sự vật dụng AI

Điện thoại thông minh thống trị hệ sinh thái kỹ thuật số trong hơn một thập kỷ qua, nó là hố đen của sự chú ý, là vật dụng cá nhân riêng tư nhất của chúng ta. Nhưng điện thoại ngay từ khi thiết kế đã sinh ra để dành cho 'con người nhìn chằm chằm vào nó' — toàn bộ logic của nó đều dừng lại ở màn hình.

Nhu cầu của AI lại hoàn toàn ngược lại: nó cần liên tục nhận thức thế giới vật lý — thấy những gì bạn thấy, nghe những gì bạn nghe, luôn hiện diện mọi lúc, thay vì đợi bạn mở khóa màn hình mới tỉnh dậy.

Khi AI thực sự trở thành một năng lực cơ bản, sớm muộn nó cũng sẽ phá vỡ lớp vỏ màn hình để tìm kiếm hình dáng riêng của mình. Đây sẽ là một quá trình khám phá và tiến hóa dài lâu.

Chuyên mục 'Ký sự vật dụng AI' ra đời từ đó, ifanr muốn cùng bạn liên tục quan sát: AI thay đổi thiết kế phần cứng như thế nào, định hình lại tương tác người-máy ra sao, và quan trọng hơn — AI sẽ bước vào đời sống hàng ngày của chúng ta dưới hình thái nào?

Đây là bài viết thứ 23 của 'Ký sự vật dụng AI'.

Những chiếc Mac mới mà Apple vừa phát hành gần đây đã một lần nữa làm mới kỳ vọng hiệu năng về 'PC AI'. Chiếc Mac mini nhỏ gọn được chính thức định nghĩa là công cụ năng suất chạy Agent cả ngày, còn Mac Studio cấp chuyên nghiệp thì trực tiếp cung cấp tới mức tối đa 512GB bộ nhớ thống nhất.

Tuy nhiên, điểm thực sự 'mạnh' của chúng lại ẩn chứa trong một thông số mà trước đây mọi người không mấy quan tâm — băng thông bộ nhớ.

Băng thông bộ nhớ thống nhất của phiên bản tiêu chuẩn M6 đạt 170GB/s, phiên bản M5 Pro đẩy lên 307GB/s, và phiên bản cấu hình cao nhất M5 Ultra thì trực tiếp vượt qua mức TB, đạt tới 1.2TB/s.

Để phối hợp với các sản phẩm mới này, Apple còn quay một đoạn quảng cáo 'bò đến' cho Mac mini, biến chiếc hộp vuông bạc nhỏ gọn mọc ra cánh tay cơ bắp to khỏe.

Không có hai, ngay trước ngày Mac Studio mới ra mắt một ngày, chip tăng tốc AI thiết bị do Xiaomi công bố là Huyền Giới O100 cũng đưa băng thông bộ nhớ lên tới 1.22TB/s; trong khi card đồ họa flagship tiêu dùng mới nhất hiện tại của Nvidia là RTX 5090, nhờ 32GB VRAM GDDR7, băng thông còn được đẩy lên gần 1.8TB/s.

Đường lối kiến trúc của SoC máy tính để bàn, NPU chuyên dụng thiết bị và GPU rời có khác biệt rất lớn, nhưng dù là người làm máy tính, người làm chip điện thoại hay người làm card đồ họa, tất cả đều cùng làm một việc — làm cho dữ liệu trong bộ nhớ chạy nhanh hơn.

AI tính toán ngày càng nhanh, cũng ngày càng dễ 'không đủ no'

Các hãng chip tốn nhiều công sức để cạnh tranh băng thông như vậy, nói cho cùng là vì AI ngày nay càng tính toán giỏi, đồng thời cũng càng dễ bị bộ nhớ 'bắt đói'.

Về điều này, phản ứng đầu tiên của nhiều người thường là: Bộ nhớ chẳng phải là xem dung lượng sao? Càng lớn càng tốt, càng tốt càng lớn!

Thực ra dung lượng và băng thông hoàn toàn là hai khái niệm khác nhau. Dung lượng quyết định máy tính này có thể chứa được mô hình cỡ nào, còn băng thông quyết định dữ liệu này mỗi giây có thể được đưa tới lõi tính toán với tốc độ bao nhanh.

Khi mô hình lớn đã chạy lên, điều tiêu tốn tài nguyên nhất thường không phải là tính toán đơn thuần, mà là 'dịch chuyển dữ liệu' diễn ra xuyên suốt.

Hình | Minh họa Prefill-Decode của LLM | NVIDIA

Những gì chúng ta thường thấy trong hộp thoại chữ lần lượt hiện ra, trong giai đoạn tự hồi quy tạo (Decode), cứ mỗi lần đơn vị tính toán sinh ra một token mới, lại phải đọc toàn bộ trọng số tham số hàng tỷ, chục tỷ trong bộ nhớ một lần.

Giống như một đầu bếp có tốc độ tay cực nhanh trong bếp, xào chỉ mất hai phút, nhưng thợ sơ chế mất nửa ngày mới mang đến một đĩa nguyên liệu đã cắt sẵn. Đầu bếp xào có nhanh đến đâu, phần lớn thời gian cũng chỉ có thể cầm xẻng xào đứng chờ trước bếp.

Dù là CPU, GPU hay NPU, hiện tại đều bị mắc kẹt ở ngưỡng này. Năng lực tính toán lao đi như bay, nhưng tốc độ mở rộng kênh bộ nhớ lại không theo kịp. Khi mô hình còn nhỏ thì còn tạm được, một khi đã lên mô hình lớn vài chục B, vài trăm B, cứ mỗi từ nhả ra đều phải吞吐 một lượng dữ liệu khổng lồ.

Đơn vị tính toán có tính giỏi đến đâu, cũng chỉ có thể tiêu tốn nhiều thời gian vào việc chờ bộ nhớ đút cơm. Hiện tượng này trong kiến trúc hệ thống được gọi là memory-bound (giới hạn bộ nhớ).

Hình | Tổng hợp từ thông tin công khai trên internet

Bộ nhớ nhanh hơn, cũng đắt hơn

Nhiều người nhìn giá bộ nhớ, trực giác thường cảm thấy '32GB chắc chắn đắt hơn 16GB, 512GB tự nhiên đắt hơn 32GB'. Nhưng nếu đặt tầm nhìn vào chuỗi cung ứng bán dẫn, quy luật thực sự lại là: bộ nhớ càng lớn càng đắt, nhưng bộ nhớ càng nhanh, mức đắt tăng theo cấp số nhân.

Để cho lượng dữ liệu khổng lồ chạy nhanh hơn, không thể chỉ dựa vào việc chất hạt nhớ, mà còn phải dùng bề rộng bit rộng hơn, giao diện tần số cao hơn, cùng với đóng gói tiên tiến và xếp chồng dọc cực kỳ phức tạp. Lấy HBM (bộ nhớ băng thông cao) là tiêu chuẩn của máy chủ AI ngày nay làm ví dụ, nó khoan lỗ xếp chồng dọc nhiều lớp chip DRAM (TSV), độ khó sản xuất và diện tích chip vượt xa bộ nhớ truyền thống.

Sự khát khao cực đoan đối với băng thông siêu cao này đang làm dấy lên một cuộc 'đại di cư công suất' mang tính toàn cầu ở thượng nguồn.

Dữ liệu điều tra của TrendForce cho thấy, do nhu cầu về HBM và DDR5 máy chủ thông số cao từ các trung tâm dữ liệu AI tăng vọt, ba ông lớn lưu trữ là Samsung, SK Hynix và Micron đang dồn toàn lực dịch chuyển công suất tinh thể tiên tiến hạn hẹp sang hướng doanh nghiệp.

Điều này trực tiếp chèn ép không gian cung cấp dành cho DRAM PC tiêu dùng, ngay cả trong mùa thấp điểm truyền thống, giá hợp đồng vẫn liên tục tăng theo tháng.

Cuối năm ngoái, Micron chính thức tuyên bố dần dần rút khỏi kinh doanh bộ nhớ tiêu dùng Crucial, nghiêng toàn bộ nguồn lực chuỗi cung ứng về các khách hàng chiến lược quy mô lớn hơn, lợi nhuận cao hơn; mà việc cửa hàng ủy quyền thương hiệu bên thứ ba của SK Hynix trong nước gần đây chấm dứt hoạt động, cũng phản chiếu sự lạnh nhạt của các nhà máy gốc thượng nguồn đối với kênh tiêu dùng.

Hình | Micron

Người lắp máy thông thường khi do dự trước giá cả, ngẩng đầu lên mới phát hiện: ngân sách để mình lắp thêm một thanh bộ nhớ, vô hình trung đang tranh giành cùng lô tinh thể tiên tiến đó với các trung tâm dữ liệu AI toàn cầu.

Để không cho năng lực tính toán bị mắc kẹt ở việc vận chuyển dữ liệu, …[Nội dung gốc quá dài, bản dịch đã bị cắt ngắn]