Mengapa PC AI Apple dan Xiaomi Sama-Sama Terobsesi pada "Tembok Memori" | Catatan Artefak AI
Ponsel pintar mendominasi ekosistem digital selama lebih dari satu dekade terakhir. Ia adalah lubang hitam bagi perhatian kita, dan merupakan barang bawaan paling pribadi yang kita miliki. Namun, sejak awal, ponsel dirancang untuk 'ditatap oleh manusia'—seluruh logikanya berakhir pada layar.
Kebutuhan AI justru sebaliknya: ia perlu terus-menerus merasakan dunia fisik—melihat apa yang Anda lihat, mendengar apa yang Anda dengar, selalu hadir, bukan menunggu Anda membuka kunci layar untuk baru kemudian bangun.
Ketika AI benar-benar menjadi kemampuan dasar, cepat atau lambat ia harus menetas dari layar dan mencari bentuknya sendiri. Ini akan menjadi proses eksplorasi dan evolusi yang panjang.
Dari sinilah kolom "Catatan Artefak AI" bermula. Ifanr ingin mengajak Anda untuk terus mengamati: bagaimana AI mengubah desain perangkat keras, bagaimana ia membentuk ulang interaksi manusia-komputer, dan yang lebih penting—dalam bentuk apa AI akan memasuki kehidupan sehari-hari kita?
Ini adalah artikel ke-23 dari "Catatan Artefak AI".
Mac baru yang baru saja dirilis Apple, sekali lagi memperbarui ekspektasi performa untuk "PC AI". Mac mini yang kompak secara resmi didefinisikan sebagai alat produktivitas yang menjalankan Agen sepanjang hari, sementara Mac Studio kelas profesional langsung diberikan memori terpadu hingga 512GB.
Namun, tempat di mana mereka benar-benar "kuat" tersembunyi dalam parameter yang dulu jarang dipedulikan orang—bandwidth memori.
Bandwidth memori terpadu versi standar M6 mencapai 170GB/s, versi M5 Pro didorong ke 307GB/s, dan konfigurasi tertinggi M5 Ultra bahkan langsung melampaui batas TB, mencapai 1.2TB/s.
Untuk mendukung produk baru ini, Apple juga membuat iklan promosi "sangat keren" untuk Mac mini, membuat kotak perak kecil itu seolah-olah memiliki lengan berotot yang kokoh.
Tak lama sebelum peluncuran Mac Studio baru, chip akselerasi AI *on-device* Xiaomi, Xuanjie O100, yang dirilis juga membawa bandwidth memori hingga 1.22TB/s; sementara itu, kartu grafis unggulan kelas konsumen terbaru Nvidia, RTX 5090, dengan memori GDDR7 32GB, bandwidth-nya bahkan didorong mendekati 1.8TB/s.
Jalur arsitektur SoC desktop, NPU khusus *on-device*, dan GPU diskrit sangat berbeda. Namun, baik pembuat PC, pembuat chip ponsel, maupun pembuat kartu grafis, semuanya tanpa sadar melakukan hal yang sama—membiarkan data dalam memori berjalan lebih cepat.
AI Menghitung Semakin Cepat, dan Semakin Mudah "Kekurangan Makan"
Pabrikan chip berusaha keras bersaing dalam bandwidth, pada dasarnya karena AI saat ini semakin baik dalam menghitung, tetapi juga semakin mudah "kelaparan" oleh memori.
Reaksi pertama banyak orang di sini sering kali: Bukankah memori hanya dilihat dari kapasitasnya? Yang besar itu bagus, yang bagus pasti besar!
Sebenarnya, kapasitas dan bandwidth adalah dua hal yang sepenuhnya berbeda. Kapasitas menentukan seberapa besar model yang dapat ditampung oleh komputer ini, sedangkan bandwidth menentukan seberapa cepat data tersebut disuplai ke inti komputasi setiap detiknya.
Setelah model besar berjalan, yang paling menguras sumber daya sering kali bukanlah perhitungan murni, melainkan "pemindahan data" yang menyeluruh.
Gambar|Skema Prefill-Decode LLM|NVIDIA
Saat kita melihat teks muncul satu per satu di kotak dialog, pada tahap generasi autoregresif (Decode), setiap kali unit komputasi menghasilkan token baru, ia harus membaca miliaran atau bahkan ratusan miliar bobot parameter di dalam memori secara lengkap.
Ini seperti koki di dapur dengan kecepatan tangan yang sangat cepat; menumis hanya butuh dua menit, tetapi asisten dapur butuh waktu lama untuk mengantar sepiring bahan yang sudah dipotong. Sekuat apa pun koki menggoreng, sebagian besar waktu ia hanya bisa memegang spatula dan menunggu di depan kompor.
Baik CPU, GPU, maupun NPU, saat ini semuanya tersangkut pada ambang ini. Kemampuan komputasi melaju kencang, tetapi kecepatan pemerataan jalur memori tidak dapat mengimbanginya. Saat model masih kecil masih bisa ditoleransi, tetapi begitu beralih ke model besar berukuran puluhan atau ratusan miliar parameter, setiap kata yang dihasilkan membutuhkan pemrosesan data dalam jumlah masif.
Unit komputasi sehebat apa pun hanya bisa menghabiskan banyak waktu menunggu memori memberinya "makan". Fenomena ini dalam arsitektur komputer dikenal sebagai *memory-bound* (terbatas memori).
Gambar|Disusun dari informasi publik di internet
Memori Lebih Cepat, Lebih Mahal nBanyak orang saat melihat harga memori, secara intuitif selalu merasa "32GB pasti lebih mahal dari 16GB, 512GB pasti lebih mahal dari 32GB". Namun jika kita memasukkannya ke dalam perspektif rantai pasokan semikonduktor, aturan sebenarnya adalah: **memori yang lebih besar memang lebih mahal, tetapi memori yang lebih cepat, harganya naik secara eksponensial.**
Untuk membuat data masif berjalan lebih cepat, tidak bisa hanya dengan menumpuk chip memori, tetapi harus menggunakan lebar bit yang lebih besar, antarmuka frekuensi tinggi, serta pengemasan canggih dan tumpukan vertikal yang sangat kompleks. Mengambil HBM (Memori Bandwidth Tinggi) yang menjadi standar server AI saat ini sebagai contoh, ia mengebor dan menumpuk beberapa lapisan chip DRAM secara vertikal (TSV), tingkat kesulitan manufaktur dan luas chip jauh melampaui memori tradisional.
Keinginan ekstrem terhadap bandwidth super tinggi ini sedang memicu "migrasi kapasitas" global di hulu industri.
Data survei TrendForce menunjukkan, karena lonjakan permintaan pusat data AI untuk HBM dan DDR5 server ber-speifikasi tinggi, tiga raksasa penyimpanan yaitu Samsung, SK Hynix, dan Micron sedang berusaha maksimal mengalihkan kapasitas wafer canggih yang terbatas ke segmen tingkat perusahaan.
Ini langsung menekan ruang pasokan untuk DRAM PC tingkat konsumen, bahkan di musim sepi tradisional sekalipun, harga kontrak masih terus meningkat secara berurutan.
Akhir tahun lalu, Micron secara resmi mengumumkan akan secara bertahap keluar dari bisnis memori konsumen Crucial, mengalihkan sumber daya rantai pasokan sepenuhnya ke pelanggan strategis yang lebih besar skala dan lebih tinggi margin profitnya; sementara baru-baru ini, toko otorisasi pihak ketiga SK Hynix di dalam negeri menghentikan operasinya, juga mencerminkan dinginnya pabrikan hulu terhadap saluran konsumen.
Gambar|Micron
Saat perakit PC biasa ragu-ragu menghadapi harga, saat mendongak mereka baru menyadari: anggaran untuk menambahkan sebatang memori tanpa sadar sedang bersaing dengan pusat data AI global untuk merebut batch wafer canggih yang sama.
Agar kemampuan komputasi tidak tersangkut pada pemindahan data,