Perché i PC AI di Apple e Xiaomi combattono il "muro della memoria" | Diario Hardware AI
Gli smartphone hanno dominato l'ecosistema digitale dell'ultimo decennio: sono buchi neri per l'attenzione e i nostri oggetti personali più intimi. Ma i telefoni sono stati progettati fin dall'inizio per essere "guardati" dall'utente — tutta la loro logica si ferma allo schermo.
Le esigenze dell'IA sono esattamente l'opposto: ha bisogno di percepire continuamente il mondo fisico — vedere ciò che vedi, ascoltare ciò che senti, essere sempre presente, invece di svegliarsi solo quando sblocchi lo schermo.
Quando l'IA diventerà una capacità fondamentale, prima o poi uscirà dal guscio dello schermo per cercare una forma propria. Sarà un lungo processo di esplorazione ed evoluzione.
Da qui nasce la rubrica "Diario Hardware AI": ifanr vuole osservare insieme a te come l'IA cambierà il design dell'hardware, come ridefinirà l'interazione uomo-macchina e, soprattutto, in che forma entrerà nella nostra vita quotidiana.
Questo è il 23° articolo del "Diario Hardware AI".
I nuovi Mac rilasciati di recente da Apple hanno nuovamente alzato l'asticella delle aspettative di prestazioni per i "PC AI". Il compatto Mac mini è stato definito ufficialmente come uno strumento di produttività per eseguire Agent 24/7, mentre il Mac Studio di livello professionale offre fino a 512GB di memoria unificata.
Tuttavia, il loro vero punto di forza si nasconde in un parametro a cui in passato pochi prestavano attenzione: la larghezza di banda della memoria.
La larghezza di banda della memoria unificata della versione standard M6 raggiunge i 170GB/s, la versione M5 Pro arriva a 307GB/s, mentre la configurazione top di gamma M5 Ultra supera direttamente la soglia del TB, raggiungendo 1,2TB/s.
Per accompagnare questo nuovo prodotto, Apple ha anche girato uno spot pubblicitario "esplosivo" per il Mac mini, in cui la piccola scatola argentata fa crescere braccia muscolose e robuste.
Non a caso, proprio il giorno prima del lancio del nuovo Mac Studio, il chip di accelerazione AI lato dispositivo Xuanjie O100 presentato da Xiaomi ha portato la larghezza di banda della memoria a 1,22TB/s; e l'attuale scheda grafica di punta consumer di Nvidia, la RTX 5090, grazie ai 32GB di memoria GDDR7, ha spinto la banda fino a quasi 1,8TB/s.
I percorsi architetturali dei SoC desktop, degli NPU dedicati lato dispositivo e delle GPU discrete sono molto diversi, ma che si tratti di produttori di PC, di chip per smartphone o di schede grafiche, stanno tutti facendo la stessa cosa: far scorrere più velocemente i dati nella memoria.
L'IA calcola sempre più velocemente, ma è sempre più facile che "resti a stomaco vuoto"
Il motivo per cui i produttori di chip si impegnano così tanto per spingere la larghezza di banda, in fondo, è che l'IA di oggi ha una capacità di calcolo sempre maggiore, ma allo stesso tempo è sempre più facile che "soffra la fame" a causa della memoria.
La prima reazione di molti qui è spesso: la memoria non si valuta in base alla capacità? Più grande è, meglio è!
In realtà, capacità e larghezza di banda sono due cose completamente diverse. La capacità determina la dimensione del modello che il computer può ospitare, mentre la larghezza di banda determina la velocità con cui questi dati vengono forniti ai core di calcolo ogni secondo.
Una volta che un modello di grandi dimensioni si mette in moto, la risorsa più consumata spesso non è il calcolo puro, ma il "trasporto dei dati" che pervade l'intero processo.
Immagine | Schema di pre-riempimento e output LLM | NVIDIA
Quando vediamo le parole comparire una dopo l'altra nella casella di chat, nella fase di generazione autoregressiva (Decode), ogni volta che l'unità di calcolo genera un nuovo token, deve leggere per intero i miliardi di parametri e pesi presenti nella memoria.
È come un cuoco in cucina con una velocità di mano estrema: la cottura in padella richiede solo due minuti, ma l'assistente di cucina impiega molto tempo per portare un piatto di ingredienti tagliati. Per quanto velocemente possa cucinare, il cuoco trascorrerà la maggior parte del tempo ad aspettare con la spatola in mano davanti ai fornelli.
Che si tratti di CPU, GPU o NPU, ora sono tutti bloccati su questo ostacolo. La potenza di calcolo corre veloce, ma la velocità di ampliamento dei canali di memoria non riesce a stare al passo. Quando i modelli sono piccoli si può ancora tirare avanti, ma una volta passati a modelli di grandi dimensioni di decine o centinaia di miliardi (B) di parametri, ogni parola generata richiede un throughput di dati massiccio.
Per quanto le unità di calcolo siano capaci, possono solo sprecare un sacco di tempo ad aspettare che la memoria dia loro da "mangiare". Questo fenomeno nell'architettura dei sistemi è noto come memory-bound (limitato dalla memoria).
Immagine | Elaborato da informazioni pubbliche su Internet
Memorie più veloci, ma anche più costose
Molti, guardando il prezzo della memoria, intuitivamente pensano che "32GB sia sicuramente più costoso di 16GB, e 512GB sia naturalmente più costoso di 32GB". Ma se si sposta lo sguardo sulla supply chain dei semiconduttori, la vera regola è in realtà questa: più grande è la memoria, più è cara, ma più veloce è la memoria, più il costo aumenta in modo esponenziale.
Per far scorrere più velocemente enormi quantità di dati, non ci si può basare solo sull'accumulo di chip, ma è necessario utilizzare una larghezza di bit maggiore, interfacce ad alta frequenza e un packaging avanzato e stacking verticale estremamente complessi. Prendendo ad esempio le memorie HBM (High Bandwidth Memory), oggi standard per i server AI, queste impilano verticalmente più strati di chip DRAM perforandoli (TSV); la difficoltà di produzione e l'area del chip sono di gran lunga superiori a quelle delle memorie tradizionali.
Questa sete estrema di larghezza di banda ultra-alta sta scatenando a monte una "grande migrazione della capacità produttiva" globale.
I dati di indagine di TrendForce mostrano che, a causa dell'impennata della domanda da parte dei data center AI per HBM e DDR5 per server ad alte specifiche, i tre giganti della memoria Samsung, SK Hynix e Micron stanno sforzando per indirizzare la limitata capacità di produzione di wafer avanzati verso il segmento enterprise.
Questo sta direttamente comprimendo lo spazio di offerta riservato alla DRAM per PC consumer, e anche nella tradizionale bassa stagione, i prezzi contrattuali continuano a registrare aumenti mensili.
Alla fine dell'anno scorso, Micron ha annunciato ufficialmente il graduale ritiro dal business delle memorie consumer Crucial, indirizzando interamente le risorse della supply chain verso clienti strategici di maggiore scala e più redditizi; recentemente, anche la chiusura dei negozi di terze parti autorizzati di SK Hynix in Cina riflette il raffreddamento dei produttori a monte verso i canali consumer.
Immagine | Micron
Quando un normale assemblatore esita di fronte al prezzo, alzando lo sguardo si rende conto che: il budget per aggiungere un banco di memoria sta, in modo invisibile, contendendo gli stessi wafer avanzati ai data center AI globali.
Per evitare che la potenza di calcolo si blocchi sul trasporto dei dati, ...[Testo originale troppo lungo, traduzione interrotta]