Chinanews
Other爱范儿Thu, 27 Aug 2026 10:15:44 +0000

Pourquoi les PC IA d'Apple et de Xiaomi s'acharnent-ils sur le « mur de la mémoire » ? | Chronique des objets IA

Pourquoi les PC IA d'Apple et de Xiaomi s'acharnent-ils sur le « mur de la mémoire » ? | Chronique des objets IA

Les smartphones ont dominé l'écosystème numérique de la dernière décennie. Ils sont les trous noirs de notre attention et nos objets les plus intimes. Mais dès leur conception, ils ont été pensés pour qu'on les fixe du regard — toute leur logique s'arrête à l'écran.

Les exigences de l'IA sont tout l'inverse : elle a besoin d'une perception continue du monde physique — voir ce que vous voyez, entendre ce que vous entendre, être toujours présente, plutôt que de s'éveiller lorsque vous déverrouillez l'écran.

Lorsque l'IA deviendra véritablement une capacité fondamentale, elle finira tôt ou tard par briser la coque de l'écran pour trouver sa propre forme. Ce sera un long processus d'exploration et d'évolution.

C'est de là que vient la chronique « Objets IA ». ifanr souhaite observer avec vous : comment l'IA modifie la conception du matériel, comment elle redéfinit l'interaction homme-machine, et plus important encore — sous quelle forme l'IA entrera dans notre vie quotidienne.

Cet article est le 23e volet de la chronique « Objets IA ».

Les nouveaux Mac récemment lancés par Apple ont une fois de plus repoussé les attentes en matière de performances des « PC IA ». Le compact Mac mini a été directement défini par la marque comme un outil de productivité capable de faire tourner des Agents en continu 24h/24, tandis que le Mac Studio, orienté professionnel, se voit attribuer jusqu'à 512 Go de mémoire unifiée.

Cependant, leur véritable force réside dans un paramètre auquel personne ne prêtait vraiment attention auparavant — la bande passante mémoire.

La bande passante de la mémoire unifiée de la puce M6 standard atteint 170 Go/s, la version M5 Pro grimpe à 307 Go/s, et le modèle haut de gamme M5 Ultra franchit allègrement la barre du téraoctet, atteignant 1,2 To/s.

Pour accompagner ces nouveautés, Apple a même réalisé une publicité spectaculaire pour le Mac mini, montrant le petit boîtier argenté se dotant de bras musclés.

Coïncidence, la veille de la sortie du nouveau Mac Studio, Xiaomi a dévoilé sa puce d'accélération IA embarquée Xuanjie O100, qui affiche également une bande passante mémoire de 1,22 To/s. De son côté, la dernière carte graphique grand public haut de gamme de Nvidia, la RTX 5090, grâce à ses 32 Go de mémoire GDDR7, voit sa bande passante culminer à près de 1,8 To/s.

Les architectures des SoC de bureau, des NPU embarqués dédiés et des GPU indépendants sont radicalement différentes. Pourtant, qu'ils fabriquent des ordinateurs, des puces pour smartphones ou des cartes graphiques, tous font inconsciemment la même chose : faire circuler les données en mémoire plus rapidement.

L'IA calcule de plus en plus vite, mais risque de plus en plus de « manquer de carburant »

Si les fabricants de puces fournissent autant d'efforts pour augmenter la bande passante, c'est fondamentalement parce que l'IA d'aujourd'hui, bien que de plus en plus performante en calcul, est de plus en plus facilement « affamée » par la mémoire.

La première réaction de beaucoup de gens est souvent : la mémoire, n'est-ce pas juste une question de capacité ? Plus c'est grand, mieux c'est !

En réalité, capacité et bande passante sont deux choses totalement différentes. La capacité détermine la taille du modèle que l'ordinateur peut contenir, tandis que la bande passante détermine la vitesse à laquelle ces données peuvent être fournies aux cœurs de calcul chaque seconde.

Une fois qu'un grand modèle est lancé, ce qui consomme le plus de ressources n'est souvent pas le calcul pur, mais le « déplacement des données » qui s'effectue en continu.

Image | Schéma de pré-remplissage et de sortie d'un LLM | NVIDIA

Lorsque nous voyons les mots apparaître un par un dans la boîte de dialogue, en phase de génération autorégressive (Decode), à chaque nouveau token généré par l'unité de calcul, celle-ci doit lire intégralement les milliards de paramètres de poids stockés en mémoire.

C'est comme un chef étoilé extrêmement rapide en cuisine : la cuisson ne prend que deux minutes, mais le commis met une éternité à apporter les ingrédients préparés. Aussi vite que le chef puisse cuisiner, il passe la majeure partie de son temps à attendre devant son piano de cuisson, spatule à la main.

Qu'il s'agisse de CPU, de GPU ou de NPU, tous sont désormais bloqués par cet obstacle. La puissance de calcul s'envole, mais la vitesse d'élargissement des canaux mémoire ne suit pas. Tant que les modèles restent petits, ça passe encore, mais dès qu'on passe à des modèles de plusieurs dizaines ou centaines de milliards de paramètres, chaque mot généré nécessite un transfert de données massif.

Même si les unités de calcul sont surpuissantes, elles doivent gaspiler un temps précieux à attendre que la mémoire les ravitaille. Ce phénomène est appelé memory-bound (limité par la mémoire) en architecture informatique.

Image | Compilé à partir d'informations publiques sur Internet

Une mémoire plus rapide, mais aussi plus chère nQuand on regarde le prix de la mémoire, l'intuition nous dit souvent que « 32 Go est forcément plus cher que 16 Go, et 512 Go plus cher que 32 Go ». Mais si l'on se penche sur la chaîne d'approvisionnement des semi-conducteurs, la vraie règle est celle-ci : plus la mémoire est grande, plus elle est chère, mais plus elle est rapide, plus son prix augmente de façon exponentielle.

Pour faire circuler les données massives plus rapidement, il ne suffit pas d'empiler des puces. Il faut des bus de données plus larges, des interfaces à plus haute fréquence, ainsi que des techniques d'empilement vertical et d'encapsulation avancée extrêmement complexes. Prenons l'exemple de la HBM (mémoire à large bande passante), devenue la norme sur les serveurs IA d'aujourd'hui : elle empile verticalement plusieurs couches de puces DRAM en les perçant (TSV), ce qui rend sa fabrication bien plus complexe et sa surface bien plus grande que la mémoire traditionnelle.

Cette soif extrême de bande passante ultra-élevée déclenche en amont une « grande migration des capacités de production » à l'échelle mondiale.

Selon les données de TrendForce, en raison de la demande explosive des centres de données IA pour la HBM et la mémoire serveur DDR5 haut de gamme, les trois géants du stockage — Samsung, SK Hynix et Micron — transfèrent activement leurs capacités limitées de production de tranches avancées vers le secteur entreprise.

Cela évince directement l'espace d'approvisionnement alloué à la DRAM pour PC grand public. Même en pleine basse saison traditionnelle, les prix contractuels continuent d'augmenter d'un trimestre sur l'autre.

À la fin de l'année dernière, Micron a officiellement annoncé son retrait progressif du marché de la mémoire grand public Crucial, réorientant toutes ses ressources logistiques vers des clients stratégiques plus importants et plus rentables. Récemment, la fermeture des magasins tiers sous licence SK Hynix en Chine reflète également le désintérêt des fabricants d'origine pour les canaux grand public.

Image | Micron

Lorsque l'utilisateur moyen hésite devant le prix, il réalise soudainement que le budget prévu pour ajouter une simple barrette de mémoire est, sans qu'il le sache, en compétition directe avec les centres de données IA mondiaux pour s'arracher les mêmes tranches de silicium avancées.

Pour éviter que la puissance de calcul ne reste bloquée sur le transport des données, les fabricants de matériel redoublent d'efforts. L'enjeu est de taille : il s'agit ni plus ni moins de l'avenir de l'informatique personnelle. À l'avenir, la capacité d'un appareil à faire tourner des modèles d'IA complexes en local ne dépendra plus seulement de la puissance brute de sa puce, mais de sa capacité à nourrir cette bête de calcul en temps réel.

C'est cette course effrénée vers la bande passante qui dessinera la prochaine génération d'appareils intelligents.