なぜAppleやXiaomiのAI PCは「メモリの壁」にこだわるのか|AIハードウェア考
スマートフォンは過去十数年のデジタルエコシステムを支配してきた。それはアテンションのブラックホールであり、私たちの最も親密な身の回りの品である。しかし、スマートフォンは設計当初から「人が画面を注視する」ために生まれたものであり、そのすべてのロジックは画面の中に留まっている。
AIのニーズは正反対である。物理世界を継続的に認識する必要がある。あなたが見るものを見、あなたが聞くものを聞き、常にそこにあり、画面をロック解除して初めて目を覚ますのを待つわけではない。
AIが真に基礎的な能力となるとき、遅かれ早かれ画面の殻を破り、それ自身の形を探し求めるだろう。これは長い探求と進化のプロセスとなる。
「AIハードウェア考」コーナーはここから生まれた。爱范儿(ifanr)は皆さんと共に観察し続けたい。AIがどのようにハードウェア設計を変え、どのようにヒューマンコンピュータインタラクションを再構築し、そしてさらに重要なのは、AIがどのような形態で私たちの日常生活に入り込むのかを。
これは「AIハードウェア考」の第23本の記事である。
Appleが先日発表した新Macは、再び「AI PC」の性能に対する期待を刷新した。コンパクトなMac miniは公式に全天候型でAgentを稼働させる生産性ツールとして直接定義され、プロフェッショナル向けのMac Studioに至っては、最大512GBのユニファイドメモリが直接提供された。
しかし、それらが真に「強力」な点は、過去に誰もあまり気にしていなかったパラメータに隠されている。それはメモリ帯域幅だ。
標準版M6のユニファイドメモリ帯域幅は170GB/sに達し、M5 Proバージョンは307GB/sに押し上げられ、トップエンドのM5 Ultraに至ってはTB級の大台を直接超え、1.2TB/sに到達した。
今回の新製品に合わせて、AppleはMac miniの「牛来(すごいのが来た)」プロモーション動画を撮影し、小さな銀色の四角い箱に太い筋肉質の腕が生えている姿を描写した。
偶然の一致か、新Mac Studioが発表される前日に、Xiaomiが発表したエッジAIアクセラレーションチップ「玄戒O100」も同様にメモリ帯域幅を1.22TB/sにまで引き上げた。また、NVIDIAの現在最新のコンシューマー向けフラッグシップグラフィックカード「RTX 5090」は、32GBのGDDR7ビデオメモリにより、帯域幅は1.8TB/sに迫っている。
デスクトップSoC、エッジ専用NPU、独立型GPUのアーキテクチャのアプローチは大きく異なるが、PCを作る者であれ、スマートフォンチップを作る者であれ、グラフィックカードを作る者であれ、誰もが無意識のうちに同じことを行っている。それは、メモリ内のデータをより速く走らせることだ。
AIはどんどん速く計算するが、ますます「飢え」やすくなる
チップメーカーがこれほどの労力を費やして帯域幅を競う根本的な理由は、今日のAIがますます計算能力を高める一方で、メモリによって「飢え」やすくなっているからだ。
ここで多くの人が最初に思うのは、メモリとは容量で見るものではないか? 大きいほど良く、良いものは大きい!ということだろう。
実は、容量と帯域幅は全く別物である。容量が決めるのは、このコンピュータにどれほど大きなモデルを格納できるかであり、帯域幅が決めるのは、そのデータを毎秒どれだけの速さで計算コアに供給できるかである。
大規模モデルが一度動き出すと、最もリソースを消費するのは純粋な計算ではなく、プロセス全体を貫く「データの移動」であることが多い。
図|LLMのプレフィル-出力イメージ|NVIDIA
私たちが普段チャットボックスで文字が次々と吐き出されるのを見るとき、自己回帰生成(Decode)段階において、計算ユニットは新しいトークンを1つ生成するたびに、メモリ内の数十億、数百億のパラメータ重みを完全に読み込まなければならない。
まるで厨房で手際の速いシェフのように、炒めるのは2分で済むが、下ごしらえ担当がなかなか切った食材を持ってこないようなものだ。シェフがどれだけ速く炒めようとも、大部分の時間は鍋铲を持ってコンロの前で待つことしかできない。
CPU、GPU、NPUを問わず、現在は皆この壁に直面している。計算能力は突き進んでいるが、メモリチャネルの拡幅スピードが追いついていない。モデルが小さい時はまだしも、数十B、数百Bの大規模モデルになると、1つの単語を吐き出すたびに膨大なデータをやり取りしなければならない。
計算ユニットがどれだけ計算できようとも、メモリからのデータ供給を待つことに大量の時間を費やすしかない。この現象は、コンピュータ・アーキテクチャにおいてメモリボトルネック(memory-bound)と呼ばれている。
図|インターネット上の公開情報より整理
より速いメモリは、より高価でもある
多くの人がメモリの価格を見る際、「32GBは間違いなく16GBより高いし、512GBは当然32GBより高い」と直感的に考える。しかし、半導体サプライチェーンの視点に入れると、真の法則は実はこうなる。大きなメモリほど高価だが、速いメモリになると、その価格は指数関数的に上昇する。
膨大なデータをより速く走らせるには、チップを積み増すだけでは不十分であり、より広いビット幅、より高周波のインターフェース、そして極めて複雑な先端パッケージングと垂直スタックが必要となる。今日のAIサーバーの標準装備となっているHBM(高帯域幅メモリ)を例にすると、複数層のDRAMチップに垂直に穴を開けてスタックする(TSV)技術が使われており、製造の難易度とチップ面積は従来のメモリをはるかに超えている。
この超高帯域幅に対する極端な渇望が、上流で世界的な「生産能力の大移動」を巻き起こしている。
TrendForceの調査データによると、AIデータセンターによるHBMや高スペックサーバー向けDDR5への需要急増を受け、サムスン、SKハイニックス、マイクロンのメモリ大手3社は、限られた先端ウェーハの生産能力をエンタープライズ級に全力で傾斜させている。
これはコンシューマー向けPC DRAMに残された供給スペースを直接圧迫しており、伝統的な閑散期であっても、契約価格は依然として前月比で持続的に上昇している。
昨年末、マイクロンはCrucial(クルーシャル)のコンシューマー向けメモリ事業から段階的に撤退することを正式に発表し、サプライチェーンのリソースを全面的に規模が更大きく、利益率の高い戦略的顧客へと向けた。また、最近国内でSKハイニックスのサードパーティブランドの正規販売店が運営を終了したことも、上流の原石メーカーによるコンシューマー向けチャネルの冷遇を反映している。
図|マイクロン
普通の自作PCユーザーが価格を前に躊躇しているとき、ふと顔を上げて気づくのは、自分がメモリを1本増設するための予算が、無意識のうちに世界的なAIデータセンターと同じ先端ウェーハの奪い合いをしているという事実である。
計算能力がデータの搬送で詰まらないようにするため、…