AIのメモリ不足:業界はいかに構造的供給不足に適応しつつあるか
TREE NEWS 報道: メモリ不足は現在のAI構築サイクルにおける最も持続的な構造的制約となっており、AIコンピュートの拡張ペースは新しいファブが稼働するのを待つ気配を見せていない。この矛盾に直面し、業界は3つの回避策——メモリ仕様の削減、推論ワークロードの分離、CXLによるメモリプーリング——を進めながら、その過程で新たな投資機会を生み出している。
NvidiaのCEO、ジェンスン・フアン氏は最近、業界はメモリのボトルネックに対処するために全く新しい思考が必要だと述べ、これを悲観的なシグナルではなく、何年も続くと予想される不足に対する前向きな認識として位置づけた。不足の強度は変動するかもしれないが、AIは予見可能な将来において利用可能な供給のほぼすべてを吸収すると予想される。
仕様削減:圧力を移動させるが排除はしない応急処置
DRAMとNANDの価格がともに上昇する中で、最も直接的な対応はデバイスごと、またはサーバーごとのメモリ構成を圧縮することだ。NvidiaはRubinプラットフォームに複数の仕様ティアを用意している。ラックあたりのLPDDR5容量は当初計画の54TBから28TBに圧縮され、モジュールは192GB SOCAMM2から96GBに縮小された。HBMについては、Rubinは当初GPUあたり288GB(8-high 12hi HBM4)が予定されていたが、現在は192GB版(8-high 8hi HBM4)が期待されている。Rubin Ultraの仕様も縮小され、比較可能なベースラインは192GBから384GBの範囲に落ちる可能性がある。
しかし仕様削減は真の解決策ではない。ある層でメモリ容量が削減されると、データの圧力は必然的に下流に移動する——HBMとLPDDRの縮小はNANDとネットワークインターコネクトへの増分需要を生む。ボトルネックは消えるのではなく移動する。3つの構造的要因がAIメモリ需要を押し上げ続けている。LLM時代における6ヶ月ごとに倍増するモデルサイズ、年間約5倍に拡大するコンテキストウィンドウ、そしてセッションごとに独立したKVキャッシュストレージを必要とする推論同時実行数の増加である。仕様削減は一時的なものに過ぎず、供給が緩和されれば業界はすぐに高仕様へと回帰するだろう。
ワークロード分離:推論フェーズごとに専用ハードウェア
推論は2つの異なるフェーズから成る。入力プロンプトを並列処理するコンピュート集約型のプリフィルと、出力トークンを1つずつ生成しメモリ帯域幅と容量により依存するデコードである。両者を分離し、それぞれに最適なハードウェアを割り当てることが、メモリ効率を改善する第2の道である。
このトレンドは2025年後半頃に顕著に加速した。Groqを買収した後、Nvidiaは高帯域幅のオンチップSRAMを基盤とするLPUをVera Rubinプラットフォームに統合した。Rubin GPUはプリフィルと大容量KVキャッシュを要するデコードを処理し、GroqはフィードフォワードとMixture-of-Expertsコンポーネントを処理し、Nvidia Dynamoがアクティベーション転送を調整する。その後AWSは、プリフィルにTrainium、デコードにCerebrasを用いる異種アーキテクチャを発表し、2027年第1四半期にAmazon Bedrockでの提供を計画している。同様のCerebras-AMDの協業は2026年第4四半期に生産入りすると予想される。MatrixのCorsairも量産に入っている。
Cerebrasはワークロード分離の最も直接的な純粋投資先として際立っている。そのウェハスケールプロセッサは大量のSRAMとコンピュートを同一シリコン上に統合し、プロセッサと外部メモリ間のデータ移動を大幅に削減する——これはデコードフェーズにおいて決定的な優位性である。分離はCerebras Cloudの経済性も実質的に改善し得る。CerebrasとAMDの開示によれば、共同システムはCerebrasの推論速度を維持しつつスループットを最大5倍に高め、導入ユニットあたりの収益を増やし、トークンあたりのコストを下げることができる。
CXL:メモリ拡張から新たなAI推論の主戦場へ
CXL(Compute Express Link)はPCIe物理層上に構築された高速インターコネクトプロトコルである。その核心的価値は、複数のプロセッサが共有メモリリソースプールにアクセスできるようにし、メモリが特定のCPUに束縛される従来アーキテクチャを根本から打ち破ることにある。
その主な用途は3つある。メモリ拡張(単一プロセッサのローカルメモリチャネル限界を超えて容量を追加する)、メモリ共有(複数プロセッサが同じデータにアクセスする)、メモリプーリング(プロセッサやサーバー間でメモリを動的に割り当て、アイドル浪費を削減する)である。歴史的にCXLは主に汎用CPUコンピューティングに用いられ、AIにおける浸透はレイテンシの不利により限られていた。しかし推論ワークロードが長いコンテキスト、エージェント型ワークロード、KVキャッシュに対して容量を急増させるにつれ、多くのデータはHBMに恒久的に常駐する必要がなくなり、CXL接続DRAMが低コスト・高容量のメモリ層として足場を得ている。
市場規模について、CXLの獲得可能市場予測は以前のCPUベースの推定40億ドル超から2030年までに約60億ドルへと引き上げられ、その増分は主に新たなAIサーバー側の導入シナリオによるものである。Astera LabsのLeoメモリコントローラシリーズ(KVキャッシュオフロード向けカスタム設計を含み、2027年に量産入り予定)と、メモリ拡張(Structera X)およびラックレベルプーリング(Structera S)を網羅するMarvellのフルポートフォリオが、この分野で支持される2つの中核銘柄である。Marvell経営陣は以前、CXLを2028年頃に10億ドル超の収益貢献と位置づけていた。
メモリ株への含意:振幅ではなく持続期間
短期的な利益最大化の観点では、これらの回避策はDRAMメーカーに対していくらか否定的な含意を持つ——AIエコシステムがメモリ不足によって完全に停滞すれば、短期的な価格はより有利になり得る。しかしそのシナリオは実現しなかった。現在のメモリサイクルは、価格の振幅よりも持続期間を主要ドライバーとして分析すべきである。
核心的論点:仕様削減は供給制約に由来し、需要の減退ではない。供給が改善すれば業界はすぐに高仕様へ回帰し、繰り延べられた需要が新たな容量を容易に吸収するだろう。注視すべきリスク要因が1つある。もしAIの減速が需要減ではなく、土地、電力、ファブ容量といったインフラのボトルネックに起因する場合、そうした一時停止はコンピュート銘柄とは異なる形でメモリ銘柄を打撃し得る。
MicronとSanDiskは引き続きオーバーウェイト評価であり、メモリ不足サイクルはまだ終わっておらず、その配分価値は依然として保持されるとの見方である。
投資家向けの重要ポイント
- メモリ不足は構造的であり、循環的ではない:モデルのスケーリング、コンテキストウィンドウの拡大、推論の同時実行数が、供給が対応できる以上に速く需要を複合的に押し上げている。
- 仕様削減は圧力逃がし弁であり、解決策ではない:需要を排除するのではなく、HBM/LPDDRからNANDとネットワーキングへと移す。
- ワークロード分離は純粋投資の勝者を生む:プリフィルとデコードが専用ハードウェアに分かれる中で、Cerebrasが最も直接的な受益者である。
- CXLは新興のAI推論の主戦場である:獲得可能市場は2030年までに約60億ドルへ上方修正され、Astera LabsとMarvellが中核的な実現企業である。
- 振幅ではなく持続期間に軸足を置く:メモリサイクルの長さは価格変動よりも重要であり、MicronとSanDiskは依然として選好されるエクスポージャーである。




