AI의 메모리 대란: 업계가 구조적 부족에 맞춰 재편되는 방식
TREE NEWS 보도: 메모리 부족은 현재 AI 구축 사이클에서 가장 지속적인 구조적 제약이 되었으며, AI 컴퓨팅 확장 속도는 새로운 팹이 가동될 때까지 기다릴 기미를 보이지 않습니다. 이러한 모순에 직면한 업계는 메모리 사양 축소, 추론 워크로드 분리, CXL을 통한 메모리 풀링이라는 세 가지 우회 전략을 추진하는 동시에 새로운 투자 기회를 창출하고 있습니다.
엔비디아 CEO 젠슨 황은 최근 업계가 메모리 병목 현상을 해결하기 위해 완전히 새로운 사고가 필요하다고 말하며, 이를 비관적 신호가 아니라 수년간 지속될 것으로 예상되는 부족에 대한 적극적인 인정으로 규정했습니다. 부족의 강도는 변동할 수 있지만, AI는 예측 가능한 미래에 사실상 모든 가용 공급을 흡수할 것으로 예상됩니다.
사양 축소: 압력을 이동시킬 뿐 제거하지 못하는 임시방편
DRAM과 NAND 가격이 모두 상승하면서 가장 직접적인 대응은 장치당 또는 서버당 메모리 구성을 압축하는 것입니다. 엔비디아는 Rubin 플랫폼에 여러 사양 등급을 제공하고 있습니다. 랙당 LPDDR5 용량은 계획된 54TB에서 28TB로 압축되었으며, 모듈은 192GB SOCAMM2에서 96GB로 축소되었습니다. HBM의 경우 Rubin은 원래 GPU당 288GB(8단 12hi HBM4)로 예정되었으나, 이제 192GB 버전(8단 8hi HBM4)이 예상됩니다. Rubin Ultra 사양도 축소되고 있으며, 비교 가능한 기준선은 잠재적으로 192GB에서 384GB 범위로 떨어질 수 있습니다.
그러나 사양 축소는 진정한 해결책이 아닙니다. 한 계층에서 메모리 용량이 줄어들면 데이터 압력은 필연적으로 아래로 이동합니다. HBM과 LPDDR 축소는 NAND와 네트워크 인터커넥트에 대한 증분 수요를 창출합니다. 병목 현상은 사라지지 않고 이동할 뿐입니다. 세 가지 구조적 요인이 AI 메모리 수요를 계속 높입니다. LLM 시대에 6개월마다 두 배로 증가하는 모델 크기, 매년 약 5배씩 확장되는 컨텍스트 윈도우, 세션당 독립적인 KV 캐시 저장을 요구하는 추론 동시성 증가입니다. 사양 축소는 일시적일 수밖에 없으며, 공급이 완화되면 업계는 빠르게 더 높은 사양으로 회귀할 것입니다.
워크로드 분리: 각 추론 단계에 전용 하드웨어
추론은 두 가지 뚜렷한 단계로 구성됩니다. 입력 프롬프트를 병렬로 처리하는 컴퓨팅 집약적인 프리필과, 출력 토큰을 하나씩 생성하며 메모리 대역폭과 용량에 더 의존하는 디코드입니다. 이 둘을 분리하여 각각에 가장 적합한 하드웨어에 할당하는 것이 메모리 효율을 개선하는 두 번째 경로입니다.
이 추세는 2025년 말경 눈에 띄게 가속화되었습니다. Groq을 인수한 후 엔비디아는 고대역폭 온칩 SRAM 기반의 LPU를 Vera Rubin 플랫폼에 통합했습니다. Rubin GPU는 프리필과 대용량 KV 캐시 용량이 필요한 디코드를 처리하고, Groq은 피드포워드 및 전문가 혼합(MoE) 구성 요소를 처리하며, 엔비디아 Dynamo는 활성화 전송을 조정합니다. 이어 AWS는 프리필에 Trainium을, 디코드에 Cerebras를 사용하는 이기종 아키텍처를 발표했으며, 2027년 1분기 Amazon Bedrock에 적용할 계획입니다. 유사한 Cerebras-AMD 협업은 2026년 4분기에 양산에 들어갈 것으로 예상됩니다. Matrix의 Corsair도 양산에 들어갔습니다.
Cerebras는 워크로드 분리의 가장 직접적인 순수 플레이 수혜자로 두드러집니다. 웨이퍼 스케일 프로세서는 대량의 SRAM을 동일 실리콘에 컴퓨팅과 통합하여 프로세서와 외부 메모리 간의 데이터 이동을 크게 줄입니다. 이는 디코드 단계에서 결정적인 이점입니다. 분리는 또한 Cerebras Cloud의 경제성을 크게 개선할 수 있습니다. Cerebras와 AMD의 공개에 따르면, 공동 시스템은 Cerebras 추론 속도를 유지하면서 처리량을 최대 5배까지 높여 배포된 유닛당 더 많은 수익을 창출하고 토큰당 비용을 낮춥니다.
CXL: 메모리 확장에서 새로운 AI 추론 격전지로
CXL(Compute Express Link)은 PCIe 물리 계층을 기반으로 구축된 고속 인터커넥트 프로토콜입니다. 핵심 가치는 여러 프로세서가 공유 메모리 리소스 풀에 접근할 수 있게 하여, 메모리가 특정 CPU에 묶여 있는 전통적인 아키텍처를 근본적으로 깨는 것입니다.
세 가지 주요 응용은 메모리 확장(단일 프로세서의 로컬 메모리 채널 한계를 넘어 용량 추가), 메모리 공유(여러 프로세서가 동일 데이터에 접근), 메모리 풀링(프로세서 또는 서버 간에 메모리를 동적으로 할당하여 유휴 낭비 감소)입니다. 역사적으로 CXL은 주로 범용 CPU 컴퓨팅에 사용되었으며, 지연 시간 단점으로 인해 AI에서의 침투가 제한적이었습니다. 그러나 추론 워크로드가 긴 컨텍스트, 에이전틱 워크로드, KV 캐시에 대해 용량을 급격히 요구하면서 많은 데이터가 HBM에 영구적으로 상주할 필요가 없어졌고, 이에 따라 CXL 연결 DRAM이 저비용·고용량 메모리 계층으로서 발판을 마련했습니다.
시장 규모 측면에서 CXL의 유효 시장 전망은 이전 CPU 기반 추정치인 40억 달러 이상에서 2030년까지 약 60억 달러로 상향되었으며, 증가분은 주로 새로운 AI 서버 측 배포 시나리오에서 비롯됩니다. Astera Labs의 Leo 메모리 컨트롤러 시리즈(KV 캐시 오프로드용 맞춤 설계 포함, 2027년 양산 예정)와 메모리 확장(Structera X) 및 랙 수준 풀링(Structera S)을 아우르는 Marvell의 전체 제품 포트폴리오가 이 분야에서 선호되는 두 핵심 주자입니다. Marvell 경영진은 이전에 CXL을 2028년경 10억 달러 이상의 수익 기여 요인으로 포지셔닝했습니다.
메모리 주식에 대한 시사점: 진폭이 아닌 지속 기간
단기 이익 극대화 관점에서 이러한 우회 전략은 DRAM 제조사에 일부 부정적 영향을 미칩니다. AI 생태계가 메모리 부족으로 완전히 정체된다면 단기 가격이 더 유리할 수 있습니다. 그러나 그 시나리오는 실현되지 않았습니다. 현재 메모리 사이클은 가격 진폭보다 지속 기간을 주요 동인으로 분석해야 합니다.
핵심 논거: 사양 축소는 수요 감소가 아닌 공급 제약에서 비롯됩니다. 공급이 개선되면 업계는 빠르게 더 높은 사양으로 회귀하고, 억눌린 수요는 새로운 용량을 쉽게 흡수할 것입니다. 주시해야 할 위험 요인: AI 둔화가 수요 감소가 아닌 토지, 전력, 팹 용량과 같은 인프라 병목에서 비롯된다면, 그러한 일시 중단은 컴퓨팅 주식과 다르게 메모리 주식에 영향을 미칠 수 있습니다.
마이크론과 샌디스크는 비중확대 등급을 유지하며, 메모리 부족 사이클이 아직 끝나지 않았고 이들의 배분 가치가 여전히 유효하다는 견해입니다.
투자자를 위한 핵심 요점
- 메모리 부족은 경기순환이 아닌 구조적 문제: 모델 확장, 컨텍스트 윈도우 성장, 추론 동시성이 공급이 대응할 수 있는 속도보다 빠르게 수요를 복리로 증가시킵니다.
- 사양 축소는 압력 밸브이지 해결책이 아님: 수요를 HBM/LPDDR에서 NAND와 네트워킹으로 이동시킬 뿐 제거하지 않습니다.
- 워크로드 분리는 순수 플레이 승자를 만듦: 프리필과 디코드가 전용 하드웨어로 분리되면서 Cerebras가 가장 직접적인 수혜자입니다.
- CXL은 부상하는 AI 추론 격전지: 유효 시장은 2030년까지 약 60억 달러로 상향 조정되었으며, Astera Labs와 Marvell이 핵심 인에이블러입니다.
- 진폭이 아닌 지속 기간에 주목: 메모리 사이클의 길이가 가격 변동보다 중요하며, 마이크론과 샌디스크가 여전히 선호되는 익스포저입니다.




