Nhấn Enter để tìm · ESC để đóng

AI × Crypto

Cuộc khủng hoảng bộ nhớ của AI: Ngành công nghiệp đang tự tái cấu trúc như thế nào xung quanh tình trạng thiếu hụt cấu trúc

Cuộc khủng hoảng bộ nhớ của AI: Ngành công nghiệp đang tự tái cấu trúc như thế nào xung quanh tình trạng thiếu hụt cấu trúc

Tình trạng thiếu hụt bộ nhớ đã trở thành hạn chế cấu trúc dai dẳng nhất trong chu kỳ xây dựng AI hiện tại, và tốc độ mở rộng tính toán AI không có dấu hiệu chờ đợi các nhà máy mới đi vào hoạt động. Đối mặt với mâu thuẫn đó, ngành công nghiệp đang theo đuổi ba giải pháp tạm thời — cắt giảm thông số kỹ thuật bộ nhớ, phân tách khối lượng công việc suy luận và gộp bộ nhớ thông qua CXL — đồng thời tạo ra các cơ hội đầu tư mới trên chặng đường.

CEO Nvidia Jensen Huang gần đây cho biết ngành công nghiệp cần tư duy hoàn toàn mới để giải quyết nút thắt bộ nhớ, coi đó không phải là tín hiệu bi quan mà là sự thừa nhận chủ động về tình trạng thiếu hụt dự kiến sẽ kéo dài trong nhiều năm. Mức độ thiếu hụt có thể dao động, nhưng AI dự kiến sẽ hấp thụ về cơ bản toàn bộ nguồn cung sẵn có trong tương lai có thể thấy trước.

Giảm thông số: Giải pháp tạm thời di chuyển áp lực, không loại bỏ nó

Với giá DRAM và NAND đều tăng, phản ứng trực tiếp nhất là thu gọn cấu hình bộ nhớ trên mỗi thiết bị hoặc mỗi máy chủ. Nvidia đang cung cấp nhiều cấp thông số kỹ thuật cho nền tảng Rubin: dung lượng LPDDR5 mỗi rack đã được thu gọn từ kế hoạch 54TB xuống 28TB, với các module thu nhỏ từ 192GB SOCAMM2 xuống 96GB. Đối với HBM, Rubin ban đầu được dự kiến 288GB mỗi GPU (8-high 12hi HBM4), nhưng phiên bản 192GB (8-high 8hi HBM4) hiện được kỳ vọng. Thông số kỹ thuật của Rubin Ultra cũng đang được điều chỉnh giảm, với đường cơ sở tương đương có thể giảm xuống khoảng 192GB đến 384GB.

Tuy nhiên, giảm thông số không phải là giải pháp thực sự. Khi dung lượng bộ nhớ bị cắt ở một lớp, áp lực dữ liệu chắc chắn sẽ dịch chuyển xuống dưới — thu nhỏ HBM và LPDDR tạo ra nhu cầu gia tăng đối với NAND và kết nối mạng. Nút thắt di chuyển thay vì biến mất. Ba lực lượng cấu trúc tiếp tục đẩy nhu cầu bộ nhớ AI lên cao hơn: kích thước mô hình tăng gấp đôi mỗi sáu tháng trong kỷ nguyên LLM, cửa sổ ngữ cảnh mở rộng khoảng gấp năm lần mỗi năm, và tính đồng thời suy luận gia tăng đòi hỏi lưu trữ KV cache độc lập cho mỗi phiên. Giảm thông số chỉ có thể là tạm thời; một khi nguồn cung giảm bớt, ngành công nghiệp sẽ nhanh chóng quay trở lại thông số kỹ thuật cao hơn.

Phân tách khối lượng công việc: Phần cứng chuyên dụng cho từng giai đoạn suy luận

Suy luận bao gồm hai giai đoạn riêng biệt: prefill, xử lý các lời nhắc đầu vào song song và đòi hỏi nhiều tính toán, và decode, tạo ra token đầu ra từng cái một và phụ thuộc nhiều hơn vào băng thông và dung lượng bộ nhớ. Tách hai giai đoạn và gán mỗi giai đoạn cho phần cứng phù hợp nhất là con đường thứ hai để cải thiện hiệu quả bộ nhớ.

Xu hướng này tăng tốc rõ rệt vào khoảng cuối năm 2025. Sau khi mua lại Groq, Nvidia đã tích hợp LPU của mình — dựa trên SRAM trên chip băng thông cao — vào nền tảng Vera Rubin, với GPU Rubin xử lý prefill và decode yêu cầu dung lượng KV cache lớn, Groq xử lý các thành phần feed-forward và mixture-of-experts, và Nvidia Dynamo điều phối chuyển giao kích hoạt. AWS sau đó đã công bố kiến trúc không đồng nhất sử dụng Trainium cho prefill và Cerebras cho decode, dự kiến cho Amazon Bedrock vào Q1 2027; một hợp tác tương tự giữa Cerebras-AMD dự kiến sẽ đi vào sản xuất vào Q4 2026. Corsair của Matrix cũng đã đi vào sản xuất hàng loạt.

Cerebras nổi bật là người hưởng lợi thuần túy trực tiếp nhất từ việc phân tách khối lượng công việc. Bộ xử lý quy mô wafer của nó tích hợp một lượng lớn SRAM với tính toán trên cùng một silicon, giảm đáng kể việc di chuyển dữ liệu giữa bộ xử lý và bộ nhớ ngoài — một lợi thế quyết định trong giai đoạn decode. Phân tách cũng có thể cải thiện đáng kể tính kinh tế của Cerebras Cloud: theo tiết lộ từ Cerebras và AMD, hệ thống kết hợp có thể tăng thông lượng lên tới 5 lần trong khi duy trì tốc độ suy luận của Cerebras, tạo ra nhiều doanh thu hơn trên mỗi đơn vị triển khai và giảm chi phí trên mỗi token.

CXL: Từ mở rộng bộ nhớ đến chiến trường suy luận AI mới

CXL (Compute Express Link) là một giao thức kết nối tốc độ cao được xây dựng trên lớp vật lý PCIe. Giá trị cốt lõi của nó là cho phép nhiều bộ xử lý truy cập vào một nhóm tài nguyên bộ nhớ chia sẻ, phá vỡ cơ bản kiến trúc truyền thống trong đó bộ nhớ bị ràng buộc với một CPU cụ thể.

Ba ứng dụng chính của nó là mở rộng bộ nhớ (thêm dung lượng vượt quá giới hạn kênh bộ nhớ cục bộ của một bộ xử lý), chia sẻ bộ nhớ (nhiều bộ xử lý truy cập cùng một dữ liệu) và gộp bộ nhớ (phân bổ động bộ nhớ giữa các bộ xử lý hoặc máy chủ để giảm lãng phí nhàn rỗi). Trước đây, CXL chủ yếu phục vụ tính toán CPU đa dụng, và sự thâm nhập của nó vào AI bị hạn chế bởi nhược điểm về độ trễ. Nhưng khi khối lượng công việc suy luận đòi hỏi dung lượng tăng mạnh cho ngữ cảnh dài, khối lượng công việc tác nhân và KV cache, nhiều dữ liệu không cần lưu trú vĩnh viễn trong HBM — tạo chỗ đứng cho DRAM gắn CXL như một tầng bộ nhớ chi phí thấp hơn, dung lượng cao hơn.

Về quy mô thị trường, dự báo thị trường có thể tiếp cận cho CXL đã được nâng từ ước tính dựa trên CPU trước đó là hơn 4 tỷ USD lên khoảng 6 tỷ USD vào năm 2030, với phần tăng chủ yếu từ các kịch bản triển khai phía máy chủ AI mới. Dòng bộ điều khiển bộ nhớ Leo của Astera Labs (bao gồm các thiết kế tùy chỉnh cho offload KV cache, dự kiến vào sản xuất hàng loạt năm 2027) và danh mục sản phẩm đầy đủ của Marvell bao gồm mở rộng bộ nhớ (Structera X) và gộp cấp rack (Structera S) là hai cái tên cốt lõi được ưa chuộng trong lĩnh vực này. Ban lãnh đạo Marvell trước đây đã định vị CXL là đóng góp doanh thu hơn 1 tỷ USD vào khoảng năm 2028.

Hàm ý cho cổ phiếu bộ nhớ: Thời gian, không phải biên độ

Từ góc độ tối đa hóa lợi nhuận ngắn hạn, các chiến lược giải pháp tạm thời này có một số hàm ý tiêu cực đối với các nhà sản xuất DRAM — nếu hệ sinh thái AI đình trệ hoàn toàn do thiếu hụt bộ nhớ, giá ngắn hạn có thể thuận lợi hơn. Nhưng kịch bản đó không bao giờ thành hiện thực. Chu kỳ bộ nhớ hiện tại nên được phân tích với thời gian là động lực chính thay vì biên độ giá.

Lập luận cốt lõi: giảm thông số xuất phát từ hạn chế nguồn cung, không phải nhu cầu suy giảm. Một khi nguồn cung được cải thiện, ngành công nghiệp sẽ nhanh chóng quay trở lại thông số kỹ thuật cao hơn, và nhu cầu bị dồn nén sẽ dễ dàng hấp thụ năng lực mới. Một yếu tố rủi ro cần theo dõi: nếu sự suy giảm AI không phải do nhu cầu giảm mà do nút thắt cơ sở hạ tầng như đất đai, điện năng hoặc năng lực nhà máy, sự tạm dừng như vậy có thể ảnh hưởng đến cổ phiếu bộ nhớ khác với cổ phiếu tính toán.

Micron và SanDisk vẫn được đánh giá vượt trội, với quan điểm rằng chu kỳ thiếu hụt bộ nhớ còn lâu mới kết thúc và giá trị phân bổ của chúng vẫn giữ nguyên.

Điểm chính cho nhà đầu tư

  • Thiếu hụt bộ nhớ là cấu trúc, không phải chu kỳ: Mở rộng mô hình, tăng trưởng cửa sổ ngữ cảnh và tính đồng thời suy luận đang làm nhu cầu tăng nhanh hơn khả năng đáp ứng của nguồn cung.
  • Giảm thông số là van xả áp, không phải giải pháp: Nó chuyển nhu cầu từ HBM/LPDDR sang NAND và mạng thay vì loại bỏ nó.
  • Phân tách khối lượng công việc tạo ra người thắng thuần túy: Cerebras là người hưởng lợi trực tiếp nhất khi prefill và decode tách sang phần cứng chuyên dụng.
  • CXL là chiến trường suy luận AI mới nổi: Thị trường có thể tiếp cận đã được điều chỉnh tăng lên ~6 tỷ USD vào năm 2030, với Astera Labs và Marvell là những đơn vị hỗ trợ cốt lõi.
  • Neo vào thời gian, không phải biên độ: Độ dài của chu kỳ bộ nhớ quan trọng hơn biến động giá; Micron và SanDisk vẫn là lựa chọn ưu tiên.

Xem bài gốc

Chia sẻ
Lưu ý rủi ro Trang này cung cấp tin tức và thông tin về ngành crypto, blockchain và Web3 chỉ để tham khảo, không phải lời khuyên đầu tư hay cam kết lợi nhuận. Hoạt động liên quan đến tiền ảo là hoạt động tài chính bất hợp pháp tại Trung Quốc đại lục; giá tài sản số biến động mạnh; bạn tự chịu rủi ro. Trang này không cung cấp dịch vụ giao dịch, phát hành token hay giới thiệu liên quan.

Bài liên quan

Tin mới nhất

Thẻ chia sẻ TREE NEWS
Nhấn giữ ảnh trên → Lưu vào Ảnh / Chia sẻ
Gửi tin Góp ý