Nhấn Enter để tìm · ESC để đóng

Vĩ mô

Google xây dựng AI 200 tỷ USD: Điện năng, không phải chip, mới là nút thắt thực sự

Giám đốc hạ tầng AI của Google nói điện năng là ràng buộc then chốt trong chương trình xây dựng 200 tỷ USD

Google đang trên đà chi hơn 200 tỷ USD trong năm nay, với phần lớn dành cho các trung tâm dữ liệu, khi công ty chạy đua để mở rộng lớp vật lý của trí tuệ nhân tạo. Amin Vahdat, người lãnh đạo hạ tầng AI của Google, đã trình bày logic kỹ thuật và chiến lược đằng sau cái mà ông mô tả là chương trình xây dựng vốn lớn nhất trong lịch sử công nghiệp — và xác định điện năng, không phải silicon, là ràng buộc cuối cùng quyết định tốc độ triển khai.

“Điện năng là ràng buộc cơ bản nhất mà chúng tôi đối mặt”, Vahdat nói. “Mọi thứ khác dường như chúng tôi biết cách giải quyết trong một khoảng thời gian nào đó. Điện năng là vấn đề ràng buộc dài hạn.”

Vì sao điều này quan trọng ngoài Google

Những phát biểu này có hàm ý trực tiếp cho nhà đầu tư ở mọi loại tài sản. Việc Google ưu tiên kết nối lưới điện hơn tự sản xuất, sẵn sàng tài trợ đường truyền và trạm biến áp để tránh chuyển chi phí sang người tiêu dùng khác, và thừa nhận rằng cung và cầu có thể lệch nhau hàng năm — tất cả đều cho thấy điện năng đang được định giá lại mang tính cấu trúc như một yếu tố đầu vào chiến lược.

Các công ty tiện ích, nhà sản xuất điện độc lập, nhà phát triển điện hạt nhân, nhà sản xuất máy biến áp và thiết bị đóng cắt, cùng các nhà cung cấp phần mềm lưới điện nằm ở phía nhận của nhu cầu đó. Mặt trái là khả năng cung cấp điện có thể giới hạn thời gian triển khai của các hyperscaler và nhà cung cấp của họ, đưa vào một nguồn rủi ro thực thi mới cho các câu chuyện cổ phiếu gắn với AI vốn được định giá dựa trên giả định mở rộng gần như vô hạn.

Học thuyết goodput

Vahdat bác bỏ FLOPS như một “chỉ số phù phiếm”, lập luận rằng hiệu năng thực nên được đo bằng “goodput” — sản lượng hữu ích được cung cấp trong điều kiện lỗi thực tế. Ở quy mô 100.000 bộ tăng tốc, ông nói, lỗi xảy ra nhiều lần mỗi ngày, thậm chí có thể nhiều lần mỗi giờ. Mỗi lỗi có thể buộc khôi phục về checkpoint, đốt cháy compute mà không tạo ra công việc hữu ích.

Cách đặt vấn đề này quan trọng với cách nhà đầu tư đánh giá hiệu quả capex AI. Nếu một phần đáng kể công suất đã lắp đặt bị mất do lỗi, phục hồi và bug phần mềm, thì số lượng chip xuất xưởng và thông lượng lý thuyết trên các tiêu đề đang phóng đại công suất hữu ích thực sự có sẵn để huấn luyện và phục vụ mô hình.

Agent định hình lại trung tâm dữ liệu

Vahdat xác định các agent tầm xa là thay đổi cấu trúc lớn nhất đối với thiết kế trung tâm dữ liệu trong năm qua. Vì agent loại bỏ con người khỏi vòng lặp yêu cầu, độ trễ có thể nén từ giây xuống mili giây, và mật độ yêu cầu tăng theo bậc độ lớn. Điều then chốt là phần lớn việc điều phối — phân tích phản hồi, quyết định hành động tiếp theo, lấy ngữ cảnh từ DRAM cục bộ, bộ nhớ từ xa, SSD hoặc HDD — chạy trên CPU, không phải bộ tăng tốc.

“Nhu cầu tính toán tăng tốc đang tăng, nhưng nhu cầu về CPU, mạng và lưu trữ cũng đang bùng nổ”, ông nói. Điều đó thách thức giả định rằng capex AI về cơ bản là giao dịch GPU/TPU. Các nhà cung cấp CPU, nhà cung cấp bộ nhớ và lưu trữ, cùng nhà sản xuất thiết bị mạng có thể chiếm phần lớn hơn trong ví chi tiêu so với kỳ vọng đồng thuận.

TPU tách đôi báo hiệu kinh tế suy luận

TPU thế hệ thứ tám của Google lần đầu tiên tách thành hai chip: 8i cho suy luận và 8t cho huấn luyện. Vahdat mô tả quyết định này như một đặt cược trực tiếp rằng suy luận có thể chiếm 30% đến 60% tổng nhu cầu compute trong vòng đời của chip. Cả hai chip vẫn giữ khả năng chạy khối lượng công việc kia, bảo toàn tính linh hoạt trước rủi ro dự báo.

Với nhà đầu tư, việc tách đôi là tín hiệu về nơi giá trị đang dịch chuyển trong ngăn xếp AI: từ khối lượng công việc chỉ huấn luyện sang phục vụ suy luận luôn bật, nơi chi phí mỗi token, hiệu quả điện năng và kinh tế sử dụng chiếm ưu thế.

Chuyển mạch quang và trung tâm dữ liệu quỹ đạo

Google đã dùng chuyển mạch quang khoảng 15 năm, dùng gương MEMS để định tuyến ánh sáng mà không cần xử lý gói điện. Trong các cụm TPU, công nghệ này cho phép thay thế một rack lỗi bằng quang trong mili giây, trực tiếp giảm tổn thất goodput. Vahdat cũng xác nhận Google đang theo đuổi trung tâm dữ liệu quỹ đạo như một moonshot chính thức, với lý do điện năng khả dụng cao hơn khoảng 40% trong không gian, độ phủ mặt trời 98% đến 100% ở quỹ đạo đồng bộ mặt trời so với 28% đến 35% trên mặt đất, và lợi thế mật độ năng lượng hiệu dụng gấp 3 đến 4 lần.

Điểm chính cho nhà đầu tư

  • Điện năng là nút thắt, không phải chip. Tiện ích, thiết bị lưới điện, hạt nhân và lưu trữ năng lượng là những bên hưởng lợi trực tiếp từ nhu cầu hyperscaler; khả năng cung cấp điện là rủi ro thực thi thực sự đối với tiến độ công suất AI.
  • Capex AI rộng hơn GPU. CPU, DRAM, SSD, HDD và thiết bị mạng đều đang chứng kiến nhu cầu tăng vọt khi agent thay đổi hình dạng khối lượng công việc.
  • Phần mềm là nguồn công suất chính. Vahdat nói phần mềm và tối ưu mô hình có thể đóng góp không ít hơn phần cứng vào khả năng tăng gấp đôi công suất phục vụ token mỗi sáu tháng của Google — lời nhắc rằng cải thiện hiệu quả có thể bù đắp một phần chi tiêu phần cứng.
  • Suy luận là thị trường tăng trưởng. Việc tách TPU 8i/8t phản ánh kỳ vọng suy luận sẽ chi phối nhu cầu compute, có lợi cho các nhà cung cấp gắn với kinh tế phục vụ.
  • Tỷ lệ lỗi quan trọng. Ở quy mô 100.000 bộ tăng tốc, lỗi hàng ngày là bình thường. Nhà đầu tư nên soi kỹ goodput, không phải thông lượng lý thuyết, khi đánh giá các tuyên bố về hạ tầng AI.

Xem bài gốc

Chia sẻ
Lưu ý rủi ro Trang này cung cấp tin tức và thông tin về ngành crypto, blockchain và Web3 chỉ để tham khảo, không phải lời khuyên đầu tư hay cam kết lợi nhuận. Hoạt động liên quan đến tiền ảo là hoạt động tài chính bất hợp pháp tại Trung Quốc đại lục; giá tài sản số biến động mạnh; bạn tự chịu rủi ro. Trang này không cung cấp dịch vụ giao dịch, phát hành token hay giới thiệu liên quan.

Bài liên quan

Tin mới nhất

Thẻ chia sẻ TREE NEWS
Nhấn giữ ảnh trên → Lưu vào Ảnh / Chia sẻ
Gửi tin Góp ý