Mô hình mới nhỏ nhất của DeepSeek trang bị thị giác đa phương thức gốc và chế độ tiết kiệm bộ nhớ triệt để
TREE NEWS đưa tin: DeepSeek đã chính thức phát hành DeepSeek V4.1 Flash, thành viên nhỏ nhất trong dòng kiến trúc mô hình mới của mình, và tính năng nổi bật không phải là hiệu năng benchmark thô mà là kinh tế học bộ nhớ. Mô hình này đi kèm khả năng hiểu thị giác đa phương thức gốc và quan trọng hơn, nén KV Cache một cách mạnh mẽ. So với thế hệ trước, yêu cầu HBM giảm xuống khoảng một phần tư và yêu cầu SSD xuống khoảng một phần tám.
Sự giảm này quan trọng vì cách các AI agent hiện đại được tính phí và vận hành. Trong khối lượng công việc agent, phí cache-hit thường là khoản mục lớn nhất trong cơ cấu chi phí, vì agent liên tục đọc lại các cửa sổ ngữ cảnh dài khi lập kế hoạch, gọi công cụ và lặp lại. Thu nhỏ KV Cache tấn công trực tiếp vào nền tảng chi phí đó, cho phép phục vụ ngữ cảnh hiệu dụng dài hơn từ các tầng bộ nhớ rẻ hơn.
Tại sao đây là bước phát triển liên quan đến crypto
Các mạng tính toán phi tập trung và GPU đã dành hai năm lập luận rằng lợi thế chi phí của họ so với các hyperscaler đến từ việc tổng hợp phần cứng chưa được sử dụng hết. Nút thắt chưa bao giờ là FLOPS thô; mà là băng thông bộ nhớ, nguồn cung HBM và kinh tế học của việc phục vụ suy luận ngữ cảnh dài trên các nút không đồng nhất. Một mô hình chỉ cần một phần tư HBM và một phần tám SSD cho cùng cửa sổ ngữ cảnh sẽ thay đổi hồ sơ phần cứng mà các mạng suy luận phi tập trung phải hỗ trợ.
- Yêu cầu nút thấp hơn: GPU cấp tiêu dùng và thiết bị biên trở nên khả thi hơn như máy chủ suy luận agent, mở rộng nguồn cung có thể tiếp cận cho các thị trường tính toán on-chain.
- Kinh tế đơn vị tốt hơn cho token agent: Các dự án kiếm tiền từ agent tự trị thấy biên lợi nhuận gộp cải thiện nếu chi phí suy luận giảm, có khả năng làm cho mô hình trả tiền theo lượt gọi dựa trên token trở nên bền vững ở mức giá thấp hơn.
- Áp lực cạnh tranh lên nhà cung cấp suy luận: Cả nhà bán lại API tập trung lẫn bên tổng hợp GPU phi tập trung đều phải định giá lại, vì đường cong chi phí cơ bản vừa thay đổi.
Mô hình rộng hơn: Hiệu quả là chiến trường thực sự
Trọng tâm của ngành AI đang dịch chuyển từ số lượng tham số sang hiệu quả suy luận. Huấn luyện một mô hình tiên phong là sự kiện vốn; phục vụ nó có lãi là kỷ luật vận hành. Việc DeepSeek nhấn mạnh vào nén KV Cache đi theo xu hướng rộng hơn về tối ưu hóa kiến trúc và cấp hệ thống, bao gồm attention thưa, lượng tử hóa và offload bộ nhớ phân tầng.
Đối với crypto, điều này có hai mặt. Suy luận rẻ hơn hạ thấp rào cản để các agent AI on-chain, thị trường suy luận phi tập trung và mạng tính toán có thể xác minh đạt được sự phù hợp sản phẩm-thị trường thực sự. Nhưng nó cũng thu hẹp hào bảo vệ của bất kỳ giao thức nào chỉ có một lời chào là ‘GPU rẻ hơn AWS.’ Nếu một mô hình có thể chạy trên một phần tư HBM, sự khác biệt phải đến từ khả năng xác minh, quyền riêng tư, khả năng chống kiểm duyệt hoặc đường ray thanh toán — không chỉ từ kinh doanh chênh lệch phần cứng.
Những điều cần theo dõi
Hãy theo dõi liệu các mạng tính toán phi tập trung có công bố benchmark cập nhật so với các mô hình cấp V4.1 Flash hay không, và liệu các dự án token tập trung vào agent có tiết lộ cải thiện chi phí trên mỗi tác vụ hay không. Tín hiệu rõ ràng nhất sẽ là giá: nếu giá API cho khối lượng công việc agent giảm đáng kể trong các quý tới, luận điểm nén KV Cache sẽ được chứng minh trên thị trường chứ không phải trên bảng thông số.



