按 Enter 搜索 · ESC 关闭

AI × Crypto

DeepSeek发布V4.1 Flash:HBM需求降至四分之一

9月10日,DeepSeek正式发布DeepSeek V4.1 Flash模型,为其全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力。公司称,新一代模型大幅压缩KV Cache缓存大小,与上一代相比,对HBM的需求减少到1/4,对SSD的需求减少到1/8。在Agent使用场景中缓存命中费用占比较高,KV Cache的压缩大幅降低了Agent类任务的使用成本。

原文

AI 解读

这条消息的关键不在模型能力本身,而在于推理侧内存需求的压缩幅度。KV Cache是长上下文与Agent任务的主要成本项,将HBM需求降至四分之一、SSD降至八分之一,意味着同等算力下可承载的并发与上下文长度显著提升,Agent类应用的单位成本结构可能被重写。受影响最直接的是依赖高带宽内存的推理硬件链条与云厂商的算力定价逻辑。值得观察的是,这类压缩是否成为后续模型结构的普遍取向,以及成本下降会否转化为Agent调用量的实际放大。

由 AI 生成,仅供参考。

分享本文

相关快讯

TREE NEWS 分享卡片
长按上方图片 → 保存到相册 / 转发分享
寻求报道 加入社群 意见反馈