先看原句。DeepSeek-V4论文(arXiv 2606.19348,2026年4月26日提交)的摘要写的是:
"In the one-million-token context setting, DeepSeek-V4-Pro requires only 27% of single-token inference FLOPs and 10% of KV cache compared with DeepSeek-V3.2."
拆开来,条件有三个:①在100万token上下文场景下、②与DeepSeek-V3.2相比、③指的是单token推理FLOPs与KV缓存。
去掉条件会错在哪
常见的转述是"计算量降到27%、显存占用降到10%"。两处失真:
第一,"显存占用"不等于"KV缓存"。KV缓存只是推理时显存的一部分,模型权重本身同样占显存——尤其V4-Pro是1.6万亿参数的模型。把KV缓存的比例说成整体显存的比例,会让人以为部署门槛下降了一个数量级。
第二,短上下文场景不适用这个比例。这一点更关键:效率优势本来就来自长上下文下的注意力压缩。V4用的是混合注意力架构——CSA(压缩稀疏注意力)沿序列维度压缩KV缓存并执行稀疏注意力,HCA(高度压缩注意力)压得更狠但保持稠密注意力。序列越长,压缩省下的越多;上下文很短时,本来也没多少可压。
换句话说,这是一个"在百万token这个特定战场上"的效率数字,不是模型在所有场景下都便宜了三分之二。
顺带说两个也常被记错的点
"4月24日发布"指的是预览版。DeepSeek官方4月24日的公告标题里就写着"预览版"。V4-Flash正式版是7月31日下午通过API文档发布日志上线公测的,当时官方表示V4-Pro正式版"将会尽快发布"。
而且正式版的提升不是靠换更大的模型:官方说明里,V4-Flash-0731的模型结构和尺寸与预览版保持一致,仅重新进行了后训练。
V4-Pro-Max不是第四个模型。它是V4-Pro的最大推理强度(maximum reasoning effort)模式。
另外,如果你是去API上调用,官方文档里的模型标识有三个:deepseek-v4-flash、deepseek-v4-pro,还有一个容易被漏掉的 deepseek-v4-flash-vision-exp(带视觉能力的实验版,exp表示实验性质,接口与可用性可能变动)。旧的deepseek-chat、deepseek-reasoner不是V4的标识。
参数、架构、许可证与各项出处(arXiv论文、Hugging Face模型卡、官方公告)整理在这里:DeepSeek-V4 — glowwiki
댓글
댓글 쓰기