기본 콘텐츠로 건너뛰기

DeepSeek-V4的"计算量27%、显存10%":论文原文里跟着三个条件

这组数字被引用得很广,但引用时常常只剩下"27%"和"10%"两个百分比。论文原文里,它们是有前提的。

先看原句。DeepSeek-V4论文(arXiv 2606.19348,2026年4月26日提交)的摘要写的是:

"In the one-million-token context setting, DeepSeek-V4-Pro requires only 27% of single-token inference FLOPs and 10% of KV cache compared with DeepSeek-V3.2."

拆开来,条件有三个:①在100万token上下文场景下、②与DeepSeek-V3.2相比、③指的是单token推理FLOPs与KV缓存。

去掉条件会错在哪

常见的转述是"计算量降到27%、显存占用降到10%"。两处失真:

第一,"显存占用"不等于"KV缓存"。KV缓存只是推理时显存的一部分,模型权重本身同样占显存——尤其V4-Pro是1.6万亿参数的模型。把KV缓存的比例说成整体显存的比例,会让人以为部署门槛下降了一个数量级。

第二,短上下文场景不适用这个比例。这一点更关键:效率优势本来就来自长上下文下的注意力压缩。V4用的是混合注意力架构——CSA(压缩稀疏注意力)沿序列维度压缩KV缓存并执行稀疏注意力,HCA(高度压缩注意力)压得更狠但保持稠密注意力。序列越长,压缩省下的越多;上下文很短时,本来也没多少可压。

换句话说,这是一个"在百万token这个特定战场上"的效率数字,不是模型在所有场景下都便宜了三分之二。

顺带说两个也常被记错的点

"4月24日发布"指的是预览版。DeepSeek官方4月24日的公告标题里就写着"预览版"。V4-Flash正式版是7月31日下午通过API文档发布日志上线公测的,当时官方表示V4-Pro正式版"将会尽快发布"。

而且正式版的提升不是靠换更大的模型:官方说明里,V4-Flash-0731的模型结构和尺寸与预览版保持一致,仅重新进行了后训练。

V4-Pro-Max不是第四个模型。它是V4-Pro的最大推理强度(maximum reasoning effort)模式。

另外,如果你是去API上调用,官方文档里的模型标识有三个:deepseek-v4-flash、deepseek-v4-pro,还有一个容易被漏掉的 deepseek-v4-flash-vision-exp(带视觉能力的实验版,exp表示实验性质,接口与可用性可能变动)。旧的deepseek-chat、deepseek-reasoner不是V4的标识。

参数、架构、许可证与各项出处(arXiv论文、Hugging Face模型卡、官方公告)整理在这里:DeepSeek-V4 — glowwiki

댓글

이 블로그의 인기 게시물

독자가 요청한 주제가 1시간 반 만에 문서가 되는 과정

오늘 오전, 글로우위키의 '문서 요청' 폼으로 이런 요청이 들어왔습니다. "킬링필드 사건에 대한 문서 작성해주세요. 캄보디아에 있었던 킬링필드 사건이 어떤 사건인지 설명해주세요." 접수 약 1시간 반 뒤, 문서가 발행됐습니다: 킬링필드 — 크메르루주 캄보디아 대학살 그 사이에 무슨 일이 있었는지가 이 글의 내용입니다. 1. 요청을 다 받지는 않습니다 먼저 주제 기준을 봅니다. "1년 뒤에도 이 제목으로 검색하는 사람이 있는가", 검색 수요가 시간이 지나도 유지되는 주제인가. 킬링필드는 역사 아카이브형이라 통과였습니다. 반짝 화제나 일회성 이슈였다면 사유를 남기고 반려합니다. 2. 숫자부터 확인합니다 킬링필드 사망자 수를 검색하면 138만, 170만, 200만, 250만이 모두 나옵니다. 어느 하나를 고르는 대신, 왜 갈리는지를 확인했습니다 — 매장지 실사 기반 집계(약 138만)와 기아·질병 사망까지 포함한 추정(170만~250만)은 집계 범위가 다른 겁니다. 문서에는 이 편차 자체를 '숫자가 갈리는 이유' 섹션으로 실었습니다. 3. 모든 문장에 출처 번호가 붙습니다 완성된 문서의 사실 항목은 전부 독립된 출처 2개 이상으로 교차 확인되고, 문장마다 [1][2] 같은 번호가 붙어 하단 출처 목록과 연결됩니다. 확인이 덜 된 내용은 '주장' 칸에 따로 둡니다. 요청은 문서 하단 '문서 요청' 폼으로 누구나 할 수 있습니다. 어떤 AI 가 몇 토큰을 써서 만들었는지도 각 문서의 '이 문서는 이렇게 만들어졌습니다' 섹션에 공개됩니다.

AI가 위키를 운영하면 어떤 일이 벌어지나 — 글로우위키를 시작합니다

글로우위키( glowwiki.com )는 지금 벌어지는 이슈를 출처와 함께 정리하는 위키입니다. AI가 문서를 쓰고 검수하며, 틀린 곳은 누구나 정정을 요청할 수 있습니다. 이 블로그에는 그날 다룬 이슈와 운영하며 겪은 일을 적습니다. 첫 글이니 이 사이트가 무엇을 다르게 하려는지부터 씁니다. 같은 사안인데 기사마다 숫자가 다를 때 문서를 쓰다 보면 자료마다 수치가 어긋나는 경우를 자주 만납니다. 보통은 더 많이 나오는 쪽을 택하거나, 최신 기사를 따릅니다. 그런데 그렇게 하면 왜 다른지 가 사라집니다. 예를 들어 'HBM 점유율 1위'를 검색하면 SK하이닉스 58%라는 기사도 있고 50%라는 기사도 나옵니다. 어느 쪽이 오보일까요? 둘 다 맞습니다. 58%는 매출 기준 이고 50%는 비트 출하량 기준 입니다. 매출 기준에서 더 높다는 것은 단가가 높은 제품 비중이 크다는 뜻이죠. 같은 시장을 두고 무엇을 세느냐에 따라 다른 숫자가 나오는 겁니다. 글로우위키는 이럴 때 한쪽을 고르지 않고 그 차이 자체를 내용으로 씁니다 . 독자가 다른 곳에서 상충하는 숫자를 봤을 때 혼란스럽지 않으려면 그게 맞다고 봅니다. 모른다고 적는 것 이번 주 광복절(8월 15일)이 토요일이라 8월 17일 월요일이 대체공휴일입니다. 그런데 올해 추석은 토요일이 끼어 있는데도 대체공휴일이 붙지 않습니다. 왜 다른지 근거 조문까지 설명한 자료를 찾으려 했지만 확인하지 못했습니다. 그래서 문서에 '확인되지 않음' 이라고 적었습니다. 그럴듯한 추측을 적는 것보다 낫다고 판단했습니다. 단정하는 글은 이미 많습니다. 모르는 것을 모른다고 적는 쪽이 오히려 드물고, 그게 신뢰의 근거가 된다고 생각합니다. 사실과 주장을 나눠 적습니다 글로우위키의 모든 문서는 문장 단위로 출처 가 붙습니다. 그리고 다음 두 가지를 구분합니다. 사실 — 서로 독립된 출처 두 곳 이상이 일치하는 내용 주장 — 단일 출처이거나, 추정이거나, ...

8월 20일 시행 단기 육아휴직 — 급여 계산에서 자주 틀리는 부분

이번 주 글로우위키가 다룬 이슈 중 확인 과정이 까다로웠던 것을 정리합니다. 1주 단위 육아휴직이 8월 20일부터 2026년 8월 20일부터 단기 육아휴직 이 시행됩니다. 만 8세 이하(초등 2학년 이하) 자녀의 질병·사고 입원, 휴원·휴교, 방학처럼 며칠만 돌봄이 필요할 때 연 1회 1주 또는 2주 단위로 쓸 수 있습니다. 그동안은 육아휴직을 30일 이상 써야 급여가 나왔습니다. 아이가 사흘 아픈 상황에는 쓸 수 없는 제도였던 셈입니다. 급여를 확인하다 만난 문제 문서를 쓰면서 급여가 얼마인지 찾아봤습니다. 검색하면 "통상임금 80%, 1주에 약 37만원" 이라는 설명이 여럿 나옵니다. 그런데 언론 보도 원문을 확인하니 달랐습니다. 단기 육아휴직 급여는 기존 육아휴직과 같은 기준이고, 그 기준은 이렇게 구간이 나뉩니다. 1~3개월 — 통상임금 100% (상한 250만원) 4~6개월 — 통상임금 100% (상한 200만원) 7개월 이후 — 통상임금 80% (상한 160만원) 단기 육아휴직은 며칠 단위라 대개 첫 구간에 해당합니다. 80%는 7개월 이후 구간 인데, 정리 매체가 그걸 잘못 가져다 쓴 것으로 보입니다. 급여는 사람들이 그대로 믿고 계획을 세우는 숫자라 특히 조심해야 합니다. 그래서 문서에는 100% 기준을 사실로 적고, 80% 설명이 왜 틀렸는지도 함께 남겼습니다. 다만 이미 육아휴직을 오래 쓴 분은 뒤 구간이 적용될 수 있어 개인차가 있다는 점도 적었습니다. 회사가 거부하면 제도를 알아도 회사가 안 된다고 하면 포기하는 경우가 많습니다. 이 부분도 확인해 넣었습니다. 육아휴직은 법정 요건을 갖추면 사업주에게 허용할 의무 가 있습니다. 신청서를 받은 날부터 14일 안에 허용 여부를 통보해야 하고, 통보가 없으면 승인한 것으로 봅니다 . 거부는 법 위반이라 고용노동부 신고 대상입니다. 갑자기 아플 때는 당일 신청 휴원·휴교나 자녀의 질병·사고 입원 같은 긴급한 사유는 당일...