DeepSeekV4 · 参数量与动态激活显存
DeepSeekV4 参数量 / 激活参数量 / 动态激活显存 · 输入实时计算,无需刷新
模型总参数量
—
模型激活参数量
—
随 TopK 激活的权重
单层动态激活(峰值)
—
attention + MoE + mhc
总动态激活(×MoE 层数)
—
📐 参数量分解
🧩 静态参数量 全部权重
模型总参数量
—
🔥 激活参数量 每 token 实际使用的权重
模型激活参数量
—
⚡ 动态激活显存分解(单位 GiB,BF16=2B / FP32=4B)
🎯 Attention 临时含 mhc · 单层 · s×b×…
单层 Attention 临时合计
—
🧠 MoE 临时含 mhc · 单层 · TopK 激活
单层 MoE 临时合计
—
单层动态激活(含 mhc 两侧峰值)· 总动态激活 = 单层 × MoE 层数
—
📐 查看全部计算公式
参数量单位 B(= 10⁹ 参数);显存单位 GiB(= 1024³ 字节)。公式字段与右侧输入框一一对应:
h=Hidden Size、v=Vocab Size、ql=q_lora_rank、kl=kv_lora_rank、nmla=num_head、qkd=qk_head_dim、
og=o_groups、ol=o_lora_rank、mix=mix_hc、hcm=hc_mult、Ld=dense 层数、Lm=MoE 层数、Lmtp=MTP 层数、
Li=Indexer 层数、nih=index_n_heads、nid=index_head_dim、Lc4=Compressor=4 层数、Lc128=Compressor=128 层数、
fe=expert_hidden_size、nr=router_expert_num、ns=shared_expert_num、k=TopK、re=expert_up_ratio、
s=seq_len、b=micro_batch、tp=TP。
单层 DSA Attn 参数 = h·kl + h·ql + ql·(nmla·kl)
+ (nmla·kl/og)·(og·ol) + (og·ol)·h
+ 2·mix·hcm·h(mhc 模块 = attn_fn + mlp_fn)
Indexer 单层 = ql·(nih·nid) + h·nih
Compressor=4 单层 = 4·h·nid + 4·h·kl
Compressor=128 单层 = 2·h·nid + 2·h·kl
单个专家 = h·(fe·re) + fe·h
MoE routed = nr × 单个专家;MoE shared = ns × 单个专家
模型总参数量 = v·h
+ (Ld+Lm)·(DSA Attn 单层 + MoE routed + MoE shared)
+ Li·Indexer 单层 + Lc4·Compressor4 单层 + Lc128·Compressor128 单层
模型激活参数量 = v·h
+ Lm·(DSA Attn 单层 + k·单个专家 + ns·单个专家)
动态激活(单层,GiB):
layer input = s·b·hcm·h·2B
logits = s·b·(v/tp)·2B;cross_entropy = s·b·(v/tp)·4B;loss 峰值 = logits + 2×cross_entropy
q_comp = s·b·ql·2B;kv_comp = s·b·kl·2B
q_full = attn_o = o_clone = s·b·nmla·qkd/tp·2B
o_down = s·b·og·ol/tp·2B;core_out = s·b·h/tp·2B
mhc:mhc_x_fp32 = s·b·hcm·h·4B;mhc_y = s·b·h·2B;mhc_post_out = s·b·hcm·h·2B
router = s·b·nr·k(字节)
dispatch = expert_out = combine = s·b·k·h·2B
expert_fc1 = s·b·k·(2·fe)·2B;expert_fc2 = s·b·k·fe·2B;shared_fc1 = s·b·(2·fe)·2B
单层 Attention 临时 = q_comp + kv_comp + q_full + attn_o + o_clone + o_down + core_out
+ mhc(attention 图峰值保留一份)
单层 MoE 临时 = router + dispatch + expert_fc1 + expert_fc2 + expert_out
+ shared_fc1 + combine + mhc(MoE 图峰值保留一份)
单层激活 = Attention 临时 + MoE 临时
总激活 = 单层激活 × Lm
重计算保存层输入 = (Lm + Lmtp) × layer input