DeepSeekV4 · 参数量与动态激活显存

DeepSeekV4 参数量 / 激活参数量 / 动态激活显存 · 输入实时计算,无需刷新
‹ 返回仿真器主界面
模型总参数量
模型激活参数量
随 TopK 激活的权重
单层动态激活(峰值)
attention + MoE + mhc
总动态激活(×MoE 层数)

📐 参数量分解

🧩 静态参数量 全部权重

    模型总参数量

    🔥 激活参数量 每 token 实际使用的权重

      模型激活参数量

      ⚡ 动态激活显存分解(单位 GiB,BF16=2B / FP32=4B)

      🎯 Attention 临时含 mhc · 单层 · s×b×…

        单层 Attention 临时合计

        🧠 MoE 临时含 mhc · 单层 · TopK 激活

          单层 MoE 临时合计
          单层动态激活(含 mhc 两侧峰值)· 总动态激活 = 单层 × MoE 层数
          📐 查看全部计算公式
          参数量单位 B(= 10⁹ 参数);显存单位 GiB(= 1024³ 字节)。公式字段与右侧输入框一一对应: h=Hidden Size、v=Vocab Size、ql=q_lora_rank、kl=kv_lora_rank、nmla=num_head、qkd=qk_head_dim、 og=o_groups、ol=o_lora_rank、mix=mix_hc、hcm=hc_mult、Ld=dense 层数、Lm=MoE 层数、Lmtp=MTP 层数、 Li=Indexer 层数、nih=index_n_heads、nid=index_head_dim、Lc4=Compressor=4 层数、Lc128=Compressor=128 层数、 fe=expert_hidden_size、nr=router_expert_num、ns=shared_expert_num、k=TopK、re=expert_up_ratio、 s=seq_len、b=micro_batch、tp=TP。 单层 DSA Attn 参数 = h·kl + h·ql + ql·(nmla·kl) + (nmla·kl/og)·(og·ol) + (og·ol)·h + 2·mix·hcm·h(mhc 模块 = attn_fn + mlp_fn) Indexer 单层 = ql·(nih·nid) + h·nih Compressor=4 单层 = 4·h·nid + 4·h·kl Compressor=128 单层 = 2·h·nid + 2·h·kl 单个专家 = h·(fe·re) + fe·h MoE routed = nr × 单个专家;MoE shared = ns × 单个专家 模型总参数量 = v·h + (Ld+Lm)·(DSA Attn 单层 + MoE routed + MoE shared) + Li·Indexer 单层 + Lc4·Compressor4 单层 + Lc128·Compressor128 单层 模型激活参数量 = v·h + Lm·(DSA Attn 单层 + k·单个专家 + ns·单个专家) 动态激活(单层,GiB): layer input = s·b·hcm·h·2B logits = s·b·(v/tp)·2B;cross_entropy = s·b·(v/tp)·4B;loss 峰值 = logits + 2×cross_entropy q_comp = s·b·ql·2B;kv_comp = s·b·kl·2B q_full = attn_o = o_clone = s·b·nmla·qkd/tp·2B o_down = s·b·og·ol/tp·2B;core_out = s·b·h/tp·2B mhc:mhc_x_fp32 = s·b·hcm·h·4B;mhc_y = s·b·h·2B;mhc_post_out = s·b·hcm·h·2B router = s·b·nr·k(字节) dispatch = expert_out = combine = s·b·k·h·2B expert_fc1 = s·b·k·(2·fe)·2B;expert_fc2 = s·b·k·fe·2B;shared_fc1 = s·b·(2·fe)·2B 单层 Attention 临时 = q_comp + kv_comp + q_full + attn_o + o_clone + o_down + core_out + mhc(attention 图峰值保留一份) 单层 MoE 临时 = router + dispatch + expert_fc1 + expert_fc2 + expert_out + shared_fc1 + combine + mhc(MoE 图峰值保留一份) 单层激活 = Attention 临时 + MoE 临时 总激活 = 单层激活 × Lm 重计算保存层输入 = (Lm + Lmtp) × layer input