MoE 混合专家模型是什么?总参数和激活参数有什么区别?
🧑💻 面试官:某个模型总参数很多,每个 token 只激活其中一部分。这是把剩下的参数删了吗?
🙋♂️ 我:没有。MoE 会根据输入选择部分专家参与这一轮计算。
🧑💻 面试官:是不是先选一个“编程专家”,然后整段回答都由它生成?
🙋♂️ 我:专家通常是模型内部的网络模块,不是独立聊天模型。
🧑💻 面试官:既然只用一部分参数,部署时也只需要放下这一部分吗?
「参与计算多少」和「模型一共要存多少」是两笔不同的账,激活参数少不等于整个模型很小。
面试速答(60 秒版)
MoE 是混合专家模型。常见做法是在 Transformer 的部分层里放置多个专家网络,再由路由器根据当前 token 的表示,选择其中少量专家参与计算。
因此,总参数表示模型包含的全部参数,激活参数表示处理一个 token 时实际参与计算的参数。通过这种方式,可以增加模型容量,而不让每个 token 都经过所有专家。
但专家不是几个分别负责“写代码、做数学”的独立 Agent,也不一定能按业务名称划分职责。不同 token、不同层可能有不同选择。
同时,没被本轮选中的专家仍然属于模型,部署通常还要存放这些权重。实际速度还受专家分布、负载和设备通信影响,不能只凭激活参数判断显存与延迟。

图里用少量专家说明路由关系,不代表某个模型的实际专家数量。
知识点详解:一个 token 怎样经过不同专家?
先把专家放回模型内部
在常见 Transformer 中,token 经过 Attention 交换上下文信息,还会经过前馈网络处理自身表示。
稀疏 MoE 通常把部分前馈网络替换成多个专家。每个专家仍然是一个神经网络模块,并不是拿着不同提示词的聊天助手。
因此,“混合专家”并不表示用户问编程题,就把整段问题发给一个独立代码模型。那更接近应用层模型路由,是另一件事。
路由器具体选择什么?
咱们假设某个 MoE 层有四个专家,每个 token 选择两个。
当前 token 的向量先进入路由器,路由器计算各个专家的分数,再按规则选出其中两个。选中专家分别处理这个向量,结果按权重组合,继续进入后面的网络层。
下一个 token 可能选择另外两个专家。到了另一层,同一个 token 也可能走不同组合。这种选择来自训练出来的路由规则,不能直接把某个专家命名成“法律专家”。
实际模型还可能包含共享专家、不同的路由策略和负载均衡设计,所以“四选二”只是帮助理解的教学例子,不是所有 MoE 的固定配置。
总参数和激活参数怎样算?
在这个例子里,四个专家的参数都属于总参数,但当前 token 的计算只用到选中的两个。
不过,激活参数并不只统计这两个专家。Attention、路由器、共享模块等参与处理的参数也需要算进去,具体数字要按模型报告的口径理解。
例如,DeepSeek-V3 技术报告说明模型总参数约为 671B,每个 token 激活约 37B。这个数字说明它采用稀疏计算,不能进一步推成“部署只需要装下 37B”。
不同模型即使激活参数相近,网络结构、上下文长度和算子实现也可能不同。参数量不是延迟测试的替代品。
没用到的专家,为什么还占存储?
因为后续 token 可能选中它们,下一次请求也可能需要它们。服务要保留调用这些专家的能力。
可以把专家分布到不同设备,让某张卡只存部分权重。但这时 token 要被发送到相应设备,算完以后再收回结果,通信也会消耗时间和带宽。
如果很多 token 都选中了同一个专家,那台设备会忙,其他设备却可能空闲。这就是负载不均衡的问题。训练和部署都需要考虑它,不能认为“专家多,设备自然就能平均工作”。
MoE 节省的是每个 token 必须经过的专家计算,不是免费取消了存储、传输和调度。

面试官继续追问
MoE 一定比稠密模型便宜吗?
不能只看参数就下结论。
在合适的批量和硬件上,稀疏计算可能有优势;但请求少、通信开销大或者专家分布不合理时,收益会变小。需要比较满足同一质量要求时的吞吐、延迟、显存和部署成本。
用户换一种语言,会固定进入另一个专家吗?
不一定。路由器可能学到语言或任务相关的模式,但这些模式不是简单的一张业务分类表。
如果没有对具体模型做分析,不能凭想象给专家分配中文、英文、代码等固定职责,更不能保证某个请求一定走某个专家。
激活参数少,会不会意味着表达能力更弱?
也不能这样直接判断。模型仍然拥有多个专家,并能对不同输入选择不同组合,容量与每次计算不是同一个指标。
最终能力需要用任务结果评测。激活参数提供了理解计算成本的一条线索,不能单独证明模型质量。
面试速记卡
- MoE:模型内部多个专家,路由器按 token 选择部分参与计算。
- 总参数:模型包含的全部权重。
- 激活参数:当前 token 实际计算涉及的权重,包含相应共享模块。
- 部署边界:未激活专家仍需存放,跨设备还有通信成本。
- 性能判断:结合负载、硬件、吞吐与延迟,不只比较参数数字。