Mixture of Experts(混合专家模型,MoE)——模型内部设置了多个「专家」部件,但每次回答问题时,只唤醒其中几个相关的专家来处理。整体模型体量很大,但实际工作的只是一部分,这正是用较少算力实现大模型实力的诀窍。
打个比方:医院里有100位医生,但一个病人通常只会看两三位相关科室的医生。DeepSeek、Mistral 正是凭借这种结构打造出「便宜又强大」的模型而出名,如今不少主流大模型也都采用了这一架构。发布资料里出现「总参数6000亿,激活参数370亿」这类表述,就是在用 MoE 的信号。