AI 新词情报站 — 追踪 AI 领域新概念与新工具,每个词条都有论文、代码、社区讨论构成的交叉验证证据链

mixture of experts

概念词 📚 基础词库 · 存量热词

混合专家

🔍 Google 联想 10 📄 arxiv 3565 篇 📅 首次出现 2026-08-28

🧠 mixture of experts 是什么

混合专家(Mixture of Experts,MoE)架构包含多个并行的"专家"子网络和一个路由器:每个输入 token 被路由到其中少数专家(如 Top-2)进行计算,其余专家保持休眠,从而以稀疏激活获得超大容量。

2022 年谷歌 Switch Transformer 证明 MoE 在同等算力下训练效率更高;2024 年 Mixtral 8x7B 与 DeepSeek-V3(总参数 671B、单 token 激活 37B)把 MoE 推向主流,成为万亿参数时代兼顾容量与成本的架构答案。

MoE 的代价是显存占用大(全部专家参数都要装载)、路由负载不均与专家坍缩等问题,常需辅助损失与负载均衡设计来保障训练稳定。

🔥 为什么现在火

万亿参数竞赛中,MoE 是"用稀疏换容量"的核心方案,多款旗舰开源模型的 MoE 架构引发社区热烈讨论。

📄 证据链(交叉验证)

🔍 搜索形态

what is mixture of experts mixture of experts LLM meaning

mixture of experts 常见问题 FAQ

MoE 模型参数很大,为什么推理还快?+

因为每个 token 只激活少数专家,实际计算量远小于总参数量,容量与效率得以兼顾。

MoE 和稠密模型怎么选?+

稠密模型每个 token 用全部参数、效果稳定;MoE 在同等推理成本下有更大容量,但工程复杂度与训练难度更高。

与 mixture of experts 相关的搜索

人们搜索 mixture of experts 时,还会关心这些问题:

  • 混合专家 是什么
  • 什么是 混合专家
  • 混合专家 是什么意思
  • 混合专家 原理
  • 混合专家 有什么用
  • 混合专家 应用场景
  • 混合专家 为什么火
  • 混合专家 2026

相关词条

更多概念词:同类新词