文章详情
MOE混合专家架构 随着大语言模型(LLM)参数规模从十亿级增长到千亿、万亿级,如何在保持性能的同时节省算力,成为研究的核心问题。 MoE(Mixture of Experts, 混合专家)架构正是在这种背景下应运而生。 MoE 的核心理念是:“模型的每个输入,只激活部分模块,让神经网络在每一次推理中‘用一部分大脑’。” 这大大减少了计算量,同时还能保持甚至
3 阅读
请输入邀请码解锁全文内容