文章详情
随着模型参数量快速增长,超过单张 GPU 显存承载能力的情况越来越常见。对于超大规模模型(如百亿参数以上),仅靠数据并行已无法训练。这时,模型并行(Model Parallelism) 应运而生,它通过将模型本身拆分到多张 GPU 上进行计算,实现显存扩展和训练加速。 1. 模型并行概述 模型并行的核心思想是将模型本身拆分到多张 GPU 上,每张 GPU 只
3 阅读
请输入邀请码解锁全文内容