文章详情
一、背景与挑战 LoRA 通过低秩分解减少微调参数,大幅降低训练资源需求,但面对超大模型(百亿参数及以上)时,显存仍然紧张。 这是因为: 大模型原始权重和激活仍占用大量显存; 传统 16/32 位浮点训练难以在单卡或小规模集群上运行。 为此,社区尝试引入量化技术,将模型权重压缩至更低比特表示,减少显存占用。 QLoRA 正是将 LoRA 和 4-bit 量化
4 阅读
请输入邀请码解锁全文内容