文章详情
一、引言 Transformer 架构中,注意力机制是性能瓶颈所在。虽然 FlashAttention 1 已大幅降低了显存和加速计算,但在实际大模型训练中,它仍存在几个重要问题: 线程并行效率不高:FlashAttention 1 的并行粒度设计不当,导致 warp 内线程使用率不足; 支持模式受限:不支持如 Multi-Query Attention (
3 阅读
请输入邀请码解锁全文内容