文章详情
因为原始transformer中采用的是Multi-HeadAttention,要重复计算Key和Value的向量,导致消耗大量的计算资源,所以出现了前面我们介绍了transformer推理加速常用的方法KV-Cache,将相应的Key和Value进行缓存,大大减小了计算量。但是随着上下文长度的不断增大,KV-Cache需要的显存也就越来越大,最后直接爆炸。
3 阅读
请输入邀请码解锁全文内容