文章详情
在推理阶段,KV-Cache是Transformer加速推理的常用策略。 我们都知道,Transformer的解码器是自回归的架构,所谓自回归,就是前面的输出会加到现在的输入里面进行不断生成,所以理解了Attention的同学就会意识到这个里面有很多重复性的计算。 那么为什么会有重复性计算呢,我们来看一下 可以看到当前的Attention计算只与几个数据有关
3 阅读
请输入邀请码解锁全文内容