#P3658. 第3题-支持LoRA的Attention实现

第3题-支持LoRA的Attention实现

题目内容

相对于全量微调,LoRALoRA微调提出了一种低秩分解的方法,只需在原模型参数基础上增加少量的可训练参数,大幅降低计算成本和内存占用。具体而言,对于原始的预训练权重矩阵WWLORALORA做以下改进:

Wq=Wq+B×AW_q'=W_q+B×A

WqW_q为原始权重(冻结不变),BRd×rB∈R^{d×r}ARr×dA ∈R^{r×d}为新增的低秩矩阵,r<<dr<<d,秩rr一般很小。微调时只更新 ABA、B这两个矩阵,显著减少训练的参数数量。请实现支持LoRALoRAAttentionAttention计算