#P3658. 第3题-支持LoRA的Attention实现
第3题-支持LoRA的Attention实现
题目内容
相对于全量微调,微调提出了一种低秩分解的方法,只需在原模型参数基础上增加少量的可训练参数,大幅降低计算成本和内存占用。具体而言,对于原始的预训练权重矩阵,做以下改进:
为原始权重(冻结不变),和 为新增的低秩矩阵,,秩一般很小。微调时只更新 这两个矩阵,显著减少训练的参数数量。请实现支持的计算
相对于全量微调,LoRA微调提出了一种低秩分解的方法,只需在原模型参数基础上增加少量的可训练参数,大幅降低计算成本和内存占用。具体而言,对于原始的预训练权重矩阵W,LORA做以下改进:
Wq′=Wq+B×A
Wq为原始权重(冻结不变),B∈Rd×r和 A∈Rr×d为新增的低秩矩阵,r<<d,秩r一般很小。微调时只更新 A、B这两个矩阵,显著减少训练的参数数量。请实现支持LoRA的Attention计算
By signing up a CodeFun2000 universal account, you can submit code and join discussions in all online judging services provided by us.