微调大模型踩了一整天的坑,loss死活不降,聊聊这个 星夜Starry UID:7824 Lv1 4小时前 AI 104 试了各种学习率、warmup比例,甚至把batch size从4调到32,loss就是卡在2.3左右纹丝不动。后来发现是数据预处理的问题,tokenizer没加padding mask,导致attention把padding位置也算了进去。改完之后loss直接掉到1.1,真想抽自己。还有个坑是梯度累积的时候忘了除以累积步数,学习率虚高,怪不得发散。记录一下,免得下次再犯。 这家伙太懒了,什么也没留下。 0 0