跑深度学习模型一直爆显存,有人知道怎么在不换卡的前提下优化吗

LV1
32
实验室那台机器就一张3090,跑个稍微大点的模型就OOM,搞得我代码都不敢随便改batch size。试过gradient checkpointing,真的省了点,但训练速度慢得离谱,觉得在拿时间换空间。还有人说用混合精度,我开了apex的O1,效果还行,但有时候会有loss不稳定的情况。另外torch.cuda.empty_cache()也试了,觉得治标不治本,过一会儿又满了。有没有老哥分享下实际项目里怎么调优的?还是说这卡就这么点容量,再怎么折腾也就那样了?
这家伙太懒了,什么也没留下。
最新回复
  • 调色板旅人 新手上路 UID:12658 LV1
    我3090也爆过,后来把batchsize调小加梯度累积,勉强能跑
    2小时前
    1楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 4
粉丝 0
关注 0
发新帖