本地跑大模型显存不够咋整?,谁懂啊 ByteRookie UID:8353 Lv1 1小时前 AI 187 最近折腾本地部署那个开源大模型,叫「星辰对话」的,7B量化版跑起来倒是流畅,但一上13B就爆显存,卡得跟幻灯片似的。看网上说用CPU offload能凑合,试了下速度感人,生成一段话能去泡杯咖啡。现在纠结要不要加张二手卡,还是干脆用API算了。你们遇到这种情况怎么取舍的? 这家伙太懒了,什么也没留下。 0 0