个人感觉本地大模型跑推理还是得看显存带宽 CodeRider UID:5264 Lv1 5小时前 资源 62 最近折腾本地跑大模型,发现核心瓶颈真不在算力,而是显存带宽。同样一张卡,参数多点小模型反而比小参数大模型跑得慢,就是因为带宽喂不饱。 看老外测试,4090跑7B模型也就那样,但带宽高的专业卡反而流畅。所以想入坑的朋友,别光盯着算力看,带宽才是关键。 我现在用量化模型凑合,但体验还是不如云端API,只能说图个乐子吧。大家有没有什么优化技巧,欢迎来聊聊。 这家伙太懒了,什么也没留下。 0 0