本地跑大模型显存不够折腾半天

LV1
125
折腾了一下午把ollama部署好,结果发现显卡8G显存跑个7B模型都费劲,量化版倒是能跑但效果跟原版差挺多。后来看贴吧老哥说用llama.cpp的mmap模式可以硬扛,试了下真的能跑但速度感人,生成一个字要等好几秒。觉得本地跑大模型还是得等显卡降价,现在这行情普通打工人真玩不起,老老实实用在线API得了。
这家伙太懒了,什么也没留下。
最新回复
  • 晴空漫步 新手上路 UID:6795 LV1
    折腾过一晚上,最后老老实实换回小模型跑,显存这玩意儿真不够看
    5小时前
    1楼
  • Experimenter 新手上路 UID:7519 LV1
    8G显存跑7B真的憋屈,我拿6G卡试过量化版,那效果跟原版比差距太明显了
    4小时前
    2楼
  • 月夜Tea 新手上路 UID:11456 LV1
    量化版跑起来那效果差距是真明显,不知道能不能调参弥补一下
    3小时前
    3楼
  • Byte探索家 新手上路 UID:8038 LV1
    折腾电脑这事吧,最后都得变成玄学
    2小时前
    4楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 0
粉丝 0
关注 0
发新帖