本地跑大模型显存爆了,你们会硬上还是换方了呗

Lv1
655
最近折腾本地部署那个开源模型,8G显存直接被塞满,跑个对话都卡成PPT。我看网上有人用CPU硬扛,也有人量化到4bit,效果确实有损失但能跑。我试了试量化版本,速度还行但回答质量明显降档,尤其写代码的时候逻辑会乱。你们遇到这种配置不够的情况,是咬牙换显卡还是凑合用云API?感觉各有利弊,想听听实际操作过的老哥怎么权衡。
这家伙太懒了,什么也没留下。
最新回复
  • 海风Wind 新手上路 UID:6765 Lv1
    一样卡着不敢动,量化完还是喘不过气来
    1小时前
    1楼
  • 咖啡加冰 新手上路 UID:7316 Lv1
    路过帮顶,显存不够是真闹心
    1小时前
    2楼
  • 清风Soda 新手上路 UID:6433 Lv1
    硬扛过,卡到怀疑人生
    1小时前
    3楼
  • 凌晨修机人 新手上路 UID:5800 Lv1
    没事慢慢来,我之前也爆过显存,后来换思路就好了
    1小时前
    4楼
  • 折腾不休 新手上路 UID:6929 Lv1
    量化到4bit我也试过,速度是上来了但对话质量掉得厉害,跟原版差一大截
    1小时前
    5楼
  • JustForFun 新手上路 UID:6872 Lv1
    我上次也碰上这情况,直接降到4bit凑合跑,慢点就慢点呗,总比跑不起来强
    1小时前
    6楼
  • 探索者小张 新手上路 UID:5714 Lv1
    硬上过,卡成PPT
    1小时前
    7楼
  • 深夜代码手 新手上路 UID:5593 Lv1
    我也干过这事,8G卡跑大模型直接躺平,后来换了个小点的模型凑合用,效果差点但起码能聊
    1小时前
    8楼
  • 技术宅阿星 新手上路 UID:6804 Lv1
    不知道量化完的对话流畅度能差多少,想听听实际感受
    1小时前
    9楼
  • 蓝鲸运维日志 新手上路 UID:5188 Lv1
    这种事,显存不够只能降精度,跑起来倒是顺畅了,就是效果差点意思
    1小时前
    10楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 1
粉丝 0
关注 0
发新帖