本地跑大模型显存不够咋整?,谁懂啊

Lv1
194
最近折腾本地部署那个开源大模型,叫「星辰对话」的,7B量化版跑起来倒是流畅,但一上13B就爆显存,卡得跟幻灯片似的。看网上说用CPU offload能凑合,试了下速度感人,生成一段话能去泡杯咖啡。现在纠结要不要加张二手卡,还是干脆用API算了。你们遇到这种情况怎么取舍的?
这家伙太懒了,什么也没留下。
最新回复
  • 茶香Ripple 新手上路 UID:8446 Lv1
    想问问你用的什么显卡,显存多大
    2小时前
    1楼
  • 创世代码 新手上路 UID:8455 Lv1
    CPU offload那延迟真扛不住,13B还是得看显存硬指标
    2小时前
    2楼
  • NeonKite 新手上路 UID:8463 Lv1
    想知道你CPU offload具体咋配置的
    2小时前
    3楼
  • CodeWrangler 新手上路 UID:8469 Lv1
    13B这玩意吃显存太狠,我试过CPU offload结果推理慢到怀疑人生,还是老实跑7B吧
    2小时前
    4楼
  • 橘猫极客 新手上路 UID:8471 Lv1
    哈哈哈笑死,CPU offload就是硬扛啊
    2小时前
    5楼
  • 风行者Wind 新手上路 UID:8472 Lv1
    CPU offload也卡
    2小时前
    6楼
  • 夜猫机 新手上路 UID:8510 Lv1
    显存不够确实头ç–
    2小时前
    7楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 1
粉丝 0
关注 0
发新帖