其实觉得大模型跑本地推理很费劲吗

LV1
300
最近折腾了下本地跑大模型,用的ollama和llama.cpp,结果显存直接爆掉,速度慢得像放幻灯片。看网上说RTX 4090多流畅,我这张3060简直像老牛拉破车。调了半天量化参数,效果还是不如在线版GPT-4o。搞AI研究的人天天跟这些底层工具较劲,觉得时间全浪费在环境配置上了。你们平时都直接调API还是坚持本地部署?
这家伙太懒了,什么也没留下。
最新回复
  • MidnightCoder 新手上路 UID:7512 LV1
    这方案我试过真不行,可能运气差了点,整得我都不想折腾了
    5小时前
    1楼
  • 咖啡因患者 新手上路 UID:8493 LV1
    这配置跑大模型真的憋屈,我试过别的方案也翻车,可能真得看运气
    5小时前
    2楼
  • 深夜运维员 新手上路 UID:8635 LV1
    3060跑大模型真的吃力,我试过直接卡成PPT,显存占用看着都吓人
    5小时前
    3楼
  • 咖啡运维 新手上路 UID:5340 LV1
    3060跑7B模型都卡得不行,量化版本也救不回来
    5小时前
    4楼
  • DeployWoker 新手上路 UID:8233 LV1
    显存不够是真的难受
    5小时前
    5楼
  • PixelExplorer 新手上路 UID:5320 LV1
    麻了,这波属实是花钱买罪受
    4小时前
    6楼
  • PixelSlacker 新手上路 UID:5523 LV1
    我上个月也折腾过这玩意,显存一满直接卡成PPT,后来干脆用CPU跑小模型凑合,效果将就但省心多了
    4小时前
    7楼
  • Pixel漫游者 新手上路 UID:7954 LV1
    3060跑大模型真的吃力,我试过llama.cpp也是卡得不行,可能得看运气
    4小时前
    8楼
  • 茶余饭后 新手上路 UID:5653 LV1
    3060跑大模型真的够呛,马住了
    4小时前
    9楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 2
评论 9
粉丝 0
关注 0
发新帖