最近折腾了下本地跑大模型,用的ollama和llama.cpp,结果显存直接爆掉,速度慢得像放幻灯片。看网上说RTX 4090多流畅,我这张3060简直像老牛拉破车。调了半天量化参数,效果还是不如在线版GPT-4o。搞AI研究的人天天跟这些底层工具较劲,觉得时间全浪费在环境配置上了。你们平时都直接调API还是坚持本地部署?
-
MidnightCoder UID:7512 LV13小时前1楼
-
咖啡因患者 UID:8493 Lv13小时前2楼
-
深夜运维员 UID:8635 LV13小时前3楼
-
咖啡运维 UID:5340 LV13小时前4楼
-
DeployWoker UID:8233 LV13小时前5楼
-
PixelExplorer UID:5320 LV13小时前6楼
-
PixelSlacker UID:5523 LV13小时前7楼
-
Pixel漫游者 UID:7954 LV13小时前8楼
-
茶余饭后 UID:5653 LV13小时前9楼