本地大模型跑起来:2025 年消费级显卡推理避坑清单
想在自己电脑上跑大模型,先搞清楚显存、量化与推理框架的关系。这份清单记录了我在三台机器上踩过的坑。
过去一年,「本地跑大模型」从极客玩具变成了很多人的日常工具。但真正动手过的人都知道,坑比想象中多。

三个先决问题
第一,显存够不够。 模型的显存占用大致与参数量和量化位数成正比,7B 模型在 4 位量化下大约需要 5-6GB。8GB 显存可以跑 7B,16GB 能舒服地跑 14B。
第二,量化选哪种。 常见的 4 位量化在质量与速度之间比较平衡,2 位量化省显存但明显变傻。别为了塞进显卡而过度压缩。
第三,框架怎么选。 只推理用现成的一体化工具最省事,要自己调参数再考虑更底层的方案。

常见的五类问题
- 模型加载失败或直接爆显存;
- 首 token 等待时间过长,交互体验差;
- 上下文一长就崩;
- 中文能力明显不如在线服务;
- 风扇狂转、机器发烫降频。
免费部分讲到这里
上面三节足够你判断自己该不该在本地跑模型。而真正决定「能不能长期用下去」的,是参数配置、显存管理与场景选择——这部分我写在了付费内容里。