想吐槽一下最近网上那波「128G MacBook Pro 本地跑 Qwen3.8-Flash-Next 爽翻了」。
模型本身没问题,问题是——你们真的把内存账算完了吗?
Q3 量化,内存就得吃掉接近 90G;IQ4 更是贴着 95G 往上走;上下文拉到 262K,整体内存占用直接 100G+。
然后再考虑 macOS、Metal、系统缓存,以及开发环境本身的内存开销。
你把 Docker 关了,Chrome 清了,IDE 关了,后台服务停了,甚至各种 sysctl 参数都调一遍,最后终于把模型“成功加载”了。
然后呢?
128G 还剩多少?
剩下十几二十个 G,真的够你日常开发吗?
Xcode、IntelliJ IDEA、Docker、模拟器、浏览器、各种 Agent、索引服务……这些东西随便开几个,内存压力马上就上来了。
所以我一直觉得:
「能跑起来」≠「用起来很爽」。
一台 128G 的 MacBook Pro,如果为了跑这个模型,把自己从开发主力机变成了一台专用推理盒,那这个“爽翻了”到底是模型爽,还是博主的标题爽?
本地部署当然值得玩,但别只晒一个“模型成功加载”的截图。
真正应该晒的是:
模型跑起来以后,我还能不能正常写代码、开 Docker、跑服务、开浏览器、跑 IDE,甚至边开发边让 Agent 干活?
如果这些都能正常干,那才叫——
128G MacBook Pro,本地部署爽翻了。
否则,充其量只能叫:
128G MacBook Pro,成功把模型塞进去了。🙂
Aug 31, 2026 · 12:22 AM UTC
1
1,761
