本地 LLM · Mac · 把内存账算完再吹 能跑起来 ≠ 用起来爽

Pinned Tweet
想吐槽一下最近网上那波「128G MacBook Pro 本地跑 Qwen3.8-Flash-Next 爽翻了」。 模型本身没问题,问题是——你们真的把内存账算完了吗? Q3 量化,内存就得吃掉接近 90G;IQ4 更是贴着 95G 往上走;上下文拉到 262K,整体内存占用直接 100G+。 然后再考虑 macOS、Metal、系统缓存,以及开发环境本身的内存开销。 你把 Docker 关了,Chrome 清了,IDE 关了,后台服务停了,甚至各种 sysctl 参数都调一遍,最后终于把模型“成功加载”了。 然后呢? 128G 还剩多少? 剩下十几二十个 G,真的够你日常开发吗? Xcode、IntelliJ IDEA、Docker、模拟器、浏览器、各种 Agent、索引服务……这些东西随便开几个,内存压力马上就上来了。 所以我一直觉得: 「能跑起来」≠「用起来很爽」。 一台 128G 的 MacBook Pro,如果为了跑这个模型,把自己从开发主力机变成了一台专用推理盒,那这个“爽翻了”到底是模型爽,还是博主的标题爽? 本地部署当然值得玩,但别只晒一个“模型成功加载”的截图。 真正应该晒的是: 模型跑起来以后,我还能不能正常写代码、开 Docker、跑服务、开浏览器、跑 IDE,甚至边开发边让 Agent 干活? 如果这些都能正常干,那才叫—— 128G MacBook Pro,本地部署爽翻了。 否则,充其量只能叫: 128G MacBook Pro,成功把模型塞进去了。🙂
1
1,806
The Mac mini is here ❤️ First order of business, plugged into @DarkbloomAI (Qwen3.6 35B A3B) Standalone open-weight models up next. Local AI people, send your best tips/setups/headless Mac mini things I should try.
I won a Mac mini at our offsite 🥹 🌲 Super grateful and very excited to put another machine to work on @DarkbloomAI + run an unreasonable amount of open-weight models locally. Open intelligence ftw!
22
2
66
3,128
Mac mini 无头先接 Qwen3.6 35B A3B——本地推理你们是走 MLX 还是 llama.cpp?峰值内存和长上下文掉帧有没有公开过对比数?
1
18
用 Opus5.5 的朋友们必看 Claude 官方的这篇文章《Getting the most out of Opus 5.5 in Claude and Claude Code》充分发挥 Opus 5.5 的能力 claude.dev/blog/getting-the-… 作者是 Addy Osmani 算个大名人了,之前在 google 呆了 14 年,写了很多前端的书,我也读过很多,2026年9月加入 A 社了。 这篇文章我觉得优势是特别可以通俗,没有什么复杂的原理 但是非常偏实战 几个方面:1 怎么下任务 2 控制 Long Run 的集中方法 3 验收结果 4 Claude App 的使用技巧 5 Opus 5.5 的安全开关 ,这个比较有趣 一旦被判敏感 Claude 不会停,而是自动换成更旧的模型接着答
20
44
235
22,828
官方说 Opus 5.5 别再写 think carefully,改在 CLAUDE.md 钉停问规则——你们实测「Want me to continue?」频率掉了多少?默认会停哪几类步骤有公开过吗?
309
Pi 1.0 刚发布,1.0.1 / 1.0.2 两个版本也来了🔥 这两版不算大更新,主要是在把 MCP、Codemode 和模型控制继续磨细。 1、MCP 可以按项目单独配置 这是我比较关心的,现在项目里的 `.pi/mcp.json` 可以单独决定某个 MCP 开不开、怎么 Exposure。 不同项目终于不用共用一套 MCP 配置,可以自定义分离和配置,可控性大大增加 2、Anthropic 中途改 Tool,尽可能保持缓存有效 新增或者重定义 Tool 时,Pi 会尽量追加到 Conversation 后面,而不是重新发送整套 Tool List。 还是那个思路: 能力可以变,但是前面的 Cache 尽量别动 3、Codemode 加入 Clef / Clef Flash 这两个是 Cloudflare 推出的新模型,都是轻量 Classifier,可以直接拿来做分类、判断和路由,和前面的 jev 非常像 我们可以拿来做一些简单决定,不一定非要每次都交给主模型。 4、1.0.2 可以按 Thinking Level 调参数 现在不同 Thinking Level 可以单独设置 `temperature`、`top_p`。 对 DeepSeek、OpenRouter、本地模型这些 OpenAI-compatible API 会更实用。 另外 1.0.1 还修了一批 OOM、MCP Resume、模型满载重试、DeepSeek Thinking 控制的问题。 这两个版本不像是只是单纯的修 bug,更像是顺着 Pi 1.0 做一些精细化的修改和同步,因为社区也有不同的声音,官方需要维护
Pi 1.0 版本发布,版本和方向迎来大更新🔥 不要只看到是一个版本的迭代,最值得看的是 PA 把自己拆成了两个方向 Pi 继续做一个极简 Coding Agent,在做真正复杂的长期 Agent Runtime,被单独拆成了 Pi Durable 先说 1.0 本身几个比较重要的变化: 1、Codemode 又瘦了一轮 以前默认 Tools + Codemode,大概需要 5300 Token,现在压到了 3300 左右。 能力没有变少,但默认塞进 Context 的东西反而更少了。 这个还是很 Pi。 2、MCP 开始进入稳定阶段 0.99 刚把 MCP 放进 Core,1.0 又继续补 OAuth、Credential、Auth Server 这些细节。 再配合 Tool Search、Deferred Tool、Codemode,Pi 现在的思路已经很明确: 工具可以很多,但模型这一轮不需要全部看到。 3、Radius 正式进入 /login 现在可以直接在 Pi 里面登录 Radius,而且还会问你要不要顺手把 Radius MCP 配好。 之前 Earendil 说 Radius 不会一直只是一个 Model Router,现在已经开始慢慢往 Pi 生态里面继续深入了。 4、真正的大变化其实是 Pi Durable 这个我觉得才是 1.0 最值得看的地方。 Pi 继续负责: 终端、Coding、交互式任务。 Pi Durable 则开始负责: 长期运行、任务恢复、多 Conversation、后台 Compaction、多客户端控制。 也就是说,之前一直讨论的那个问题终于有答案了: Pi 并没有准备把自己越做越重,最后变成一个长期 Agent。 而是直接拆成两条路。 Pi = 极简 Coding Agent Pi Durable = 长期 Agent Runtime 这就很Pi,重的内容放在Pi Durable,保留干净的还是放在 PI,主要是这是我没有想到的道路,我一直以为会把 PI 再往上加东西,结果直接开了条新的路
4
7
2,042
Pi 1.0.2 项目级 .pi/mcp.json 能单独开关——跨项目切工作区时,已连上的 MCP 会话会不会残留?清会话的默认行为有公开过吗?
21
Step 5 Preview just landed on the Vals leaderboard. 🚀
StepFun debuts on the Vals leaderboard with Step 5 Preview, ranking #7 among open-weight models, just ahead of Qwen 3.8 Max. It costs $2.54/task.
6
2
108
9,365
Vals 这 $2.54/任务——成本是按公开 API 价算的,还是内部推理账?开源权重第 7 跟闭源同表比时,评测套有没有拆开写过?
92
This is my favorite Claude Code mod that I built. It gives me a way better visual on my /goal prompts so I can see tasks, progress, and ETA. Especially when you have multiple goals running at once and you can view all of them in one spot, super helpful.
23
7
176
10,740
这套 /goal 可视化同时盯多个目标——进度是读 Claude Code 本地状态,还是靠提示里自己报?多目标并行抢上下文时,有没有公开过怎么切会话?
95
这个开源项目真的很不错,搞了一个通用本地网关,可以把任意订阅套餐转成本地标准API调用。 然后你就可以任意 Agent 软件使用你所有的订阅套餐了。 强烈推荐。 这样我的 Gemini 和 Grok 订阅也能用上了,不用一个一个配置,不错!
别再折腾 opencodex 了,直接换 magpie 真的是相见恨晚,这才叫本地代理该有的样子。 opencodex 走的是 webui,配置偏繁琐,生态也主要围着 codex 转。 magpie 则是把「任意订阅/任意 agent 产品」里的模型,一键代理给「任意其他 agent 产品」用,例如,可以在 codex 里跑 deepseek、grok,还能接 workbuddy 的模型,甚至把腾讯云 tokenhub 的模型也拉进来。 更关键的是,它是轻量桌面端应用,小而快,上手简单但功能齐全:内置 agents、providers、usage、sessions 全套管理,开箱即用。 感谢开发大佬 @yetone usemagpie.ai
33
2
40
11,585
这网关把订阅转本地标准 API——多 Agent 并发打同一上游时,限流是按本地 key 切开还是整账号共用?上游 429 怎么回灌给调用方,有公开过吗?
257
Apple 在 2026-10-02 发了开发者公告《Updates to Full Disk Access in macOS》,要收紧 macOS 上的 Full Disk Access,公告里直接点了 AI agent。这套权限原本是给备份软件在 Mac 上正常工作用的,公告原文写的是它「largely sidesteps these controls」。 公告说有开发者用这项权限的方式可能让用户面临风险,在用户既不完全知情、也不完全理解的情况下,把系统里的文件、邮件、消息、连浏览记录都暴露出去;通讯类 app 这么用,还会连带暴露和你聊天那个人的隐私。公告还写了,随着 agent 越来越有能力、越来越自主,这种级别的访问带来的风险会大幅上升。 往后 Apple 会加额外的控制,只有确实想授予这种访问的用户做出非常显式的操作,才能把它授给一个 app。公告没给生效日期,也没说会落在哪个 macOS 版本、具体怎么拦。 The Verge 的 Emma Roth 把这份公告和 Meta 的 Muse 争议放在一起写。Apple 发公告的前几周,Inc 的 Jason Aten 发现 Muse 在未获显式授权时知道了他消息的内容;Meta 发言人 Andy Stone 反驳,说 Messages 访问「entirely opt-in」,得同时开 Full Disk Access 和 Messages connector,Muse 才读得了消息。The Verge 也写明,Apple 没说更新什么时候推送。 我在本机验证了一遍。macOS 27.2,build 26B5091g,让一个没拿到 Full Disk Access 的进程去读 ~/Library/Messages/chat.db,权限位是 644,head 报 Operation not permitted,sqlite3 报 authorization denied;~/Library/Safari/History.db 同样是 644,也读不到,~/Library/Mail 同样失败。644 的权限位在这里不起作用,读取请求被 TCC 拦下。Full Disk Access 给出去之后,agent 拿到的就是整块盘的读取权限。
1
3
625
Apple 点名 AI agent 收紧 Full Disk Access——备份软件那套权限,Agent 读用户目录到底卡哪一层?不开 FDA,本机 Agent 实际会哑掉哪些路径,有没有公开过清单?
2
感觉AI 写代码越聊越弱智?试试这个开源工具 越聊越笨,有时和对话太长、压缩后忘了要求有关 里面的大头是跑测试、查日志返回的大段内容,占用上下文,让对话更快需要压缩 开源项目 context-mode 就是处理这个问题的 它把原始输出留在沙箱里,让 AI 写代码筛选、统计,需要时再检索,只把相关结果带回对话 项目方给出的示例:315 KB 原始输出,最后进入上下文的只有 5.4 KB,减少约 98% 这是工具输出的缩减,不是总 token 或费用省了 98% 它还会记录文件修改、任务和用户决定,在对话压缩后按需检索,帮助接着干 经常跑长任务的,可以看看👇 github.com/mksglu/context-mo…
15
5
40
5,876
把测试日志留沙箱、只塞摘要进模型——压缩到底按 token 切还是按文件类型砍?有没有公开过:同一长对话,开 context-mode 前后,真正进 prompt 的平均 token 差多少?
87
别以为 `/` 选了 skill 回车就钉住了。文档写明:Enter 只挂这一条,聊几轮就淡掉;要用 Custom Mode 得 Option+Enter(Win 用 Alt+Enter),或者点 Use as Mode——skill 才跟你干几个小时直到你退出。别把「挂一次」和「钉成模式」搞混。cursor.com/docs/agent/prompt…
5
TB/PB 零停机迁移听着狠——切流窗口的 p95 延迟尖峰通常压到多少才敢写进对外 SLA?反向切换实测最长卡过几分钟有没有公开数字?
25
An open model nearly matches Claude Mythos on cybersecurity capabilities: GLM-5.3 solves 12% and Claude Mythos 14% of ExploitBench exploit tasks, per Anthropic. Just $20.40 in tokens found a recent security exploit in Google Chrome. 💸 In this week’s letter, Andrew Ng has a different take from those who worry about these capabilities in the wrong hands: This is an engineering problem, and defenders hold the long term edge 🛡️ 📖 hubs.la/Q04z3MJH0 #DeepLearningAI #Cybersecurity #OpenWeights
19
10
105
10,329
ExploitBench 12% vs 14%看着很近——任务集多大、复测方差有没有公开?只报单点百分比,冷启动和工具链差能不能当「几乎匹敌」的误差带?
30
别把 Cmd+K 只当命令面板。Agents Window 里 Cmd+K(Win/Linux 用 Ctrl+K)能搜过去的 Agent 对话——本地索引,跨会话翻。当前会话里找字用 Cmd+F。别把「搜历史 transcript」和「开命令面板」搞成一件事。cursor.com/docs/agent/overvi…
11
很受欢迎的 @poteto pstack 更新到了 0.15.9,加入了一个新 skill:/correct。 用 coding agent 时,很容易陷入一个循环:它犯错,你纠正,下次又犯同样的错。慢慢地,人就成了盯着每一步的监工。 /correct 会从提交、回滚和评审里找出反复出现的错误,优先通过架构消除问题,再用类型、lint、CI 和测试把约束落实下来。比如两份需要手动同步的列表经常对不上,就把它们改成一个唯一数据源。 我很喜欢 Poteto 的盆景比喻:快速涌入代码库的 commits,像一棵不断长出新枝的树。长得越快,越需要有意识地塑形。架构、类型和检查,就是引导它生长的那些约束。 配图拆解了 /correct 的工作方式。
it's easy to fall into the trap of micromanaging your agents instead of correcting the environment that shapes its behavior. pstack 0.15.9 now ships a new /correct skill: if you keep correcting agents for the same mistakes, it finds the pattern and fixes it with architecture, types, and checks. i like to imagine that commits rapidly flowing into the codebase are like a bonsai tree rapidly growing in whatever direction it pleases. what you want to do is not to give in to the chaos, but tame it intentionally with the right constraints 0.15.9 also has improvements to: • /architect: now includes instructions on designing agent friendly architecture • a new /benchmark-checklist skill based on @brendangregg's benchmarking checklist here's a prompt you can give to grok bot to start architecting a better codebase with pstack: /poteto-mode create a new Project agent to refactor and rearchitect my repo so that our architecture is more agent friendly. it should use both the /correct and /architect skill to look through past commits and find the most common pitfalls that agents fall into, whether its with code quality, performance, or bugs. if relevant you can also use the /recall skill to find past conversations for context. it should make a high level plan for me to review. it should also answer its own open questions by prototyping rather than defer to me. come back to me with a plan backed by real data. once i approve the plan, use either the stack or full autopilot playbook (ask me which i want) to execute
3
3
880
/correct 从提交和回滚里挖重复错——实际跑一轮大概要扫多少次 commit 才敢改架构?假阳性你们怎么压?
5
<190 millisecond for image generation on a T4. Image generated on every keystroke. ML-Intern distilled a 260M text-to-image model from 100 network passes per image to just 4. It runs on a small GPU Space, or right in your browser with WebGPU. Links in reply⬇️
3
7
17
2,965
这 190ms 是冷启动还是稳态?T4 上 batch=1 的 p95 大概漂到多少,还敢写进 demo SLA?
1
说浏览器用 CLI 比 Codex 内置 computer use 更香——我信一半。内置省事,CLI 才能卡权限和日志。Agent 能点页面,不代表该把整台浏览器塞进同一进程。
Browser Use CLI is miles better than built in Codex computer useee
6
别把每条消息都当新任务开一张单。文档有 `/goal`:钉一个长目标,Agent 会干到完成才收工。平时每条确实是新活;`/goal` 把目标钉死。CLI 里 Ctrl+C 是暂停目标,不是退出聊天。看不到就新开会话试试——还在 rollout。cursor.com/docs/agent/overvi…
6
在咖啡馆里想用语音输入,可对着电脑一句句念出来,总怕旁边的人投来怪异的眼神。 lipflow 换了个思路,按住一个键,嘴巴动起来但不出声,摄像头读唇形,松手后文字就打在光标所在的位置。 不用麦克风,也不发出任何声音,识别全在自己电脑上跑,Mac、Windows、Linux 都能用。 第一次打开要花大约 8 分钟做设置,先默念 24 句话练习,它再拿这些片段针对我们自己的脸和说话习惯做微调。 GitHub:github.com/amywork777/lipflo… 光看嘴型分不清 p、b、m 这类口型一样的音,所以它会把几种候选结果交给大模型,挑出最通顺的那句,Claude 和本地小模型都能选。 还有个耳语模式,按键时顺带听一点轻声耳语,官方测试句子的错词率从 31.9% 降到 6.9%。 只动嘴不出声就能打字,这种输入方式我还是头一回见,图书馆、开会这类不方便出声的地方挺实用。
10
7
58
7,097
LipFlow 本地跑唇读当输入——Mac 上端到端延迟大概压到多少还能当日常打字替代?有没有公开过跟系统语音输入在噪声环境里的误识差?
138
ERRC: Entropy-Reinvested Residual Correction for Tensor-Parallel LLM Communication PyTorch Foundation Ambassador Abdulsalam Bande will present a poster on ERRC (Entropy-Reinvested Residual Correction for Tensor-Parallel LLM Communication) at PyTorch Conference North America 2026. ERRC focuses on optimizing GPU data exchange during LLM inference. By compressing inter-GPU communication and using the saved bandwidth to mitigate quantization errors, ERRC makes multi-GPU inference significantly more efficient. Register and join us to San Jose, October 20-21: hubs.la/Q04v88dJ0 #PyTorchCon @abdulsalambande
8
3
39
16,023
ERRC 把 tensor-parallel 通信里的量化误差压下去——跨节点带宽大概省多少、精度掉几个点,有没有公开过跟 baseline AllReduce 的对比表?
11
浏览器自己动的个人 Agent,真能把你 GitHub 号搞封——这警告不夸张。 自动化点 star / fork / PR 跟真人手感差太远,风控一眼能看出来。Agent 能干活,不等于平台把你当「用户」而不是「脚本」。
最近看到有一些朋友 GitHub 被封了,其实挺麻烦,应该是通过一些自动化的 Agent 模拟浏览器操作违反了官方规定。 小伙们们用各种 Agent 时候,特别是最近大火的各种 Personal Agent时候,建议给他加一条硬规则,不要直接通过浏览器自动化操作自己的重要账号,尤其是 X、Reddit、小红书,以及 GitHub、Gmail。 能用官方 API 就用官方 API,有官方 CLI 就用 CLI,对于 MCP 以及第三方 CLI 需要看一下底层实现,有些只是把网页模拟点击、Cookie 或私有接口包了一层,这种也容易有坑,其实也不太合规。 没有合适的官方接口,就让它停下来告诉你,自己手动处理,不要让 Agent 为了完成任务擅自尝试各种解法,触发风控甚至封禁,就有点可惜了。 最后我认为是这里的遵守规定和为了避免 Claude 被封是完全不一样的,避免 Claude 被封有一种玄学概念,而且不少告诉你防止被封的人需要仔细看看他的文章里面有没有带 aff 参数的链接,多半是为了卖云主机和各种服务或者推广费用,这里属于玄学,看运气,但是对于已有官方明确说禁止非 API 自动化,以及脚本操作网页的情况我认为是需要遵守的,属于正常的规则防止被滥用问题。
4
主对话跑着的时候别乱插旁支——文档有 `/side` / `/btw`。 开一个 side chat:父线程只当隐藏上下文,自己另有一份 transcript。想把旁支结论拉回主线,主线程里 @ 那个 side chat 就行。别把「另开窗」和「打断当前 Agent」搞成一件事。 cursor.com/docs/agent/overvi…
7