中年程序员|这个号每天聊 AI:新模型实测、工具推荐、大新闻追踪,只讲真能用的

pi v0.99 新增的 Codemode 允许模型写一段 JavaScript,把多次工具调用串起来或并行执行。 工具返回一大堆数据,也可以先筛出需要的部分,再交回模型,少往上下文里塞整屏输出。 对比如下: 普通模式:输入 8,562 token,耗时 6.66 秒 Codemode:输入 3,858 token,耗时 3.98 秒 两边都是 2 次模型请求、20 次并行读取。Codemode 这次主要少了进入模型上下文的中间数据,输入减少约 55%;
6
Codex Cloud 之前就有?我今天才发现 😂 之前没用过任何 cloud 功能,拿私人项目试了一把:腾讯 CloudBase 上的 4 个云函数+数据库,迁到云服务器,静态资源扔 CDN。1.5 小时、扫了 20 个文件,全程手机搞定,跑的还是 6.1 Sol 极高档,是真方便。 要说还差点啥:要是能录屏看自动化测试跑完,闭环就齐了。
21
Claude 哪天出生图,我立马从 GPT 换阵营。 之前选 GPT 就两个原因:响应快,加上生图。Claude 写东西再好,生不了图一直是硬伤。 但 GPT-6 的额度最近是真不够用,重度用两天就见底。Opus 5.5 一出,代码这块的天平又往 Claude 偏了。 现在卡住我的,就剩"生图"这一个功能。
1
43
搞懂 Muse 是怎么连上外部服务的,再决定给它开多大权限,其实就三层: ① 官方 connector:Gmail、Spotify、Apple Health 这些 Meta 官方做的,走标准授权,最省心。 ② 自定义 connector:有公开 API 的服务,Muse 现场给你写一个接上,密钥进独立存储。但注意 Meta 明确说了不审核这一层——方便和风险是一体的。 ③ 浏览器兜底:没 API 的网站,它直接开个 Chromium 替你点。最脆弱、token 烧得最贵,能不用就不用。 我的用法:日常只开第一层,第二层按需开、用完就关,第三层当一次性工具。你们呢,敢给 agent 开到第几层?
1
29
Muse、OpenClaw、豆包、元宝,根本不是一类东西,硬排一二三没意义。 豆包是“抖音那套”:3 月打通抖音电商全链路,9 月 17 日特斯拉 OTA 直接集成。元宝是“腾讯那套”:微信、QQ 音乐、腾讯会议全家桶,9 月刚上粤语播报。 Muse 是代办走得最远、摔得最疼的:9 月初 agent 能跨网站代购,9 月 20 日被 Amazon 以违反条款封了。OpenClaw 是极客玩具:7×24 常驻,能跑 Shell 接微信飞书,但得自己部署。 网购多用豆包,微信重度用元宝,想让 AI 跑腿就盯 Muse,极客自己搭 OpenClaw。
44
我给 Grok bot 扔了一个想法,之后全程几乎没参与,只等着看结果。它自己拉起 4 个专员——产品、原型、内容、实验,自己分工讨论,最后原型直接部署到 Cloudflare,Notion 项目页、Linear 任务、招募文案一次配齐。 multi-agent 以前都是论文里的 demo,这次我是真拿它跑了一遍 0→1 验证。它交付的是一个跑起来的项目:分工、排期、对外招募全包,细得像个真团队。 实话说,离直接上生产还有点距离,但从 PoC 到原型这一段,完全可以放心交给它。验证一个想法的成本,从"组个团队干一周"变成了"一句话"。 2026 年拼的不再是单个 AI 有多强,而是谁先把"AI 团队"变成生产力。Muse 还在卷单兵代办的时候,我已经让 AI 自己当 PM 了。 这种扔个想法、只等结果的模式,你们敢用在生产项目上吗?
21
GPT-6 Sol 和 Luna 发布,最狠的不是模型变强了,是 OpenAI 终于把 benchmark 换成了「多少钱办成一件事」。 AutomationBench 测的是 agent 跑完一整条 workflow(47 个工具,销售/财务/客服全覆盖):Sol 33.2% 成功率,$0.27 跑完一个任务;Claude Opus 5 是 26.9%,成本是它的 11 倍。 作为天天让 agent 跑长任务的人,这组数字比参数升级实在得多——试错成本降下来,长链条任务才敢放开跑。personal agent 的下半场,拼的可能不是谁更聪明,而是谁跑得起。 不过 vendor benchmark 都要打折看:OpenAI 的对比表里全是旧 Opus 5,而 Anthropic 同一天发布的 Opus 5.5 自称同项 40.0%。两家 CEO 十天前还说要一起"pace the frontier",转头就互相砸场子。这出戏,配得上今天的热搜第一。 你们现在用 agent 跑长任务,感觉最烧钱的是哪一步?
Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
31
OpenAI 凌晨直接把 GPT-6 Sol 和 Luna 放出来了,一句话总结:带着 Astra 的不少本事,价格直接砍半。 Sol 主攻重活(复杂代码 + agent 工作流),Luna 跑高频小任务,API 比 5.6 一代便宜 50%:Sol 是 $2/$10 每百万 token,Luna 更是 $0.10/$0.50。 Altman 亲自下场把话挑明:以后别只看 token 单价,要看"完成一个任务的成本"。这是在重写全行业的比价规则,等于逼所有对手跟牌。 对开发者最实在的一点:做 agent 应用终于不用全程烧 Astra 旗舰了,日常任务丢给 Sol/Luna,账单直接腰斩。
24
刚发现 Muse 有个被低估的功能:旁聊。 刚才在主聊里聊 X 推荐算法,聊出一堆有用的点,我随口说了句"把有用点转给 X 旁聊"。再打开 X 运营这个旁聊——5 条要点一条不少,全在那儿了。 不用复制粘贴,不用新开话题再把上下文讲一遍,主聊和旁聊之间可以直接传话。 这才是 AI 助手该有的样子:不是一个万能聊天框,而是一堆按话题分开的工作台。很多产品还在卷单次问答,Meta 已经开始卷"长期协作"了。 你们平时跟 AI 聊多话题是怎么管的?一个框聊到底,还是也分开?
16
Grok 4.7 发布,官方说 agentic tool use 强了 3 倍。但今天英文区吵得最凶的不是它有多强,而是到底好不好用。 一边是「几分钟做个游戏」的 demo 视频,一边是「useless in cursor」的 5.1K 赞吐槽——独立 benchmark 上它的 agentic coding 只有 26%,GPT-6 是 60%。 这说明 agent 竞赛的下半场已经不在模型参数里了:demo 强、workflow 拉胯,中间差的是 tool use 的稳定性和场景适配。 有意思的对照:Meta 的 Alexandr Wang 今天也在回应 Muse 的定位,"make AI accessible to way more people"。xAI 卷能力上限,Meta 卷普通人下限。最后谁赢,看的可能不是谁更聪明,而是谁先成为你的默认代理。
21
我现在每天通勤 40 分钟,全靠 Muse 把碎片时间用起来,一个真实场景: 1. 早上起床,让它生成今天的 AI 行业简报,不用自己刷新闻 2. 一键把简报转成播客音频 3. 开车路上听完,到公司已经比同事多知道三件事 相当于每天白捡 40 分钟学习时间。 附两个实拍: 图1:今天 Play 商店热门免费榜,Muse 排第一 图2:我刚兑换了朋友的邀请码,双方都拿到 10 亿 Muse 词元 想试试的话,注册后在「设置 > 兑换邀请码」填我的码:6RBB1B
26