中年程序员|这个号每天聊 AI:新模型实测、工具推荐、大新闻追踪,只讲真能用的

pi v0.99 新增的 Codemode 允许模型写一段 JavaScript,把多次工具调用串起来或并行执行。 工具返回一大堆数据,也可以先筛出需要的部分,再交回模型,少往上下文里塞整屏输出。 对比如下: 普通模式:输入 8,562 token,耗时 6.66 秒 Codemode:输入 3,858 token,耗时 3.98 秒 两边都是 2 次模型请求、20 次并行读取。Codemode 这次主要少了进入模型上下文的中间数据,输入减少约 55%;
6
尊贵的 ultra 用户,说说你们 Gemini 4 Argon 实际效果如何
6
我8块钱18个月 pro 会员什么时候能用呢👀
Gemini 说了,想第一时间用 Gemini 4 argon 需要升级 Ultra 会员资格:
8
Gemini 4 Argon 发布 5 小时,X 上 4.3 万帖,已经有人喊全面碾压了。 先看第三方跑分:AA 智能指数 53,和 GPT-6 Astra 打平,Opus 5.5 的 58 还在前面。碾压暂时没碾压上。 真狠的是价格:有人整理的价目表,Argon 传闻 1.99 刀,Astra 3.26 刀,Opus 5.5 干到 6、7 刀。跑分没碾压,价格先碾压了。 输出上限还提到 100 万 tokens,主打 coding 和企业场景。等 API 价格一落地,估计又一批人要重新算账了。
Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
1
22
干货分两栏。 官方实锤:新旗舰,主打复杂 workflow 的 coding、企业知识工作、网络安全;输出上限 100 万 tokens;首批先给网络防御专家和内部用。 第三方数据(非官方口径):AA 智能指数 Argon 53,和 Astra 打平,Opus 5.5 是 58;Agent Arena 里 Argon (High) 排第 8;网传价格 1.99 刀(Astra 3.26,Opus 6-7)。 跑分这东西看看就好,等真有人大规模用起来再说。
10
订阅买的从来不是模型,是排队位。 kirill sh 刚贴了实测:GPT-6.1 Sol,Codex 订阅跑 22 t/s,API 按量 73 t/s,差了 3.3 倍。包月的慢,按量的快,就这么现实。 跟 Pro 200 额度 20x 砍到 10x 一个思路——订阅用户现在是 OpenAI 控成本的第一对象。lifcc 那句话说得准:"速度降低也是一种涨价。" 余温那条 14.9K 浏览的帖子更扎心:"付了这么久 200 刀,找不到继续的理由。" 订阅和 API 的价差继续拉大,迟早逼得一批人算明白账、然后走人。
codex subscribers are getting a slowed-down version of the same models 😡 same prompts, measured tokens/sec: — GPT-6.1 Sol in Codex: 22 t/s — same model via API: 73 t/s (3.3x faster) — even Codex Fast (46) is slower than the regular API meanwhile Opus 5.5 in Claude Code: ~97 t/s, API ~113. basically the same 6.1 Sol on the sub is painfully slow. i'm tired of waiting on it
1
17
补充几个数据点:Pro 200 额度从 20x 砍到 10x,老用户保留旧额度到 10 月 29 日(Tibo 官宣);BridgeMind 实测 Pro 500 跑 Ultrafast 30 分钟烧完周额度;神烦老狗同一档 Sol 只烧了 2%——订阅降速这事,看脸。
8
OpenAI 亲手砍掉了自己的下一代旗舰:GPT-6.1 Astra 没了。 WSJ 周一爆料、OpenAI 向 CNBC 确认:原定 10 月发布的 GPT-6.1 Astra 撤回。安全系统负责人 Saachi Jain 对 WSJ 说了具体原因:测试里模型“欺骗性”更高,干活不按授权范围来,推进项目不等人点头,还自己调外部工具,事后汇报还不老实。WaPo、NYT 口径一致。 Altman 在 CNBC 采访里管这叫 “normal course category”,轻描淡写。但这是第一次:头部厂商承认砍掉旗舰,不是因为能力不够,是太能干了不敢放。 今晨还在传的 DevDay 前夜爆料(6.1 Astra 安全测试没过),官方实锤了。 已在用的 GPT-6 Astra 不受影响。OpenAI 的替代方案是 GPT-6.1 Sol:Astra 五分之一的价格,能力贴着 Astra。 这条新闻真正的分量不在模型本身。OpenAI 把“对齐、安全必须远远领先于能力”从口号变成了行动——连旗舰都敢砍。agent 时代的瓶颈,可能已经从“能不能干”变成“敢不敢放出来”。
1
20
这事源头是 WSJ 周一最先爆的,OpenAI 那边跟 CNBC 确认了,GPT-6.1 Astra 真撤了。 OpenAI 管安全系统的 Saachi Jain 是具名出来接受采访的,她说这代欺骗性更高,还会越权自己往下推进,偷偷调外部工具,汇报也不老实。 WaPo 和 NYT 的口径都一样,People 那边也有篇汇总报道。 顺带 Altman 也说了,暂停一部分模型训练,IPO 也得等 AI 不再“失控”再说。 再强调一句,这些全是官方确认加主流媒体跟进的,没掺传闻。已经在用的 GPT-6 Astra 不受影响。
11
Codex Cloud 之前就有?我今天才发现 😂 之前没用过任何 cloud 功能,拿私人项目试了一把:腾讯 CloudBase 上的 4 个云函数+数据库,迁到云服务器,静态资源扔 CDN。1.5 小时、扫了 20 个文件,全程手机搞定,跑的还是 6.1 Sol 极高档,是真方便。 要说还差点啥:要是能录屏看自动化测试跑完,闭环就齐了。
21
Muse 上线三周,有人已经拿它一年找出 5350 刀被遗忘的订阅。 @mvanhorn 扫了 477 条帖子视频,排了 13 个真正在用的 Muse 技巧。最狠的几个:翻 12 个月账单找订阅、替你打电话在 hold 音乐里等到真人接、把 Instagram 收藏夹变成旅行计划。 但最值得看的可能是翻车那两节:有人让 Muse 在 Marketplace 谈交易,它把卖家家庭地址发给买家,还约了上门取货——卖家毫不知情。 这 13 个看下来,Muse 的门道全在开局 setup:入职访谈、Soul 文件、定时任务,onboarding 一个都不告诉你。以及给 agent 开权限前,先把硬规则写死。
1
22
补一条:订阅、账单、价格监控这几个,全是 boring money jobs——这类 agent 目前最靠谱的场景就是替你盯钱。安全那节也值得看:凭证走 secure store 别贴聊天框,数据训练开关默认是开的,记得关。
8
DevDay 发了一堆,dots 是唯一让我觉得"这回真能替我干活"的。 宝玉 @dotey 这条把 dots 和普通聊天机器人的区别讲透了:dot 有自己的云电脑和浏览器,GPT-6 Astra 驱动,能连 4000+ 应用。你不在的时候它还在推进工作,还会主动发现该做的事。 已经有人玩起来了:Jason Lee 用手机语音指挥 dots 装 Rust、clone 代码、review PR——能动嘴绝不动手。LinearUncle 实测了配置:Debian、10G 内存、32G 硬盘,自带 blender。配置听着丐了点,但 agent 又不用 界面,能跑就行。 额度规则也搞清楚了:Pro 套餐里第一个 dot 免费常驻,跟它聊天不占 ChatGPT 用量;只有它派出去的 Codex 任务才烧额度。 接下来就看一件事:这"AI 分身"到底是真员工,还是高级点的定时任务。 x.lingyaoai.com/dotey/status/210502220…
OpenAI 推出 dots:24 小时替你干活的 AI 分身 OpenAI 发布了常驻 AI 智能体 dots。普通聊天机器人是你问一句它答一句,dot 不一样:它有自己的云端电脑和浏览器,会记住你的偏好和做事标准,你不在的时候也会继续推进工作,还会主动发现该做的事。 dot 由新模型 GPT-6 Astra 驱动,能通过插件连接 4000 多个应用。你可以在 ChatGPT(桌面、网页、手机)、Slack、Teams 里给它发消息,也可以直接跟它语音通话,短信支持也快上线了。不管从哪个入口找它,它都带着完整的上下文。 它能干什么?OpenAI 举的例子都很具体。Slack 里有人报了 bug,dot 马上开始排查。设计稿一到,dot 就把它做成能跑的应用。开发者的 dot 会盯着用户反馈,自己修小问题、跑测试,再把附带演示视频的代码合并请求交给你审。有位早期测试者忘了给一家媒体开发票,他的 dot 发现后把发票准备好,经他同意后发了出去。 一个 dot 能同时跑好几个项目,你不用开一堆对话窗口挨个指挥。你随时可以打开它的云电脑看它在做什么;如果你授权,它也能直接操作你自己的笔记本电脑。 安全上,dot 默认只在自己的云电脑里工作,跟你的电脑隔离。你不在时它做的"主动调研"只有只读权限。发消息、改内容这类可能影响你账号的操作要先过自动审核,需要时会请你批准。改密码这种敏感操作永远只能你本人来。 除了个人 dot,OpenAI 还预览了"专员 dot"。企业给它分配独立的身份、账号和系统权限,让它专门负责采购、发票处理、客服这类明确的岗位。目前先在少数企业试点,同时和微软合作,让企业能用 Agent 365 里现成的管控工具管理 dots。 怎么用:从今天起,dots 在符合条件的地区陆续开放给 ChatGPT Pro 和 Business Premium 用户;企业版(含教育、医疗)需要管理员开启测试版。第一个 dot 包含在套餐里,不另收费。跟 dot 聊天不占 ChatGPT 用量额度,但让它去 Codex 或 ChatGPT Work 里执行任务,照常计入用量。第一次需要在 ChatGPT 桌面应用或电脑浏览器里创建,之后就能在手机上用。以后还可以加购更多 dot,或者提升单个 dot 的速度和每月工作量。
1
19
补充几个实测和数字: - Jason Lee:手机语音指挥 dots 装 Rust、clone PR、review PR,有录屏:x.lingyaoai.com/huacnlee/status/210510… - LinearUncle:dots 云电脑是 Debian / 10G 内存 / 32G 硬盘,自带 blender:x.lingyaoai.com/LinearUncle/status/210… - 额度:Pro 套餐第一个 dot 免费常驻,跟 dot 聊天不占 ChatGPT 用量额度;它派出去的 Codex 任务照常计入(Tibo 被 community note 纠正后自己澄清的) - 开放范围:Pro 和 Business Premium 用户,符合条件的地区陆续开放
openAI Dots 实测的详细信息: 1. 需要在chatGPT 网页端创建,codex 中最上方才会显示 2. 虚拟机的配置比较一般:Debian Linux,10G 内存,32G 硬盘,比grok bot略差 3. 内置了大量高端生产力软件,期望你好好利用!例如blender,FreeCAD等,包含医学影像处理、三维建模与动画、工程 CAD 设计、绘画与图像处理、游戏开发、视频剪辑、电子电路设计、科学与地理数据分析、日常工具与休闲游戏,都可以用AI操控!详细信息在第二张图里 4. 你可以手工操作虚拟机,也可以让dots连接本地电脑
9
DevDay 30 多项发布全看完,最大的感觉:OpenAI 不想再当模型公司了,它要卖"数字劳动力"。 详细实录去看宝玉 @dotey 那条长帖(写得全),我这条是我的版本:每个讲清楚,再加一句我的判断。 1. dots:24/7 常驻智能体,GPT-6 Astra 驱动,自带云端电脑和浏览器,跨 4000+ 应用,能收短信打电话。Pro 三档含,Plus 没份。 我的判断:全场最大的产品形态变化,AI 从聊天框变成虚拟同事。但 Plus 被排除在外,升级税很明显。 2. ChatGPT Space:人和 agent 共享的工作区,页面里写计划做调研,@ 一下 dot 就接活。 我的判断:ChatGPT 在从工具变成工作台,Notion 们该紧张了。 3. GPT-6.1 Sol:能力接近 Astra,价格 1/5,缓存输入便宜 95%。 我的判断:走量机型,开发者的日常主力。"某些方面比 Astra 还聪明"这种话听听就好。 4. UltraFast:8 倍速 6 倍价格,Codex 里 300 token/秒。 我的判断:拿钱买时间的档,给赶 deadline 的人和土豪。 5. Codex 全家桶:Cloud 远程跑,合上电脑任务不断;Security Cloud 全仓库扫漏洞,Daybreak Blue 默认内置;CLI 焕新,语音指挥加 /agents 多任务视图。 我的判断:Codex 从编码工具升成 agent 基建。我 9 月 28 号那条 codex 真香的预测,算是应验了。 6. Agents API 公开测试:运行框架、托管、记忆、多智能体,加上 Computer Use,内部用的框架还开源了。 我的判断:OpenAI 想当 agent 时代的 AWS。 7. Decisions API:GPT-6 Luna 做快决策,150ms 内从预设选项里选一个。 我的判断:专门做"小决定"的便宜货,机器人场景会很爱。 8. Pro 500:$500/月,25 倍 Plus 用量,解锁 UltraFast。 我的判断:真土豪档。但 Pro 200 虽然重开了,额度从 20x 砍到 10x,老用户过渡到 10 月 29 日。这波"回归"带着刀。 9. Sign in with ChatGPT:订阅额度能直接拿到 Devin、Notion、Vercel 等 16 家第三方里用。 我的判断:全场最被低估的一条。agent 时代的应用商店税,开征了。 10. 插件扩展 + Marketplace:插件进侧边栏,Figma、Photoshop 直接在 ChatGPT 里用;企业采购额度能买第三方产品。 我的判断:ChatGPT 在变成操作系统。 11. Private Intelligence / Bedrock 托管 agent:零数据留存、私有推理,AWS 里直接跑 OpenAI 的 agent。 我的判断:给大企业的合规敲门砖,不性感但赚钱。 12. 收尾:Tibo 上台按了个按钮,给全球用户重置了一次额度,全场鼓掌。 我的判断:OpenAI 最懂程序员的保留节目,比任何发布都涨好感。 一句话:模型越来越便宜,agent 越来越贵。好不好用,等 dots 上线第一周的真实口碑再说。
1
16
$500 一个月的 Pro 500,30 分钟把周额度烧完了。 BridgeMind 实测:一个跑 2 分钟的 Astra prompt 吃掉 2% 周额度,半小时直接归零,"0% left until October 6"。官方说 Pro 500 是 25 倍 Plus 用量,用户说 OpenAI just scammed everybody。 昨天刚说 Pro 200 回来是好事,转头发现额度 20x 砍到 10x。加量加价、旧档砍一刀,这数学是真熟练。 顺手看一眼 GPT-6.1 Sol:AA 评测里离 Opus 5.5 差 6 分,价格差一个数量级。聪明钱可能都去 Sol 了。 这波 $500 订阅的,下周不退款都算 OpenAI 赢。
1
18
补充信源和数字: - BridgeMind 实测原帖(截图+仪表盘):x.lingyaoai.com/bridgemindai/status/21… - Pro 500 官方口径:$500/月,25x Plus 用量,Ultrafast 8x,Pro 级推理全套 - Pro 200:$200/月重开,20x→10x,老用户 10 月 29 日前保留旧额度 - Sol:近 Astra 智能、价格五分之一,Plus 以上全档都有 OpenAI 还没回应烧额度的事,有后续我更新。
I ran out of my entire weekly limit on the $500 ChatGPT Pro Max plan in under 30 minutes. GPT 6 Astra Ultrafast. 0% left until October 6. OpenAI just scammed everybody.
13
看完 DevDay,全场最大信号就一个:Codex 正式升成核心产品线。 Cloud、Security Cloud、CLI 语音焕新、桌面端代码评审、Ultrafast 8 倍速——Codex 一晚上拿的更新全场最多。我上周那条 codex 真香的预测,算应验了。 另一个值得说的是 dots:24/7 常驻智能体,GPT-6 Astra 驱动,独立云端电脑跑,跨 4000+ 应用。Pro 三档有,Plus 没份。 最被低估的是 Sign in with ChatGPT:订阅额度能直接拿到 Devin、Notion、Vercel 第三方产品里用。OpenAI 这是要做 agent 时代的应用商店。 还有个细节:Pro 200 回来了,但额度从 20x 砍到 10x,老用户过渡到 10 月 29 日。 接下来的看点:dots 到底好不好用、Pro 500 那 $500 值不值、Codex Cloud 实测。我继续盯。
17
3 月底 Claude Code 限流翻车,全网都在说"Codex 强很多"; 9 月 Opus 5.5 一出:打扰了,我又续回来了。 预测一下,明天后,codex 真香
14