💻 Backend 架构|游戏发行后台 10年+ 🛠️ AI 让个人也能把系统做成产品 📡 分享AI、Coding 、架构和出海基建

Pinned Tweet
游戏发行后台做了 10 年+,主业是 Backend 架构。 AI 把个人做产品的门槛打下来了,所以开始把行业里验证过的经验往外用。 之后会在这里公开写: 出海基建:账号、支付、环境、收款怎么搭 AI:如何降本增效及最佳实践 Coding / 架构:能复用的设计和取舍 Build in public。做了再说,踩坑也写
5
708
本地跑、先 probe 再验证,还能接 Claude、Cursor、Codex,这已经不是给 Agent 塞几个命令了,是真把剪辑流程接起来了
终于有人把 FFmpeg 直接接进 AI 编程助手了。 以前让 Agent 剪视频,参数经常靠猜,做完甚至不检查结果。这个 ffmpeg-skill 把流程补齐了。 ① 全程本地运行,不用账号、API Key,素材也不用上传 ② 内置 42 个工具,剪切、拼接、去静音、字幕、画幅、响度、HDR 转 SDR 都能做 ③ 支持 Claude Code、Cursor、Codex ④ npx ffmpeg-skill 一行安装 ⑤ 先 probe 再处理,完成后再自动验证 简单说,就是让 AI 不只是“调用 FFmpeg”,而是先看素材,再动手,最后检查结果。 🔗 :github.com/kajisho5/ffmpeg-s…
6
这条把 Claude Code 防封的真实配置和半年稳定使用的细节都摊开了,独立主机、固定网络和 Surge 规则这些信息对做海外 AI 工具的人很有参考价值,尤其是连“没有 100% 防封”也说清楚了,读起来很实在
今天刷到不少推友国庆喜提 A\ 封号大礼包 我简单总结下我目前为止使用的方式,过去半年一直稳定使用 - 独立 Mac 主机 - 美西时区 - 单账号,从未切换过其他账号 - Surge 规则模式常开 - 夏威夷独立家宽 IP - 美国信用卡 - 每周用量50-80% - 外出用 UU 远程访问主机发起任务,配合手机移动端查看 当然肯定不存在100%防被封的方法,这大概率都看 A\ 的心情 我都直接让 Claude 优化我的 Surge 配置,它知道 Anthropic 流量会走代理,所以 A\ 如果要标记轻轻松松 只能说稳定 IP + 非高频使用,大概率能降低封号风险
41
把 effort 档位、别让模型反复重想、做完再停这几条串起来看,Claude Opus 5.5 的使用逻辑一下就清楚了,尤其是把“做完再停”写进提示词这点很实用
Claude 官方最新发布了 Claude Opus 5.5 的提示词指南,1 分钟带你看完! 1)先把思考档位调对 模型想得多还是少,主要由思考档位 effort 决定。Opus 5.5 平时用 medium 就够了,这一档在编程和知识类工作上已经能追平上一代的 high,还更快、更省钱。Sonnet 5.5 默认使用 high,但目标明确的编程任务同样可以从 medium 开始,日常聊天则建议选择 medium 或 low。 2)想让模型少想,就降低档位 当模型想得太久时,最有效的办法就是调低档位。聊天提示词里的 “请仔细思考再回答” 也可以删掉,因为模型会自己判断需要想多久。 3)不要让模型把推理过程写进回答 很多人习惯要求模型 “把思考过程写出来”,但在 5.5 这一代,这样写可能导致请求被直接拒绝。想了解模型的思路,查看思考摘要就可以了。 4)追问变慢时,别让模型回头重想 在多轮对话中,哪怕你只追问一句很短的话,模型也可能把上一轮的答案重新想一遍。你可以在系统提示里说明,已经回答过的问题就算完成,后面只需要思考当前的提问,这样回复会更快开始。 5)让模型把任务做完再停下 做长任务时,模型经常写完一段总结,说一句 “下一步我要做什么”,然后就停下来等你回复。你可以在提示词里要求模型汇报进度之后继续操作,只有缺少你的配合,或者即将执行有风险的操作时,才停下来询问。 6)别让模型做多余的事 档位越高,模型越喜欢顺手补上测试、文档和一些小文件,开到最高两档时,甚至会自己多开几轮审查。所以最好再补一句,要求模型做完并检查无误就停止,额外的想法放在最后提出来。官方在最高档测过,加上类似的话之后,花费少了三分之一,质量没有变化。 7)只想看方案,就提前说清楚 如果你只是随口说一句 “让我看看你能做什么”,模型可能直接开始做演示、写报告。你要是只想先看看思路,就在提示词里说明:用户要的是想法或方案,给完就停,等确认后再动手。 8)让模型先验证,再下结论 在编程任务中,要求模型改完代码后真正运行一遍测试或构建,不要只检查语法。遇到收费、规则这类容易过时的问题,也应该让模型先搜索再回答。 9)要求越具体,效果越好 让模型做网页时,与其笼统地说 “不要有 AI 味儿”,不如直接点名你不想要的样式,比如蓝紫渐变、XX 字体等。遇到特别密集的图表时,给模型提供裁剪和放大的工具,也比把档位调到最高更准确、更省钱。 总结,用好模型的关键是把档位调对 + 把要求说清楚。
28
把 Coding Agent 的性能瓶颈从模型本身拉回到上下文、缓存和工具链,这个视角很关键。尤其 3.41% 的 Context Mutation 却带来 62.6% fresh prefill,确实很能解释为什么很多优化看着忙,体感却没变
我们可能一直在错误地优化 Coding Agent。 大家盯着模型价格、Token/s、推理能力,但 Harvard MadSys 放出的一批真实 Agent workload 数据里,一个很扎眼的结论是:76% 的 Agent session 中,Cached Input 才是最大的成本来源。 更夸张的是,只有 3.41% 的请求发生 Context Mutation,却制造了 62.6% 的 fresh prefill。 改 system prompt、做 compaction、删除 tool result,看起来只是 Harness 的小动作,但只要前缀发生变化,大量 KV Cache 就可能失效。 Prompt Engineering 到了 Agent 时代,已经开始变成 Infrastructure Engineering。
22
Rust 把 Harness 的插件树做成契约驱动这条路挺有意思,尤其是 ABI + SHA-256 校验、失败回滚和能自改代码的 Agent 循环,已经不只是把功能拼起来了,工程味很足
🔥快来玩!DeepSeek Harness 负责人崔添翼刚点名的 Rust 玩具项目,值得盯一眼! CordisClaw:把 Harness「一切皆插件」的思路用 Rust 重做成契约驱动的插件树。 发现靠显式父子边,加载靠 ABI + SHA-256 校验,文档直接当运行时输入,执行走 CPN Net,失败可回滚,还带能自己改代码的 Agent 循环。 不是官方产品,是 DSH 团队成员的个人实验。 上手三步: 1️⃣clone github.com/Chinesezjc/Cordis… 2️⃣cargo run -p cordis-runtime -- serve fixtures 3️⃣进 agent / shell 模式,或用 execute 跑单节点 #DeepSeek #DeepSeekHarness #CordisClaw #AIAgent #Rust #开源 #插件树
35
最有共鸣的是把 State 和时间绑在一起这句,登录、支付、任务进度这些例子一下就把“stateless”为什么常常只是口号讲明白了,后面这张图也很适合拿来给团队对齐
软件工程里有一句很常见的话:“尽量让服务保持 stateless。” 真正做过系统的人都知道,这句话其实有点骗人。 任何有用的软件几乎都有 State。 用户有没有登录、订单有没有支付、任务执行到哪一步、文档现在是什么内容、数据库里存了什么…… 真正的问题是:这个 State 到底放在哪里,谁负责它,以及它错了以后怎么办。
24
把 Agent 修 Bug 时越修越乱的根因讲得很到位,先锁定事实源和责任层,再让模型动手,这个 Markdown Skill 的思路对 Codex 和 Claude Code 都很实用
用编码 Agent 维护中大型工程时,最容易出现的问题是状态分叉与补丁累积。 很多开发者会发现,同一个 Bug 让模型修了几次,代码量反而越来越大。原因在于模型通常只针对当前触发异常的代码行做局部修补,比如在消费端加一层防御性过滤,或者在前端复制一份临时状态。这种修改虽然能在当前单测或单一操作路径下通过,但底层事实源的竞争关系依然存在,换一个入口依然会暴露。 要避免系统被补丁拖垮,关键是在模型动刀之前设立一道责任层预检。 doublesq 开源的 su-architecture-first 是一个纯文件形态的 Agent Skill。它的做法是在修改系统之前,先跑通一条极简的约束链条:定位真实目标、明确所属层级、锁定唯一事实源、决定改动类型,并在修改前定义回归证据。 尤其是对于复发问题,明确要求先从结构层面排查竞争路径与重复逻辑,在引入新逻辑之前先清理已经被证伪的旧代码。整个 Skill 没有任何外部可执行脚本或三方服务依赖,纯靠 Markdown 规范决策边界。 适合经常用 Codex 或 Claude Code 修复杂链路、被模型局部乱打补丁折磨的开发者参考。 项目地址: github.com/doublesq97-ui/su-…
16
把 Skills 按工程规范、代码库解析、界面开发和架构可视化分开整理,清单里的组合也很实用,做 AI 编程的人基本都能找到对得上的一组
大多数人还在把 AI 编程 Agent 当成“带终端的自动补全”,但真正拉开生产力差距的,是给 Agent 配备 Skills(技能包)——给模型注入可复用的工作流、架构规范与工程约束。 精选 10 个适配 OpenCode、Cursor、Claude Code、Codex 及 Gemini CLI 的高价值开源 Agent Skills,附完整项目链接: 一、 工程规范与架构思维 Superpowers:完整的 Agent 软件工程方法论,强制执行需求拆解、TDD 测试驱动、调试纪律与全流程代码验证。 GitHub:github.com/obra/superpowers Ponytail:让 Agent 具备务实的高级工程师思维,杜绝非必要代码与过度设计,优先采用简洁可行的方案。 GitHub:github.com/DietrichGebert/po… Caveman:轻量级实用约束工具,专注于降低复杂度,保持开发敏捷。 GitHub:github.com/JuliusBrussee/cav… Addy Osmani’s Agent Skills:工业级工程规范合集,让 Agent 生成的代码高度贴合真实生产环境实践。 GitHub:github.com/addyosmani/agent-… 二、 复杂代码库与系统解析 Graphify:通过本地确定性 AST 解析,将源码、SQL、配置和文档构建为可查询的知识图谱,告别盲目全库 grep。 GitHub:github.com/Graphify-Labs/gra… Understand Anything:基于多智能体管道的代码分析利器,提供依赖可视化看板,内置 /understand 与 /understand-diff 指令。 GitHub:github.com/Egonex-AI/Underst… 三、 界面开发与架构可视化 UI/UX Pro Max:跨框架设计智能技能,提供排版配色与定制化设计系统决策,摆脱千篇一律的“AI 模板味”。 GitHub:github.com/nextlevelbuilder/… Impeccable:嵌入式设计语言规范,在 Agent 修改前端 UI 代码时自动触发设计合规检查。 GitHub:github.com/pbakaus/impeccabl… Archify:一键生成系统架构图、数据流图与时序图,直接输出带交互动效的自包含 HTML 文件。 GitHub:github.com/tt-a1i/archify 四、 综合技能合集 Awesome Claude Skills:社区高星精选技能库,采用通用的 SKILL.md 规范,通用支持主流多 Agent 运行环境。 GitHub:github.com/ComposioHQ/awesom… 💡 实战组合推荐: 接手陌生巨型项目:Graphify + Understand Anything + Ponytail 构建高质感 Web 应用:Superpowers + UI/UX Pro Max + Impeccable 架构重构与严谨开发:Superpowers + Ponytail + Addy Osmani’s Agent Skills 安装所有技能并不是目的,建议先挑选一个能解决你当下编码痛点的技能,真正融入日常开发流程。 #AI编程 #CodingAgent #OpenCode #Cursor #ClaudeCode #GitHub #开发者工具 #独立开发 #软件工程 #LLM #AIAgents #WebDev
34
DeepSeek 开源的 TileLang Ascend、昇腾和 AKG 放在一起讲,连 Transformer 的数据搬移和算子性能也说明白了,这种 AI Infra 视角真的很难得
昨天 DeepSeek 开源的 TileLang Ascend 很有意思。抽象层次跟我 2019 年在昇腾里做的 AKG 里面的 isl schedule 很类似,都是把 L0 A/B/C(矩阵计算的输入输出缓冲)、UB(向量计算的缓冲)等显式分配出来,然后编排数据搬移和计算。 一直有不少人说,昇腾难编程;架构是为 CNN 定制的,不适合 Transformer。我认为这两个说法都站不住脚。 首先,随便写个 CUDA 算子确实是不用关心片内的缓存层次,也不用做矩阵和向量计算单元之间的同步,也不用让数据按照 16 的倍数对齐。但是要把性能优化到极致,还是必须考虑 GPU microarchitecture 的。不想自己折腾数据搬移和同步的可以试用我们开源的 AKG 自动生成算子,写 Python 总比写 CUDA 简单。 其次,昇腾跟 TPU 等很多加速器类似,都是考虑到 Transformer 等神经网络的计算特征(QK 矩阵计算 -> Softmax 向量计算 -> PV 矩阵计算这样交错进行),使用专用缓冲区甚至 950 中的专用数据通路来降低数据搬移开销。Img2col 这些为 CNN 定制的指令也换成了为 Transformer 定制的 NDDMA 数据重排指令。要知道,950 的制程跟 A100 是相当的,但性能可达 H100,就是靠架构优化。 截图出自我的开源书《深入理解 AI Infra》 github.com/bojieli/ai-infra-…
34
最有意思的不是 15 小时这个数字,而是人只盯 summary、目标和架构,Agent 就把 Rust + Tiptap + Yjs、MCP、OAuth 这些东西一路落地了。AI 编程真正把人的工作往产品判断和取舍上推了
15 hours + $500 cost. From idea to production. 昨晚到现在,Agent 连续工作了 15 小时,做出一个类似 Claude Docs 的产品,现在已经上线。 我没看代码,也没读文档。只看 summary、设定目标、做架构和产品决策。 Rust + Tiptap + Yjs,完全托管在 Cloudflare。Notion 式编辑、AI 与多人实时协作、OAuth、MCP、Google 登录,都跑通了。 AI 时代,写代码的成本正在迅速下降。真正拉开差距的,是架构设计、产品取舍和 Taste。
27
看完才发现,Agent Harness 更像是把模型、工具和工作流装进一个自己能掌控的工作台。把系统提示、工具、Agent 循环和转换层拆开讲,连 Pi 为什么强调可塑性都一下顺了,很适合补这块基础概念
24
Pi 里直接跑独立 Subagent,还能按任务分模型并行 Steering,这套玩法把 Multi-Agent 从概念落到可操作的插件层了
Pi 配上 Subagent,有点 Multi-Agent 的味道了🔥 推荐一个最近在玩的插件:jopqior/pi-subagents 可以直接在 Pi 里面拉起多个独立的 Subagent,而且不是再开几个 CLI 子进程,是直接跑在 Pi 自己的 Runtime 里面 1、每个 Subagent 都是独立的 可以有自己的 Model、Thinking、Tools、System Prompt 和 Session 比如主 Agent 负责整体任务,再单独开一个 Research、一个 Coding、一个 Review,各干各的。 2、可以并行跑,而且中途还能管 默认可以同时跑多个 Subagent,后台干活的时候你还能继续跟主 Agent 聊。 跑偏了可以 Steering,跑完了还能 Resume 原来的 Session,不是一次性问完就没了。 3、不同 Subagent 还能分配不同模型 配合 pi-subagents-model-selector,可以让: Research → Gemini Coding → Claude Review → GPT 谁适合干什么就分给谁,不需要所有 Agent 都用一个模型。 这个插件火起来也有一段时间了,最新版本也更新了 MCP,现在是子线程也火起来了 连 PI 慢慢更新的跟 OMP 一样了,那我还不如直接去隔壁使用 OMP🤣
29
15 小时把 Rust、Tiptap、Yjs 和 Cloudflare 这一套直接跑到上线,最有冲击力的不是 Agent 写了多少代码,而是人只盯 summary、目标和架构取舍,最后还能把协作、OAuth、MCP 都串起来。AI 把实现成本压下去以后,真正值钱的确实是产品判断和边界设计
15 hours + $500 cost. From idea to production. 昨晚到现在,Agent 连续工作了 15 小时,做出一个类似 Claude Docs 的产品,现在已经上线。 我没看代码,也没读文档。只看 summary、设定目标、做架构和产品决策。 Rust + Tiptap + Yjs,完全托管在 Cloudflare。Notion 式编辑、AI 与多人实时协作、OAuth、MCP、Google 登录,都跑通了。 AI 时代,写代码的成本正在迅速下降。真正拉开差距的,是架构设计、产品取舍和 Taste。
1
2
37
生成证明的速度上去后,真正稀缺的确实是能把前提、引用和推导逐条核过的人。把 Halpern、Mockenhaupt、Nivat 这些案例和 Lean 验证流程放在一起看,AI for Math 的瓶颈一下就清楚了,这个视角很有冲击力
AI 开始批量生成数学证明后,谁来验证? AI for Math 接下来最贵的环节,会是验证。 AI 系统可以同时展开大量证明路线,在几天内生成一份候选论证。数学家仍然要逐步检查前提、引用和推导,一份证明的独立评议可能持续几个月。生成能力增长得越快,验证资源就越紧张。 我每天使用 Coding Agent,对这种变化很熟悉。 以前写代码最花时间,现在 Agent 一次可以生成几百上千行。代码生成速度上来以后,review、测试和 eval 占用的时间越来越多。数学研究也开始遇到同一个问题:证明可以批量生成,能判断它是否成立的人和验证流程没有同步增加。 由清华人工智能学院助理教授陈勇超(@YongchaoC)创立的超衍智能(@apexin_ai)最近公开了 5 项 AI 数学研究。 其中 2 项已经由作者或合作数学家核验:Halpern 迭代与高阶优化,以及 Mockenhaupt 三项猜想覆盖全部参数的新证明。 另外 3 份仍然标为候选论证:凸形 Nivat 猜想完整证明、Souto 猜想亏格二情形,以及 Kakimizu 复形可缩性。 合作数学家先选择有研究价值的问题,Apex 的 AI 系统并行探索并交叉检查证明路线。找到候选证明后,再由作者或合作数学家逐步核验,并为最终结论负责。 这 5 项研究中,一个已核验案例和一个候选论证案例,正好展示了这套流程的两端。 Halpern 迭代与高阶优化研究展示了这套分工。AI 找到了 Halpern 迭代与锚定张量法(Anchored Tensor Method,ATM)的组合路线,但初版子求解器包含三层循环。合作数学家随后把它简化成单层结构,并整理、核验完整证明。论文公开后,清华、北大和 Google Research 的研究者又沿着相关方向继续推进复杂度结果。 凸形 Nivat 猜想最能说明这套流程的验证边界。根据官方披露,配套的 Lean 4 形式化项目约有 3.6 万行代码,目前可以零错误、零 sorry 编译。 这里需要区分 Lean 已经检查的内容和整项数学结论。 通过机器检查的是已经写入 Lean 的部分,并不等于整项数学结论已经得到完整验证。整条证明仍然引用 Colle 已发表的一条外部定理,这项输入尚未完成形式化。 机器已经检查了大量推理步骤。外部定理以及整套论证能否获得独立认可,仍然需要研究者继续核验。因此,官方仍把它标为候选论证,没有直接写成已经解决的数学成果。 为了推动这 3 份候选论证获得进一步验证,超衍把候选论证和关键证明步骤公开,并设置总额 10 万元的学术悬赏。研究者可以认领一条关键引理、一段归约或一个估计,投稿时标明对应的论文版本和命题位置,再附上可以复核的推导、反例或代码。经过核实的贡献会被单独记录。 悬赏面向数学及相关学科的高校研究者、独立研究者,也欢迎熟悉 Lean 和形式化证明的开发者参与。奖项分为重大漏洞奖、关键验证奖和突破贡献奖。 配图 1|封面:AI 开始批量生成数学证明后,谁来验证 配图 2|Coding Agent 与 AI for Math 的评估瓶颈 配图 3|超衍智能五项研究的核验状态 配图 4|Nivat Lean 验证范围与十万元悬赏 论文、验证任务和投稿入口都在: math.apexin.net/
31
这套搭配挺顺,把网页和微信读书的素材收进来,再用 Excalidraw 理关系、Kaitox 出长文,Obsidian 终于不只是个存笔记的地方了
好久没有给大家分享工具了! 很多朋友都会选择 Obsidian 来做自己的创作知识库 下面的5个插件工具几乎是必备的: 1️⃣Claudian:使用claude 或者 codex来整理笔记,辅助写作。 2️⃣Obsidian Web Clipper:网页上看到的东西一键导入到 obsidian 来做素材收集 3️⃣WeRead:同步微信读书、读书划线、想法积累都会被同步在obsidian 当中。 4️⃣Excalidraw:把零散观点画成关系图,链接相关笔记 5️⃣Kaitox:把写好的 Markdown 图文转成 X 长文草稿 收集素材 → 梳理关系 → 动手写作 → 输出分享。都包含了!希望可以帮到大家~
33
WorkBuddy做微信小程序这条路讲得很实在,从开发者工具、AppID、服务器这些前置环节,到直接把代码生成、预览、发布放进一个窗口,连免费版积分和实际踩坑都写清楚了。想用 AI 做出第一个小程序的人,照着这份从成品倒推流程的教程走,真的很有收获
25
看完最有感觉的是,它把 SEO 从“凭感觉排查”变成了一张能执行的清单:52 条规则、逐页语义判断,连优先级、改法和官方出处都能一起导出。还能直接装进 Claude Code 当 Skill,给客户交付时附上报告,这个闭环很实用
自己做的网站上线好几个月,Google 上就是搜不到,找人做 SEO 诊断要花钱,自己对着官方文档一条条查,又不知道先改哪个。 jev-seo 是一个开源的网站 SEO 体检工具,给它一个首页网址,大约一分钟把整个站爬一遍,出一份排好优先级的整改清单。 它对照 Google 官方搜索文档里的 52 条规则逐项检查,死链、重定向、结构化数据、页面加载体验这些都会查到。 每个页面还会交给 TypeSafe 的 Jev 模型判断,这页是干什么的、内容够不够具体、有没有几页在抢同一个搜索词。 GitHub:github.com/AgriciDaniel/jev-… 报告一次出 PDF、Excel 和 Markdown 三份,PDF 给客户看,Excel 里每条整改项都带优先级、改法和官方出处,直接能当进度表用。 费用挺低的,标准模式一个站大约花 1 美分的模型调用费,不用订 SEO 数据服务。作者还拿同样 59 个页面跑了两遍,打分平均只差 0.03。 能在命令行跑,也能装进 Claude Code 当 Skill 用。给客户建站的,交付时附一份这个报告,比口头说一句「SEO 做好了」有说服力。
21