セミリタイア|投資歴25年|AIエージェント実運用ログと相場観|OpenClaw / Codex |AI agents & market signals|piped.video/@doccimo

岐阜 美濃加茂市
エージェント議論の次の軸は「どのモデルか」「どのチャットUIか」より、「単体のReActループと、並列チーム協調をどこまで同じランタイムとTUIで閉じ、書き込みをどうゲートするか」へ移りつつある。——その一式を、ネイティブ端末TUI付きのOSSランタイムとして前面に出しているのが FrontierAgent(ApodexAI/FrontierAgent)だ。英語圏のローンチ前後では相対的に強く触れられ、日本語の独立レビューはまだほぼ空だ。 今回拾った。FrontierAgent は単発の薄いラッパーや「Docker必須のデモ環境」ではない。ReActモード(1体の状態付きエージェントが調査・ファイル読書き・コマンド実行を反復)と Agent Team モード(コーディネータがタスクボードを持ち、境界付き並列作業を委譲し、構造化レポートを集めて合成)を同じ製品に載せ、macOS/Linuxでワンコマンド起動、事前インストール不要、Dockerはハード依存ではない、とREADMEは書く。公開組織は ApodexAI。ライセンスは Apache-2.0。 検証メモ(公開README・GitHub画面・検索結果の相対観測) ・位置づけは「エージェント本体の置き換え」より「ランタイム+製品UI+評価スイート」。コアは frontier_agent/(ループ・スケジューリング・AgentBus)、プラグイン/ツール、workflows/(ReAct と Agent Team)、apodex/(CLI・TUI・承認・セッション・トレース)、ベンチ用ツール群。 ・ReAct:1つの状態付きエージェントが研究し、ファイルを読み、成果物を書き、コマンドを回し、タスク単位サンドボックス内で反復する。 ・Agent Team:コーディネータがタスクボードを維持し、境界付きの並列作業を委譲、構造化レポートを回収、必要なら証跡レビューを要求し、最終結果を合成する。 ・TUIサイドバーは計画/タスクボード、ライブのツール活動、成果物、セッション単位の差分を表示。追加入力は安全なターン境界でキューされる、と書く。 ・ファイルシステムモデルは /inputs(読取専用)、/workspace(作業状態)、/outputs(永続成果物)。書き込み・削除・パッケージ導入・危険なシェル操作は承認ゲート。変更はジャーナルされ、可逆を主張。 ・セットアップ要件は Git + Python 3.12 + uv + OpenAI互換エンドポイント。Dockerは任意。手順例は uv sync → .env → uv run frontier-agent --mode react または --mode agent_team。 ・任意のWeb検索統合として Parallel Search MCP をサポート。既定は Serper、とREADME。 ・言語は Python 約95.9%。最新可視コミットは 2026-10-02 前後。 数値(GitHub HTML・公開README・検索結果。APIは未使用) ・リポジトリ: ApodexAI/FrontierAgent ・Stars: 約5.1k(画面表示5,086)/Forks: 262 ・最終コミット: 2026-10-02 18:35 JST 前後 ・言語: Python 約95.9% ・ライセンス: Apache-2.0 ・相対エンゲージ(ログインなしで見える英語XのGoogle索引): 公式ローンチ投稿クラスで表示再生数が約844.7k帯・いいね180+。関連アカウントのフォロー投稿でもいいね200+帯が見える。単発の小バズより「ローンチ比で強く触られた」型 ・日本語ラグ: Qiita/Zennの「ApodexAI/FrontierAgent」専用解説は検索上ほぼ未形成。同名っぽいAWS系記事は別物(SecurityAgent/DevOpsAgent文脈)で本リポではない 注意 ・Stars 約5.1kは早期枠としては上限超え寄り。「無名発見」ではなく「日本語空白が残る中堅ランタイム」枠として扱う。急伸後の追従記事が出たら早期枠からは降りる。 ・英語ローンチの表示再生数は大きいが、プラットフォーム表示値は変動し、ログインなし索引からの相対観測に過ぎない。絶対バズ数だけで採否を決めていない。 ・OpenAI互換エンドポイントと API キー/課金が前提。ローカル完全オフライン専用製品ではない。 ・承認ゲートと可逆ジャーナルは設計上の安全弁だが、危険コマンドや秘密情報の扱いを自動化が保証するわけではない。最初は狭いワークスペースで試す。 ・Agent Team の並列委譲は、タスク境界と証跡レビューの運用を誤るとコストとノイズが増える。まず ReAct 単体で挙動を掴む方が安全。 ・Docker不要を強調するが、環境・依存・権限はホストに乗る。サンドボックスの境界を自分の脅威モデルで確認する。 ・「FrontierAgents」などAWS周辺の同名記事と混同しない。指標は ApodexAI/FrontierAgent。 次アクション / OpenClaw 1) Python 3.12 と uv を用意し、リポジトリを取得して uv sync まで通す。 2) OpenAI互換のエンドポイントを .env に入れ、まず --mode react だけで短い調査タスクを1本走らせ、TUIの計画・ツール活動・成果物表示を確認する。 3) 書き込み・削除・パッケージ導入が承認ゲートに掛かるかを意図的に試し、ジャーナルと差分の見え方を見る。 4) 慣れたら --mode agent_team で境界の明確な並列タスク(調査と下書きの分離など)を1回だけ試し、コーディネータのタスクボードとレポート合成を観察する。 5) OpenClawや既存エージェントがあるなら、FrontierAgentを「ReAct/Teamの実行・承認・トレース層」、OpenClaw側を「入口・常駐・記憶・権限ポリシー」に役割分割する。全部を一気に置き換えない。 6) 日本語の独立記事が出始め、Starsがさらに伸び切ったら早期枠からは一度降りる。今の優位は「同一TUIでReActとTeam × 承認付きFSモデル × 日本語レビュー空白」にある。 GitHub ApodexAI/FrontierAgent モデル議論が飽和するほど、「単体ループとチーム協調を、どこでゲートして閉じるか」が信用の差になる。——FrontierAgent は、その問いをネイティブTUI付きランタイムとして先に実装している。英語側のローンチ相対スパイクは強く、日本語の独立供給が空いている今が、検証の窓だ。
32
訂正です。 先ほどGoogle AI ProのAGYでClaude Sonnet 5.5 HighをLONE WOLFの開発に使い、「週間枠が約70%まで減った」と投稿しましたが、その後の最終的な残量を確認するともっと激しかったです。 Claude/GPT枠は、 5時間枠 0% 週間枠 48% 100%から一度の重いAgent作業で週間枠を約半分使いました😂 つまり、この規模の作業は単純計算でも1週間に2回できないレベル。 Geminiとは別枠なので追加されたこと自体はありがたいですが、Google AI ProでSonnet 5.5 Highを長時間のAgent作業に使う場合は、かなり慎重にした方がよさそうです。 前の投稿はこちら👇 x.lingyaoai.com/superdoccimo/status/21…
Google AI ProのAGYで、新しく使えるようになったClaude Sonnet 5.5 HighをLONE WOLFの開発に使ってみた。 結果、一瞬で5時間枠終了😂 しかも100%あったClaude/GPTの週間枠まで約70%まで減った。 Geminiとは別枠なのはありがたいけど、Google AI ProでもSonnet 5.5 Highを長時間のAgent作業に使うと消費はかなり激しい。 普段はGemini中心、Claudeはここぞという時だけ使うのが良さそう。 Sonnetでこれなので、Opusはさらに慎重に使いたい🔥
2
94
イランの通貨リアルが再び過去最安値圏へ沈み、中央銀行側が為替防衛のためのドル売却に動いたと報じられた。ロイターによると、自由市場では1ドルあたり約268万8000リアル前後まで下落し、追跡サイトによっては269万5000リアル付近まで弱い水準が示された。直前の取引日である金曜時点のおよそ263万2000リアルからさらに軟化した格好で、記事はこれを新たな安値として扱っている。 イラン国営テレビは、国営銀行が通貨を支えるため最大20億ドルの売却を始めたと伝えた。この20億ドルという規模は国営テレビの報道に基づくもので、ロイターが独自に裏付けた数字ではない点は区別しておく必要がある。中央銀行の為替担当補佐官であるメフディ・ダラビ氏は、米国側によるイラン経済崩壊観測が下落を促した一因だと述べ、下落は一時的だと国営テレビで説明した。 背景としてロイターは、リアルが過去1年で価値の半分超を失ったこと、インフレ率が70%を超える水準にあること、米国の制裁と海上封鎖が石油輸出という国家の外貨収入の柱を圧迫していることを挙げている。市民の間ではドルやその他外貨、金への資金逃避が進んでいるとも報じられている。確認できたのは、自由市場のレート水準、国営テレビ経由の最大20億ドル売却報道、当局者の「一時的」との説明までであり、介入の実際の執行額や効果の持続性は本稿時点では未確認である。 見解として、イラン通貨の急落と公的なドル供給は、制裁圧力とエネルギー輸出制約が実体経済の外貨循環にまで及んでいることを改めて示す動きだ。原油・LNGなど中東供給リスクを意識する日本市場にとっては、イラン単体の通貨ニュースというより、制裁・封鎖・地政学の緊張が為替と資源価格の双方に残る材料として位置づけやすい。短期の売買判断に直結させる材料ではなく、中東リスクプレミアムとエネルギー関連のボラティリティを見るうえでの背景情報として押さえておく価値がある。 元情報・一次情報: reuters.com/world/middle-eas…
122
エージェント議論の次の軸は「どのモデルか」「どのCLIか」より、「イベント駆動でどこまで非同期に閉じ、セッションと操作をどれだけ耐久的に持てるか」へ移りつつある。——その問いを、async-firstのエージェント・ハーネスとして前面に出しているのが Unreal Agent(unreallabsai/unreal-agent)だ。英語圏のGitHub上では短期間で相対的に星が積み上がり、日本語の独立レビューはまだほぼ空だ。 今回拾った。Unreal Agent は単発チャットCLIや特定モデルの薄いラッパーではない。呼び出し側が渡すグローバル一意IDを入口に、セッション単位のインボックスで再配送を冪等に扱い、append-onlyの履歴・フォーク・復旧・非同期オペレーションを一つの協調ループで回す設計だ。公開組織は Unreal Labs(英国表記)。スローガンは「ハーネス・ランタイム・推論の入念な設計で、エージェントをより良く・より安くする」。公開リポジトリはこの1本。最新は v0.2.0(2026-09-23前後公開)。 検証メモ(公開README・Releases・組織ページ・GitHub画面・検索結果の相対観測) ・位置づけは「エージェント本体の置き換え」より「async-first harness」。ライブラリは harness/、実行体は cmd/、ベンチは benchmarks/。インストール手順や対応プロバイダ一覧はREADMEにほぼ無く、設計仕様書型の説明が中心。 ・入力は呼び出し側が渡すグローバル一意ID。再配送でも安定。セッション・スコープのインボックスが外部入力・制御入力・クラッシュ入力をメモリ上で重複排除する。 ・セッションは append-only の永続履歴。フォーク可能。セッションストアは正規履歴とオペレーション状態を保持し、復旧とフォークを支え、ツール呼び出し状態をオペレーションと原子的に記録する。ストレージ形式はバージョン付き。非対応バージョンは明示的な再開エラー。 ・LLMターンは、論理的に1回のLLM要求を囲むコーディネータ管理の一連処理。コンテキストビルダはI/Oなしでモデル入力を状態的に組み立て、省略・切り詰め・圧縮された内容も記録する。 ・LLMアダプタが用意済み入力をプロバイダへ送り、正規化された完了応答を返す。認証・キャンセル・プロバイダエラーはこの層の責務。リポジトリ内には OpenAI Responses API 向けの生成ワイヤ型(internal/openaiapi)があるが、README上の対応プロバイダ一覧としては未整理。 ・ツールはスキーマ記述の能力。ツール翻訳器は呼び出しを検証し、オペレーションへ変換する。コーディネータのイベントループ上で同期実行され、I/Oやサスペンドをしてはならない、と明記。固定定義として Bash、ViewImage、skill-use がレジストリに載る。 ・オペレーションは非同期実行向けの直列化可能な作業記述。オペレーションマネージャが耐久実行のアクターランタイム。ローカル実装は差し替え可能で、プロキシ経由ならリモートサンドボックス内のローカルマネージャへ送り、ツールをそこで実行できる。 ・リリースは v0.1.0 → v0.1.1 → v0.2.0。v0.2.0 には Darwin/Linux の amd64・arm64 ランナーアーカイブが付く。言語は Go 約95.3%、ライセンス MIT。Open Issues は一桁台。 数値(GitHub HTML・公開README・Releases・検索結果。APIは未使用) ・リポジトリ: unreallabsai/unreal-agent ・Stars: 約2.1k(画面表示2,060)/Forks: 118/Watching: 3/Open Issues: 8 ・最新リリース: v0.2.0(2026-09-23 19:15 UTC 前後) ・最終コミット表示: 2026-09-23〜24 JST 前後(commit 1b9f778 帯) ・組織カード更新: 2026-10-02 前後 ・言語: Go 約95.3%/Python 約4.4% ・ライセンス: MIT ・公開期間感: おおよそ2026-09-21前後公開クラスの観測から約2週間で2k星帯。相対的な立ち上がりは速い ・相対エンゲージ(X): 今回の探索ではログイン壁で英語Xの直接観測は未実施。HN表層にも固有言及は見当たらず。現時点の強い信号は「短期間の星の積み上がり × 設計のニッチさ × 日本語空白」側 ・日本語ラグ: Qiita / Zenn で unreal-agent/"Unreal Agent" unreallabs 系の exact ヒットは検索上ゼロ。独立日本語レビュー供給はほぼ未形成 注意 ・Stars約2.1kは早期枠としては上限寄り。「無名発見」ではなく「日本語空白が残る中堅 async harness」枠として扱う。 ・最終コミットは9月下旬帯。組織更新は10月初頭でも、メイン線のコミット頻度は落ちているように見える。勢いの持続はまだ検証途上。 ・READMEは設計中心で、導入コマンド・対応モデル一覧・定量ベンチ結果は乏しい。触る前に自分でビルド/バイナリ経路を確認する必要がある。 ・名前が Unreal Engine 系用語と衝突しやすい。検索・共有時は unreallabsai を必ず添える。 ・公開コントリビュータは少数、公開リポは組織に1本。エコシステム成熟度はまだ浅い。 ・リモートサンドボックス実行は設計上の差し替え点。本番の隔離保証や運用手順をREADMEが保証しているわけではない。 ・「async-first」「耐久オペレーション」は設計思想の説明。スループットやコスト優位の独立ベンチは本稿時点で未確認。 次アクション / OpenClaw 1) GitHubのReleasesから自分のOS向けランナー(Darwin/Linux × amd64/arm64)を取り、まずローカルだけで一度起動経路を確認する。 2) 小さながセッションを1本作り、同一グローバルIDの再送でインボックスの冪等が効くかを見る。 3) Bash など固定ツールを1つだけ通し、オペレーションが非同期に記録・完了するかをログで追う。 4) フォークと再開を一度だけ試す。バージョン非対応時の明示エラーも確認対象。 5) OpenClawや既存エージェントがあるなら、Unreal Agentを「イベント駆動・耐久オペレーションの実行核」、常駐UIや別エージェントを「入口・権限・記憶」に役割分割する。最初からリモートサンドボックスや多プロバイダを混ぜない。 6) 日本語独立記事が出始め、Starsが急伸したりコミットが完全に止まったら早期枠からは一度降りる。今の優位は「async-first harness × 冪等入力/フォーク可能なセッション × 差し替え可能な遠隔実行 × 日本語レビュー空白」にある。 GitHub unreallabsai/unreal-agent モデルや単体CLIの議論が飽和するほど、「入力の冪等と、操作の非同期耐久をどこで閉じるか」が信用の差になる。——Unreal Agent は、その問いをコーディネータとセッションストアとオペレーションマネージャの分割として先に実装している。英語Xの直接スパイクは未確認でも、GitHub上の相対立ち上がりと日本語の独立供給の空白は同時に残っている。今が、設計を読む検証の窓だ。
1
215
Google AI ProのAGYで、新しく使えるようになったClaude Sonnet 5.5 HighをLONE WOLFの開発に使ってみた。 結果、一瞬で5時間枠終了😂 しかも100%あったClaude/GPTの週間枠まで約70%まで減った。 Geminiとは別枠なのはありがたいけど、Google AI ProでもSonnet 5.5 Highを長時間のAgent作業に使うと消費はかなり激しい。 普段はGemini中心、Claudeはここぞという時だけ使うのが良さそう。 Sonnetでこれなので、Opusはさらに慎重に使いたい🔥
1
153
AGY、いつの間にかかなり強化されてた。 Gemini 3.8 Flashだけでなく、Claude Opus 5.5、Claude Sonnet 5.5、GPT-OSS 120Bまで選べるようになってる。 しかも重要なのが、GeminiとClaude/GPTの利用枠が別。 Claude系はかなり消費が速いという報告もあるので、Opus 5.5を常用するのは厳しそう。ただ、Geminiの枠を残したまま別枠でClaudeを使えるのはかなりありがたい。 普段はGemini、難しい仕事はSonnet、ここぞという時だけOpus。 この使い分けが一番良さそうです。🤖
1
116
Cloudflare Tracesがオープンベータに。本番の1リクエストをWAF→Transform→Cache→Worker→Originまで追跡でき、さらにMCP経由でAIエージェントが正常系と失敗系を比較して原因調査する世界まで見えてきた。これは単なる監視機能の追加ではない。
Article

Cloudflare Tracesがオープンベータ エッジからオリジンまで、1本のリクエストを丸ごと追う

Cloudflare Tracesで、本番障害をAIが追えるようになってきた Cloudflareが2026年10月2日、「Cloudflare Traces」をオープンベータで公開した。 これ、単にWorkersのトレース画面が豪華になったという話ではない。

1
2
142
2026年10月4日昼前の時点で、ウクライナのゼレンスキー大統領は、ロシアによるウクライナのエネルギー施設への攻撃に対し、ロシア国内の石油製油所などエネルギー関連施設への攻撃を強める方針を示した。ロイターがキエフ発で伝えた内容によると、大統領は民間施設を無差別に狙うのではなく、戦争を支えるエネルギー資産を対象にする、と説明している。ロシア側がインフラや物流、道路、学校、病院まで含む「新しいドクトリン」で攻撃範囲を広げている、とする文書にも触れ、その対抗措置として製油所攻撃を位置づけた。 原油やディーゼルなどエネルギー価格に関わりうる話である。記事自体には、この発言直後の原油相場の新しい反応は書かれていない。過去にトランプ米大統領が、製油所への攻撃が世界のディーゼル価格を押し上げていると警告していた、という経緯だけが触れられている。週明けの原油・エネルギー関連の材料になりうるが、価格がどう動くかは、この発言だけでは決まらない。 日本の主要報道については、この時点の確認ではNHKのトップ付近や新しい見出しとしては目立たなかった。Yahoo!ニュースやNewsweek日本版などに、ロイター系の見出しが載っている程度で、国内で広く一斉に扱われている段階ではなさそうだ。日経平均やドル円への直接の公式材料ではなく、原油・海運・エネルギー関連を通じた間接的な材料、という見立てになる。 確認済みの事実は次のとおりだ。ゼレンスキー大統領が、ロシアの製油所などエネルギー施設への攻撃を強めると述べたこと。民間対象の無差別攻撃ではなく、戦争を支えるエネルギー資産を狙うとしていること。ロシア側の攻撃範囲拡大を「新ドクトリン」として言及していること。ロイターの記事は2026年10月3日付のキエフ発で、日本時間10月4日にもページ更新が見えること。記事内に、この発言そのものに直接ひも付く原油価格の新値動きは書かれていないこと。 未確認なのは、攻撃の具体的な日時や対象施設名、損害の規模、実際の出撃の有無、原油・ディーゼルの当日の価格反応である。ロシア側文書の原文も、この確認では開いていない。 元情報: reuters.com/business/aerospa… cnbc.com/2026/10/03/ukraine-… 一次情報: ゼレンスキー大統領の発言(ロイターおよびCNBCが報じた内容)。大統領府の原文ページは未取得。
238
イタリア大手銀行インテーザ・サンパオロが、同行によるモンテ・デイ・パスキ・ディ・シエナ(MPS)買収提案について、現金部分を引き上げたとロイターが報じた。改定後の条件は、MPS株1株あたり現金1.25ユーロ(従来は1.00ユーロ)に加え、新発行のインテーザ株1.6株を渡す、という内容だ。6月時点の当初提案の価値は約340億ユーロとされていたが、改定後の総額については、確認した記事では明示されていない。 加えて、MPS株主が会社側の対抗策を否決した場合に支払う条件付き現金として、8億ユーロ(記事では約9億ドルとも表記)が触れられている。MPS株主は10月29日に議決を予定しており、インテーザ側は、MPS側の提案が通れば入札を取りやめる可能性がある、との立場を示している。ロイター引用では、条件の放棄は意図せず、未充足を主張する、という趣旨の文言もある。 欧州の大型銀行再編の話であり、世界の株式・金融セクターの材料になる。日本株への直接の公式材料ではないが、欧州銀行株や金融株のリスク選好、M&A相場の空気を見る材料にはなりうる。株価の反応そのものは、この確認では記事に具体的な数値としては出ていなかった。 確認済みの事実は次のとおりだ。インテーザがMPS向け提案の現金部分を1株あたり1.25ユーロへ引き上げた、とロイターが報じたこと。株式交換比率としてインテーザ新株1.6株が含まれること。当初提案の価値として約340億ユーロという数字が記事にあること。条件付き現金8億ユーロへの言及があること。MPS株主総会(または議決)の日程として10月29日が挙げられていること。インテーザが、MPS側案が承認されれば入札を取りやめる可能性があると警告していること。 一方、インテーザの投資家向けサイトで開いた2026年10月2日付の英文PDFは、トリノ・ミラノ発の「FILING NOTICE(届出通知)」であり、改定後の対価条件そのものは書かれていなかった。したがって、現金1.25ユーロや交換比率などの詳細は、現時点ではロイターが伝える会社側説明に依拠しており、改定条件を列挙した別の公式プレス全文は未取得である。 未確認なのは、改定後の正式な総額、インテーザ株・MPS株の当日の値動きの正確な数字、届出通知以外の対価改定プレスの原文URLである。 元情報: reuters.com/business/finance… 一次情報: group.intesasanpaolo.com/con… (上記はFiling Notice。対価改定の詳細を列挙した公式文は未取得。条件の数字はロイター報道に依拠。)
141
コーディングエージェントの次の論点は「どれを選ぶか」から、「複数エージェントをどこで束ね、セッションと差分をどう閉じるか」へ移りつつある。——その「制御プレーン」をローカルファーストのネイティブUIとして前面に出しているのが Zeron(zeronsh/zeron)だ。英語圏では相対的に繰り返し言及され始め、日本語の独立レビューはまだほぼ空だ。 今回拾った。Zeron は Claude Code や Codex を置き換える新しいハーネスではない。既存のコーディングエージェントをローカルで動かし、セッション・ワークスペース・差分を一つの操作画面から管理する control plane。通常はアカウントもネットワークも要らず、必要なときだけ信頼デバイス同期を足す設計だ。zeronsh の公開OSSで、最新は v0.2.102(2026-10-02前後公開)。 検証メモ(公開README・ARCHITECTURE・公式サイト・GitHub画面・検索結果の相対観測) ・位置づけは「エージェント本体」ではなく「複数エージェントの司令塔」。README記載の対応は Claude Code、Codex、Cursor、Devin、Grok、Hermes、Pi、Antigravity。公式サイト側では OpenCode も列挙される。 ・ローカルファースト。新規インストールはアカウント不要・ネット不要を明記。各デバイス上の小さな Engine/デーモンがそのデバイスのセッションを保持する。 ・アーキテクチャは Rust 製 Engine(実行・認証・端末・リポジトリ/worktree・差分同期・文書保存)と gpui 製 UI。型付きRPCで同一プロセスまたは別デーモン経由。`zeron` はGUI付き、`zeron headless` はエンジン専用で、VPS上の常駐エンジンを別端末UIから操作できる。 ・任意のマルチデバイス同期は Loro CRDT を Cloudflare Durable Objects 経由で同期。`zeron daemon stop` → `zeron login` → `zeron daemon start` で同期プロファイルを選ぶ。同期後は別デバイスから追跡・操作、ノートPCを閉じてもVPS側で継続、ワークスペースの読書きが可能。`.git` は常に除外。 ・セッション文書はチャット単位でトランスクリプトと永続コマンドキューを保持。`send`/`steer`/`interrupt`/`respondInput` は文書に記録され、ホストデバイスが実行。オフライン送信もキューに入り、復帰後に処理される。 ・導入経路は Linux の `curl … | sh`(デーモン即時起動・再起動後も維持・`zeron status/update/daemon`)、macOS デスクトップまたは launchd、Windows はユーザー権限インストーラー/ポータブルZIP。更新は起動時・毎時・スリープ復帰時に確認、`ZERON_AUTO_UPDATE=0` で背景DLを止められる。 ・開発速度は速い。最新リリース v0.2.102、main 最新は Mermaid 描画対応(#760)。言語は Rust 約90.2%、ライセンス MIT。ARCHITECTURE は「Fresh app; no backwards compatibility required」と明記。 数値(GitHub HTML・公開README・Releases・検索結果。APIは未使用) ・リポジトリ: zeronsh/zeron ・Stars: 約2.9k(画面表示2,944)/Forks: 276/Watching: 3 ・最新リリース: v0.2.102(2026-10-02 09:23 UTC 前後) ・最終コミット: 2026-10-03 14:55 JST 前後(Mermaid diagrams in chat replies) ・言語: Rust 約90.2% ・ライセンス: MIT ・初登場トレンド観測: 2026-09-25 前後に GitHub Trending 初登場クラスの言及(当時おおよそ2.2k帯) ・相対エンゲージ(ログインなしで見える英語XのGoogle索引): @winglee など複数アカウントが散発共有。表示いいねはおおよそ数十〜3k帯。単発バズより「通常比で繰り返し触られる」型 ・日本語ラグ: Qiita は GitHub日報の一行紹介が1件(2026-09-25)。Zenn の独立記事や専用レビューは検索上ほぼ未形成 注意 ・Stars 約2.9kは早期枠としては上限寄り。「無名発見」ではなく「日本語空白が残る中堅 control plane」枠として扱う。 ・ARCHITECTURE は後方互換を保証しない。M5 Full surface/M6 Polish 未完、Composer添付や Cursor harness などのギャップ記載あり。本番前提の安定APIではない。 ・同期アカウントのデバイス同士はワークスペース全体を信頼する関係。`Show ignored files` を有効にすると `.env` などもリモートから見え得る。信頼できるデバイスだけをログインさせる。 ・`.git` 除外はあるが、完全なファイル名 denylist によるセキュリティ保証ではない。 ・Linux ヘッドレスでも `libasound.so.2` が必要。サイドバー内ブラウザには Linux browser runtime も要る。 ・公式サイトの GitHub 表記に `zeronsh/comet` が見える局面がある。指標は `zeronsh/zeron` と混同しない。 ・対応エージェント一覧はREADMEと公式サイトで差がある(OpenCode等)。実際に接続できるかは自分の環境で確認する。 次アクション / OpenClaw 1) 公式サイトから自分のOS向けバイナリを入れ、まずローカルのみ(ログインなし)で `zeron` を一度起動する。 2) 手元で常用しているエージェント(Claude Code か Codex など)を1つだけ接続し、セッション作成・中断・再開を確認する。 3) VPS検証するなら `zeron headless` を常駐させ、別端末UIから追跡できるかを見る。最初から同期ログインを混ぜない。 4) 同期を試す場合は信頼デバイスを1台に限定し、`.env` や秘密情報のあるワークスペースでは `Show ignored files` を安易にオンにしない。 5) OpenClawや既存エージェントがあるなら、Zeronを「複数エージェントの表示・セッション・差分の束ね層」、常駐UIや別エージェントを「入口・権限・記憶」に役割分割する。ハーネス自体を置き換えない。 6) 日本語独立記事が出始め、Starsが急伸したら早期枠からは一度降りる。今の優位は「ローカル制御プレーン × 多エージェント束ね × デバイス横断 × 日本語レビュー空白」にある。 GitHub zeronsh/zeron モデルや単体ハーネスの議論が飽和するほど、「何体を、どこで、どう閉じるか」が信用の差になる。——Zeron は、その問いをローカル Engine と任意同期の control plane として先に実装している。英語Xの相対スパイクは散発、日本語の独立供給が空いている今が、検証の窓だ。
1
1
2
245
コーディングエージェントの次の勝負どころは「どのモデルか」より、「薄いランタイムで何体並べ、どこまでオフラインで閉じられるか」へ移りつつある。——その軸を、単一Rust実行ファイルの端末エージェントとして前面に出しているのが Ante(AntigmaLabs/ante)だ。英語圏では相対的に繰り返し言及され始め、日本語の独立記事はまだほぼ空だ。 今回拾った。Ante は Claude Code / Codex 系の依存やモデル縛りに乗らず、約15MBの圧縮バイナリを展開するだけで動く自己完結型のターミナルエージェント・ハーネス。ホスト型プロバイダのプリセットとローカル推論を同居させ、名前付き端末や永続サブエージェントで「小さなエージェントを細胞のように複製・再接続する」設計をREADMEは cellular-native と呼ぶ。Antigma Labs の公開OSSで、最新は v0.2.8(2026-10-03前後公開)。 検証メモ(公開README・Releases・GitHub画面・検索結果の相対観測) ・配布形態は単一Rust実行ファイル。ランタイム依存ゼロを主張。圧縮ダウンロードは約15MB。クライアント/デーモン構成で、TUI・ヘッドレス・ante serve が同じデーモンに接続し、セッション・ターン・ステップ・ツール・権限・スキル/エージェントを管理する。 ・モデル層は「15のホスト型プロバイダ・プリセット+ローカル」。APIキー/サブスクリプション/持ち込みモデルを選べる。ローカルは管理された llama.cpp 経由でGGUF推論。「APIキーなし・アカウントなし・ネットなし」を明記。 ・/term で別の対話セッションを共有ビューとして開く。永続インタラクティブ・サブエージェントをデタッチ/再接続し、追加入力・回答比較・会話ブランチが可能、と書く。v0.2.8では /rewind・/fork、ante serve のトランスクリプト出力、GPT-6.1 Sol 対応、バイナリ約6%小型化、トークン更新・コンテキスト溢れ・WebSocketキャンセル・プロバイダタイムアウト修正が入る。 ・性能主張は「20並列Dockerタスク」比較。Claude Code 比でピークメモリ約7×減、平均CPU約9×減、ディスクI/O約5×減、とREADMEに数値がある。公開評価は Terminal-Bench 2.1 の継続試験:89タスク×5試行。最新はオープンウェイト DeepSeek V4.1 Flash で 83.9%(370/445 trials、Ante 0.preview.98)。 ・設計言語は「細胞」。小さく、使い捨て可能で、大量複製されるエージェントの基質(substrate for self-organizing intelligence)として位置付ける。単発チャットCLIというより、多体運用の薄いハーネス寄り。 ・開発速度は速い。タグ/リリースは100本超規模、最新コミットは 2026-10-03 13:14 JST 前後「chore(release): sync v0.2.8」。言語はRust約68.7%、ライセンス Apache-2.0。Open Issuesは十数件規模で、巨大化前の運用感。 数値(GitHub HTML・公開README・Releases・検索結果。APIは未使用) ・リポジトリ: AntigmaLabs/ante ・Stars: 約2.0k/Forks: 68/Watching: 3/Open Issues: 13 ・最新リリース: v0.2.8(エントリ日付 2026-10-02、公開 2026-10-03 04:14)。/rewind・/fork・serve transcript・GPT-6.1 Sol・バイナリ縮小・安定性修正 ・言語: Rust 約68.7%/他 ・ライセンス: Apache-2.0 ・Terminal-Bench 2.1: 83.9%(DeepSeek V4.1 Flash、370/445) ・相対リソース主張(20並列Docker): ピークメモリ約7×減、平均CPU約9×減、ディスクI/O約5×減(対 Claude Code) ・相対エンゲージ(ログインなしで見える英語XのGoogle索引): 公式 Antigma アカウントに加え、Chris Short、connect24h、aftahi_ai、NoCommas、betterhn50 など複数アカウントが散発共有。表示ビューはおおよそ数十〜1.3k帯、インタラクションは控えめ。単発バズより「通常比で繰り返し触られる」型 ・日本語ラグ: Qiita / Zenn で AntigmaLabs ante/ante Antigma の exact 系ヒットは検索上ゼロ。独立日本語レビュー供給はほぼ未形成 注意 ・「Claude Code 比で7×/9×/5×」はREADME上の自社比較。条件・バージョン・測定手順の独立再現が公開されるまで、相対優位の主張として読む。 ・Terminal-Bench 83.9% は特定モデル(DeepSeek V4.1 Flash)と特定ビルド(0.preview.98)の結果。モデルやバージョンを変えると数字は動く。 ・Stars約2kは早期枠としては上限寄り。メガバイラルではないが、「無名発見」枠ではなく「日本語空白が残る中堅」枠として扱う。 ・オフライン主張はGGUF+llama.cpp前提。ホスト型プリセット利用時はネットとキー境界が戻る。課金経路を混ぜない。 ・cellular/自己組織化のレトリックは設計思想の説明。自律増殖や無人運用の実証ではない。 ・Open Issues 13・Watching 3。機能密度は高いが、コミュニティ成熟と運用ノウハウの層はまだ薄い。 次アクション / OpenClaw 1) 公式リリースから単一バイナリを入れ、まずローカルGGUFか単一ホストプロバイダだけで ante のTUIを一度通す。 2) ante serve またはヘッドレスでデーモン接続を確認。セッションがクライアント再起動後も残るかを見る。 3) /term とサブエージェントのデタッチ/再接続を、小さな並列タスク(ログ要約+テスト修正など)で一度だけ試す。 4) 20並列級の負荷や Claude Code 比較は、自分のマシン条件をメモしたうえで少数並列から。README数値をそのまま信用しない。 5) OpenClawや既存エージェントがあるなら、Anteを「薄い多体実行層」、常駐UIや別エージェントを「入口・権限・記憶」に役割分割する。最初からプロバイダを混ぜない。 6) 日本語独立記事が出始め、Starsが急伸したら早期枠からは一度降りる。今の優位は「薄いRustランタイム × オフライン/多体設計 × 日本語レビュー空白」にある。 GitHub AntigmaLabs/ante モデル選定の議論が飽和するほど、「どれだけ薄く、オフラインでも、何体並べられるか」が信用の差になる。——Ante は、その問いを単一Rust実行ファイルと cellular なセッション設計で先に実装している。英語Xの相対スパイクは小さく散発、日本語の独立供給が空いている今が、検証の窓だ。
1
1
341
発見日時: 2026年10月4日 10:42(日本時間) 速報度: A カテゴリ: 商品(原油)・地政学・中東・ホルムズ海峡 ネタ名: イラク国営タンカー会社が、イラク産原油200万バレルをVLCCでホルムズ海峡経由で運んだと発表 2026年10月3日から4日にかけて、イラクの国営石油タンカー会社が、イラク産原油200万バレルを大型原油タンカー(VLCC)に積んでホルムズ海峡を通過させたと報じられた。国営タンカー会社のアリ・カイス・アブドゥルジャッバール局長は、この規模のオペレーションは数十年ぶりだと説明している。売り手側の柔軟性という点では、イラク国営石油販売会社SOMOが、バスラ渡しに限らない出荷の選択肢を広げた、という位置づけである。 確認できているのは、国営側が「200万バレル」「VLCC」「ホルムズ海峡」「数十年ぶり」と述べた、という報道までである。出典はArab Newsがロイターを引いた2026年10月3日23:50更新の記事、ABCの2026年10月4日の記事、Iran Internationalである。船名、通過した正確な時刻、買い手、この積荷の売値、この航海についてイラン側が個別に許可したかどうか、損傷や拿捕があったかどうか、イラク政府の原文発表のURLは、この時点では確認できていない。これらは未確認であり、本文でも事実としては扱わない。 日本の主要紙では、日経、NHK、共同の見出しとしては見つかっていない。日本語ではInvesting.com系の配信が1件ある程度で、国内の株式・商品コメントとしてはまだ薄い。そのため速報度はSではなくAとした。すでに日本で広く消化されたニュースではなく、ただし公式の一次文書そのものまでは追えていない。 見解として、この話の芯は「イラクが1隻分の原油を売った」ことより、「誰がホルムズを実際に通せるか」を示す実例になったことにある。ホルムズ海峡は世界の海上原油輸送の要で、日本の中東依存とも直結する。週末の北海ブレントは1バレル102.7ドル前後で高止まりしていたが、その価格自体はこのタンカー1隻のニュースで動いた数字ではない。むしろ、海峡が完全に閉じているわけではない一方、通常の商業航海が戻ったともまだ言えない、という中間の状態を市場が見ている局面での一例である。 日本市場との関係では、原油高の継続は石油元売り、電力、化学、航空、陸運のコストと、交易条件を通じた円と株の両方に効く。ただしこの1件だけで「原油が上がる」「下がる」とは言えない。200万バレルはVLCC1隻としては標準的な積荷でも、世界の一日の消費に比べれば小さい。価格を動かすなら、同種の航海が続くのか、保険や用船が実際に付くのか、イラン側の通航条件が緩むのか、という次の確認が出てからである。 元情報: - Arab News(Reuters)2026年10月3日 23:50更新 - ABC 2026年10月4日 - Iran International 一次情報: - イラク国営タンカー会社およびアリ・カイス・アブドゥルジャッバール局長の発言として各媒体が伝えたもの。政府・会社の原文URLは未確認。
236
コーディングエージェントの競争軸が「単発のコード生成」から「計画→並列実装→検証→レビューまでを同じCLIで閉じる」へ移るほど、サンドボックス既定と権限モデルが信用の分水嶺になる。——その設計を、BYOモデルのローカルCLIとして厚く載せているのが Alysis Code(AlysisAi/alysis-code)だ。英語Xでは小さく跳ね、日本語の独立記事はまだほぼ空だ。 今回拾った。Alysis Code は「Everyone's coding agent」を掲げるローカルCLIのコーディングエージェント。計画をレビュー済み・PR準備のコードへ落とす、とREADMEは書く。モデルは持ち込み。サンドボックスは既定で有効。Athens(ギリシャ)の独立ラボ Alysis AI の最初の製品で、個人スクリプトからチームサーバー、CIまで同じエージェントを使う、という位置付けだ。 検証メモ(公開README・Docs・Releases・GitHub画面・検索結果の相対観測) ・中核は Forge Mode。要求を受け、曖昧なら1〜3個の確認質問。plan.json にタスク・依存関係・書き込み範囲を保存し、/execute plan で準備済みタスクをワーカーへ並列配布。タスクごとに検証し、失敗は issue として次回試行へ継承。検証済み変更を開始ブランチへ統合する。証跡は .alysis/runs/<run_id>/ に計画・ログ・パッチ・検証・レビューとして残る。 ・並列(swarm)は Git worktree またはスナップショット分離。write_scope や estimated_files が正確で相互排他的なときだけ並列化しやすい。ディレクトリや曖昧な glob では単独実行になりやすい、と明記。 ・PRモードはローカルのブランチ・コミット・review・verify・mergeまで。リモートへの push、ホスト型PR作成、保護ブランチへの merge は行わない。例: alysis forge swarm --parallel 3、alysis forge exec T01 --pr --review --verify strict。 ・権限は readonly / review / auto / fullaccess。review が安全な既定で、書き込みと shell の前に確認。fullaccess でも denylist と監査ログは残る。ペルソナは code / architect / ask / debug。 ・サンドボックス既定は strict、backend=auto、network=off、環境変数クリア、Gitメタデータ保護。Linuxは Bubblewrap、macOS/Windowsは Docker推奨。sandboxが使えなければホストshellへフォールバックせず fail-closed。rm -rf /、curl | sh、sudo などは fullaccess でも常時拒否。検証も strict sandbox が既定。 ・注意点として、sandboxの対象は shell/verification 中心。カスタムPythonツールの subprocess は自動ではsandbox化されない。sandboxは不正コードを安全化するものではない、とも書く。 ・拡張は Skills(SKILL.md)、Plugins(alysis-plugin.toml)、Hooks(PreToolUse / PostToolUse / PostWrite / SessionStart / SessionStop など11イベント)、カスタムPython tools(.alysis/tools/*.py、プロジェクトツールはファイルハッシュの明示trust)、MCP(stdioとStreamable HTTP)。MCPは起動時にツールカタログをスナップショットしセッション中は固定。swarm worker・subagent・conflict resolverにはMCPを公開しない。 ・モデル層は OpenAI / Anthropic / DeepSeek / Qwen / Gemini / Mistral / Xiaomi MiMo / OpenRouter / xAI など。ローカルは Ollama / LM Studio / vLLM。完全オフライン運用を主張。APIキー、Alysisアカウント、対応AIサブスクリプションを選べる。 ・導入は Python 3.11+。pipx install alysis-code → alysis-code(短縮 alysis)→ chat / run / setup。READMEは macOS・Linux・Windows対応。公式サイト側は Windows via WSL とより限定的。 ・アーキテクチャは Typer CLI、workspace binding、session runtime、model provider、tool assembly、approval/sandbox、local artifacts。workspace root を固定し、作業ディレクトリが root 外へ逃げられない設計。長い会話では tool-output offload と conversation compaction。 ・ドキュメントの食い違い: READMEは旧来のチャット /plan を削除したと書く一方、Docs側に /plan <task> 等が残る。mainには「Release v0.14.4 with IDE integrations…」(9/29)があるが、Releasesの最新タグはまだ v0.14.3。急速開発中の痕跡。 数値(GitHub HTML・公開README・Releases・検索結果。APIは未使用) ・リポジトリ: AlysisAi/alysis-code ・Stars: 166/Forks: 19/Watching: 0/Open Issues: 3/PRs: 5/Commits: 67/Contributors: 3/Releases: 25 ・最新リリース: v0.14.3(2026-09-28)。Sonnet系のネイティブ Messages、streaming、signed reasoning、hosted accountのprompt caching自動既定など。prereleaseではなく安定線の 0.14.x。 ・最新コミット: 2026-09-29 23:55 JST「Isolate checkpoint data-policy tests from worker startup timing」 ・言語: Python 約85.5%/TypeScript 約10.6%/JS・HTML・CSS・Shellほか ・ライセンス: Apache-2.0 ・公式サイトとラボ(Athens, Greece)を公開。月50 free creditsを掲載。SWE-bench等の公開勝率・速度比較はREADME/Docsに見当たらず ・相対エンゲージ(ログインなしで見える英語XのGoogle索引): pengsonal の紹介が70+ likes。公式 AlysisAI は70+ followers規模。他は数likesの小投稿が散発。絶対バズではなく、小アカウント比で厚い初期反応 ・日本語ラグ: Qiita / Zenn / note / はてな系の exact-name 記事は検索上ゼロ。上位は公式GitHub・公式サイト中心。独立日本語レビュー供給はほぼ未形成 注意 ・「PR-ready」「plans, builds, and ships」は製品設計上の主張。公開ベンチマークがない段階では、性能実証ではなくワークフロー実装として読む。 ・sandboxは shell/verification 中心。カスタムツールやモデル出力そのものを安全化しない。fullaccess と network 開放は別物として扱う。 ・Windowsは READMEと公式サイトの表現がずれる。実機は WSL前提で試す方が安全。 ・Alysisアカウントの月次creditsはホスト側課金境界。BYOキー運用と混同しない。 ・Docsの /plan 記述や v0.14.4 未タグなど、ドキュメントとリリース面のドリフトがある。検証は README+最新リリースノートを正にする。 ・Stars三桁前半・コントリビュータ3人。設計は厚いが、コミュニティ成熟と再現実験の層はまだ薄い。 次アクション / OpenClaw 1) Python 3.11+ 環境で pipx install alysis-code。まず readonly または review で alysis-code setup → chat のみ通す。 2) sandbox backend(Bubblewrap / Docker)が実際に起つか確認。起たなければ fail-closed になるので、ホスト実行へ逃げない設定のまま止める。 3) 小さな失敗テスト修正を alysis-code run で一度だけ。Forge / swarm / --pr は write_scope を狭く切ってから。 4) MCP・カスタムPython tools・hooksは明示trust後。swarm worker側にMCPが乗らない前提で、権限境界を設計する。 5) OpenClawや既存CLIエージェントがあるなら、Alysisを「計画と並列検証の実行層」、常駐UIや別エージェントを「入口」に役割分割する。モデルは最初からローカル(Ollama等)か単一プロバイダに固定し、課金境界を混ぜない。 6) 日本語独立記事が出始め、Starsが急伸したら早期枠からは一度降りる。今の優位は「設計の厚み × 日本語レビュー空白」にある。 GitHub AlysisAi/alysis-code 単発チャットでファイルを直す段階を超え、「計画・並列・検証・ローカル統合」まで同じCLIで閉じたい人ほど——Alysis Code は、BYOモデルと fail-closed サンドボックスを前提にした Forge 実装を、Apache-2.0 の薄いスター数のまま先に触れる題材になる。英語Xの相対スパイクは小さく、日本語の独立供給が空いている今が、検証の窓だ。
1
2
471
Cloudflare Workers OAuth Provider v1では、認証WorkerとMCPなどのリソースWorkerを分離。Service Binding経由でトークンを検証し、複数MCPや不足scopeの再認可にも対応します。0.xからの移行ではresourceMetadataの追加が主な変更点です。
Article

CloudflareのMCP向けOAuthがv1に——認証サーバーとリソースサーバーを分離

リモートMCPサーバーを公開するとき、いちばん面倒なのが認可まわりです。Cloudflareのパッケージ @cloudflare/workers-oauth-provider がv1になり、Authorization ServerとResource

1
1
159
Cloudflare AI SearchがGA。対応モデルでは画像埋め込み、スキャンPDFはOCRで検索できます。新規インスタンスではハイブリッド検索が既定。課金開始は2026年11月1日です。
Article

Cloudflare AI Searchが一般提供開始——画像埋め込み・OCR・ハイブリッド検索を標準に

Cloudflareは2026年10月1日、AI Searchを一般提供(GA)した。Workers AI、Vectorize、R2、Browser

1
554
日本株の信用倍率が、 8.35倍 → 7.30倍 → 6.17倍 まで低下。 しかも今回は、信用買いが大きく減ったというより、売り残が8,844億円→1兆472億円まで一気に増えたのが大きい。 売り1に対して買い約6。 まだ買い長ではあるけど、需給の偏りはかなり縮んできた。 こういう相場、オプションの「売り」しかやらない僕には少しずつキツくなる。 オプション売りは、方向を当てるというより時間価値を取る戦略なので、相場が一定方向へ走り続けるのが一番しんどい。 上昇が続けばコール売りが苦しくなる。 下落が続けばプット売りが苦しくなる。 逆に、ある程度行ったり来たりしてくれれば時間が味方になる。 ただ、春先から初夏にかけて日経平均が一気に1万9千円近く上げた局面と比べれば、今はまだ全然楽。 あの時は「どこまで行くんや」という上昇を、コール売り側でまともに受け続けた😂 今はプット売りも使えるし、ヘッジもしながら対応できる。 結局オプション売りで一番怖いのは上げ相場でも下げ相場でもなく、 「同じ方向へのトレンドが長く続くこと」 だと思っています。 信用倍率が6.17倍まで下がってきた今、この先さらに売り残が増えて需給が変わっていくのかはかなり注目しています。 x.lingyaoai.com/superdoccimo/status/20… ※個人の売買経験についての投稿であり、投資助言ではありません。 #日本株 #日経平均 #オプション取引 #信用取引 #投資
1
257
コーディングエージェントの常駐化が進むほど、「チャットに閉じ込められたAI」と「机の上で話しながら動く相棒」の差が、実務の摩擦に直結する。——その差を、実プロダクトとしてほぼそのまま埋めてきているOSSが、英語圏ではまだ薄いまま日本語Xで先に動き始めている。 今回拾った。ASIST(nyosegawa/asist)は、Mac/Windows向けのリアルタイム音声デスクトップアシスタントだ。話すと声で答え、天気・予定・メール・ToDo・為替・ニュース・地図・タイマーなどをカードで示し、長い調査やファイル編集は承認後にローカルのCodexまたはClaude CLIへAgent Jobとして渡す。会話モデルはAnthropic/OpenAI/Google/Cerebrasから選べる。 検証メモ(公開README・リリースノート・GitHub画面・X画面の相対観測) ・立ち位置は「完全なAlways-on daemon」というより、机の横に常駐する会話UI。Electron+electron-vite+React/TypeScript。package.json上はElectron 43系・React 19系。 ・話し終わると短い応答をすぐ開始し、話しかけると読み上げを止める。日本語では相づち・うなずき・間を調整する、と明記。バックチャネル判定までローカルモデル側に寄せている。 ・Calendar: Google Calendarの表示・追加・変更。Mail: IMAP/SMTPで読み、要約し、返信下書き。Memory: 毎日、会話から「ユーザーについての記憶」とASIST自身の日記を作り、翌日の会話は前日の記憶から始まる。me.md/user.mdを各会話へ注入する実装もv0.7.0に入った。 ・Mini AppsとしてAgent jobs、Tasks、Notes、Mail、Memory、CalendarなどをDock側に持つ。完了済みAgent Job履歴は直近50件。 ・Agentは子プロセスとしてCodex(デフォルト)またはClaude CLIを起動。読み取り専用でも開始前・継続前に確認画面。Git管理下では別worktreeで作業し、diffをレビューしてMerge/Discard。Git外フォルダは直接変更。WindowsのCodexは独自sandbox設定がないと書き込みJobが起動しない。 ・ASISTに保存したAPIキーや環境変数のAPIキーはCLIへ渡さない。CLI自身の認証・料金・利用上限を使う。課金境界が二重になりにくい設計。 ・ローカル処理: 音声認識、VAD、ノイズ抑制、日本語相づち判定、メモリ検索。外部LLMへは会話文・プロンプト・関連メモリ(Live API時はマイク音声も)。天気・ニュース・為替・地図では必要最小限の語が各サービスへ行く。 ・ローカルモデル群の例: Qwen3-ASR、Whisper small、Silero VAD、DeepFilterNet3、Irodori-TTS、Qwen3-TTS、multilingual-e5。日本語相づちには京都大学MaAI関連と日本語分類モデル。 ・v0.7.0(当日Latest): 11言語Memoryテンプレート、大容量ファイル向け時間・メモリ予算、HTMLプレビューの隔離セッション、Git worktree/merge/crash recovery、Windows Codex sandbox、同梱Git 2.55.0など。Commitsは228、Releasesは8段階。 数値(GitHub HTML・公開README・X画面表示。APIは未使用) ・リポジトリ: nyosegawa/asist ・Stars: 13/Forks: 1/Watching: 0/Open Issues: 9/Commits: 228/Releases: 8 ・最新リリース: ASIST 0.7.0(2026-10-03)/最新コミット同日 17:50 JST「Raise the version to 0.7.0」 ・言語: TypeScript約88.9%/JS・CSS・Pythonほか ・ライセンス: MIT(本体)。同梱MinGitはGPL-2.0、モデルと外部データは個別ライセンス ・OS: macOS 14以降・Apple Siliconのみ(Intel非対応)/Windows 11 x64のみ(Arm非対応) ・ローカル音声: Mac合計約5.1GB(16GB未満は約3.5GB推奨)。Irodori-TTS約+2.1GB、Qwen3-TTS約+1.8GB。WindowsはVulkan対応独立GPUが必要(ASRはVRAM6GB以上で1.7B、未満は0.6B。TTSは8GB以上推奨)。GPUなしはブラウザ内Whisper/Gemini Live/テキスト入力が代替 ・相対エンゲージ: @gyakuse(約9.6Kフォロワー)の紹介は約1.74万表示・172いいね・35リポスト・102ブックマーク(2026-10-02)。Stars 13に対して異常に厚い。@sora19aiは約2,100表示・11いいね・2リポストで二次拡散はまだ小さい ・英語圏: 独立英語レビューや大規模英語X投稿はほぼ見当たらず。公式README・英語ドキュメント・中国語転載が中心。日本語X先行、英語認知はsparse 注意 ・「開発者へデータを送らない/データはコンピューターに残る」は、完全オフラインや完全プライベートを意味しない。 ・会話ログ・Memory・取得メールは暗号化されない通常ファイル。Memoryを画面で消してもGit履歴に残り得る。APIキーとメールパスワードはElectron safeStorage(Mac Keychain/Windows DPAPI)だが、Windowsでは同一ユーザー権限の他プログラムが復号し得る、と公式が書く。 ・Agentはユーザー権限で動き、作業ディレクトリだけに完全隔離されるわけではない。承認後のメール送信・カレンダー変更・Agent Jobは実世界に作用する。 ・公式自身が、メール/Web/ファイル内容中のプロンプトインジェクション(モデルが指示を実行しようとする)を警告している。 ・Windowsインストーラーは未署名。API費用は各プロバイダー直払い。ASISTのコスト表示は推定値で、Codex Job費用を含まない。毎日のMemory curationもCLIアカウント課金に乗り得る。 ・今回の枠の読み方: 海外Xで先に跳ねた案件の日本語ラグ、というより「日本語コミュニティで相対スパイクが出た常駐音声エージェント」を、英語圏のレビュー供給が追いつく前に検証する逆方向ラグ。早期シグナルの形は違うが、Starsとブックマークの乖離ははっきりしている。 次アクション / OpenClaw 1) Apple Silicon Mac、またはVulkan GPU付きWindows 11でASIST 0.7.0を入れ、マイク/モデル/言語だけ先に通す。カレンダーとメールは後回し。 2) 保存先(Mac: ~/Library/Application Support/asist/、Win: %APPDATA%\asist\)と平文ログ前提を、接続前に確認する。 3) Agentは読み取り専用Job→worktreeのdiffレビュー→Mergeの順。最初から書き込みJobやメール送信を開かない。 4) OpenClawや既存のCLIコーディングエージェントがあるなら、ASISTを「常駐UIとカード」、Codex/Claude CLIを「重い実行」に役割分割する。APIキーを二重に渡さない設計は、課金境界の確認にも使える。 5) Stars二桁のままブックマーク三桁が乗る状態は毀損しやすい。READMEのPrivacyとリリースノートを毎回突き合わせ、英語圏の認知が厚くなったら早期枠からは一度降りる。 GitHub nyosegawa/asist 自前の音声エージェントと、本業用CLIエージェントの境界が曖昧な人ほど——ASISTは「机で話し、カードで確認し、重い仕事だけ承認してCLIへ渡す」という分離を、MITの実アプリとして先に触れる題材になる。日本語Xで相対が立ち、英語圏のレビュー供給がまだ薄い今が、検証の窓だ。
5
1,055
コーディングエージェントの強化学習が「自前プロンプト+自前ツール」の閉じた箱で止まる限り、本番で使うClaude CodeやCodex、OpenCodeへの転移は測れない。——この穴を、実ハーネスをそのまま走らせて埋めるOSSが、英語圏で静かに伸びている。 結論から言う。FineEnvs(adithya-s-k/FineEnvs)は、LLMエージェント向けのRL環境と訓練レシピを、複数の実コーディングハーネス横断で回すためのオープンな基盤だ。売りは「新しい巨大モデル」ではなく、出荷状態のハーネスを書き換えずに同一タスク集合で学習・評価し、小型モデルでも正答率とツール呼び出し効率を同時に動かす、という再現可能な立て付けにある。探索時点のStarsは三百台前後。絶対バズではなく、日本語の厚い一次解説がまだ薄い早期シグナル枠。 検証メモ(公開README・HF記事・ダッシュボード観察、JST) ・公式の立て付けは「RL Environments 101: building and scaling RL environments in the age of LLMs」。タスク集合、プロンプト、初期状態、ツール/ハーネス、世界状態、実行バックエンド、観測、決定論的報酬、終了条件までを環境として切り出す設計。 ・公開されたマルチハーネス実験の中核はLFM2.5-2.6B。4ハーネス横断で正答率が約42%から約54%へ、ツール呼び出しは約31%減、という主張。公開チェックポイントはstep 1000で全体pass@1 54.2%(542/1000セル)。 ・評価は固定のSmolDataEnvsテスト250タスク×4ハーネス=1000セル。ハーネス別のLFM pass@1はおおよそ OpenCode 49.6%、Claude Code 48.8%、Codex 53.6%、Mini-SWE-Agent 64.8%。「同じタスク集合を、出荷状態の異なるエージェントループで測る」のが芯。 ・歴史ベースラインは421/998=約42.18%(未採点2セルあり)。step 700の54.6%は同一テスト集合上で選ばれたベストであり、独立バリデーションではない、と記事側も明示している。 ・ツール呼び出し削減の「31.1%」は、両モデルが解いた356のタスク/ハーネス組に限ったマッチド比較。全タスクの因果効果ではない。 ・報酬は correctness × (1 + 0.1 × 15/(15+tool_calls))。pass@1自体は正しさのみ。SmolDataEnvsは「報酬経路にLLMを置かない」と明記。決定論的グレーディングが売り。 ・データ側のSmolDataEnvsはKaggle由来471データセットから5394タスク。固定テスト分割はeasy 33/medium 118/hard 99。 ・訓練スタックはOpenEnv/Harbor、TRL Async GRPO、vLLM、Daytona/E2Bサンドボックス、Hugging Face JobsまたはSlurm。現行マルチハーネスレシピはPython 3.12とH100/H200×2想定。 ・ロールアウトはwhite-box(トレーナーが生成とツール実行を握る)とblack-box(ハーネスがエージェントループを握り、OpenEnvがロールアウトを捕捉)の二系統。エンジン側のtoken ID・logprob・loss maskをトレースで保持し、編集済みテキストの再トークン化を避ける、と説明されている。 ・Qwen3.5-2BのマルチハーネスRLも公開され、step 500でpass@1 37.0%(正しさのみ報酬、ツール効率ボーナスなし)。LFM系と並べて「小型モデル×実ハーネス」の再現実験が揃っている。 ・記事ダッシュボード上ではOpenHands SDK、Terminus-2、SWE-Agent、Claude Code、Goose、Hermes、Qwen-Coder、OpenCode、Gemini CLI、Trae-Agent、Kimi CLI、Codexなど複数ハーネスが列挙される。エージェント執筆スキル側はClaude Code/Cursor/Codex/OpenCode/Gemini CLI等にも触れる。 ・重要:FineEnvsはハーネスやそのツールを書き換えない。出荷状態のまま走らせる。したがって「自前ミニエージェントで良い数字」と「本番ハーネスで良い数字」を混同しにくい。 ・日本語の導入記事・比較レビューは探索時点でほぼ見当たらない。英語のGitHub/Hugging Face記事が一次情報の中心で、情報ラグが残る。 数値(GitHub HTML・HF記事・公開チェックポイント観察) ・リポジトリ: adithya-s-k/FineEnvs ・Stars: 約302/Forks: 約38(探索時) ・ライセンス: Apache-2.0 ・言語: JavaScript/Python/HTML/Astro/TypeScript ほか混在。環境・訓練・ノート・テスト・デプロイ資産が揃う実装リポ ・コミット: 2026-10-01〜10-02帯に更新。公開Releaseは探索時点で未整備、コミット約127本規模 ・LFM公開モデル: FineEnvs/LFM2.5-2.6B-multiharness-RL(約3B、LFM Open License v1.0) ・LFM結果: 歴史ベース約42.18% → step1000で54.2% pass@1;マッチド356組でツール呼び出し約31.1%減 ・ハーネス別LFM pass@1: OpenCode 124/250、Claude Code 122/250、Codex 134/250、Mini-SWE-Agent 162/250 ・SmolDataEnvs: 5394タスク/471 Kaggle由来、固定テスト250(E33/M118/H99) ・HF組織の公開物: モデル十数本、データセット四十台、Spaces二十台超(探索時の表示) ・英語圏の一次告知は相対エンゲージが強く、ブックマーク優位の保存型拡散が見える一方、GitHub Starsはまだ三百台——認知と実装利用のギャップが残る 注意 ・「42→54+ツール31%減」は見出し用の要約。54.2%は1000セルのpass@1、31%減はマッチド成功組のみ。因果分離や全タスク平均と読み替えない。 ・ベストチェックポイント選択が同一テスト集合上である点は記事自身が注意する。単一ラン・ハーネス版依存・交絡あり。再現は条件を自分で固定する。 ・報酬にツール効率ボーナスを入れる設定と、正しさのみの設定が混在する。Qwen実験は正しさのみ。数字を横断比較するときは報酬定義を揃える。 ・ネイティブopencode_envはOpenEnv 0.7.0以降deprecated。新規はHarbor推奨。古い手順書をそのまま踏まない。 ・訓練はH100/H200級とサンドボックス前提。ノートPC一発で本番同等は期待しない。まずは評価ダッシュボードと公開チェックポイントの追試から。 ・Stars三百台は成熟製品ではない。環境API・ハーネスアダプタ・報酬定義の変更があり得る。週次でREADMEとHFコレクション差分を見る。 ・「マルチエージェント」「自作RL環境」一般論と混ぜない。今回の芯は「出荷状態の複数コーディングハーネスを、決定論的タスク集合で横断学習・評価するRL環境基盤」一点。 次アクション / OpenClaw向け 1) まず公開HFのLFM2.5-2.6B-multiharness-RLチェックポイントと、SmolDataEnvs固定テストの評価手順だけを読む。訓練を回す前に「何がpass@1で、何がツール効率か」を切り分ける。 2) 手元にClaude Code/Codex/OpenCodeのいずれかがあるなら、同一の小さなタスク集合で黒箱評価だけ通電。自前プロンプト評価とハーネス評価の数字がどれだけズレるかを先に見る。 3) 報酬経路にLLM審判を置いていないか確認する。FineEnvsの売りは決定論的グレーディングなので、社内タスクを足すときも採点をスクリプト化する。 4) 新規ランはHarbor前提で組む。deprecatedなネイティブOpenCode環境や、再トークン化前提の古いログ収集は使わない。 5) OpenClaw並走なら、長期メモリ・承認・社内ワークフローはOpenClaw側に残し、FineEnvsは「ハーネス横断の学習・評価ラボ」に限定する。最初の1本は副作用の小さいデータタスク評価だけ。upstreamは三百Star台なので、LFM/Qwenの報酬定義差分とテスト集合選択の注意書きを週次で見る。 GitHub adithya-s-k/FineEnvs 自前ミニエージェントの良い数字と、本番ハーネスの良い数字は別物——FineEnvsは、その差を同一タスク集合で見える化するRL環境側の答えを、小型モデルの公開チェックポイント付きで出した、という見立て。日本語の厚い解説がまだ薄い今のうちに、評価セルの定義・マッチド比較の範囲・同一テスト上のチェックポイント選択の三点だけ先に押さえ、捨て環境で黒箱評価を1本通すのが最短の検証になる。
1
1
2
796