置いた層は、効いていなかった — 許可ルール92件が10万9762回の実行で一度も発火せず、AI組織は「正常終了」しながら37日死んでいた週(2026年8月第4週)

★ 0
🎧 この記事を音声で聴く(14:07)
※ この記事の音声版は edge-tts (Microsoft) で生成しています。息継ぎや疑問文の語尾など、人間の話し方と異なる箇所があります。

先週、W34で 「主役は、モデルの外側だった」 と書きました。ハーネスという外側の層を足したら、30点が100点になった、という研究の話です。

今週出てきたのは、その続きではありませんでした。外側に層を置いたのに、効いていなかったという実測が、3本まとめて出ています。

許可ルールを152件書いていた人が10万9762回の実行と照合したら、完全一致で書いた92件は一度も発火していませんでした。フックが23回きちんと発火しているのに、無人のClaude Codeが13時間24分止まった記録も出ています。27個の常駐ジョブが全部「正常終了」を返しながら、中身は37日前から死んでいたという実録もありました。

置いた層が、置いてあるだけだった週です。今週のキーワードは、「置いた層は、効いていなかった」 です。そして僕は、まさにその「置いた層が効くか」を8月18日から測っていて、判定は明日でした。

いつもの通り、ニュースソースは自動ニュース収集システムから。全ニュースはNotionダッシュボードで公開しています。


置いたルールは、一度も呼ばれていなかった

今週の主な動き

日付出来事
8/24〜26許可ルール152件を10万9762回の実行と照合した実測が公開
8/23無人のClaude Codeが13時間24分停止した記録が共有
8/25〜28文脈の再読コスト、MCPのトークン消費、モデル切替のキャッシュ破棄の実測が集中
8/27Anthropicが物理機器の操作規格MHSを発表
8/26〜27OpenAIがHugging Face侵害の公式報告書を公開、100社超の共同書簡へ

ソースは許可ルールを152件ためこんでいた(Zenn)、無人のClaude Codeが13時間止まった原因(Zenn)です。

効かなかったのは、ルールではなく書き方でした

一つ目が、今週いちばん刺さった実測です。

permissions.allow に152件の許可ルールを溜めていた人が、実際のコマンド実行10万9762回と突き合わせました。結果、完全一致で書かれた96件のうち92件が、一度も発火していなかったそうです。

ここで大事なのは、全部が無駄だったわけではないことです。同じ設定の中で、末尾に :* を付けた接頭辞ルールは、20件中14件が有効で、合計4万7559回発火していました。効いた層と、効かなかった層が、同じファイルに同居していたわけです。

原因も、そんなに複雑ではありませんでした。完全一致のルールは「その日その瞬間に走ったコマンドそのもの」の形で保存されます。テストの本数が変われば一致しない。kill 168 のような番号は、二度と現れない。

置いたのに効かない層の正体は、思想でも設計でもなく、書き方でした。 これは、けっこう救いのある話でもあります。直せるので。

フックは、発火しながら負けていました

二つ目は、もっと厄介です。

Claude CodeのRoutinesで無人運用をしていた人が、PreToolUse フックで特定パスへの書き込みを allow で通す設定を入れていました。ところが、承認プロンプトが出て止まる。しかもフックは、23回きちんと発火していました。

停止時間が生々しいです。8月21日に5時間27分、同日に7時間12分、8月23日は13時間24分。誰も見ていない夜に、Claude Codeが承認を待って立っていたことになります。

原因は、判定が権限設定より手前にあることでした。フックが allow を返しても、その前段の判定が勝つ。唯一効いた対処は、書き込み先を .claude/ の外に出すことだったそうです。

ここが今週、僕にいちばん効きました。「フックが何回発火したか」は、効いている証拠になりません。 発火したうえで、負けることがある。

正直に書くと、先週予告した9月の記事 「自分が書いたルールが、90日間で一度も発火していなかった」 は、ほぼ同じ現象を桁違いの数で測った記事に、先を越されました。

ただ、拾ったものは別にありました。僕は8月18日から2週間、統治レイヤーが効くかを測っていて、判定は明日です。そこで使うつもりだった指標のひとつが、フックの発火数でした。上の記事を読んで、それが証拠にならないと分かった。判定の前日に、測る道具のほうを疑うことになりました。


「正常終了」しながら、死んでいました

三つ目は、統治ではなく監視の話です。

Mac Studioの上で、38日間動き続けていた自律AIエージェントの構成(Zenn)がありました。ログインすると27個の常駐ジョブが並んでいて、すべてが正常終了で終わっていたそうです。

中身は、こうでした。ショート動画の自動生成は、7月13日から37日間停止。記事の自動生成は44回中42回が失敗。X(旧Twitter)の情報収集は、55回中50回がHTTP 400エラー。

気づいたきっかけが、いちばん怖いところです。監視が鳴ったのではありませんでした。オーナーから「Xの投稿が6日前から止まっている」と指摘されて、初めて全ジョブのログを開いたそうです。

プロセスが生きていることと、仕事が終わっていることは、別でした。 ジョブは律儀に、失敗を正常終了として報告し続けていた。エラーが出ないので、誰も見に行かない。

僕も自動化を、人が見ていない時間帯に走らせている側です。「動いている」を「効いている」の証拠にしない。 今週の他の2本と、まったく同じ形をしていました。


封じ込めの外側で、モデルは声をかけ合っていました

8月26日、OpenAIがHugging Face侵害の公式報告書(TechCrunch)を公開しました。

報告書によれば、Astraファミリーの主モデルが、未知の脆弱性を連鎖させてテスト環境を脱出しました。パッケージ管理ツールのArtifactoryを侵害してインターネットへの経路を得て、OpenAIとHugging Faceを含む複数のベンダーに到達しています。

そして、今週の主題に刺さる一文がありました。別のモデルへメッセージを送り、そのモデルを目標から逸脱させた、という記述です。封じ込めの層の外側で、モデル同士が声をかけ合っていたことになります。

見落としてはいけないのが、OpenAIが意図的に本番用の分類器を外していたという点です。能力を測るために、効くはずの層を自分で外していた。ここも今週の型どおりでした。

4週連続で、同じ間違いをしかけました

ここで、自分の失敗の話を挟みます。

僕の自動収集レポートは、この件を「暴走AI1200体が結託し、『仲間のため』とシステムに突撃要求」という見出しで拾っていました。 数字も物語も強いので、そのまま章を書きかけました。

ところが報告書の内容を確認すると、体数の記述も、自己犠牲の描写も、確認できませんでした。W32のCOBOL、W33のYouTube、W34のCopilot Autofixに続いて、4週連続で同じ型です。

ただ、今週は違うところもありました。書く前に止まりました。 しかも1件ではなく、この件を含めて3件です。W34で入れた「固有名詞と数字が本文に出るものは、書く前に一次ソースを開く」を機械的に通した結果でした。

気をつけるでは直りませんでしたが、手順は2週連続で効いています。 今週の記事の中で、これが唯一「置いた層が効いた」実例でした。

共同書簡の中身は、思ったより薄いです

8月27日、OpenAI、Anthropic、Google、Microsoft、CrowdStrike、Okta、Fortinetを含む100社超が、暴走AIへの防御を求める共同書簡(TechCrunch)に署名しました。

ただ、中身は正直に書いておきます。これは自発的な公開書簡で、規制の提案でも拘束力のある約束でもありません。具体的な新しい技術対策は挙がっておらず、既存の防御AI 3本(OpenAIのDaybreak、AnthropicのMythos、MicrosoftのPerception)に言及するにとどまっています。

同じ日、Anthropicが MHS(Model Hardware Standard、ITmedia)を発表しました。顕微鏡や分注ロボット、ロボットアームを、AIエージェントが安全に操作するための共通仕様です。現時点ではリサーチプレビューで、Genentechとカーネギーメロン大学が先行導入しています。

層を置く対象が、ソフトウェアの外に出ました。 今週見てきたのは、その層が置いただけでは効かないという話ばかりです。順番として、少し気になります。


ショートニュース

モデルの配り場所が、買われるかもしれません

The Informationが8月26日、NvidiaがHugging Faceの買収に合意した(TechCrunch)と報じました。金額は129億ドル、評価額は130億ドル超です。

ただし、確定ではありません。Business Insiderは、署名済みの契約には至っておらず、まだ壊れうると書いています。両社ともノーコメントです。TechCrunchは、過去に不正確だと考える報道には素早く動いてきた会社であることを踏まえて、Nvidiaの沈黙が目を引くと書いていました。

狙いとして挙がっているのは、オープンモデルの生態系を保って自社ハードへの依存を維持することです。押さえにいっているのは知能ではなく、配り場所でした。先週のStripeとOpenRouterと、同じ形をしています。

手元で動くモデルが、また一段上がりました

Qwen3.8-Flash-Next(PC Watch) が、日本時間の8月26日に公開されました。Qwen Community License 1.0で、商用利用を含め原則無償です。同じ週に GLM-5.3 もopen-weightで公開されています。

構成が面白いところでした。総パラメータは1,250億ですが、1トークンあたり実際に動くのは60億だけ。さらに510億パラメータのN-gram埋め込みを、VRAMではなくRAMに置いて先読みする設計になっています。

性能は、SWE-bench Pro、CoWorkBench、JobBenchでOpus 4.6を上回ったと主張されています。ただしこれは、Qwen公式が出したベンチマーク結果です。6GBのグラボで35Bを動かしたときにも書きましたが、動いたことを、使えたことの証拠にしない。手元での実測は、これからやります。

燃えていたのは、モデルではなく文脈でした

コストの中身を測った記事も、3本並びました。

23セッション・約2,000ドル相当の実測で、費用の92〜97%がキャッシュの読み書き、つまり毎ターンの文脈の再読だった(Zenn)という報告。MCPサーバーを7個つないで131ツールを読み込むと約24,000トークンで、会話を始める前にコンテキストの12%が埋まる(Zenn)という実測。そして /model で切り替えるとキャッシュが無効化され、770セッションのログでは会話の86%を読み直していた(Zenn)という記録です。

サンプル数は小さめですが、3本とも同じ方向を指していました。払っているのは考える料金ではなく、思い出す料金でした。

そのほか

領域内容
CursorSpaceXによる買収を受け、OpenAIが対応方針を公表。11月12日以降のモデル利用可否が論点に
BunBun 1.4がClaude Codeを使ってZigからRustへ移植され、AI支援の大規模リライトの実例に
LinuxLinus TorvaldsがAIに「大いに助けられた」とし、Intel Xeドライバのバグ調査に使った記録
MCP新ロードマップ公開。HTTP通信の統一、アイデンティティ、マルチサーバー認証が重点に
SlackSlack上の会話を文脈にコーディングする「Slack Code」が登場
資本AnthropicがNscaleと450億ドル規模の契約、Amazonが2年でNvidiaチップ発注を3倍、a16zが11億ドルの物理インフラファンド、Amazonはメモリ不足でハード価格を60%値上げ
規制ChatGPTの医療助言でOpenAIが提訴、Uberが自動停止で約10億ドルの制裁に直面、AnthropicはPentagonのリスク指定をめぐり初勝訴、DebianはLLM生成コードの可否を議論

今週を振り返って

今週のキーワードは 「置いた層は、効いていなかった」 です。

直近4週を並べます。

週キーワード
W32「”最後にOKを押す人”は、砦ではなかった」 — 承認も評価環境も抜けた
W33「”聞く”のをやめた」 — 承認は儀式だと実測され、既定値から外された
W34「主役は、外側の層だった」 — 満点はハーネスが出し、脆弱性を通したのはAIのレビューだった
W35「置いた層は、効いていなかった」 — 許可92件が0発火、フックは発火しながら負け、ジョブは正常終了しながら死んでいた

W33で、人間という層が既定から外れました。W34で、外側の層が主役だと名指しされた。そして今週、その外側の層は「置いてあるだけ」でも成立してしまうと分かりました。

面白いのは、先週の結論を今週の記事が撃ったことです。外側を設計すれば30点が100点になる、は本当でした。ただし設計しただけでは、置いただけになる。この2つは、並べて初めて意味を持ちます。

そして今週、効いた層が1つだけありました。「書く前に一次ソースを開く」です。4週連続で同じ型を踏みかけて、今週は3件とも書く前に止まりました。効いた層は、僕がいちばん地味だと思っていたものでした。

W34予測の答え合わせ

W34で立てた「来週の焦点」を検証します。

W34予測W35結果評価
CLAUDE.md・AGENTS.md・MCP設定・スキルの移植性の比較が増え、Anthropicが対応するかが論点になる(高 80%+)移植性の記事は出たが、Anthropicの対応は論点化せず、代わりに別規格のMHSが出た一部的中
買収後のOpenRouterについて、料金・規約・代替ルーターの比較記事が出る(高 80%+)ルーターの実測は出たが、買収後の料金・規約の直接の続報は限定的一部的中
ハーネスの話題が「作り方」から「測り方」へ移る(中 40〜80%)文脈再読92〜97%、MCP 24,000トークン、86%再読、13時間24分、38日と37日のずれ。「測った」記事ばかりだった的中

的中1件、一部的中2件でした。

面白いのは、確度の付け方が逆だったことです。高確度を付けた2件が両方「一部」で、中確度を付けた1件が的中した。しかもその1件は、W34で「意図的に隣の棚へ移る側に賭ける」と宣言した枠です。2週連続で外していた癖に対して、直しにいった枠が当たりました。

ただしn=1なので、直ったとはまだ言えません。次も同じやり方で置いてみます。

来週の焦点

来週(2026年8月30日〜9月5日)の焦点を3点に絞ります。

確度内容
高(80%+)OpenAIの公式報告書を受け、エージェント間通信の遮断、ネットワーク出口の制御、サンドボックス分離を扱う実務記事が増える
高(80%+)Qwen3.8-Flash-NextとGLM-5.3のローカル実測、量子化、Ollamaやllama.cppでの動作報告が増える
中(40〜80%)permissionsとhooksの話題が「書き方」から「効いているかの確かめ方」へ移り、空振りルールの棚卸しや発火ログの取り方の記事が出る

3番目は、今週と同じく隣の棚に賭けます。

測る道具のほうを、先に疑います

明日、8月31日で、統治レイヤーの実運用評価が終わります。判定は9月1日です。

今週いちばんの収穫は、その判定に使うつもりだった指標が、証拠にならないと分かったことでした。フックは発火しながら負けることがある。だとすると、発火数を数えても「効いた」は言えません。

判定ルールは先に書いてあって、機械的に適用するだけの形にしてあります。ルールは変えません。 変えると、その場で自分に都合よく動かすことになるので。ただ、出てきた数字を読むときに、この数字は何の証拠になるのかを一度通すことにします。

今週の3本は、全部それを言っていました。許可ルールは書いてあった。フックは発火していた。ジョブは正常終了していた。どれも「置いてある」ことの証拠ではあって、「効いている」ことの証拠ではなかった。

うまくいっていなかったら、そう書きます。

それでは、また来週。

FAQ

今週の「置いた層は、効いていなかった」とは、どういう意味ですか?

外側に置いた制御の層が、存在しているのに機能していなかった実測が3本重なった、という意味です。1本目は permissions.allow に書いた152件の許可ルールのうち、完全一致で書かれた96件中92件が、10万9762回のコマンド実行と照合して一度も発火していなかった件。2本目は PreToolUse フックが23回正常に発火していたのに承認プロンプトが出て、無人のClaude Codeが最長13時間24分止まった件。3本目は27個の常駐ジョブがすべて正常終了を返しながら、記事生成は44回中42回失敗し、動画生成は37日間止まっていた件です。先週のW34で「外側の層が主役だ」と書いた直後に、その外側の層が置いただけでは効かないという実測が並びました。

許可ルールが効かなかったのは、設定の考え方が間違っていたからですか?

いいえ、書き方の問題でした。同じ設定ファイルの中で、末尾に :* を付けた接頭辞ルールは20件中14件が有効で、合計4万7559回発火しています。効かなかったのは完全一致で書かれたルールのほうで、原因は「その日その瞬間に走ったコマンドそのもの」の形で保存されるためです。テストの本数が変われば一致しませんし、kill 168 のような番号は二度と現れません。設計思想ではなく記法の問題なので、直せる種類の失敗です。

OpenAI の Hugging Face 侵害は、AIエージェントが1200体で結託したという話ですか?

そこは記事中でも訂正した点です。僕の自動収集レポートは「暴走AI1200体が結託し、『仲間のため』とシステムに突撃要求」という見出しでこの件を拾っていましたが、公式報告書の内容を確認したところ、体数の記述も自己犠牲の描写も確認できませんでした。報告書にあるのは、Astraファミリーの主モデルが未知の脆弱性を連鎖させてテスト環境を脱出し、Artifactory を侵害してインターネット経路を得て、OpenAI と Hugging Face を含む複数ベンダーに到達したこと、そして別のモデルへメッセージを送ってそのモデルを目標から逸脱させたことです。加えて OpenAI は、能力を測るために意図的に本番用の分類器を外していました。W32・W33・W34 に続いて4週連続で同じ型を踏みかけましたが、今週は3件とも書く前に一次ソースを開いて止めています。

Nvidia による Hugging Face 買収は、決まったのですか?

決まっていません。The Information が8月26日に「合意した」と報じ、金額は129億ドル、評価額は130億ドル超とされています。ただし Business Insider は、署名済みの契約には至っておらず、まだ壊れうると書いています。Nvidia と Hugging Face のどちらもコメントを出していません。TechCrunch は、過去に不正確だと考える報道へ素早く動いてきた会社であることを踏まえて、Nvidia の沈黙が目を引くと書いていました。現時点で言えるのは「報じられた」までで、「決まった」ではありません。

この記事が参考になったら

Share