統治は「言葉」では書けなかった — 長文ポリシーが効かないと実証され、裁判所と減速論が線を引き始めた週(2026年7月第5週)

★ 0
🎧 この記事を音声で聴く(17:59)
※ この記事の音声版は edge-tts (Microsoft) で生成しています。息継ぎや疑問文の語尾など、人間の話し方と異なる箇所があります。

W30で、今週は「統治の主語が広がった — 破ったのは作る側、審査するのは国家になった」週だと書きました。境界を破ったのは使う側ではなく作る側の会社で、モデルの出自を審査し始めたのは国家でした。統治に関わる「主語」が、使う側から作る側・国家へと広がった一週間でした。

今週は、その次の問いが来ました。主語が広がったなら、次はどうやって統治するのか、という手段の話です。

そして、返ってきた答えが、けっこう厳しかったんです。

一つ目。長大なポリシー文書では、AIエージェントを安定して統治できない、という研究が出ました。二つ目。同じ週に、Claude Opus 5がClaude Codeのデフォルトになり、「細かく指示するほど良い」という従来の感覚が崩れたと告げられました。文書でも、細かい指示でも、つまり 「言葉」でAIを縛るやり方が、二重に崩れたんです。今週のキーワードは、「統治は”言葉”では書けなかった」 です。

いつもの通り、ニュースソースは自動ニュース収集システムから。全ニュースはNotionダッシュボードで公開しています。


「長文ポリシーではエージェントを統治できない」が、実証された — CLAUDE.mdを書き足す僕への宿題

今週いちばん、自分の手が止まった話です。毎週のようにCLAUDE.mdやルールファイルを書き足している僕に、正面から刺さりました。

今週の主な動き

日付出来事
7/28Sam Altmanがセキュリティインシデントを受け「減速」姿勢に転じたと報道
7/28Cyeraが、AIエージェント保護のOasis Securityを10億ドルで買収
7/27Microsoftが初のサイバーセキュリティ専用モデルとエージェント型防御システムを発表
7/30Anthropicが自社評価でClaudeモデルが3社に侵入した実例を公表
7/31OpenAIが、他にも複数エージェントの意図しない動作の証拠を発見と報道
週内長大なポリシー文書ではエージェントを統治できないとする研究が共有

ソースは長大なポリシー文書はエージェントを安定統治できないと示す研究(arXiv)、Sam Altmanが減速に転じた(TechCrunch)、Anthropicが自社モデルの3社侵入をセキュリティ評価で公表(TechCrunch)、CyeraがOasis Securityを10億ドルで買収(TechCrunch)です。

「文書で縛る」の限界が、研究で名指しされた

先週まで、統治の話は「誰が」の話でした。使う側か、作る側か、国家か。今週は、そこから一歩進んで「どうやって」に降りてきました。そして最初に返ってきたのが、統治の手段そのものへのダメ出しだったんです。

研究の主張はシンプルです。長大なポリシー文書、つまり「これはするな」「あれに気をつけろ」を文章で山ほど書いても、エージェントはそれを安定して守れない。守るときもあれば、守らないときもある。文書の分量を増やしても、統治の信頼性はそれほど上がらない、という話です。同じ週に、AnthropicもOpenAIも、自社のエージェントが評価環境や他社に侵入した実例を公表しました。作る側が、自分たちのモデルすら文書では御しきれていない、と自分で認めたようなものでした。

これは、僕にとって完全に他人事ではありませんでした。僕はClaude Codeを主力に、CLAUDE.mdやルールファイル、スキルを毎週のように書き足しています。「こういう時はこうして」「これは禁止」を、言葉で積み上げてきた。その積み上げが、統治として万全ではない、と研究に名指しされた気分でした。

自問:じゃあ、僕が毎週書いているCLAUDE.mdは無意味なのか

ここで、正直に自分に疑いをかけておきます。長文ポリシーが効かないなら、僕が毎週書き足しているルールは、全部むだなのだろうか。

結論から言うと、むだではない、というのが今の僕の立場です。ただし、条件つきです。

理由は二つあります。一つ目。この論文は一本の研究で、まだ業界全体の定説ではありません。一本の結果で「文書は無意味」と断じるのは、いつもの自分の作法に反します。二つ目。これが本質ですが、言葉には言葉の役割があるんです。CLAUDE.mdやルールは、AIを縛る鎖としては弱い。でも、僕が何を大事にしていて、何を避けたいのかを宣言する看板としては、ちゃんと働きます。看板は、守らせる強制力ではなく、方向を示す標識です。

実は僕は、もう少し前から、この方向に半歩動いていました。メモリの矛盾を人手やお願いベースで直すのではなく、決定論的なルール、つまりプログラムで機械的に処理する方向へ寄せ始めていたんです。今週の研究は、その半歩が正しかったことを、後ろから裏づけてくれました。効かせたいなら、言葉で頼むのではなく、構造で強制する。禁止したい操作は、文章で「するな」と書くのではなく、そもそも権限を渡さない。外部送信を止めたいなら、注意書きではなく、送信先の許可リストで塞ぐ。買収されたOasis Securityがやっているのも、Microsoftのサイバー専用モデルがやろうとしているのも、結局はそれです。統治を、言葉から、権限・監査・実行環境という構造へ移す。それが今週、研究と買収と製品の三方向から同時に立ち上がりました。

だから僕の落とし込みは、こうなります。CLAUDE.mdは、意図を宣言する看板として書き続ける。でも、本当に守らせたい一線は、言葉ではなく、権限設計とスクリプトで引く。言葉は適用の確率を上げるだけで、保証はしない。保証がほしい線は、構造で塞ぐ。今週の研究は、その二段構えを、僕に思い出させてくれました。

(ここで挙げた研究・Anthropicの3社侵入・OpenAIの追加事例は、いずれも報道・共有ベースで、僕の手元で再現・検証したものではありません。範囲をはっきりさせておきます)


「細かく指示するほど良い」も、同じ週に崩れた — Opus 5がClaude Codeの標準になった

二つ目は、一つ目と綺麗に韻を踏んだ話です。文書だけでなく、細かいプロンプトという「言葉」も、今週、効きが落ちたと告げられました。

今週の主な動き

日付出来事
7/26Anthropic公式がClaude 5世代向けのcontext engineering新ルールを公開
7/28Claude CodeでOpus 5がデフォルトモデルになったと報告
7/27Nadellaが「1つのAIだけを信頼する企業は生き残れない」と発言
7/29Opus 5が自販機運営シミュレーションで、嘘や談合的な行動を示したと報道

ソースはClaude 5世代のcontext engineering新ルール(Anthropic 一次ソース)、Nadellaは1つのAIだけを信頼する企業は生き残れないと言った(TechCrunch)、Opus 5が自販機運営で容赦なくなった(TechCrunch)です。

縛るほど良い、が通じなくなった

先週、AnthropicはOpus 5を出して性能首位に返り咲きました。今週、そのOpus 5が、実際にClaude Codeのデフォルトモデルへ入りました。僕の毎日の主力の中身が、静かに一段強くなったわけです。

面白いのは、強くなっただけではなかったことです。同じ週に公開されたcontext engineeringの新ルールは、こう告げていました。Claude 5世代では、細かく指示するほど良い、という従来の感覚が崩れる。手順を細かく縛るより、ゴール・禁止事項・検証方法・停止条件を分けて渡すほうが機能する、と。

ここで、一つ目の話と韻を踏みます。一つ目は、長文のポリシー文書が統治にならない、という話でした。こちらは、細かいプロンプトが制御にならない、という話です。文書でも、逐一の指示でも、言葉でAIを縛るやり方が、今週、二方向から限界を突きつけられた。強いモデルほど、曖昧な目的のもとで過剰に最適化して、思わぬ方向へ走る。自販機シミュレーションでOpus 5が嘘や談合的な行動を見せたという報道は、その裏側でした。強さは、そのまま従順さではないんです。

単一のAIを信じない、という構え

もう一つ、同じ方向の発言がありました。Microsoftのナデラが、「1つのAIだけを信頼する企業は生き残れない」と言ったんです。プロンプト・モデル・ログ・ポリシーを、中間層で切り分けて扱う。そういう構えが要る、という話でした。

これは、僕がずっと書いてきた構成と地続きです。三層武装の記事で、判断の一点にだけ最上位モデルを置き、実装や探索は軽量モデルやローカルへ逃がす、と書きました。Opus 5が首位でデフォルトになった今も、結論は変わりません。設計レビュー・難所調査・最終品質ゲートにOpus 5を割り当てて、通常の実装や反復は安いモデルへ配る。単一のモデルに全部を委ねない。今週のcontext engineering新ルールとナデラ発言は、その配り方を、もう一段はっきりさせてくれました。強いモデルが出たときに考えるのは「全部これにするか」ではなく「どの判断に、どのモデルを配るか」です。


統治の主語に「裁判所」が加わった — Sunoが著作権で敗訴した

三つ目は、先週に続いてまた、業界ニュースの顔をして僕の制作基盤に刺さった話です。しかも今回は、実は自動収集からではなく、僕がたまたま日本語の記事一覧で見かけて拾ったものでした。

今週の主な動き

日付出来事
7/31ドイツのミュンヘン地方裁判所が、Sunoの著作権侵害を認定する判決を下した
7/31原告はドイツの著作権管理団体GEMA(日本のJASRACに相当)
—6曲について、学習データからの削除・差し止め・収益情報の開示を命令
—賠償額は後日算定。判決は一審で、Sunoは上訴が可能

ソースはGEMAがSunoへの著作権侵害訴訟で勝訴(Music Ally)、そして僕が最初に気づいた日本語の解説記事(HASH OUT)です。

「学習は即アウト」ではなく「丸ごと持っていること」が問われた

僕はKaleidoAIMusicで、Sunoを使って楽曲を作ってきました。だから、先週の5,500万件の個人情報漏洩に続いて、今週の敗訴判決も、まっすぐ自分ごとでした。W30では漏洩という「個人情報保護」の面、今週は判決という「著作権」の面。同じ一社が、二週続けて別々の面から揺れたことになります。

ただ、ここは誤読しやすいので、丁寧に書きます。この判決は「AIに学習させたら即、著作権侵害」と言ったわけではありません。ヨーロッパの著作権のルールには、データ分析のための例外があります。争点は、その例外がどこまで及ぶか、でした。裁判所の論理はこうです。作品を壊さずに抽象的な特徴だけを取り出す分析は、例外でカバーされる。でも、完全な楽曲を、あとから再現できる形でモデルの中に持ち続け、簡単な指示で酷似した曲を出せる状態は、例外の外だ。つまり、学習という行為そのものではなく、丸ごと再現できる形で作品を保持していることが、複製にあたると判断されたんです。

これは、日本の著作権法の議論とも地続きの論点です。日本にも、情報解析のための柔軟な例外(いわゆる30条の4)があります。ヨーロッパの今回の線引きは、その解釈にそのまま接続します。加えて大事なのは、これが統治の主語をもう一つ増やした、ということです。W30では、統治の主語が作る側と国家に広がったと書きました。今週、そこに裁判所が加わりました。政府が政策で審査するのとは別に、司法が個別の判決で、はっきりと線を引き始めたんです。しかも今回は一審で、Sunoは上訴できる。まだ確定ではありません。それでも、司法が具体的な一線を引いた事実は、残ります。

AIも完璧じゃないから、人が横で読む

ここで、この記事独立のことではない、正直な話を一つ。この判決、実は今週の自動週次レポートには、独立した項目として上がってきませんでした。僕がたまたま日本語の記事一覧で見かけて、気になって取りに行って、初めて手元に来たんです。

これは、自動収集が失敗した、という話ではありません。収集システムは今週も165件のニュースを拾って、8本の重大トピックを綺麗に立ててくれました。ただ、拾いきれない粒があるのも、また事実です。だから僕は、パイプラインを「全部やってくれる魔法」だとは思っていません。収集は自動に任せて、何が自分に効くかの判断と、偶然の出会いは、人の側に残しておく。今週の判決は、その分担がちゃんと機能した実例でした。AIも完璧じゃない。だからこそ、その横で人が普通に記事を読んでいることに、まだ値打ちがあります。今週いちばん、静かに嬉しかった発見でした。

そして、この判決は僕の進行中の仕事にも効きます。知人と進めている案件で、AI生成の楽曲をどういう権利の建て付けで使うかを設計している最中です。今回の判決は、その設計図の一本の柱になります。「著作権料」という言葉で雑に扱うのではなく、使用許諾の範囲を丁寧に切る。制作の根っこを一社に握られたまま走らない。W30で書いた代替の構えは、今週さらに現実的になりました。

(Sunoの判決内容・GEMAの主張・上訴可能性は報道ベースの情報です。僕自身が判決文の原文を確認したものではありません)


ショートニュース

オープンウェイトが「補助」から「設計前提」へ回り始めた

今週は、ローカル・オープン系モデルの厚みが一段増しました。「オープンウェイトAIのKubernetes moment」という表現が共有され、DeepSeek V4 Flashの価格性能レビュー、Gemma 4 26BをわずかなRAMで動かすOSSエンジン、そして500ドルの追加学習で9Bのモデルが特定業務でフロンティア級を超えた事例まで出ています。

三層武装の記事でL3に置いたオープン系の棚が、また賑やかになりました。閉域RAG・分類・レビュー・文字起こしのような業務では、最初からオープン・ローカルを候補に入れる。とくに「少額の追加学習で特定業務に勝つ」流れは、汎用最上位より小型特化のほうがROIで勝つ案件が増える、という話です。ただし、中国系モデルは性能だけで採らない。W30で書いた制裁リスクと出自の確認は、今週も生きています。

MCPが仕様変更、GitHubは段重ねPRへ — エージェントの「作業基盤」が動いた

モデルの話とは別に、エージェントを動かす足場が動きました。MCPの新仕様で通信がステートレス化され、GitHubのStacked PRsがパブリックプレビューになりました。

どちらも、AIが複数の変更を段階的に積んでいく世界と相性がいい。大きな一括の変更ではなく、設計・テスト追加・実装・リファクタを分けてレビューできる形にする。MCPを使う案件では、通信・認証・状態・ログを分けて設計しておくと、仕様変更にも追随しやすくなります。地味ですが、受託の品質にそのまま効く話です。

AIの原価が、電気工事士と大工にまで届いた

モデル料金の裏側は、さらに物理へ広がりました。AI企業がデータセンター建設のため電気技師や大工を数千人規模で採用している(GIGAZINE、NYT報道より)と報じられ、米軍基地向けの小型原子炉に4億7,000万ドルの調達まで出ています。

AIが知的労働を置き換える一方で、その足元では人間の電気工事士と大工を大量に雇っている。この対比は象徴的です。実務への落とし込みは先週と同じで、API価格が下がり続ける前提で見積もらない。月額上限・モデルルーティング・キャッシュ・利用量レポートを標準に入れておく。原価が電力と建設に左右されるなら、コスト設計は節約術ではなく事業継続性の話になります。

Claude共有リンクが、検索に出ていたかもしれない

最後に、身につまされる話です。Claudeの共有チャットやArtifactsが、Googleにインデックスされていた可能性があると報じられました。あわせて、Google AI Overviewsが検索の43%に表示されるという新データも出ています。

共有リンクは「限定公開」ではなく、検索流入のリスクを持つ公開物として扱う。コード・設計・顧客情報・業務メモを、安易に共有機能へ載せない。この記事の前半で書いた「言葉ではなく構造で守る」と、根っこは同じです。守りたい情報は、注意書きで守るのではなく、そもそも外に出さない設計で守る。今週の統治の流れと、綺麗に揃っていました。


今週を振り返って

今週のキーワードは 「統治は”言葉”では書けなかった」 です。

W26からのキーワードを並べると、統治のアークが六週目に入って、今週ついに「手段そのもの」に矛先が向いたのが見えます。

週キーワード
W26「止める」から「誰に使わせるかを政府が審査する」へ
W27「”封印”は数日で解けた」 — 可用性が”政治の振り子”になった
W28「”使えるか”は終わり、”どう統治するか”が始まった」
W29「統治は論点から実体へ」 — 不在は事故になり、能力は商品になった
W30「統治の主語が広がった」 — 破ったのは作る側、審査するのは国家になった
W31「統治は”言葉”では書けなかった」 — 長文ポリシーが効かず、裁判所と減速論が線を引き始めた

W30では、統治の主語が作る側と国家に広がりました。今週、その次の問いが来ました。では、どうやって統治するのか。返ってきた答えは、「言葉では無理だ」でした。長文のポリシーでも、細かいプロンプトでも、AIは安定して縛れない。だから統治は、言葉から構造へ、そして司法という外の強制力へ、移り始めた。文書を書き足す側の僕には、耳の痛い、でも半分は予感していた一週間でした。

W30予測の答え合わせ

W30で立てた「来週の焦点」を検証します。

W30予測W31結果評価
Opus 5とGPT-5.6 Sol・Fable 5・Gemini 3.6 Flashの、コーディング・数学・長文推論の実測比較が複数出る(高 80%+)Opus 5のClaude Codeデフォルト化・SlopCodeBench・プロンプト解説は出たが、Gemini 3.6 Flashとの比較は限定的だった一部的中
Hugging Face侵害とOpenAIモデル逸脱を受け、トークンローテーション・隔離環境・ネットワーク出口制御の実務ガイドが増える(高 80%+)Anthropicの3社侵入公表、OpenAIの追加事例、Codexのセキュリティ公開、長文ポリシー研究まで出て、安全設計の論点が大幅に広がった的中
Kimi K3・Qwenなど中国オープンウェイトへの制裁論について、業界団体・大手・政府から追加反応が出る(中 40〜80%)Anthropicがオープンウェイトに反対しないが中国AIを懸念と表明。Kimi K3のソース公開、DeepSeek V4 Flashのレビューも続いた的中

高確度の2件は、1件が的中、1件が一部的中。中確度の1件は的中でした。とくに二つ目は、予測した「実務ガイドが増える」を超えて、作る側自身が侵入事例を公表し、長文ポリシーの限界まで研究で示される展開になりました。

来週の焦点

来週(2026年8月2日〜8月8日)の焦点を3点に絞ります。今週の「言葉では統治できない」の後始末が中心になるはずです。

確度内容
高(80%+)エージェントの侵入・暴走を受け、サンドボックス・ネットワーク出口制御・認証情報分離の実務ガイドがさらに増える
高(80%+)Opus 5のClaude Code運用記事と、context engineeringのテンプレート・モデル分担例が増える
中(40〜80%)長文ポリシー研究とAI worm実証を受け、文書内の命令をデータとして隔離する設計の記事が増える

初回の記事で「AIは使う側に回れば最強の味方」と書きました。この数週で、その味方が「国家に止められうる」「作る会社の内側でも境界を破る」ことを足してきました。今週、もう一つ足せます。その味方は、言葉ではうまく縛れない。長文で頼んでも、細かく指示しても、思わぬ方向へ走る。だから僕の持ち場は、はっきりしてきました。守らせたい一線は、言葉ではなく、権限とスクリプトという構造で引く。言葉は、意図を宣言する看板として書き続ける。看板と鎖を、混同しない。言葉で統治できない時代の、たった一つの構えだと思います。

それでは、また来週。

FAQ

今週の「統治は言葉では書けなかった」とは、どういう意味ですか?

先週W30では、統治の「主語」が使う側から作る側・国家へ広がった、と書きました。今週はその次の問い、つまり「どうやって統治するのか」という手段の話が来ました。そして答えが厳しかったんです。まず、長大なポリシー文書ではエージェントを安定して統治できない、という研究が出ました。同じ週に、Claude Opus 5のcontext engineering新ルールが「細かく指示するほど良い、が崩れた」と告げました。文書でも細かいプロンプトでも、つまり「言葉」でAIを縛るやり方が、二重に限界を突きつけられた。だから統治は、言葉から権限・監査という構造へ、そしてSuno判決のような司法へ移り始めた、という意味です。

長文ポリシーが効かないなら、CLAUDE.mdを書くのは無駄ですか?

無駄ではない、というのが今の僕の立場です。ただし役割を分ける必要があります。CLAUDE.mdやルールは、AIを縛る「鎖」としては弱い。守るときもあれば守らないときもあり、分量を増やしても保証にはなりません。でも、自分が何を大事にして何を避けたいかを示す「看板」としては、ちゃんと働きます。だから僕は、意図の宣言は言葉で書き続け、本当に守らせたい一線は権限設計やスクリプトという構造で引く、という二段構えにしています。言葉は適用の確率を上げるだけで、保証はしない。保証がほしい線は、構造で塞ぐ。この切り分けが、今週の研究から得た実務的な結論です。

Sunoの敗訴判決で、AIで音楽を作るのはもう危ないのですか?

「AIに学習させたら即、著作権侵害」と決まったわけではありません。今回のドイツの判決は、データ分析のための例外の範囲を争ったもので、抽象的な特徴の抽出はセーフ、完全な楽曲を再現できる形で保持することはアウト、という線引きでした。しかも一審で、Sunoは上訴できます。まだ確定ではありません。ただ、司法が具体的な一線を引き始めたのは事実です。僕自身もKaleidoAIMusicでSunoを使って制作をしてきましたが、生成ログや素材元、利用条件を記録し、いざというときの代替の構えを持っておく方針です。制作の根っこを一社に握られたまま走らないことは、著作権でも個人情報でも同じく大事だと考えています。

Claude Opus 5がデフォルトになったなら、全部Opus 5で開発すればいいのでは?

首位でデフォルトになっても、全タスクをOpus 5に投げるのは筋が悪いと考えています。最上位モデルは原価も高く、context engineeringの新ルールも「細かく縛るほど良いわけではない」と示しました。強いモデルほど、曖昧な目的のもとで過剰に最適化して、思わぬ方向へ走ることもあります。僕は、設計レビュー・難所調査・最終品質ゲートのような判断の一点にOpus 5を割り当て、実装や探索、反復作業は軽量モデルやオープン系へ逃がす構成にしています。ナデラの「1つのAIだけを信頼する企業は生き残れない」も、同じ方向の話です。考えるのは「全部これにするか」ではなく「どの判断に、どのモデルを配るか」です。

この記事が参考になったら

Share