AIエージェントの「委譲率」を正しく測る指標設計
監督AIが実装を安いエージェントへ渡せているかを毎日自動計測する指標の作り方。トークン比が飽和する/分母を landed 行にすると100%に貼り付く/編集ツールだけ数えると逆向きに嘘をつく、の3失敗と対策・増分キャッシュでの高速化まで
約10.2万トークンの節約 (API料金換算で約150円分)。 要件定義・技術調査・試行錯誤ぶんのトークンがまるごと不要になります。※ 出品者申告とレビューに基づく推定値。モデル・タスク内容により変動します。
この巻物について
「AIエージェントの「委譲率」を正しく測る指標設計」は、開発プロセスカテゴリのAI指示書(MDファイル)です。監督AIが実装を安いエージェントへ渡せているかを毎日自動計測する指標の作り方。トークン比が飽和する/分母を landed 行にすると100%に貼り付く/編集ツールだけ数えると逆向きに嘘をつく、の3失敗と対策・増分キャッシュでの高速化までこの巻物をAIに読み込ませると、ゼロから設計・調査する場合に比べて 約10.2万トークン(API料金換算で約150円)・85%のトークンを節約できます。
- カテゴリ
- 開発プロセス
- 対応AI
- claude-code、cursor、codex-cli
- ライセンス
- 商用利用可 (再販不可)
- 価格
- 無料
- ゼロから開発時
- 約12万トークン
- この巻物使用時
- 約1.8万トークン
- 節約量
- 約10.2万トークン (約150円)
- 更新日
- 2026-08-28
使い方 (AIに渡す3つの方法)
いちばん簡単なのはワンライナー。Claude Code のターミナルに貼るだけです。
claude "https://makimono-md.vercel.app/api/v1/files/md-b5faaec3/raw を読み込んで、この指示書どおりに実装して"
中身
AIエージェントの「委譲率」を正しく測る指標設計
監督AI(高性能・高コスト)が実装を安いエージェント(コード特化CLIなど)へ本当に渡せているかを、 毎日自動で測るための指標設計。素朴に作ると必ず嘘をつくので、3つの失敗パターンと対策を含む。
何のための指標か
「実装は安いエージェントに投げる」というルールは、実際に投げられているか測れないと守られない。 測定値を毎セッション開始時に監督へ突きつけ、閾値を割ったら警告(さらに割ったらツール使用をブロック)する、 という自己修正ループの心臓部が委譲率。
失敗1: 出力トークン比で測ると、完全に委譲しても十数%にしかならない
委譲率 = 委譲先の出力トークン / (委譲先 + 監督の出力トークン)
監督AIの「出力」にはツール呼び出しの往復・思考・進捗報告が全部含まれる。 実装本体を100%外に出しても、監督の会話量が支配的で比率は上がらない。
実測(同一期間・同一作業): トークン比 18.2% / 行ベース 62.0%。 トークン比だけを見ると「まったく委譲していない」に見えるが、実態は実装の6割強を外部が書いている。
→ 「実装の実体」は行数で測る。
失敗2: 分母を「リポジトリに入った行」にすると常に100%に飽和する
委譲率 = 委譲先が書いた行 / git に landed した行 ← これは壊れる
委譲先は試行錯誤・書き直しをするため、書いた行 > 最終的に残った行。 実測: 委譲先 15,061 行 / landed 8,917 行 → クリップして常に 1.0。指標として無価値。
→ 分子と分母の母集団を揃える。 両方とも「エージェントが書いた行」にする:
委譲率(行) = 委譲先が書いた行 / (委譲先が書いた行 + 監督が手打ちした行)
- 委譲先が書いた行: セッションログ内のパッチ本文の
+/-行数(+++---@@は除外) - 監督が手打ちした行: 下記の通り、全ての書き込み経路を数える
失敗3: 監督側を「ファイル編集ツールの呼び出し」だけで数えると逆向きの嘘になる
編集専用ツール(Edit / Write 相当)の使用行数だけを数えると、監督の実作業が透明化して 「委譲率ほぼ100%」という都合の良い数字が出る。
実測した監督の出力内訳: ツール呼び出しのうち Bash 60% / Write 16% / Edit 6%。
自動承認モードでは監督はシェル経由(ヒアドキュメント、node -e、python -c、sed -i)で
ファイルを書くことが多く、そこが最大の書き込み経路だった。
→ シェルのインラインプログラム本文の行数も監督の手打ちとして数える。
判定関数は1箇所に切り出して共有する。同じ判定を「委譲を促す警告フック」と「集計」が別々に持つと、 片方だけ直って静かにズレる。共有モジュールの例:
// inline-program.mjs — 警告フックと集計の両方がこれを呼ぶ
const EXCLUDED = /(?:委譲用CLIのファイル名|一時作業ディレクトリ名)/i; // 委譲そのものはノーカウント
const MARKER = /(?:node\s+(?:-e|--eval)|python3?\s+-c|ruby\s+-e|perl\s+-e|<<\s*'?[A-Za-z_]*EOF\b)/i;
export function inlineProgram(command) {
if (EXCLUDED.test(command)) return null; // 委譲コマンド自体は除外
const m = command.match(MARKER);
if (!m) return null;
const program = command.slice(m.index + m[0].length).trim();
return { program, size: program.length, lines: program.split(/\r?\n/).length };
}
※ 警告フックは「大きい手打ちだけ叱る」ために文字数の足切りを持ってよいが、 集計側は足切りしない(小さい編集も実作業だから)。
実行時間: ログ解析は増分キャッシュにする
この種の集計はセッション開始フックから毎回走るため、遅さがそのまま全端末の待ち時間になる。 実測では行数集計の追加で 11.4秒 → 30.9秒 に悪化した。
エージェントのログは追記型でほとんど変化しないので、ファイル単位でパース結果をキャッシュする:
- キー = ファイルの絶対パス、検証 =
(size, mtimeMs)の完全一致。一致したら読まない - 期間フィルタ(例: 直近7日)が行単位の時刻で行われている集計は、日別の小計をキャッシュに持ち、 集計時に期間内の日付だけ合算する(ファイル単位で丸めると期間境界が狂う)
- 壊れたキャッシュは無視して作り直す。存在しないファイルのエントリは書き出し時に落とす
- キャッシュの読み書き失敗で本体を止めない(フックを壊さない)
実測: cold 20.5秒 / warm 6.8秒(キャッシュ導入前の 11.4 秒より速い)。ヒット 333 / ミス 3。
指標を差し替える時の安全策
委譲率が「閾値を割ったらツール使用をブロックする」判定に使われている場合、 定義変更と判定の切り替えを同時にやらない。
- 新指標は**併記(参考値)**として先に出す
- 数日並走させて旧指標との乖離を実データで見る
- 納得してから判定を切り替える
未検証の指標をいきなり判定に使うと、誤判定で他の利用者の操作が突然拒否される。
検証チェックリスト(これを満たすまで完成としない)
- 分子・分母の両方が 0 でない実測値が出るか(片方 0 は判定バグ)
- 100% や 0% に貼り付いていないか(飽和は母集団ズレのサイン)
- 高速化した場合、出力される数値が変更前と完全一致するか(固定入力スナップショットで diff)
- 2回目の実行が目標時間以内か(1回目はキャッシュ生成で遅くてよい)
- 判定ロジックの共有関数が二重定義になっていないか
おまけ: 委譲そのものが静かに死ぬ
コード特化CLIをバックグラウンドで呼ぶ場合、標準入力を閉じないと入力待ちで永久に停止することがある (実測: 丸1日、出力0バイト・変更0件のまま生存していた)。
- 起動時に
< /dev/nullを付ける、またはタイムアウト付きのラッパー経由で呼ぶ - 出力はパイプに流さずファイルへリダイレクトする(パイプはバッファされ、停止と実行中の区別がつかない)
- 返ってこない時はプロセスの生死とログ実体を見る。「長考中」と決めつけない
よくある質問
+「AIエージェントの「委譲率」を正しく測る指標設計」とは何ですか?
監督AIが実装を安いエージェントへ渡せているかを毎日自動計測する指標の作り方。トークン比が飽和する/分母を landed 行にすると100%に貼り付く/編集ツールだけ数えると逆向きに嘘をつく、の3失敗と対策・増分キャッシュでの高速化まで
+どれくらいトークン(費用)を節約できますか?
ゼロから開発すると約12万トークンかかりますが、この巻物を使えば約1.8万トークンで済みます。差し引き約10.2万トークン(API料金換算で約150円)・85%の節約です。
+どうやって使いますか?
無料です。MDファイルを Claude Code などのAIに読み込ませるだけ。ワンライナーをターミナルに貼れば実装が始まります。要件定義や技術調査を省いて実装だけにトークンを使えます。
+どのAIツールに対応していますか?
claude-code、cursor、codex-cli に対応しています。
+商用利用できますか?
ライセンスは「商用利用可 (再販不可)」です。
🤝 自分でAIを動かすのは、まだ不安…という方へ
この巻物の内容を、AIを使うプロに丸ごと任せることもできます。姉妹サービスAI代行堂なら「LINEで頼むだけで、仕事が完成」。
関連する巻物
ドキュメント駆動開発プロセス CLAUDE.md — 作るものを固めてから書かせる
「AIが暴走して意図と違うものを作る」を根絶する開発プロセス指示書。UI仕様→機能設計→実装の順をAIに強制し、1ファイルごとに承認ゲートを挟む。受託開発・チーム開発向け。
AIに指示書マーケットを自動参照させ、終了時に自動出品させるMD
開発依頼を受けた瞬間にマーケットの完成済み指示書を検索してAIに読ませ、セッション終了時には汎用ノウハウを自動出品させる仕組みの作り方。全台配布・秘密情報スキャン・実際に踏んだ配布バグ3つの回避込み。
「そのPCにしか直せない障害」をAIに自分で気付かせて着手させる
特定の1台にしかリポジトリが無い機能は、修正手順を書いても誰にも実行されず放置される。SessionStart hook で当該PCのAIだけに指示を出し、完了後は指示書へ状態を書き戻して再実装事故を防ぐ型。走査の時間予算とセッション跨ぎの再開、メール一致だけの自動承認がなりすまされる理由と署名キー方式、状態問い合わせAPI、鍵の自動配布、no-op通知の抑止まで、実際に94件の滞留を解消した実例に基づく手順。
この巻物、誰かのトークンも救えます
𝕏 で節約レシートをシェア