◉ANTIGRAVITY LABEN
記事一覧/Agents & Manager
◈ Agents & Manager/2026-07-04上級

AIコードレビューエージェントの指摘を誰も読まなくなったとき — 採用率を計測して立て直す運用メモ

AI コードレビューエージェントの指摘が半年で読まれなくなった経験から、PR イベントを使った採用率の自動集計、偽陽性と疲労による無視の切り分け、重大度別の健全度しきい値の設け方まで、形骸化を立て直す運用手順を実測の数字とともに整理しました。

code-review9ai-agent17production59instrumentationci-cd16

✦ プレミアム記事

エージェントを入れた当初は、レビューコメントに全員が返信していました。半年後、ある朝のPRを開いて手が止まりました。エージェントが付けた11件の指摘が、すべて無言で解決済みにされていたのです。

議論も、修正も、返信もありません。ただ静かに閉じられている。指摘の中身は半年前と変わらず妥当そうに見えるのに、誰も読んでいない。

これはツールの故障ではありません。指摘が多すぎて、チームが「とりあえず全部閉じる」を学習してしまった状態です。数値で見ないと気づけない、静かな形骸化。個人開発で回している小さなチームでも、これは静かに起こります。私自身、この形骸化に気づくまで半年かかりました。この記事は、その兆候を計測で捉えて立て直すまでの運用メモです。

「動いている」と「効いている」は別の指標

コードレビューエージェントの健全度を、私たちは長らく「稼働しているか」で見ていました。CIが緑で、コメントが投稿されていれば正常。そう思っていました。

ですが本当に見るべきは、投稿された指摘が実際に行動につながったかです。ここを分けて考えないと、形骸化は永遠に見えません。

観点「動いている」の指標「効いている」の指標
稼働CI成功率・コメント投稿数—
受容—採用率(指摘に対して修正 or 議論が発生した割合)
精度—偽陽性率(wontfix・not-applicable で閉じられた割合)
負荷—1PRあたりの指摘数の中央値

投稿数はいくらでも増やせます。増やすほど採用率は下がる。この逆相関に気づかないまま指摘を増やし続けると、ある日全員が読むのをやめます。

採用率をPRイベントから自動で集計する

まず必要なのは、指摘が「その後どうなったか」を追う仕組みです。GitHub の Review Comment には、解決状態と、そこに付いた返信が残ります。これを収穫します。

エージェントが投稿したコメントを起点に、後続の人間の行動を3分類します。修正コミットが続いたら actioned、返信で議論が起きたら discussed、返信も修正もなく解決されたら ignored。

# collect_actioned_rate.py
# エージェントのレビューコメントが「行動につながったか」を集計する
import os, requests
from collections import Counter
 
REPO = os.environ["REPO"]           # 例: "owner/name"
BOT = os.environ["BOT_LOGIN"]       # レビューエージェントのアカウント名
TOKEN = os.environ["GITHUB_TOKEN"]
H = {"Authorization": f"Bearer {TOKEN}", "Accept": "application/vnd.github+json"}
 
def paged(url, params=None):
    params = dict(params or {}, per_page=100)
    while url:
        r = requests.get(url, headers=H, params=params, timeout=30)
        r.raise_for_status()
        yield from r.json()
        url = r.links.get("next", {}).get("url")
        params = None  # next の URL に条件が含まれるため
 
def classify(comment, later_commit_shas):
    # actioned: 指摘後に同一ファイルへ変更コミットがある
    # discussed: 返信スレッドに人間の応答がある
    # ignored: どちらもなく解決済み
    if comment["reply_count"] > 0:
        return "discussed"
    if comment["path_touched_after"]:
        return "actioned"
    return "ignored"

ポイントは、ignored を「悪」と即断しないことです。INFOレベルの参考指摘は無視されて当然。重大度と紐づけて初めて意味を持ちます。次でそこを切り分けます。

✦

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
✦指摘の採用率(actioned-rate)と却下理由をPRイベントから自動集計するスクリプト
✦偽陽性を重大度別に切り分け、形骸化の兆候を数値で早期に捉える判定基準
✦エージェントの指摘量を絞り込み、採用率を回復させる段階的な締め方
Stripe による安全な決済 · いつでもキャンセル可能
✦

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Antigravity Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • ✦コピー&ペーストで使える実装コード付き
  • ✦毎日新しい上級ガイドを追加
  • ✦¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

◈ Agents & Manager2026-04-13
Gemma 4 × Antigravity で作るコーディングエージェントシステム — コードレビュー・テスト生成・リファクタリング支援を一括処理する実装ガイド
Gemma 4とAntigravity AgentKit 2.0を使い、コードレビュー・テスト自動生成・リファクタリング提案を担う3エージェント協調システムをゼロから構築する実践ガイド。プロダクション品質のコードと落とし穴対策を網羅。
◈ Agents & Manager2026-05-27
Antigravity Agent の Record & Replay — 失敗を3分で再現する本番運用パターン
Antigravity の自律エージェントが本番で失敗した瞬間を、後からオフラインで決定的に再生する Record & Replay の設計と実装。実際に運用してきた経験から、ストレージ設計・PII マスク・ハーネスのコードまで具体的に解説します。
◈ Agents & Manager2026-05-12
Antigravity エージェントの判断を追跡する — 意思決定ログと説明可能性の実装設計
AIエージェントが「なぜその判断をしたか」を記録・分析する意思決定ログの設計を、動作するPythonコード例とともに解説します。本番環境での予期しない動作を根本から追跡し、品質改善サイクルを実装します。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます