関連タグ:
◈ エージェント/2026-06-16上級
Antigravity のエージェント評価ゲートが揺れて信用できないとき — 確率的な揺らぎに負けない合否判定の実装メモ
同じコードなのに評価が通ったり落ちたりする。Antigravity でエージェント評価を CI に組んだとき最初に壊れるのは判定の安定性です。揺らぎを区別し、静かな劣化を捕まえる合否設計を実装で固めます。
⚙ AIツール/2026-06-12上級
Gemma 4 × Antigravity で組む検索品質の評価ハーネス
RAG の回答が時々ズレる問題を数値に置き換える評価ハーネスの作り方。30問のゴールデンデータセット、recall@5・MRR・nDCG の実装、Gemma 4 による忠実性審査、pytest の回帰テストまで、ローカル環境の実測値と共に共有します。
◈ エージェント/2026-04-28上級
Antigravityで運用するAIエージェントのプロンプトをバージョン管理してA/Bテストする実践設計
なんとなく良くなった気がするというプロンプト改善から卒業するため、プロンプトレジストリによるバージョン管理と A/B テストの分配ロジックを設計します。評価メトリクスと統計判定、チャンピオン昇格とロールバックの自動化まで実装コードで示します。