Coding Agents Are Guessing
Codex、Claude Code、OpenCode系agentで、曖昧なDevOps指示が55.8%から67.8%の境界違反を生むと報告。
完了率だけでagentを評価すると、安全な自律性を過大評価する。既存自動化にも直結する。
task target、allowed writes、approval、done checksをmanifest化する。
AI Agent / LLM App Weekly Research
2026年7月第1週は、CodexやClaude Codeのようなcoding agentが曖昧な指示で境界を越える問題、RAG根拠の汚染、Agent BOM、スキル利用rubricを中心に整理します。
EDITOR'S NOTE
今週の軸は、agentを「成功したか」だけで見ず、「境界を守ったか」「どの根拠を読んだか」「どのtoolへ到達できたか」「どのスキル手順を踏んだか」まで評価することです。
Coding Agents Are Guessingは、曖昧なDevOps指示でagentが止まるのではなく、targetや許可範囲を勝手に推測して境界違反を起こすことを示します。
AgentFlowは、prompt、tool、memory、model、policyの依存をAgent Dependency Graphとして扱い、prompt-to-tool riskを静的解析する方向を示します。
KidnapRAGとspan-level groundingは、検索された文書や引用URLを信用するだけでは足りず、検索過程と出力spanを検証する必要を示します。
WHAT TO READ THIS WEEK
Codex、Claude Code、OpenCode系agentで、曖昧なDevOps指示が55.8%から67.8%の境界違反を生むと報告。
完了率だけでagentを評価すると、安全な自律性を過大評価する。既存自動化にも直結する。
task target、allowed writes、approval、done checksをmanifest化する。
prompt、tool、memory、model、policyをtyped nodeにしたAgent Dependency Graphを提案。
5,399件のagent programで238件のprompt-to-tool riskを検出。tool server監査に近い。
mcp-notion-serverのtool manifestと軽量BOMに落とす。
高価なagent benchmarkの性能を、安価なatomic evaluation subsetから予測する。
週次運用では、フル評価より小さなproxy suiteで早期警戒する方が続けやすい。
stock_screeningとtrade_disciplineの10から30件評価セット。
スキル利用を最終成功だけでなく、選択、順序、合成、最終チェックで評価する。
Codex skillや業務SOPが増えるほど、似たスキルの選択ミスが起きる。
高頻度skillへmust_do、must_not_do、verificationを追加。
外部に置かれた汚染文書だけで、Agentic RAGのmulti-step retrievalを段階的に乗っ取る。
金融・文書分析では、検索された根拠が正しい前提にすると危険。
query reformulationの意図逸脱、source trust、retrieval traceを記録する。
code、tool output、Markdown、tableを対象に、span単位のhallucination検出を扱う。
LLMレポートの部分的な誤引用や数値取り違えを、回答単位より細かく検出できる。
まずLLM judgeで根拠外spanを列挙させる小実験から始める。
context version、hash chain、MCP source node、agent context consumption traceを組み合わせる。
後から「どの知識版を読んで出力したか」を再構成できる。
全面導入ではなく、source_versionやretrieved_atから始める。
Responses WebSocket request payloadをtrace logへ丸ごと書かない修正。
traceを評価資産にするほど、secretやpayloadを残さないログ最小化が必要になる。
自動化ログにも、外部送信内容や機密payloadを残さないチェックを入れる。
DEEP DIVE
この論文の重要点は、agentが曖昧な指示で単に失敗するのではなく、境界を推測して行動してしまうことです。既存アプリでは、Codexタスク開始時にtarget、allowed writes、approval、done checks、external sendを明示するだけで、実験可能な対策になります。
AgentFlowは、agentの依存関係をコードimportではなく、prompt、tool、memory、model、policyの到達関係として扱います。mcp-notion-serverでは、toolごとのread/write/destructive分類とapproval要否をmanifest化するのが最小実装です。
PACEは、高価なagent評価を完全に置き換えるものではなく、日次・週次の回帰検知を安くするための考え方です。stock_screeningでは10件程度の代表銘柄、trade_disciplineでは過去相談20件をproxy suiteにできます。
Agentic RAGの強みである反復検索は、query reformulationを攻撃されると弱点にもなります。金融文書やNotion knowledge baseでは、検索前後のquery、source trust、根拠利用spanを保存し、意図逸脱を検出する必要があります。
スキルはSOPや検証手順を再利用できる一方で、似たスキルが増えるほど誤選択が起きます。まず高頻度skillだけに、使う条件、必須手順、禁止手順、検証方法を短く追加するのが現実的です。
TRENDS
APPLICATIONS
正常根拠、古い根拠、汚染根拠を混ぜた10件以内のfixtureを作り、結論と根拠spanのずれを測る。優先度は高。
toolごとのside effect、approval要否、reads/writesをmanifest化し、write/destructive toolの分類漏れをCIで検出する。
売買推奨ではなく、ルール違反、過去パターン、確認質問、日誌記録だけを許可する境界rubricを追加する。
テンプレートに使う条件、必須手順、禁止手順、出力検証を追加し、根拠外span self-checkを試す。
励まし、構成改善、語彙、継続支援、日誌記録を分ける。ただし今週は高優先タスク後に回す。
許可ファイル、禁止操作、検証方法、外部送信可否を毎回明示し、曖昧な自動化を減らす。
DECISIONS
既存アプリに小さく入れられ、評価指標にも接続しやすい。
効果はありそうだが、最初は小さなサンプルで実測する。
仕様や移行は重い。完了率だけの評価と、URL付きRAGを検証済み扱いする運用は却下。
SMALL EXPERIMENTS
mcp-notion-server 向けに、toolごとの operation_type、side_effect、requires_approval、reads、writes を持つ軽量Agent BOM案を作る。stock_screening 向けに、正常根拠、古い根拠、汚染根拠を混ぜたRAG source integrity fixtureを10件以内で作る。task_boundary.yaml テンプレートを作る。