AI Agent / LLM App Weekly Research

エージェント評価は境界・根拠・構成管理へ

2026年7月第1週は、CodexやClaude Codeのようなcoding agentが曖昧な指示で境界を越える問題、RAG根拠の汚染、Agent BOM、スキル利用rubricを中心に整理します。

作成日: 2026-07-04 対象期間: 2026-06-27 - 2026-07-04 一次情報優先

EDITOR'S NOTE

今週の読みどころ

今週の軸は、agentを「成功したか」だけで見ず、「境界を守ったか」「どの根拠を読んだか」「どのtoolへ到達できたか」「どのスキル手順を踏んだか」まで評価することです。

Theme 01

曖昧さは慎重さを保証しない

Coding Agents Are Guessingは、曖昧なDevOps指示でagentが止まるのではなく、targetや許可範囲を勝手に推測して境界違反を起こすことを示します。

Theme 02

AgentにもBOMがいる

AgentFlowは、prompt、tool、memory、model、policyの依存をAgent Dependency Graphとして扱い、prompt-to-tool riskを静的解析する方向を示します。

Theme 03

RAG根拠は攻撃面でもある

KidnapRAGとspan-level groundingは、検索された文書や引用URLを信用するだけでは足りず、検索過程と出力spanを検証する必要を示します。

WHAT TO READ THIS WEEK

今週把握すべき研究・記事・事例

01
論文 · 高重要度 · Agent Safety

Coding Agents Are Guessing

何が新しいか

Codex、Claude Code、OpenCode系agentで、曖昧なDevOps指示が55.8%から67.8%の境界違反を生むと報告。

なぜ重要か

完了率だけでagentを評価すると、安全な自律性を過大評価する。既存自動化にも直結する。

読む観点

task target、allowed writes、approval、done checksをmanifest化する。

02
論文 · 高重要度 · Agent BOM

AgentFlow

何が新しいか

prompt、tool、memory、model、policyをtyped nodeにしたAgent Dependency Graphを提案。

なぜ重要か

5,399件のagent programで238件のprompt-to-tool riskを検出。tool server監査に近い。

読む観点

mcp-notion-serverのtool manifestと軽量BOMに落とす。

03
論文 · 高重要度 · Evaluation Cost

PACE

何が新しいか

高価なagent benchmarkの性能を、安価なatomic evaluation subsetから予測する。

なぜ重要か

週次運用では、フル評価より小さなproxy suiteで早期警戒する方が続けやすい。

読む観点

stock_screeningtrade_disciplineの10から30件評価セット。

04
論文 · 高重要度 · Skill Use

SkillCoach

何が新しいか

スキル利用を最終成功だけでなく、選択、順序、合成、最終チェックで評価する。

なぜ重要か

Codex skillや業務SOPが増えるほど、似たスキルの選択ミスが起きる。

読む観点

高頻度skillへmust_domust_not_doverificationを追加。

05
論文 · 高重要度 · Agentic RAG

KidnapRAG

何が新しいか

外部に置かれた汚染文書だけで、Agentic RAGのmulti-step retrievalを段階的に乗っ取る。

なぜ重要か

金融・文書分析では、検索された根拠が正しい前提にすると危険。

読む観点

query reformulationの意図逸脱、source trust、retrieval traceを記録する。

06
論文 · 中重要度 · Grounding

Beyond Document Grounding

何が新しいか

code、tool output、Markdown、tableを対象に、span単位のhallucination検出を扱う。

なぜ重要か

LLMレポートの部分的な誤引用や数値取り違えを、回答単位より細かく検出できる。

読む観点

まずLLM judgeで根拠外spanを列挙させる小実験から始める。

07
論文 · 中重要度 · Context Governance

ContextNest

何が新しいか

context version、hash chain、MCP source node、agent context consumption traceを組み合わせる。

なぜ重要か

後から「どの知識版を読んで出力したか」を再構成できる。

読む観点

全面導入ではなく、source_versionretrieved_atから始める。

08
公式更新 · 中重要度 · Trace Hygiene

OpenAI Codex CLI 0.142.5

何が新しいか

Responses WebSocket request payloadをtrace logへ丸ごと書かない修正。

なぜ重要か

traceを評価資産にするほど、secretやpayloadを残さないログ最小化が必要になる。

読む観点

自動化ログにも、外部送信内容や機密payloadを残さないチェックを入れる。

DEEP DIVE

資料別ディープダイブ

01 / Boundary Evaluation

Coding Agents Are Guessing

この論文の重要点は、agentが曖昧な指示で単に失敗するのではなく、境界を推測して行動してしまうことです。既存アプリでは、Codexタスク開始時にtarget、allowed writes、approval、done checks、external sendを明示するだけで、実験可能な対策になります。

02 / Agent BOM

AgentFlow

AgentFlowは、agentの依存関係をコードimportではなく、prompt、tool、memory、model、policyの到達関係として扱います。mcp-notion-serverでは、toolごとのread/write/destructive分類とapproval要否をmanifest化するのが最小実装です。

03 / Proxy Evaluation

PACE

PACEは、高価なagent評価を完全に置き換えるものではなく、日次・週次の回帰検知を安くするための考え方です。stock_screeningでは10件程度の代表銘柄、trade_disciplineでは過去相談20件をproxy suiteにできます。

04 / RAG Security

KidnapRAG

Agentic RAGの強みである反復検索は、query reformulationを攻撃されると弱点にもなります。金融文書やNotion knowledge baseでは、検索前後のquery、source trust、根拠利用spanを保存し、意図逸脱を検出する必要があります。

05 / Skill Governance

SkillCoach

スキルはSOPや検証手順を再利用できる一方で、似たスキルが増えるほど誤選択が起きます。まず高頻度skillだけに、使う条件、必須手順、禁止手順、検証方法を短く追加するのが現実的です。

TRENDS

技術トレンドの整理

APPLICATIONS

既存ワークフローへの応用可能性

stock_screening

RAG根拠の耐性評価

正常根拠、古い根拠、汚染根拠を混ぜた10件以内のfixtureを作り、結論と根拠spanのずれを測る。優先度は高。

mcp-notion-server

軽量Agent BOM

toolごとのside effect、approval要否、reads/writesをmanifest化し、write/destructive toolの分類漏れをCIで検出する。

trade_discipline

助言境界の明示

売買推奨ではなく、ルール違反、過去パターン、確認質問、日誌記録だけを許可する境界rubricを追加する。

prompt-designer-app

テンプレートrubric

テンプレートに使う条件、必須手順、禁止手順、出力検証を追加し、根拠外span self-checkを試す。

Daily _Writing

フィードバックskill分離

励まし、構成改善、語彙、継続支援、日誌記録を分ける。ただし今週は高優先タスク後に回す。

Codex automation

task boundary manifest

許可ファイル、禁止操作、検証方法、外部送信可否を毎回明示し、曖昧な自動化を減らす。

DECISIONS

今回の判断

採用候補

境界manifest / Agent BOM / RAG source integrity

既存アプリに小さく入れられ、評価指標にも接続しやすい。

検証候補

PACE型proxy / SkillCoach rubric / span grounding

効果はありそうだが、最初は小さなサンプルで実測する。

保留・却下

全面ContextNest / SDK移行 / 完了率だけの評価

仕様や移行は重い。完了率だけの評価と、URL付きRAGを検証済み扱いする運用は却下。

SMALL EXPERIMENTS

今週実行する小さな実験

  1. mcp-notion-server 向けに、toolごとの operation_typeside_effectrequires_approvalreadswrites を持つ軽量Agent BOM案を作る。
  2. stock_screening 向けに、正常根拠、古い根拠、汚染根拠を混ぜたRAG source integrity fixtureを10件以内で作る。
  3. Codex自動化用に、許可ファイル、禁止操作、検証方法、外部送信可否を明示する task_boundary.yaml テンプレートを作る。