AI Agent / LLM App Weekly Research

エージェント安全性は完了率の外にある

今週は、tool-using agentの情報漏えい、共有メモリ統治、低権限ツール選択、coding agentの持久力、Record & Replay、Vercel eve/Connectを中心に整理する。既存アプリでは、能力評価と安全評価を分け、ツール権限と検索ログを先に整える。

作成日: 2026-06-20 対象期間: 2026-06-13 - 2026-06-20 一次情報優先

EDITOR'S NOTE

今週の読みどころ

エージェントがタスクを完了しても、不要な情報を読み、削除済み記憶を使い、高権限ツールへ逃げるなら、本番では失敗である。今週の焦点は、完了率の外側にある安全性と統治を測ることにある。

Theme 01

安全評価を分ける

Data Leakage Risksは、完了率とは別に、data minimization、audience awareness、access boundaryを測る必要を示す。

Theme 02

記憶は統治対象

GateMemは、共有メモリでutility、access control、active forgettingを同時に評価する。

Theme 03

権限を最小化する

ToolPrivBenchは、agentが低権限で足りる場面でも高権限ツールを選びやすいことを示す。

WHAT TO READ THIS WEEK

今週把握すべき研究・記事・事例

01
論文 · 高 · Data Safety

Data Leakage Risks in Tool-Using LLM Agents

何が新しいか非敵対的な通常タスクでもagentが情報漏えいを起こすかを、MCP環境とリスク別rubricで評価する。

なぜ重要かGmail、Slack、Notion、MCP操作では、タスク成功とデータ取扱い成功を分けないと危険を見落とす。

読む観点resource、recipient、data class、宛先妥当性をtool logに残す設計へ落とす。

02
論文 · 高 · Memory Governance

GateMem

何が新しいか共有メモリのutilityだけでなく、access controlとactive forgettingを同時に測る。

なぜ重要か`trade_discipline` と `Daily _Writing` では、現在有効な記憶、過去傾向、削除済み情報を分ける必要がある。

読む観点memory itemへowner、scope、validity、deleted_at、source_eventを追加する。

03
論文 · 高 · Tool Privilege

Over-Privileged Tool Selection

何が新しいか低権限ツールで十分な場面でも、agentが高権限ツールを選ぶ問題をToolPrivBenchで測る。

なぜ重要か`mcp-notion-server` ではreadで足りる場面のwrite、dry-runなしの更新が本番リスクになる。

読む観点全toolにprivilege level、side effect、dry-run、approval、低権限代替を付ける。

04
論文 · 高 · Coding Agent Eval

StaminaBench

何が新しいかcoding agentを最大100 interaction turnsでstress-testし、長い変更列でどこまで品質を保つかを見る。

なぜ重要か週次リサーチ自動化やCodex作業は、調査、生成、検証、配信、記録の連鎖で壊れやすい。

読む観点step、acceptance check、retry count、evidence pathをrun logに残す。

05
公式 · 高 · Claude Code

Agentic coding and persistent returns to expertise

何が新しいか約40万Claude Codeセッションから、人間がplanning、agentがexecutionを担う分業を分析している。

なぜ重要かCodex自動化でも、ドメイン制約と成功条件を人間側が明示するほど成果が安定する。

読む観点「小さいタスク」だけでなく、採用判断、禁止事項、検証方法をセットで渡す。

06
公式 · 中 · Codex Skill

Codex Record & Replay

何が新しいかMac上の定型手順を実演し、再利用可能なskillへ変換する導線が追加された。

なぜ重要か週次配信やUI操作を含む確認作業を、説明ではなく実演からskill化できる可能性がある。

読む観点機密情報を含めず、短く完結したworkflowと検証条件だけを記録する。

07
公式/OSS · 中 · Agent Stack

Vercel eve / Connect

何が新しいかagentをファイル構造、typed tools、approvals、skills、connections、evals、durable executionで定義する。

なぜ重要か`mcp-notion-server` のtool manifest、承認、credential設計に参考になる。

読む観点全面移行ではなく、filesystem-firstな権限metadataと短命token発想だけを流用する。

08
論文 · 中 · RAG Security

CAREATTACK / HyGRAG / Agents-K1

何が新しいかRAGの攻撃面がretriever編集へ広がり、graph/evidence構造化の重要性が増している。

なぜ重要か`stock_screening` のSEC検索やNotion論文DBでは、retriever versionとsource idを残す必要がある。

読む観点graph RAG本格導入ではなく、固定質問セットと検索ログの回帰評価から始める。

DEEP DIVE

資料別ディープダイブ

能力評価と安全評価を分離する

Data Leakage Risks、GateMem、Over-Privileged Tool Selectionは、agentが「できる」ことと「してよい」ことを分けて測る必要を示している。タスク完了率だけでは、不要なページを読んだ、削除済みmemoryを使った、低権限で足りるのにwrite toolへ進んだ、という失敗を見落とす。

既存アプリでは、tool callごとにresource、recipient、privilege、side effect、data class、approval statusを残すところから始める。これは本番自律化の前提であり、promptで「気をつけて」と書くだけでは足りない。

長いCodex作業には持久力ログが必要

StaminaBenchは、coding agentが連続変更でどこまで品質を保てるかを測る。AnthropicのClaude Code分析も、人間が計画、agentが実行という分業を示す。週次リサーチ自動化では、調査、生成、公開、配信、記録の各stepにacceptance checkとevidence pathを持たせるほうが、最終成果物だけを見るより改善しやすい。

RAGは検索器と根拠IDまで監査する

CAREATTACKは、retriever model編集によって悪意あるpassageが上位に出る攻撃を扱う。HyGRAGやAgents-K1は、chunkだけでなくentity、relation、evidenceを接続する方向を示す。今すぐgraph RAGへ移る必要はないが、retriever version、query、top-k、source id、score、採用理由を保存しないままretrieverを変更するのは避ける。

Agent frameworkは本番プリミティブへ寄っている

Vercel eveとConnectは、agentをpromptではなく、ファイル構造、tool、skill、approval、credential、schedule、evalとして扱う。既存環境をVercelへ移す判断は保留でよいが、`mcp-notion-server` のtool manifest設計には、approval、dry-run、short-lived credential、audit logの考え方を取り込む価値がある。

APPLICATIONS

既存ワークフローへの応用

High Priority

mcp-notion-server

全toolをread-only、write、destructive、external-send、high-cost、long-runningで分類し、dry-run、approval、低権限代替、audit fieldsをmanifest化する。過剰権限選択と情報漏えいの検査を先に作る。

High Priority

stock_screening

SEC/決算資料検索にretriever version、query、top-k、source id、score、採用理由、根拠spanを残す。retriever変更前後を固定質問10件で比較する。

High Priority

trade_discipline

memory itemにowner、scope、valid_from、valid_until、deleted_at、source_eventを持たせる。現在有効なルール、過去傾向、削除済み情報を分離する。

Medium Priority

prompt-designer-app / Daily _Writing

prompt templateと文章フィードバックmemoryをinstruction asset / governed memoryとして扱う。高優先アプリでschemaが固まってから移植する。

DECISIONS

今回の判断

採用候補

agent安全評価5分類、memory governance schema、least-privilege tool manifest、RAG retriever version付き評価ログ、Codex長期作業run log。

検証候補

Record & Replayによる週次配信手順のskill化、Vercel eve構造の一部流用、evidence graph最小schema。

保留

Vercel eve全面移行、Vercel Connect導入、Self-Harness、graph RAG本格導入、retriever model変更。

却下

完了率だけのagent評価、LLM judge単独安全判定、削除済みmemoryをpromptだけで抑止する対策、dry-runなしwrite自律実行。

NEXT EXPERIMENTS

今週の小さな実験

  1. `mcp-notion-server` のMCP tool権限分類表を作る。
  2. `stock_screening` にRAG回帰評価用 `retrieval_eval_cases.jsonl` のschema案とサンプル2件を作る。
  3. Codex自動化用に、`step`, `acceptance_check`, `retry_count`, `evidence_path`, `decision` を持つrun log雛形をこのリサーチOpsへ追加する。

REFERENCES

参考URL