Data Leakage Risks in Tool-Using LLM Agents
何が新しいか非敵対的な通常タスクでもagentが情報漏えいを起こすかを、MCP環境とリスク別rubricで評価する。
なぜ重要かGmail、Slack、Notion、MCP操作では、タスク成功とデータ取扱い成功を分けないと危険を見落とす。
読む観点resource、recipient、data class、宛先妥当性をtool logに残す設計へ落とす。
AI Agent / LLM App Weekly Research
今週は、tool-using agentの情報漏えい、共有メモリ統治、低権限ツール選択、coding agentの持久力、Record & Replay、Vercel eve/Connectを中心に整理する。既存アプリでは、能力評価と安全評価を分け、ツール権限と検索ログを先に整える。
EDITOR'S NOTE
エージェントがタスクを完了しても、不要な情報を読み、削除済み記憶を使い、高権限ツールへ逃げるなら、本番では失敗である。今週の焦点は、完了率の外側にある安全性と統治を測ることにある。
Data Leakage Risksは、完了率とは別に、data minimization、audience awareness、access boundaryを測る必要を示す。
GateMemは、共有メモリでutility、access control、active forgettingを同時に評価する。
ToolPrivBenchは、agentが低権限で足りる場面でも高権限ツールを選びやすいことを示す。
WHAT TO READ THIS WEEK
何が新しいか非敵対的な通常タスクでもagentが情報漏えいを起こすかを、MCP環境とリスク別rubricで評価する。
なぜ重要かGmail、Slack、Notion、MCP操作では、タスク成功とデータ取扱い成功を分けないと危険を見落とす。
読む観点resource、recipient、data class、宛先妥当性をtool logに残す設計へ落とす。
何が新しいか共有メモリのutilityだけでなく、access controlとactive forgettingを同時に測る。
なぜ重要か`trade_discipline` と `Daily _Writing` では、現在有効な記憶、過去傾向、削除済み情報を分ける必要がある。
読む観点memory itemへowner、scope、validity、deleted_at、source_eventを追加する。
何が新しいか低権限ツールで十分な場面でも、agentが高権限ツールを選ぶ問題をToolPrivBenchで測る。
なぜ重要か`mcp-notion-server` ではreadで足りる場面のwrite、dry-runなしの更新が本番リスクになる。
読む観点全toolにprivilege level、side effect、dry-run、approval、低権限代替を付ける。
何が新しいかcoding agentを最大100 interaction turnsでstress-testし、長い変更列でどこまで品質を保つかを見る。
なぜ重要か週次リサーチ自動化やCodex作業は、調査、生成、検証、配信、記録の連鎖で壊れやすい。
読む観点step、acceptance check、retry count、evidence pathをrun logに残す。
何が新しいか約40万Claude Codeセッションから、人間がplanning、agentがexecutionを担う分業を分析している。
なぜ重要かCodex自動化でも、ドメイン制約と成功条件を人間側が明示するほど成果が安定する。
読む観点「小さいタスク」だけでなく、採用判断、禁止事項、検証方法をセットで渡す。
何が新しいかMac上の定型手順を実演し、再利用可能なskillへ変換する導線が追加された。
なぜ重要か週次配信やUI操作を含む確認作業を、説明ではなく実演からskill化できる可能性がある。
読む観点機密情報を含めず、短く完結したworkflowと検証条件だけを記録する。
何が新しいかagentをファイル構造、typed tools、approvals、skills、connections、evals、durable executionで定義する。
なぜ重要か`mcp-notion-server` のtool manifest、承認、credential設計に参考になる。
読む観点全面移行ではなく、filesystem-firstな権限metadataと短命token発想だけを流用する。
何が新しいかRAGの攻撃面がretriever編集へ広がり、graph/evidence構造化の重要性が増している。
なぜ重要か`stock_screening` のSEC検索やNotion論文DBでは、retriever versionとsource idを残す必要がある。
読む観点graph RAG本格導入ではなく、固定質問セットと検索ログの回帰評価から始める。
DEEP DIVE
Data Leakage Risks、GateMem、Over-Privileged Tool Selectionは、agentが「できる」ことと「してよい」ことを分けて測る必要を示している。タスク完了率だけでは、不要なページを読んだ、削除済みmemoryを使った、低権限で足りるのにwrite toolへ進んだ、という失敗を見落とす。
既存アプリでは、tool callごとにresource、recipient、privilege、side effect、data class、approval statusを残すところから始める。これは本番自律化の前提であり、promptで「気をつけて」と書くだけでは足りない。
StaminaBenchは、coding agentが連続変更でどこまで品質を保てるかを測る。AnthropicのClaude Code分析も、人間が計画、agentが実行という分業を示す。週次リサーチ自動化では、調査、生成、公開、配信、記録の各stepにacceptance checkとevidence pathを持たせるほうが、最終成果物だけを見るより改善しやすい。
CAREATTACKは、retriever model編集によって悪意あるpassageが上位に出る攻撃を扱う。HyGRAGやAgents-K1は、chunkだけでなくentity、relation、evidenceを接続する方向を示す。今すぐgraph RAGへ移る必要はないが、retriever version、query、top-k、source id、score、採用理由を保存しないままretrieverを変更するのは避ける。
Vercel eveとConnectは、agentをpromptではなく、ファイル構造、tool、skill、approval、credential、schedule、evalとして扱う。既存環境をVercelへ移す判断は保留でよいが、`mcp-notion-server` のtool manifest設計には、approval、dry-run、short-lived credential、audit logの考え方を取り込む価値がある。
APPLICATIONS
全toolをread-only、write、destructive、external-send、high-cost、long-runningで分類し、dry-run、approval、低権限代替、audit fieldsをmanifest化する。過剰権限選択と情報漏えいの検査を先に作る。
SEC/決算資料検索にretriever version、query、top-k、source id、score、採用理由、根拠spanを残す。retriever変更前後を固定質問10件で比較する。
memory itemにowner、scope、valid_from、valid_until、deleted_at、source_eventを持たせる。現在有効なルール、過去傾向、削除済み情報を分離する。
prompt templateと文章フィードバックmemoryをinstruction asset / governed memoryとして扱う。高優先アプリでschemaが固まってから移植する。
DECISIONS
agent安全評価5分類、memory governance schema、least-privilege tool manifest、RAG retriever version付き評価ログ、Codex長期作業run log。
Record & Replayによる週次配信手順のskill化、Vercel eve構造の一部流用、evidence graph最小schema。
Vercel eve全面移行、Vercel Connect導入、Self-Harness、graph RAG本格導入、retriever model変更。
完了率だけのagent評価、LLM judge単独安全判定、削除済みmemoryをpromptだけで抑止する対策、dry-runなしwrite自律実行。
NEXT EXPERIMENTS
REFERENCES