AI Agent / LLM App Weekly Research

エージェントは経験・時間・権限を持つ実行基盤へ

2026年6月最終週は、反復型agentの止め方、RAG/メモリの時間有効性、MCP tool surfaceの形式制御、production agent基盤の成熟を中心に整理します。

作成日: 2026-06-27 対象期間: 2026-06-20 - 2026-06-27 一次情報優先

EDITOR'S NOTE

今週の読みどころ

今週の軸は、agentを賢くすることではなく、経験、停止条件、時間有効性、権限、検証を運用可能な部品へ分けることです。

Theme 01

反復には止め方がいる

Semantic Early-Stoppingは、固定回数のWriter/Critic loopを、意味変化と品質改善が止まった時点で終了させる考え方を示します。

Theme 02

記憶には時間と役割がいる

Temporal ValidityとMemory Rolesは、RAG/長期記憶を検索スコアだけでなく、有効期間、退役、役割で扱う必要を示します。

Theme 03

ツールには形式的な境界がいる

Policy-as-CodeとShareLockは、MCP tool descriptionやtool集合そのものが統制対象であり攻撃面でもあることを示します。

WHAT TO READ THIS WEEK

今週把握すべき研究・記事・事例

01
公式記事 · 高重要度 · Agent Runtime

AI SDK 7 is now available

何が新しいか

tool approvals、durability、timeouts、sandbox、HarnessAgent、telemetryをproduction agentの標準部品として扱う。

なぜ重要か

CodexやClaude Codeのようなharnessを共通インターフェースで動かす設計が、既存アプリの実験基盤に参考になる。

読む観点

全面移行ではなく、承認、停止、再開、観測、隔離の運用設計だけを借りる。

02
論文 · 高重要度 · Agent Loop

Semantic Early-Stopping for Iterative LLM Agent Loops

何が新しいか

固定の反復回数ではなく、draft間の意味変化と品質改善の停止でloopを止める。

なぜ重要か

文書生成、プロンプト改善、レビューloopで、token浪費と早すぎる打ち切りを同時に減らせる。

読む観点

embedding距離だけに依存せず、rubric別品質スコアと禁止事項チェックを併用する。

03
論文 · 高重要度 · Retrieval Memory

Temporal Validity in Retrieval Memory

何が新しいか

古い事実と新しい事実をembedding similarityだけで区別できない問題を示し、bi-temporal ledgerを提案する。

なぜ重要か

SEC資料、決算ガイダンス、取引ルール、API名の更新が古い根拠として混入するリスクに直結する。

読む観点

valid_fromvalid_untilsupersedessource_idをschemaで持つ。

04
論文 · 高重要度 · Policy-as-Code

Autoformalization of Agent Instructions into Policy-as-Code

何が新しいか

prompt、MCP tool description、自然言語ポリシーからCedar Policy Languageへの変換を試みる。

なぜ重要か

tool利用の安全性を「注意書き」から実行時に止められるpolicyへ移す方向性を示す。

読む観点

まずはMCP tool manifestをPolicy-as-Code化しやすい形に整える。

05
論文 · 高重要度 · MCP Security

ShareLock

何が新しいか

MCP tool poisoningを複数toolへ分散し、tool単体では見えにくくする攻撃を扱う。

なぜ重要か

外部MCP server接続や自作tool増加時に、tool集合としての監査が必要になる。

読む観点

tool snapshot、description差分、server全体の結合description検査を導入する。

06
論文 · 中重要度 · Verification Harness

NOVA

何が新しいか

動くコードではなく、ドメイン制約を満たす変更を検証するagent harnessを提案する。

なぜ重要か

Codexタスクの成功条件を、ビルド成功からKPI・禁止事項・回帰サンプルへ拡張する根拠になる。

読む観点

実装依頼にはdomain verification checklistを付ける。

07
論文 · 中重要度 · GUI Agent

Autonomous Experience Exploration for GUI Agents

何が新しいか

GUI agentが自律探索で経験を集め、hindsightから高レベルの計画データを作る。

なぜ重要か

週次配信、deploy、Gmail/Slack共有の定型手順をrunbookやRecord & Replayで改善する発想に近い。

読む観点

本番自律探索ではなく、成功/失敗手順の資産化に限定する。

08
論文 · 中重要度 · Memory Roles

Memory Makes the Difference

何が新しいか

会話メモリを機能的役割で分類し、ユーザー視点の評価で応答差を見る。

なぜ重要か

Daily Writingとtrade_disciplineで、好み、目標、ルール、反省、期限切れを分ける根拠になる。

読む観点

memory itemにroleを追加し、取得時に役割を制御する。

09
論文 · 中重要度 · Multi-Model Eval

When Does Combining Language Models Help?

何が新しいか

複数モデル構成の上限を、全モデルが同じqueryで同時に間違える率から見る。

なぜ重要か

投票やルーティングの前に、同時失敗率と共通の根拠不足を測るべきだと分かる。

読む観点

2から3モデルの小評価セットで十分。先に全モデル失敗の原因を潰す。

10
論文 · 中重要度 · Financial Documents

LLM-Based Examination of Securities Prospectuses

何が新しいか

長大・半構造・多言語の金融文書を抽出、正規化、解釈に分けて処理する実務寄り事例。

なぜ重要か

stock_screeningのSEC/決算資料処理で、最終レポートだけでなく中間構造化データを評価する根拠になる。

読む観点

投資助言ではなく、分析手順と根拠保持の改善として扱う。

DEEP DIVE

資料別ディープダイブ

Vercel AI SDK 7

agentをpromptではなくruntimeとして扱う

AI SDK 7は、tool approval、durability、timeout、sandbox、HarnessAgent、telemetryをproduction agentの中心に置く。既存アプリを全面移行する必要はないが、Codex自動化やLLM touchpointには、承認点、失敗時の再開、実行ログ、sandbox境界を持たせるべきだと分かる。

Semantic Early-Stopping

反復の終了を品質制御にする

固定回数の推敲は、簡単な入力では無駄に長く、難しい入力では足りない。draft間の意味差分、rubric score、patience windowを組み合わせ、改善が止まった時点で停止する。prompt-designer-appと週次レポート生成で小実験しやすい。

Temporal Validity

古い事実は検索スコアでは消えない

RAGは古い事実と新しい事実を似たembeddingとして返す。API名、決算ガイダンス、取引ルールのように上書きされる情報は、valid_fromvalid_untilsupersedessource_idで管理し、retrieval前にfilterする必要がある。

Policy-as-Code / ShareLock

MCP tool surfaceを統制対象にする

MCP tool descriptionは、説明文であると同時にagentが読む命令面でもある。Policy-as-Codeは自然言語仕様を実行時policyへ寄せ、ShareLockは複数toolへ分散されたpoisoningの危険を示す。まずはtool manifest、snapshot差分、結合description検査から始める。

NOVA / GUI Experience

経験と検証を資産化する

NOVAはdomain verificationをharnessに入れ、GUI agent論文は経験をhindsightで計画データへ変換する。Codexタスクでも、成功/失敗手順、受け入れ条件、domain check、evidence pathを残すことで、次回の実行品質が上がる。

Memory Roles / Co-Failure / Financial IE

個人化、複数モデル、金融文書を評価可能にする

会話メモリは好み、目標、ルール、反省、期限切れを分ける。複数モデル導入前には同時失敗率を見る。金融文書処理では、最終レポートではなく抽出、正規化、解釈の中間成果物を評価する。

APPLICATIONS

既存ワークフローへの応用

stock_screening

時間有効な根拠を残す

SEC/決算資料の抽出を、抽出、正規化、解釈、レポート生成に分ける。古いガイダンス混入を防ぐため、source、span、validity、supersessionを保存する。

trade_discipline / Daily Writing

記憶に役割と期限を持たせる

ルール、心理トリガー、過去の反省、現在の目標、好み、避けたい指摘をroleで分け、期限切れや削除済みをretrieval前に除外する。

mcp-notion-server

tool manifestを監査可能にする

各toolにprivilege、side effect、approval requirement、resource scope、dry-run可否を持たせ、tool snapshot差分を保存する。

DECISIONS

今回の判断

採用候補

Semantic Early-Stopping、Temporal Validity schema、MCP tool権限manifest、tool snapshot差分、段階別金融文書抽出評価。

検証候補

AI SDK 7のHarnessAgent設計観点、GUI agent経験探索のrunbook利用、Memory Roles、Co-Failure Ceiling。

保留・却下

AI SDK 7全面移行、Cedar enforcement本番化、GUI自律探索本番運用は保留。固定回数loopとembeddingだけの鮮度判断は却下。

NEXT EXPERIMENTS

今週実行する小さな実験

  1. mcp-notion-server にMCP tool権限manifest案を作る。各toolへ権限、承認要否、dry-run可否、代替低権限toolを付ける。
  2. stock_screening に文書抽出/RAG評価schema案を作る。source、span、抽出値、正規化値、validity、supersession、retriever versionを含める。
  3. prompt-designer-app または週次リサーチ生成にSemantic Early-Stoppingの小実験を入れ、停止理由と節約token見積もりを記録する。