AI SDK 7 is now available
tool approvals、durability、timeouts、sandbox、HarnessAgent、telemetryをproduction agentの標準部品として扱う。
CodexやClaude Codeのようなharnessを共通インターフェースで動かす設計が、既存アプリの実験基盤に参考になる。
全面移行ではなく、承認、停止、再開、観測、隔離の運用設計だけを借りる。
AI Agent / LLM App Weekly Research
2026年6月最終週は、反復型agentの止め方、RAG/メモリの時間有効性、MCP tool surfaceの形式制御、production agent基盤の成熟を中心に整理します。
EDITOR'S NOTE
今週の軸は、agentを賢くすることではなく、経験、停止条件、時間有効性、権限、検証を運用可能な部品へ分けることです。
Semantic Early-Stoppingは、固定回数のWriter/Critic loopを、意味変化と品質改善が止まった時点で終了させる考え方を示します。
Temporal ValidityとMemory Rolesは、RAG/長期記憶を検索スコアだけでなく、有効期間、退役、役割で扱う必要を示します。
Policy-as-CodeとShareLockは、MCP tool descriptionやtool集合そのものが統制対象であり攻撃面でもあることを示します。
WHAT TO READ THIS WEEK
tool approvals、durability、timeouts、sandbox、HarnessAgent、telemetryをproduction agentの標準部品として扱う。
CodexやClaude Codeのようなharnessを共通インターフェースで動かす設計が、既存アプリの実験基盤に参考になる。
全面移行ではなく、承認、停止、再開、観測、隔離の運用設計だけを借りる。
固定の反復回数ではなく、draft間の意味変化と品質改善の停止でloopを止める。
文書生成、プロンプト改善、レビューloopで、token浪費と早すぎる打ち切りを同時に減らせる。
embedding距離だけに依存せず、rubric別品質スコアと禁止事項チェックを併用する。
古い事実と新しい事実をembedding similarityだけで区別できない問題を示し、bi-temporal ledgerを提案する。
SEC資料、決算ガイダンス、取引ルール、API名の更新が古い根拠として混入するリスクに直結する。
valid_from、valid_until、supersedes、source_idをschemaで持つ。
prompt、MCP tool description、自然言語ポリシーからCedar Policy Languageへの変換を試みる。
tool利用の安全性を「注意書き」から実行時に止められるpolicyへ移す方向性を示す。
まずはMCP tool manifestをPolicy-as-Code化しやすい形に整える。
MCP tool poisoningを複数toolへ分散し、tool単体では見えにくくする攻撃を扱う。
外部MCP server接続や自作tool増加時に、tool集合としての監査が必要になる。
tool snapshot、description差分、server全体の結合description検査を導入する。
動くコードではなく、ドメイン制約を満たす変更を検証するagent harnessを提案する。
Codexタスクの成功条件を、ビルド成功からKPI・禁止事項・回帰サンプルへ拡張する根拠になる。
実装依頼にはdomain verification checklistを付ける。
GUI agentが自律探索で経験を集め、hindsightから高レベルの計画データを作る。
週次配信、deploy、Gmail/Slack共有の定型手順をrunbookやRecord & Replayで改善する発想に近い。
本番自律探索ではなく、成功/失敗手順の資産化に限定する。
会話メモリを機能的役割で分類し、ユーザー視点の評価で応答差を見る。
Daily Writingとtrade_disciplineで、好み、目標、ルール、反省、期限切れを分ける根拠になる。
memory itemにroleを追加し、取得時に役割を制御する。
複数モデル構成の上限を、全モデルが同じqueryで同時に間違える率から見る。
投票やルーティングの前に、同時失敗率と共通の根拠不足を測るべきだと分かる。
2から3モデルの小評価セットで十分。先に全モデル失敗の原因を潰す。
長大・半構造・多言語の金融文書を抽出、正規化、解釈に分けて処理する実務寄り事例。
stock_screeningのSEC/決算資料処理で、最終レポートだけでなく中間構造化データを評価する根拠になる。
投資助言ではなく、分析手順と根拠保持の改善として扱う。
DEEP DIVE
AI SDK 7は、tool approval、durability、timeout、sandbox、HarnessAgent、telemetryをproduction agentの中心に置く。既存アプリを全面移行する必要はないが、Codex自動化やLLM touchpointには、承認点、失敗時の再開、実行ログ、sandbox境界を持たせるべきだと分かる。
固定回数の推敲は、簡単な入力では無駄に長く、難しい入力では足りない。draft間の意味差分、rubric score、patience windowを組み合わせ、改善が止まった時点で停止する。prompt-designer-appと週次レポート生成で小実験しやすい。
RAGは古い事実と新しい事実を似たembeddingとして返す。API名、決算ガイダンス、取引ルールのように上書きされる情報は、valid_from、valid_until、supersedes、source_idで管理し、retrieval前にfilterする必要がある。
MCP tool descriptionは、説明文であると同時にagentが読む命令面でもある。Policy-as-Codeは自然言語仕様を実行時policyへ寄せ、ShareLockは複数toolへ分散されたpoisoningの危険を示す。まずはtool manifest、snapshot差分、結合description検査から始める。
NOVAはdomain verificationをharnessに入れ、GUI agent論文は経験をhindsightで計画データへ変換する。Codexタスクでも、成功/失敗手順、受け入れ条件、domain check、evidence pathを残すことで、次回の実行品質が上がる。
会話メモリは好み、目標、ルール、反省、期限切れを分ける。複数モデル導入前には同時失敗率を見る。金融文書処理では、最終レポートではなく抽出、正規化、解釈の中間成果物を評価する。
APPLICATIONS
SEC/決算資料の抽出を、抽出、正規化、解釈、レポート生成に分ける。古いガイダンス混入を防ぐため、source、span、validity、supersessionを保存する。
ルール、心理トリガー、過去の反省、現在の目標、好み、避けたい指摘をroleで分け、期限切れや削除済みをretrieval前に除外する。
各toolにprivilege、side effect、approval requirement、resource scope、dry-run可否を持たせ、tool snapshot差分を保存する。
DECISIONS
Semantic Early-Stopping、Temporal Validity schema、MCP tool権限manifest、tool snapshot差分、段階別金融文書抽出評価。
AI SDK 7のHarnessAgent設計観点、GUI agent経験探索のrunbook利用、Memory Roles、Co-Failure Ceiling。
AI SDK 7全面移行、Cedar enforcement本番化、GUI自律探索本番運用は保留。固定回数loopとembeddingだけの鮮度判断は却下。
NEXT EXPERIMENTS
mcp-notion-server にMCP tool権限manifest案を作る。各toolへ権限、承認要否、dry-run可否、代替低権限toolを付ける。stock_screening に文書抽出/RAG評価schema案を作る。source、span、抽出値、正規化値、validity、supersession、retriever versionを含める。prompt-designer-app または週次リサーチ生成にSemantic Early-Stoppingの小実験を入れ、停止理由と節約token見積もりを記録する。