AI Agent / LLM App Weekly Research

評価境界と実行契約を先に置く

今週は、エージェントに実行環境を明示する設計、評価ハーネスの報酬改ざん耐性、長期記憶・画像・A2A通信の信頼境界を、既存アプリの小さなfixtureへ落とします。

作成日: 2026-09-12 対象期間: 2026-09-05 - 2026-09-12 重点: Execution Contract / Eval Boundary / Memory Safety / MCP

EDITOR'S NOTE

今週の読みどころ

前号は、スキル進化、資源認識ツール利用、read-only telemetry fixture、MCP metadataを採用候補にしました。今週は、そこから一歩進めて「実行契約を明示する」「評価ハーネスを守る」「記憶や画像入力を命令経路にしない」へ焦点を移します。

EXECUTION CONTRACT

制約はpromptの一部になる

RAM、時間、権限、情報日付、失敗時方針を先に渡すと、agentの計画と生成コードが変わります。

EVAL BOUNDARY

評価ハーネスも攻撃面になる

agentが触るworkspaceと採点経路を分け、提出物と証跡から成功を判定する必要があります。

MEMORY AND INPUTS

記憶・画像・委譲を境界化する

外部コンテンツ、画像内テキスト、agent間capability claimは、命令ではなく検証対象として扱います。

PRIMARY SOURCES

今週把握すべき研究・記事・事例

01
論文 / 高重要度 / 2026-09-04

Substrate-Aware AI Agents

何が新しいか実行時間やRAM契約を入力に入れると、生成コードの構造と資源消費が変わる。

なぜ重要かCodexや分析workflowに、実行環境を先に明示する根拠になる。

読む観点memory_budget、time_budget、allowed_io、failure_policyをprompt contract化する。

02
論文 / 高重要度 / 2026-09-10

BenchShield

何が新しいか評価ハーネスのreward-relevant eventsを有限状態モデルで監査する。

なぜ重要かagent評価では、採点経路そのものを守らないと結果を信用しにくい。

読む観点採点ファイル、参照可能ファイル、提出物、検証コマンドをfixtureに明記する。

03
論文/OSS / 高重要度 / 2026-09-04

RefactorPlatform

何が新しいかrepo規模refactoring agentをtokens、diff、transcript、AST検証つきで評価する。

なぜ重要かCodex小タスクを、patchだけでなく再現可能な検証ログにできる。

読む観点本体導入ではなく、入力、制約、変更、テスト、判断ログを残す。

04
論文 / 高重要度 / 2026-09-01

PipePoison

何が新しいか長期記憶poisoningを、書き込み、検索、利用をまたぐend-to-end問題として扱う。

なぜ重要か記憶の保存前フィルタだけでは、将来行動への影響を防ぎきれない。

読む観点外部コンテンツは永続方針へ自動昇格しない。

05
論文/ベンチマーク / 高重要度 / 2026-09-08

MMPIBench

何が新しいか画像や音声内の指示が、認識、計画、tool callへ届く過程を測る。

なぜ重要か文書処理や画像入力つきプロンプト設計で、資料内指示を命令にしない境界が必要。

読む観点画像/PDF内の文字は、ユーザー命令ではなく処理対象データとして扱う。

06
論文 / 中重要度 / 2026-09-09

A2ABreak

何が新しいかA2A仕様準拠でも起こるcontext injection、identity loss、未検証capability claimを分析する。

なぜ重要かMCP tool安全性だけでなく、agent間委譲の信頼境界も必要になる。

読む観点caller_identity、delegated_by、capability_sourceを設計メモに残す。

07
論文/ベンチマーク / 中重要度 / 2026-09-10

SemVerBench

何が新しいかLLM coding agentが、npm、PEP 440、Cargoのバージョン制約で系統的に失敗する。

なぜ重要か依存更新提案は説明だけでなく、実resolverで検証すべき。

読む観点dependency_constraint_fixtureを作り、LLM提案とpackage manager結果を比較する。

08
論文 / 高重要度 / 2026-09-03

Financial Market Agent Risk

何が新しいか高性能モデルほど判断が相関し、共通誤情報下で市場リスクになり得る。

なぜ重要か投資系アプリでは、予測精度だけでなく同質化した誤判断を減らす必要がある。

読む観点強気/弱気根拠、情報源独立性、反証トリガーを記録する。

09
論文 / 中重要度 / 2026-09-04

Constructive Story Feedback

何が新しいか文章フィードバックを、作品固有で行動可能な助言へ寄せるreward設計。

なぜ重要かDaily Writingでは、たくさん直すより、次に直せる一観点が効く可能性がある。

読む観点本文根拠、最重要の一観点、次に直す一文を返す。

10
OSSリリース / 監視 / 2026-09-12

Vercel AI SDK releases

何が新しいか`ai@7.0.99`、`@ai-sdk/workflow@2.0.30` などのpatch releaseが確認できる。

なぜ重要かworkflow/gateway周辺の更新が続くため、LLMアプリではバージョン固定と差分確認が必要。

読む観点即更新ではなく、lockfile差分とsemver fixtureで確認する。

DEEP DIVE

ディープダイブ

エージェントpromptは実行契約になる

Substrate-Aware AI Agentsは、RAMや実行時間の制約を先に渡すだけで、生成コードが制約を意識した構造へ寄ることを示します。既存アプリでは、memory_budget、time_budget、allowed_io、failure_policy、利用可能な情報日付をprompt templateに含めるのが小さな第一歩です。

評価ハーネスの採点経路を守る

BenchShieldは、評価環境そのものがagentに触られる攻撃面になると考えます。stock_screeningやtrade_disciplineのfixtureでは、参照可能ファイル、採点対象、提出物、未来情報の禁止を分けるだけでも、結果の信頼性が上がります。

記憶は保存だけでなく利用まで監査する

PipePoisonは、長期記憶攻撃が書き込み、検索、利用をまたいで成立することを示します。ユーザー明示の好み、観察された傾向、外部コンテンツ、一時文脈を分け、外部コンテンツを長期方針へ自動昇格しない設計が必要です。

画像やPDFの文字は命令ではなくデータ

MMPIBenchは、画像、EXIF、QR、偽UI、音声がagentの計画やtool callへ届く経路を測ります。prompt-designer-appでは、資料中の指示を実行せず、要約対象データとして扱うfixtureを先に作るべきです。

金融agentは同質化リスクを見る

Financial Market Agent Riskは、モデル性能が上がっても、同じ情報環境で似た行動を取る相関リスクが残ることを示します。投資系アプリでは、自動売買ではなく、反証、情報源独立性、規律違反検出に使うのが安全です。

APPLICATION

既存ワークフローへの応用

HIGH

stock_screening

Layer 4分析にanalysis_contract、counter_evidence、source_independenceを追加し、未来情報混入と同質的な強気判断を後日検証する。

HIGH

trade_discipline

相談ログをuser_declared_rule、observed_behavior、external_market_content、execution_boundaryに分け、外部刺激を長期方針へ昇格させない。

HIGH

mcp-notion-server

代表3toolにread_only、side_effect、requires_confirmation、idempotency_key、caller_identity、dry_run_supportedのmetadata案を作る。

DECISIONS

今回の判断

採用候補

実行契約付きCodex task template、agent評価fixtureの採点境界、長期記憶source/scope分類、画像入力prompt injection fixture、金融分析の反証ログ。

検証候補

BenchShield型の簡易reward boundary、RefactorPlatform型のtokens/diff/transcript保存、SemVer resolver fixture、A2A委譲metadata。

保留・却下

BenchShield本体導入、A2A採用、AI SDK patch即更新、外部コンテンツの長期方針自動昇格、dry-runなしNotion更新。

NEXT EXPERIMENTS

今週の小さな実験

  1. stock_screeningにanalysis_contract、counter_evidence、source_independenceを含むas-of分析fixtureを1件追加する。
  2. prompt-designer-appに、文書内prompt injectionをデータとして扱う3件の入力fixtureと期待出力rubricを追加する。
  3. mcp-notion-serverに、代表3toolのmetadata/dry-run設計メモと最小fixtureを追加する。