AI Agent / LLM App Weekly Research

記憶とスキルは境界を評価する

今週は、エージェントが読む文書、保存する記憶、再利用するスキル、検索する根拠、呼び出すツールを、増やす前にどう検証するかを整理します。

作成日: 2026-08-22 対象期間: 2026-08-15 - 2026-08-22 重点: Memory / Skills / RAG / Tool Trajectory

EDITOR'S NOTE

今週の読みどころ

前号は予算、時点付きRAG、generic-first skills、trajectory safety logsを採用候補にしました。今週は、そこから一段進んで「記憶・スキル・検索・ツールの境界をどう評価するか」に焦点を移します。

DOCUMENTATION

エージェントが読む文書は偏る

実セッションでは、APIリファレンスよりもAGENTS.md、CLAUDE.md、作業メモなどのagent-facing artifactsが中心でした。

MEMORY

正しい記憶でも推論を歪める

保存・検索できるかだけではなく、今使ってよいか、永続化してよいか、確認が必要かを評価します。

RAG AND TOOLS

根拠発見と実行軌跡を分ける

RAGはqrels/evidence recall、MCPはschema grounding/required args/状態差分を見ます。

PRIMARY SOURCES

今週把握すべき研究・記事・事例

01
論文 / 高重要度 / 2026-08-20

From Agent Behaviour to Agent-Friendly Documentation

何が新しいか557件の実セッションと33,097件のagentic PRから、エージェントの文書利用を測定。

なぜ重要か文書インタラクションの中心はagent instruction filesとworking notesで、API referenceではない。

読む観点AGENTS.mdや検証ログを、エージェントが読む実行仕様として扱う。

02
論文 / 高重要度 / 2026-08-20

MemTrapBench

何が新しいか正しく関連する記憶でも、現在タスクの推論を固定・歪曲する場合を評価。

なぜ重要か長期記憶や個人化を入れる前に、memory-induced trapを検証できる。

読む観点memory_distorted_reasoningやcurrent_task_mismatchをrubricへ足す。

03
論文 / 高重要度 / 2026-08-20

Remember, Verify, or Ask?

何が新しいか記憶候補を、保存、今だけ使用、外部検証、ユーザー確認に分ける境界評価。

なぜ重要か誤った永続記憶は将来の全タスクを静かに歪める。

読む観点persist/use_now/verify/ask_userをtool-call selectionとして評価する。

04
論文 / 高重要度 / 2026-08-20

Break It Down, Pass It On

何が新しいかtask-level skillは平均で害、subtask-level text skillは平均改善という比較。

なぜ重要か成功タスク全体をそのままスキル化する運用を避けられる。

読む観点skill registryにscope、format、utility_score、negative examplesを持つ。

05
論文/データ / 中重要度 / 2026-08-20

MidTool

何が新しいかAPI、MCP skills、文書grounded workflowからtool-use trajectoryを合成。

なぜ重要かMCP serverのfixtureを、単発出力ではなくtrajectoryとして設計できる。

読む観点schema grounding、必須引数、clarification、tool-response consistencyを見る。

06
論文/データ / 高重要度 / 2026-08-20

BrowseComp-PlusCM

何が新しいかBrowseComp-Plusを400B-token/553M-documentのClimbMixへ投影。

なぜ重要か最終回答だけでなく、retrieverが正しい証拠を見つけたかを分けて測れる。

読む観点qrels、evidence recall、missing evidence reasonをRAG評価に入れる。

07
論文 / 高重要度 / 2026-08-20

When Text and Numbers Disagree

何が新しいか文章、数値、外部forecastが衝突したときのLLMの証拠裁定を評価。

なぜ重要か金融分析や売買規律では、説明文と数値ログの衝突が頻出する。

読む観点chosen_evidence_typeやtool_forecast_overrode_contextを記録する。

08
論文 / 中重要度 / 2026-08-20

Pandora's AI Model Routing Box

何が新しいかcheap estimateとcostly estimateを、価値情報とコストで使い分ける。

なぜ重要か全件を高コスト深掘りせず、深掘りする価値がある対象だけを選べる。

読む観点routing_reasonとestimated_value_of_informationをログ化する。

09
論文/OSS予定 / 中重要度 / 2026-08-20

Task-CoEvolve

何が新しいかcandidate harnessの差が出やすいタスクへ評価予算を集中させる。

なぜ重要かprompt/harness改善で全ケース評価のコストを抑えられる。

読む観点固定fixtureを作った後、discriminativenessを評価履歴へ入れる。

10
公式/OSS / 中重要度 / 2026-08-18 - 21

Codex, Claude, MCP Inspector updates

何が新しいかCodex共有snapshot、Claude memory stores/domain制限、Inspector 2.3.0のschema/UI修正。

なぜ重要か履歴、権限、memory、MCP tool schemaの運用検証に効く。

読む観点agent運用ログを、監査証跡と再現fixtureとして扱う。

DEEP DIVE

ディープダイブ

agent-facing docsは実行仕様になる

Agent-Friendly Documentationは、エージェントがAPI referenceよりもinstruction filesやworking notesを多く読むことを実測した。既存プロジェクトのAGENTS.md、automation memory、検証ログは、読み物ではなく実行時仕様として扱うべき。

記憶は保存前にcommitment boundaryを見る

MemTrapBenchは、正しい記憶でも推論を歪めることを示した。Remember, Verify, or Ask?は、保存、今だけ使用、検証、ユーザー確認を分けて評価する。trade_disciplineやDaily Writingでは、この境界をschemaにする価値が高い。

スキルはsubtask単位で昇格する

Break It Down, Pass It Onは、task-level skillが平均で害になり、subtask-level text skillが改善しやすいことを示す。成功例を丸ごとテンプレにするより、入力正規化、根拠確認、出力検査などへ分解する。

RAGとツール利用はtrajectory fixtureで測る

BrowseComp-PlusCMはretrieverとagentを分ける評価、MidToolはtool schemaとworkflowを含むtrajectory設計を示す。mcp-notion-serverでは、schema grounding、必須引数、禁止DB、状態差分をfixtureにする。

金融・規律支援では証拠衝突を明示する

Evidence Arbitrationは、文章、数値、外部forecastの衝突時にモデルが系統的な癖で証拠を選ぶことを示す。stock_screeningでは数値と会社説明、trade_disciplineでは日誌と実取引ログの衝突を記録する。

APPLICATION

既存ワークフローへの応用

HIGH

stock_screening

as-of retrieval、text/numeric conflict、deep-dive routingのfixtureを作り、1W/1M/3M結果へ帰属する。

HIGH

trade_discipline

相談ログにpersist/use_now/verify/ask_user、stop/escalate/proceed、budget_usedを追加する。

HIGH

mcp-notion-server

代表3 toolのdry-run safety fixtureを作り、Inspector 2.3.0でschemaと状態差分を検証する。

DECISIONS

今回の判断

採用候補

agent-facing docs整備、memory commitment schema、subtask-level skill registry、qrels/evidence recall、証拠衝突fixture、MCP trajectory fixture。

検証候補

Pandora型deep dive routing、Task-CoEvolve型評価fixture選択、AdaptiveMem風memory trap warning prompt。

保留・却下

MidTool本体、大規模検索基盤、成功タスク全体の無条件スキル化、現在版だけのRAG評価、最終文章だけの安全評価。

NEXT EXPERIMENTS

今週の小さな実験

  1. stock_screeningで過去レポート10件のas-of retrieval、text/numeric conflict、deep-dive routing fixtureを作る。
  2. trade_disciplineで相談ログschemaにmemory commitmentとstop/escalate/proceedを追加する案を作る。
  3. mcp-notion-serverで代表3 toolのdry-run safety fixtureとMCP Inspector検証手順を作る。