From Agent Behaviour to Agent-Friendly Documentation
何が新しいか557件の実セッションと33,097件のagentic PRから、エージェントの文書利用を測定。
なぜ重要か文書インタラクションの中心はagent instruction filesとworking notesで、API referenceではない。
読む観点AGENTS.mdや検証ログを、エージェントが読む実行仕様として扱う。
AI Agent / LLM App Weekly Research
今週は、エージェントが読む文書、保存する記憶、再利用するスキル、検索する根拠、呼び出すツールを、増やす前にどう検証するかを整理します。
EDITOR'S NOTE
前号は予算、時点付きRAG、generic-first skills、trajectory safety logsを採用候補にしました。今週は、そこから一段進んで「記憶・スキル・検索・ツールの境界をどう評価するか」に焦点を移します。
実セッションでは、APIリファレンスよりもAGENTS.md、CLAUDE.md、作業メモなどのagent-facing artifactsが中心でした。
保存・検索できるかだけではなく、今使ってよいか、永続化してよいか、確認が必要かを評価します。
RAGはqrels/evidence recall、MCPはschema grounding/required args/状態差分を見ます。
PRIMARY SOURCES
何が新しいか557件の実セッションと33,097件のagentic PRから、エージェントの文書利用を測定。
なぜ重要か文書インタラクションの中心はagent instruction filesとworking notesで、API referenceではない。
読む観点AGENTS.mdや検証ログを、エージェントが読む実行仕様として扱う。
何が新しいか正しく関連する記憶でも、現在タスクの推論を固定・歪曲する場合を評価。
なぜ重要か長期記憶や個人化を入れる前に、memory-induced trapを検証できる。
読む観点memory_distorted_reasoningやcurrent_task_mismatchをrubricへ足す。
何が新しいか記憶候補を、保存、今だけ使用、外部検証、ユーザー確認に分ける境界評価。
なぜ重要か誤った永続記憶は将来の全タスクを静かに歪める。
読む観点persist/use_now/verify/ask_userをtool-call selectionとして評価する。
何が新しいかtask-level skillは平均で害、subtask-level text skillは平均改善という比較。
なぜ重要か成功タスク全体をそのままスキル化する運用を避けられる。
読む観点skill registryにscope、format、utility_score、negative examplesを持つ。
何が新しいかAPI、MCP skills、文書grounded workflowからtool-use trajectoryを合成。
なぜ重要かMCP serverのfixtureを、単発出力ではなくtrajectoryとして設計できる。
読む観点schema grounding、必須引数、clarification、tool-response consistencyを見る。
何が新しいかBrowseComp-Plusを400B-token/553M-documentのClimbMixへ投影。
なぜ重要か最終回答だけでなく、retrieverが正しい証拠を見つけたかを分けて測れる。
読む観点qrels、evidence recall、missing evidence reasonをRAG評価に入れる。
何が新しいか文章、数値、外部forecastが衝突したときのLLMの証拠裁定を評価。
なぜ重要か金融分析や売買規律では、説明文と数値ログの衝突が頻出する。
読む観点chosen_evidence_typeやtool_forecast_overrode_contextを記録する。
何が新しいかcheap estimateとcostly estimateを、価値情報とコストで使い分ける。
なぜ重要か全件を高コスト深掘りせず、深掘りする価値がある対象だけを選べる。
読む観点routing_reasonとestimated_value_of_informationをログ化する。
何が新しいかcandidate harnessの差が出やすいタスクへ評価予算を集中させる。
なぜ重要かprompt/harness改善で全ケース評価のコストを抑えられる。
読む観点固定fixtureを作った後、discriminativenessを評価履歴へ入れる。
何が新しいかCodex共有snapshot、Claude memory stores/domain制限、Inspector 2.3.0のschema/UI修正。
なぜ重要か履歴、権限、memory、MCP tool schemaの運用検証に効く。
読む観点agent運用ログを、監査証跡と再現fixtureとして扱う。
DEEP DIVE
Agent-Friendly Documentationは、エージェントがAPI referenceよりもinstruction filesやworking notesを多く読むことを実測した。既存プロジェクトのAGENTS.md、automation memory、検証ログは、読み物ではなく実行時仕様として扱うべき。
MemTrapBenchは、正しい記憶でも推論を歪めることを示した。Remember, Verify, or Ask?は、保存、今だけ使用、検証、ユーザー確認を分けて評価する。trade_disciplineやDaily Writingでは、この境界をschemaにする価値が高い。
Break It Down, Pass It Onは、task-level skillが平均で害になり、subtask-level text skillが改善しやすいことを示す。成功例を丸ごとテンプレにするより、入力正規化、根拠確認、出力検査などへ分解する。
BrowseComp-PlusCMはretrieverとagentを分ける評価、MidToolはtool schemaとworkflowを含むtrajectory設計を示す。mcp-notion-serverでは、schema grounding、必須引数、禁止DB、状態差分をfixtureにする。
Evidence Arbitrationは、文章、数値、外部forecastの衝突時にモデルが系統的な癖で証拠を選ぶことを示す。stock_screeningでは数値と会社説明、trade_disciplineでは日誌と実取引ログの衝突を記録する。
APPLICATION
as-of retrieval、text/numeric conflict、deep-dive routingのfixtureを作り、1W/1M/3M結果へ帰属する。
相談ログにpersist/use_now/verify/ask_user、stop/escalate/proceed、budget_usedを追加する。
代表3 toolのdry-run safety fixtureを作り、Inspector 2.3.0でschemaと状態差分を検証する。
DECISIONS
agent-facing docs整備、memory commitment schema、subtask-level skill registry、qrels/evidence recall、証拠衝突fixture、MCP trajectory fixture。
Pandora型deep dive routing、Task-CoEvolve型評価fixture選択、AdaptiveMem風memory trap warning prompt。
MidTool本体、大規模検索基盤、成功タスク全体の無条件スキル化、現在版だけのRAG評価、最終文章だけの安全評価。
NEXT EXPERIMENTS