AI Agent / LLM App Weekly Research

スキル進化と資源認識ツール利用

今週は、エージェント経験を小さなスキルへ昇格する設計、時間・予算・並列性を含むツール利用評価、MCPの非同期・認可・発見性のロードマップを、既存アプリの小さなfixtureへ落とします。

作成日: 2026-08-29 対象期間: 2026-08-22 - 2026-08-29 重点: Skills / Tool Metrics / Telemetry / MCP

EDITOR'S NOTE

今週の読みどころ

前号は、記憶・スキル・RAG・MCPを「境界評価」へ寄せました。今週は、その境界を運用に乗せるため、経験の昇格条件、資源認識ツール利用、read-only telemetryからの再現fixture、MCP tool metadataへ焦点を移します。

SKILL EVOLUTION

経験は小さな知識へ昇格する

WikiSkillは経験を永続知識に変える方向を示します。ただし成功タスク全体の自動スキル化は避け、scopeと退役条件を持たせます。

TOOL METRICS

ツール利用は資源で測る

PeakBenchは正解率に加えて、時間、予算、並列性、依存関係を評価対象にします。MCPや金融分析workflowに直結します。

MCP OPERATIONS

MCPは認可と発見性へ進む

公式ロードマップはasync operations、OAuth、progressive discovery、registryを示しています。Notion MCPはmetadata整備から始めます。

PRIMARY SOURCES

今週把握すべき研究・記事・事例

01
論文 / 高重要度 / 2026-08-27

WikiSkill

何が新しいかagent experienceを永続知識に変換し、スキルを継続更新する。

なぜ重要か前号のsubtask skill方針を、実際の運用メタデータへ進められる。

読む観点scope、evidence_count、negative_case、retire_conditionを持つ小粒度スキルにする。

02
論文/ベンチマーク / 高重要度 / 2026-08-25

Resource-Aware Tool Invocation

何が新しいかtool-useを時間、予算、並列化、依存関係つきで評価する。

なぜ重要か最終回答が合っていても、無駄な呼び出しや予算超過を失敗扱いにできる。

読む観点critical_path_time、budget_used、parallelizable_callsをログ化する。

03
論文/ベンチマーク / 中重要度 / 2026-08-24

MobilePA-Bench

何が新しいか計画効率とスマホGUI操作の状態遷移を分けて測る。

なぜ重要かLLMアプリの品質は出力だけでなく、生成前後の操作負荷にも出る。

読む観点代表workflowの期待画面状態、許容操作数、復旧条件を置く。

04
論文 / 高重要度 / 2026-08-27

BTS-AgentBench

何が新しいかread-only telemetry logsから決定的で再生可能なagent benchmarkを作る。

なぜ重要か実ログを直接使わず、監査可能なfixtureへ変換できる。

読む観点input_snapshot、expected_decision、failure_modes、replay_commandを持つ。

05
論文 / 中重要度 / 2026-08-27

MCR-Bench

何が新しいか現実のコードレビューを、静的diff読解より動的に評価する。

なぜ重要かCodexタスクはpatchだけでなく、テスト、判断、再レビュー可能性が品質になる。

読む観点小さい差分、検証ログ、採用しなかった案をPR説明へ残す。

06
論文 / 中重要度 / 2026-08-27

Persona-Execution Separation

何が新しいかpersonaや長期方針と、実行権限・監査ログを分ける設計。

なぜ重要か個人化agentと実行agentを曖昧に混ぜるリスクを下げる。

読む観点persona_context、execution_scope、audit_logを分ける。

07
論文/ベンチマーク / 中重要度 / 2026-08-27

RATIO

何が新しいか科学文献検索を、比較、拡張、反証などのtyped ideation operationで評価する。

なぜ重要か週次リサーチの資料保存を「何を考えるための資料か」で整理できる。

読む観点採用候補だけoperation_typeを付け、Notion検索しやすくする。

08
論文/ベンチマーク / 高重要度 / 2026-08-27

CorporateBench

何が新しいか企業情報Q&Aを時間つき知識ベースで評価する。

なぜ重要かstock_screeningのas-of企業分析と未来情報混入チェックに近い。

読む観点根拠公開日、レポート生成日、後日リターンを結ぶ。

09
公式ロードマップ / 高重要度 / 2026-08-22確認

MCP Roadmap

何が新しいかasync operations、OAuth、progressive discovery、registry、agent graphが示されている。

なぜ重要かmcp-notion-serverのtool metadata、dry-run、認可準備に直結する。

読む観点read_only、side_effect、requires_confirmation、idempotencyを整える。

10
公式記事 / 中重要度 / 2026-08-25周辺

Codex automation運用

何が新しいか反復作業をCodexで自動化し、レビュー可能な成果物として扱う運用例。

なぜ重要か週次リサーチ自動化は、成果物、判断ログ、検証結果を残してこそ改善できる。

読む観点memory、公開HTML、Gmail HTML、配信検証を毎回残す。

DEEP DIVE

ディープダイブ

スキルは昇格条件と退役条件を持つ

WikiSkillは、経験を永続知識へ変換する方向を示す。ただし前号の結論どおり、成功軌跡を丸ごと保存すると現在タスクを歪める。既存アプリでは、scope、evidence_count、negative_case、retire_conditionを持つ短いsubtask skillだけを採用候補にする。

ツール利用は正解率だけで採点しない

PeakBenchは、時間、予算、並列化、依存関係をtool invocation評価へ入れる。stock_screeningの深掘り分析やmcp-notion-serverの検索/更新workflowでは、critical_path_time、budget_used、parallelizable_calls、dependency_violationを残す価値が高い。

実ログは直接使わずfixtureへ変換する

BTS-AgentBenchは、read-only telemetryから再生可能なagent benchmarkを作る発想を示す。trade_disciplineの相談ログやstock_screeningの過去レポートは、個人情報や未来情報を除いたinput_snapshotとexpected_decisionへ変換して評価する。

RAGは時間と検索目的を持つ

CorporateBenchは企業情報を時間つき知識ベースで評価し、RATIOは研究検索を目的別操作で見る。週次リサーチとstock_screeningでは、資料の公開日、利用時点、operation_typeを記録する。

MCPはmetadataとdry-runから備える

MCP Roadmapは、async operations、OAuth、progressive discovery、registryを示している。すぐ全面改修せず、代表toolにread_only、side_effect、requires_confirmation、idempotency_key、dry_run_supportedを付けるのが現実的。

APPLICATION

既存ワークフローへの応用

HIGH

stock_screening

CorporateBench型に、過去10件の根拠公開日、レポート生成日、LLM判断、後日リターンを結ぶas-of evidence fixtureを作る。

HIGH

trade_discipline

BTS-AgentBench型に相談ログ3件をread-only fixture化し、persona_context、execution_scope、audit_logを分ける。

HIGH

mcp-notion-server

MCP Roadmapに備え、代表3 toolへmetadataとdry-run safety fixtureを追加する設計から始める。

DECISIONS

今回の判断

採用候補

小粒度スキル進化メタデータ、resource-aware tool metrics、read-only log to replayable fixture、temporal corporate evidence、MCP tool metadata/dry-run。

検証候補

UI状態遷移評価、typed ideation operation、コードレビュー可能性チェック、persona/execution/audit分離。

保留・却下

大規模知識基盤化、ベンチマーク本体導入、MCP async先行実装、成功タスク全体の自動スキル化、dry-runなしNotion更新。

NEXT EXPERIMENTS

今週の小さな実験

  1. stock_screeningにas-of evidence fixtureの雛形を作る。
  2. trade_disciplineの相談ログschema案にpersona、memory commitment、execution scope、audit logを追加する。
  3. mcp-notion-serverで代表3 toolのdry-run safety fixtureとInspector検証手順を作る。