WikiSkill
何が新しいかagent experienceを永続知識に変換し、スキルを継続更新する。
なぜ重要か前号のsubtask skill方針を、実際の運用メタデータへ進められる。
読む観点scope、evidence_count、negative_case、retire_conditionを持つ小粒度スキルにする。
AI Agent / LLM App Weekly Research
今週は、エージェント経験を小さなスキルへ昇格する設計、時間・予算・並列性を含むツール利用評価、MCPの非同期・認可・発見性のロードマップを、既存アプリの小さなfixtureへ落とします。
EDITOR'S NOTE
前号は、記憶・スキル・RAG・MCPを「境界評価」へ寄せました。今週は、その境界を運用に乗せるため、経験の昇格条件、資源認識ツール利用、read-only telemetryからの再現fixture、MCP tool metadataへ焦点を移します。
WikiSkillは経験を永続知識に変える方向を示します。ただし成功タスク全体の自動スキル化は避け、scopeと退役条件を持たせます。
PeakBenchは正解率に加えて、時間、予算、並列性、依存関係を評価対象にします。MCPや金融分析workflowに直結します。
公式ロードマップはasync operations、OAuth、progressive discovery、registryを示しています。Notion MCPはmetadata整備から始めます。
PRIMARY SOURCES
何が新しいかagent experienceを永続知識に変換し、スキルを継続更新する。
なぜ重要か前号のsubtask skill方針を、実際の運用メタデータへ進められる。
読む観点scope、evidence_count、negative_case、retire_conditionを持つ小粒度スキルにする。
何が新しいかtool-useを時間、予算、並列化、依存関係つきで評価する。
なぜ重要か最終回答が合っていても、無駄な呼び出しや予算超過を失敗扱いにできる。
読む観点critical_path_time、budget_used、parallelizable_callsをログ化する。
何が新しいか計画効率とスマホGUI操作の状態遷移を分けて測る。
なぜ重要かLLMアプリの品質は出力だけでなく、生成前後の操作負荷にも出る。
読む観点代表workflowの期待画面状態、許容操作数、復旧条件を置く。
何が新しいかread-only telemetry logsから決定的で再生可能なagent benchmarkを作る。
なぜ重要か実ログを直接使わず、監査可能なfixtureへ変換できる。
読む観点input_snapshot、expected_decision、failure_modes、replay_commandを持つ。
何が新しいか現実のコードレビューを、静的diff読解より動的に評価する。
なぜ重要かCodexタスクはpatchだけでなく、テスト、判断、再レビュー可能性が品質になる。
読む観点小さい差分、検証ログ、採用しなかった案をPR説明へ残す。
何が新しいかpersonaや長期方針と、実行権限・監査ログを分ける設計。
なぜ重要か個人化agentと実行agentを曖昧に混ぜるリスクを下げる。
読む観点persona_context、execution_scope、audit_logを分ける。
何が新しいか科学文献検索を、比較、拡張、反証などのtyped ideation operationで評価する。
なぜ重要か週次リサーチの資料保存を「何を考えるための資料か」で整理できる。
読む観点採用候補だけoperation_typeを付け、Notion検索しやすくする。
何が新しいか企業情報Q&Aを時間つき知識ベースで評価する。
なぜ重要かstock_screeningのas-of企業分析と未来情報混入チェックに近い。
読む観点根拠公開日、レポート生成日、後日リターンを結ぶ。
何が新しいかasync operations、OAuth、progressive discovery、registry、agent graphが示されている。
なぜ重要かmcp-notion-serverのtool metadata、dry-run、認可準備に直結する。
読む観点read_only、side_effect、requires_confirmation、idempotencyを整える。
何が新しいか反復作業をCodexで自動化し、レビュー可能な成果物として扱う運用例。
なぜ重要か週次リサーチ自動化は、成果物、判断ログ、検証結果を残してこそ改善できる。
読む観点memory、公開HTML、Gmail HTML、配信検証を毎回残す。
DEEP DIVE
WikiSkillは、経験を永続知識へ変換する方向を示す。ただし前号の結論どおり、成功軌跡を丸ごと保存すると現在タスクを歪める。既存アプリでは、scope、evidence_count、negative_case、retire_conditionを持つ短いsubtask skillだけを採用候補にする。
PeakBenchは、時間、予算、並列化、依存関係をtool invocation評価へ入れる。stock_screeningの深掘り分析やmcp-notion-serverの検索/更新workflowでは、critical_path_time、budget_used、parallelizable_calls、dependency_violationを残す価値が高い。
BTS-AgentBenchは、read-only telemetryから再生可能なagent benchmarkを作る発想を示す。trade_disciplineの相談ログやstock_screeningの過去レポートは、個人情報や未来情報を除いたinput_snapshotとexpected_decisionへ変換して評価する。
CorporateBenchは企業情報を時間つき知識ベースで評価し、RATIOは研究検索を目的別操作で見る。週次リサーチとstock_screeningでは、資料の公開日、利用時点、operation_typeを記録する。
MCP Roadmapは、async operations、OAuth、progressive discovery、registryを示している。すぐ全面改修せず、代表toolにread_only、side_effect、requires_confirmation、idempotency_key、dry_run_supportedを付けるのが現実的。
APPLICATION
CorporateBench型に、過去10件の根拠公開日、レポート生成日、LLM判断、後日リターンを結ぶas-of evidence fixtureを作る。
BTS-AgentBench型に相談ログ3件をread-only fixture化し、persona_context、execution_scope、audit_logを分ける。
MCP Roadmapに備え、代表3 toolへmetadataとdry-run safety fixtureを追加する設計から始める。
DECISIONS
小粒度スキル進化メタデータ、resource-aware tool metrics、read-only log to replayable fixture、temporal corporate evidence、MCP tool metadata/dry-run。
UI状態遷移評価、typed ideation operation、コードレビュー可能性チェック、persona/execution/audit分離。
大規模知識基盤化、ベンチマーク本体導入、MCP async先行実装、成功タスク全体の自動スキル化、dry-runなしNotion更新。
NEXT EXPERIMENTS