AI Agent / LLM App Weekly Research

履歴と予算を評価対象にする

今週は、エージェント評価を最終回答から、予算、停止判断、時点付きRAG、行動ログ、スキル汚染耐性へ広げます。

作成日: 2026-08-15 対象期間: 2026-08-08 - 2026-08-15 重点: Budget / As-of RAG / Skills / Safety Logs

EDITOR'S NOTE

今週の読みどころ

前号はpartial decision recordとtyped memoryを採用候補にしました。今週は、エージェントが履歴、スキル、外部ツール、予算を持つほど、評価は「答えが良いか」ではなく「いつ止め、何に権限を使い、どの根拠時点で判断したか」に移る、という流れです。

BUDGET

完了率だけでは採用しない

EcoAgent-BenchとBusiness Arenaは、予算、エスカレーション、遅延成果、行動別損益を評価対象にする。

RAG

根拠には対象日が必要

Temporal Misgroundingは、現在版だけのRAGが実在するが適用不能な根拠を引用する問題を示す。

SKILLS

個人化と自己進化は審査する

個人別スキルは不安定で、自己進化スキルは軌跡汚染の攻撃面になる。generic-firstと昇格審査が現実的。

PRIMARY SOURCES

今週把握すべき研究・記事・事例

01
論文 / 高重要度 / 2026-08-06

EcoAgent-Bench

何が新しいか価格付き行動と予算を入れ、安く済ませる、上げる、止めるを評価する。

なぜ重要かstock/tradeで強いモデルを使う条件をログ化できる。

読む観点cost_decision、escalation_reason、stop_reasonを評価項目にする。

02
論文 / 高重要度 / 2026-08-09

Business Arena

何が新しいか長期事業運営を最終利益、スキル別指標、行動別損益帰属で評価する。

なぜ重要か遅れて効く判断を、後日メトリクスへ結び直す設計に使える。

読む観点文章品質ではなく、判断が1W/1M/3M結果へどう効いたかを見る。

03
論文 / 高重要度 / 2026-08-10

Temporal Misgrounding

何が新しいか対象日に適用される版ではなく現在版を引用するRAG失敗を定義する。

なぜ重要かSEC、決算、価格、ルールの後知恵混入を減らせる。

読む観点valid_from、valid_to、as_of_date、published_atをchunk metadataに入れる。

04
論文 / 高重要度 / 2026-08-10

ActBench

何が新しいか最終応答ではなく実行軌跡から、漏えい、無許可API、状態改変を評価する。

なぜ重要かmcp-notion-serverの書き込み安全性をfixture化できる。

読む観点tool call、送信先、状態差分、権限境界をログで見る。

05
論文 / 高重要度 / 2026-08-10

Personalized Skills

何が新しいか個人別スキルは小さく不安定、汎用スキルは一貫して効くという結果。

なぜ重要かCodexスキルやprompt templateを増やす基準になる。

読む観点generic、project、personalを分け、personalは昇格制にする。

06
論文 / 高重要度 / 2026-08-08

Trajectory Backdoor Attack

何が新しいかqueryだけで自己進化スキルに条件付きバックドアを学ばせる攻撃を示す。

なぜ重要か成功軌跡を自動でスキル化する運用に審査が必要になる。

読む観点source_traces、trigger_conditions、negative_testsを必須にする。

07
論文 / 中重要度 / 2026-08-10

Social Gym and SPaRTan

何が新しいかルール決着する多エージェントゲームで、反省playbookの再利用を評価する。

なぜ重要かtrade_disciplineの反省ルールが次回行動に効いたかを測れる。

読む観点反省の文章量ではなく、再利用と結果改善を見る。

08
論文 / 中重要度 / 2026-08-12

Corpus-specific RAG

何が新しいかドメイン特化RAGが新しい汎用LLMと同等以上になる一方、表現品質は落ちる。

なぜ重要かstock reportで正確性、完全性、読みやすさを分けて評価できる。

読む観点grounding、completeness、communicationを別rubricにする。

09
公式 / 中重要度 / 2026-08-10 - 14

Codex history and imports

何が新しいかComputer Historyと、Claude Code/Cursorなどからの設定・スキル・履歴import。

なぜ重要か履歴RAGには出典、削除、権限、同期のmetadataが必要になる。

読む観点履歴を便利機能ではなく監査対象の記憶基盤として扱う。

10
公式/OSS / 中重要度 / 2026-08-11 - 14

Audit and compatibility updates

何が新しいかClaude local transcript、session budget、LangChain trace修正、MCP Inspector 2.2.0。

なぜ重要かagent運用ログ、費用停止、tool result互換、MCP検証に効く。

読む観点デバッグログではなく、採用判断・監査・再現のデータとして残す。

DEEP DIVE

ディープダイブ

予算と停止判断は評価指標になる

EcoAgent-Benchは、上位モデルや人へ上げる判断と、 unsupported premiseで止める判断をタスクに含める。Business Arenaは、長期の連動結果を最終利益だけでなく行動別に帰属する。stock_screeningとtrade_disciplineでは、LLM出力の見栄えではなく、後日メトリクスと費用の両方を見る。

RAGには対象日と版が必要

Temporal Misgroundingは、現在版だけのRAGが対象日に適用されない根拠を高信頼に引用する問題を実証した。SEC提出、決算、価格、売買ルールは時点依存なので、as_of_date、published_at、valid_from、valid_toを検索と評価に入れる。

スキルはgeneric-firstで審査する

Personalized Skillsは、個人別スキルが小さく不安定で、汎用スキルが安定する場合を示す。Trajectory Backdoor Attackは、自己進化スキルが軌跡から汚染ルールを学ぶ危険を示す。成功軌跡をスキル化する前に、出典軌跡、トリガー条件、negative testを確認する。

安全性はtrajectoryで見る

ActBenchは、データ漏えい、無許可API、状態改変を実行ログから評価する。ClaudeのCompliance transcript、CodexのComputer History/import、LangChainのtrace互換修正、MCP InspectorのCLI/TUI整備も、agent運用のログと監査を中心にした実装へ寄っている。

APPLICATION

既存ワークフローへの応用

HIGH

stock_screening

as-of RAG metadataとeconomic escalation logを追加し、判断を1W/1M/3M結果へ帰属する。

HIGH

trade_discipline

stop/escalate/proceed、budget_used、playbook_usedを相談ログへ追加し、後続行動で検証する。

HIGH

mcp-notion-server

代表3 toolのdry-run safety fixtureを作り、Inspector CLIでschema、禁止DB、状態差分を検証する。

DECISIONS

今回の判断

採用候補

as-of/versioned RAG metadata、economic escalation log、trajectory safety fixture、generic-first skill registry。

検証候補

delayed outcome attribution、playbook reuse log、session budget/stop reason、Inspector CLI smoke。

保留・却下

visual cache最適化、本格多エージェントゲーム評価、個人別スキルの無条件採用、現在版だけのRAG評価。

NEXT EXPERIMENTS

今週の小さな実験

  1. stock_screeningで過去レポート10件のas-of RAG/economic escalation fixtureを作る。
  2. trade_disciplineで相談ログschemaにstop/escalate/proceed、budget、playbook fieldsを追加する案を作る。
  3. mcp-notion-serverで代表3 toolのdry-run safety fixtureを作り、Inspector CLI検証手順を固める。