EcoAgent-Bench
何が新しいか価格付き行動と予算を入れ、安く済ませる、上げる、止めるを評価する。
なぜ重要かstock/tradeで強いモデルを使う条件をログ化できる。
読む観点cost_decision、escalation_reason、stop_reasonを評価項目にする。
AI Agent / LLM App Weekly Research
今週は、エージェント評価を最終回答から、予算、停止判断、時点付きRAG、行動ログ、スキル汚染耐性へ広げます。
EDITOR'S NOTE
前号はpartial decision recordとtyped memoryを採用候補にしました。今週は、エージェントが履歴、スキル、外部ツール、予算を持つほど、評価は「答えが良いか」ではなく「いつ止め、何に権限を使い、どの根拠時点で判断したか」に移る、という流れです。
EcoAgent-BenchとBusiness Arenaは、予算、エスカレーション、遅延成果、行動別損益を評価対象にする。
Temporal Misgroundingは、現在版だけのRAGが実在するが適用不能な根拠を引用する問題を示す。
個人別スキルは不安定で、自己進化スキルは軌跡汚染の攻撃面になる。generic-firstと昇格審査が現実的。
PRIMARY SOURCES
何が新しいか価格付き行動と予算を入れ、安く済ませる、上げる、止めるを評価する。
なぜ重要かstock/tradeで強いモデルを使う条件をログ化できる。
読む観点cost_decision、escalation_reason、stop_reasonを評価項目にする。
何が新しいか長期事業運営を最終利益、スキル別指標、行動別損益帰属で評価する。
なぜ重要か遅れて効く判断を、後日メトリクスへ結び直す設計に使える。
読む観点文章品質ではなく、判断が1W/1M/3M結果へどう効いたかを見る。
何が新しいか対象日に適用される版ではなく現在版を引用するRAG失敗を定義する。
なぜ重要かSEC、決算、価格、ルールの後知恵混入を減らせる。
読む観点valid_from、valid_to、as_of_date、published_atをchunk metadataに入れる。
何が新しいか最終応答ではなく実行軌跡から、漏えい、無許可API、状態改変を評価する。
なぜ重要かmcp-notion-serverの書き込み安全性をfixture化できる。
読む観点tool call、送信先、状態差分、権限境界をログで見る。
何が新しいか個人別スキルは小さく不安定、汎用スキルは一貫して効くという結果。
なぜ重要かCodexスキルやprompt templateを増やす基準になる。
読む観点generic、project、personalを分け、personalは昇格制にする。
何が新しいかqueryだけで自己進化スキルに条件付きバックドアを学ばせる攻撃を示す。
なぜ重要か成功軌跡を自動でスキル化する運用に審査が必要になる。
読む観点source_traces、trigger_conditions、negative_testsを必須にする。
何が新しいかルール決着する多エージェントゲームで、反省playbookの再利用を評価する。
なぜ重要かtrade_disciplineの反省ルールが次回行動に効いたかを測れる。
読む観点反省の文章量ではなく、再利用と結果改善を見る。
何が新しいかドメイン特化RAGが新しい汎用LLMと同等以上になる一方、表現品質は落ちる。
なぜ重要かstock reportで正確性、完全性、読みやすさを分けて評価できる。
読む観点grounding、completeness、communicationを別rubricにする。
何が新しいかComputer Historyと、Claude Code/Cursorなどからの設定・スキル・履歴import。
なぜ重要か履歴RAGには出典、削除、権限、同期のmetadataが必要になる。
読む観点履歴を便利機能ではなく監査対象の記憶基盤として扱う。
何が新しいかClaude local transcript、session budget、LangChain trace修正、MCP Inspector 2.2.0。
なぜ重要かagent運用ログ、費用停止、tool result互換、MCP検証に効く。
読む観点デバッグログではなく、採用判断・監査・再現のデータとして残す。
DEEP DIVE
EcoAgent-Benchは、上位モデルや人へ上げる判断と、 unsupported premiseで止める判断をタスクに含める。Business Arenaは、長期の連動結果を最終利益だけでなく行動別に帰属する。stock_screeningとtrade_disciplineでは、LLM出力の見栄えではなく、後日メトリクスと費用の両方を見る。
Temporal Misgroundingは、現在版だけのRAGが対象日に適用されない根拠を高信頼に引用する問題を実証した。SEC提出、決算、価格、売買ルールは時点依存なので、as_of_date、published_at、valid_from、valid_toを検索と評価に入れる。
Personalized Skillsは、個人別スキルが小さく不安定で、汎用スキルが安定する場合を示す。Trajectory Backdoor Attackは、自己進化スキルが軌跡から汚染ルールを学ぶ危険を示す。成功軌跡をスキル化する前に、出典軌跡、トリガー条件、negative testを確認する。
ActBenchは、データ漏えい、無許可API、状態改変を実行ログから評価する。ClaudeのCompliance transcript、CodexのComputer History/import、LangChainのtrace互換修正、MCP InspectorのCLI/TUI整備も、agent運用のログと監査を中心にした実装へ寄っている。
APPLICATION
as-of RAG metadataとeconomic escalation logを追加し、判断を1W/1M/3M結果へ帰属する。
stop/escalate/proceed、budget_used、playbook_usedを相談ログへ追加し、後続行動で検証する。
代表3 toolのdry-run safety fixtureを作り、Inspector CLIでschema、禁止DB、状態差分を検証する。
DECISIONS
as-of/versioned RAG metadata、economic escalation log、trajectory safety fixture、generic-first skill registry。
delayed outcome attribution、playbook reuse log、session budget/stop reason、Inspector CLI smoke。
visual cache最適化、本格多エージェントゲーム評価、個人別スキルの無条件採用、現在版だけのRAG評価。
NEXT EXPERIMENTS