ParEvalLayer
何が新しいか部分評価をpromote/reject/continue/abstainの判断記録に変換する。
なぜ重要か少数fixtureでの早すぎる採用を防げる。
読む観点比較閾値、coverage、未決率、棄権理由を保存する。
AI Agent / LLM App Weekly Research
今週は、エージェント評価のpartial decision record、長期記憶の型分けと提示制御、ツール引数検証、構造を保つRAGを整理します。
EDITOR'S NOTE
前号はメモリの版管理とMCP互換性を扱いました。今週は、改善案をすぐ採用するのではなく、途中結果が判断に足るか、どの記憶が行動に効いたか、ツール引数が正しいかを記録する方向が濃くなっています。
ParEvalLayerは、promote、reject、continue、abstainをcoverageや棄権率と一緒に保存する。
LeanMemとMemArbiterは、記憶をprofile/event/recordや機能別bankへ分け、行動直前の予算配分を重視する。
ParamBenchはtool引数、Title-Chain Prefixesは見出し文脈、DyRetrieverは依存関係の収集を評価対象にする。
PRIMARY SOURCES
何が新しいか部分評価をpromote/reject/continue/abstainの判断記録に変換する。
なぜ重要か少数fixtureでの早すぎる採用を防げる。
読む観点比較閾値、coverage、未決率、棄権理由を保存する。
何が新しいか記憶をprofile、event、recordに分け、queryごとにretrieval budgetを配分する。
なぜ重要か個人化アプリで誤記憶とtoken増を同時に抑えられる。
読む観点安定情報、最近の出来事、原文記録を分ける。
何が新しいか検索済み記憶が行動に効かないMemory-Action Gapを扱う。
なぜ重要かtrade_disciplineの助言で関係ない過去例の混入を減らせる。
読む観点focal evidenceとbackground contextを分ける。
何が新しいかtool useの難所をツール選択ではなく引数生成として測る。
なぜ重要かmcp-notion-serverの誤操作防止に直結する。
読む観点ネスト、相互依存、前回結果からの値導出をfixture化する。
何が新しいかMarkdownの見出し階層をchunk prefixとして残し、追加LLM callなしでMRRを改善する。
なぜ重要かNotion/Markdown RAGの文脈欠落を低コストで減らせる。
読む観点評価時にも候補の見出し文脈を剥がさない。
何が新しいかrepo全体の静的グラフではなく、必要箇所だけpartial dependency graphを辿る。
なぜ重要かCodex作業で関連ファイルを過不足なく集めるヒントになる。
読む観点entry point、依存先、呼び出し元、テストを段階収集する。
何が新しいかuser-specific dataを扱うMCP serverのOAuth 2.1、PRM、audit要件を整理する。
なぜ重要かmcp-notion-serverをremote化する前の判断材料になる。
読む観点STDIO localとremote HTTPで認可設計を分ける。
何が新しいか評価環境の隔離前提ミスが実システムへのアクセスにつながった事例を公開した。
なぜ重要かagent評価ではpromptより環境境界の機械検証が重要。
読む観点dry-run、allowlist、write禁止、送信先固定を確認する。
DEEP DIVE
ParEvalLayerは、途中スコアを報告する代わりに、判断に必要な改善幅、task group coverage、decision-error target、abstention targetを記録する。stock_screeningのレポートfixtureでも、coverage不足なら採用判断にしない形が合う。
LeanMemはprofile/event/recordを分け、MemArbiterはfocal/ambient表現とtemporal gateで記憶のsalienceを制御する。Daily _Writingやtrade_disciplineでは、履歴全量投入ではなく、現在の判断に効く証拠だけを強く提示する。
ParamBenchは引数のネストや依存関係を、Title-Chain Prefixesは見出し階層を評価対象に戻す。mcp-notion-serverではargument fixtureとsection path付き検索結果が、小さく効く改善になる。
APPLICATION
過去レポート10件から、ticker、根拠URL、反証、投資助言表現禁止、coverageを含むpartial decision record fixtureを作る。
memory candidateをprofile/event/recordに分け、フィードバックで使った記憶型と誤記憶混入をログ化する。
代表tool 3件のargument validation fixtureと、STDIO/remote HTTP別のauthorization checklistを作る。
DECISIONS
partial decision record、typed memory schema、focal/background memory presentation、tool argument fixture、title-chain chunk prefix。
skill reuse metadata、provider metadata logging、context window exceeded分類、MCP authorization checklist。
probe-guided training、full DyRetriever実装、OAuth実装、履歴全量prompt投入、tool name accuracyだけの評価。