AI Agent / LLM App Weekly Research

評価は途中判断を記録する

今週は、エージェント評価のpartial decision record、長期記憶の型分けと提示制御、ツール引数検証、構造を保つRAGを整理します。

作成日: 2026-08-08 対象期間: 2026-08-01 - 2026-08-08 重点: Evaluation / Memory / Tool Calls / RAG

EDITOR'S NOTE

今週の読みどころ

前号はメモリの版管理とMCP互換性を扱いました。今週は、改善案をすぐ採用するのではなく、途中結果が判断に足るか、どの記憶が行動に効いたか、ツール引数が正しいかを記録する方向が濃くなっています。

EVALUATION

途中スコアより判断記録

ParEvalLayerは、promote、reject、continue、abstainをcoverageや棄権率と一緒に保存する。

MEMORY

記憶は型と提示で効く

LeanMemとMemArbiterは、記憶をprofile/event/recordや機能別bankへ分け、行動直前の予算配分を重視する。

TOOL/RAG

引数と構造を検証する

ParamBenchはtool引数、Title-Chain Prefixesは見出し文脈、DyRetrieverは依存関係の収集を評価対象にする。

PRIMARY SOURCES

今週把握すべき研究・記事・事例

01
論文 / 高重要度 / 2026-08-03

ParEvalLayer

何が新しいか部分評価をpromote/reject/continue/abstainの判断記録に変換する。

なぜ重要か少数fixtureでの早すぎる採用を防げる。

読む観点比較閾値、coverage、未決率、棄権理由を保存する。

02
論文 / 高重要度 / 2026-08-04

LeanMem

何が新しいか記憶をprofile、event、recordに分け、queryごとにretrieval budgetを配分する。

なぜ重要か個人化アプリで誤記憶とtoken増を同時に抑えられる。

読む観点安定情報、最近の出来事、原文記録を分ける。

03
論文 / 高重要度 / 2026-08-03

MemArbiter

何が新しいか検索済み記憶が行動に効かないMemory-Action Gapを扱う。

なぜ重要かtrade_disciplineの助言で関係ない過去例の混入を減らせる。

読む観点focal evidenceとbackground contextを分ける。

04
論文 / 高重要度 / 2026-08-04

ParamBench

何が新しいかtool useの難所をツール選択ではなく引数生成として測る。

なぜ重要かmcp-notion-serverの誤操作防止に直結する。

読む観点ネスト、相互依存、前回結果からの値導出をfixture化する。

05
論文 / 中重要度 / 2026-08-01

Title-Chain Prefixes

何が新しいかMarkdownの見出し階層をchunk prefixとして残し、追加LLM callなしでMRRを改善する。

なぜ重要かNotion/Markdown RAGの文脈欠落を低コストで減らせる。

読む観点評価時にも候補の見出し文脈を剥がさない。

06
論文 / 中重要度 / 2026-08-03

DyRetriever

何が新しいかrepo全体の静的グラフではなく、必要箇所だけpartial dependency graphを辿る。

なぜ重要かCodex作業で関連ファイルを過不足なく集めるヒントになる。

読む観点entry point、依存先、呼び出し元、テストを段階収集する。

07
公式ドキュメント / 高重要度

MCP Authorization

何が新しいかuser-specific dataを扱うMCP serverのOAuth 2.1、PRM、audit要件を整理する。

なぜ重要かmcp-notion-serverをremote化する前の判断材料になる。

読む観点STDIO localとremote HTTPで認可設計を分ける。

08
公式記事 / 中重要度 / 2026-08

Anthropic eval incidents

何が新しいか評価環境の隔離前提ミスが実システムへのアクセスにつながった事例を公開した。

なぜ重要かagent評価ではpromptより環境境界の機械検証が重要。

読む観点dry-run、allowlist、write禁止、送信先固定を確認する。

DEEP DIVE

ディープダイブ

評価は採用・却下・継続・棄権を分ける

ParEvalLayerは、途中スコアを報告する代わりに、判断に必要な改善幅、task group coverage、decision-error target、abstention targetを記録する。stock_screeningのレポートfixtureでも、coverage不足なら採用判断にしない形が合う。

長期記憶は検索後の提示で差が出る

LeanMemはprofile/event/recordを分け、MemArbiterはfocal/ambient表現とtemporal gateで記憶のsalienceを制御する。Daily _Writingやtrade_disciplineでは、履歴全量投入ではなく、現在の判断に効く証拠だけを強く提示する。

ツール/RAGは構造を失うと壊れる

ParamBenchは引数のネストや依存関係を、Title-Chain Prefixesは見出し階層を評価対象に戻す。mcp-notion-serverではargument fixtureとsection path付き検索結果が、小さく効く改善になる。

APPLICATION

既存ワークフローへの応用

HIGH

stock_screening

過去レポート10件から、ticker、根拠URL、反証、投資助言表現禁止、coverageを含むpartial decision record fixtureを作る。

HIGH

Daily _Writing

memory candidateをprofile/event/recordに分け、フィードバックで使った記憶型と誤記憶混入をログ化する。

HIGH

mcp-notion-server

代表tool 3件のargument validation fixtureと、STDIO/remote HTTP別のauthorization checklistを作る。

DECISIONS

今回の判断

採用候補

partial decision record、typed memory schema、focal/background memory presentation、tool argument fixture、title-chain chunk prefix。

検証候補

skill reuse metadata、provider metadata logging、context window exceeded分類、MCP authorization checklist。

保留・却下

probe-guided training、full DyRetriever実装、OAuth実装、履歴全量prompt投入、tool name accuracyだけの評価。