AI Agent / LLM App Weekly Research

メモリとセットアップを信頼境界に戻す

今週は、永続メモリ、依存関係セットアップ、探索状態、完了宣言を、モデルの善意ではなく検証できる外部状態として扱う研究と公式更新を整理します。

作成日: 2026-07-18 対象期間: 2026-07-11 - 2026-07-18 重点: Memory / Setup / Evidence Gates / Agentic RAG

EDITOR'S NOTE

今週の読みどころ

前号のテーマは、プロンプトから契約・ゲート・承認へ責務を移すことでした。今週はさらに一段進み、永続メモリ、README、検索履歴、完了状態そのものを、検証対象のartifactとして扱う流れがはっきりしました。

MEMORY

保存は実行前入力になる

メモリは個人化の材料である一方、将来セッションへ注入を持ち越す媒体になります。保存候補、承認、差分、破棄を分ける必要があります。

SETUP

依存導入前に止める

coding agentはREADMEやMakefileを読んで依存関係を入れます。registry、package名、version、lockfile差分は実行前に検査すべきです。

EVIDENCE

完了宣言は状態ではない

`DONE`、`tested`、`sent` はagentの文章ではなく、対象source stateに紐づいたfresh evidenceで判定します。

PRIMARY SOURCES

今週把握すべき研究・記事・事例

01
論文 / 高重要度 / 2026-07-16

Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems

何が新しいか外部コンテンツからメモリを書き換えさせる攻撃と、すでにメモリへ植え込まれたpayloadが将来セッションへ影響する攻撃を分けて評価します。

なぜ重要かCodex自動化、Daily Writing、trade_disciplineは長期状態を使うため、メモリは便利な文脈ではなく信頼境界です。

読む観点保存元、承認、差分、取り消しをどう残すか。既存メモリの棚卸しをどう回帰テスト化するか。

02
論文 / 高重要度 / 2026-07-16

Setup Complete, Now You Are Compromised

何が新しいかREADME、requirements、Makefileを少し変えるだけで、agentをuntrusted registryや脆弱versionへ誘導できることを示します。

なぜ重要か同じモデルでもharnessによって止めたり通したりします。安全性はモデル単体ではなく、実行ハーネス込みで決まります。

読む観点依存関係の名前、source、versionをinstall前に決定的に検査するpre-install gate。

03
論文 / 高重要度 / 2026-07-16

Proof-or-Stop

何が新しいか`reviewed`、`tested`、`DONE` をagentの主張ではなく、freshで機械検証可能な証拠に結びつけます。

なぜ重要か週次レポート自動化の「保存した」「配信した」も、ファイルパス、deploy結果、送信結果の証拠で扱うべきです。

読む観点ライフサイクル状態をclaimとして扱い、gate-admissible evidenceがあるときだけ遷移させる。

04
論文/OSS / 高重要度 / 2026-07-16

SearchOS-V1

何が新しいかFrontier Task、Evidence Graph、Coverage Map、Failure Memoryで検索進捗を外部化し、agentの探索停滞を抑えます。

なぜ重要か週次リサーチ、SEC/決算調査、Notion文献登録は、確認済み・未確認・失敗queryを会話履歴の外へ出すと再現性が上がります。

読む観点SearchOS全体ではなく、Coverage MapとFailure Memoryだけを小さく取り入れる。

05
論文 / 高重要度 / 2026-07-16

Bridge Evidence

何が新しいか静的RAG有用性と、agentic searchで次の検索を開く因果的有用性がほぼ独立であることを示します。

なぜ重要かstock_screeningでは、直接答えを含まない文書でも、競合名や論点を拾って次の調査queryを開くことがあります。

読む観点sourceがfinal answerに使われたかだけでなく、next queryを生んだかを記録する。

06
論文/OSS / 中重要度 / 2026-07-16

StructureClaw

何が新しいか要求解釈、計算モデル、検証記録、solver出力、最終報告をartifact chainとして評価します。

なぜ重要かLLMアプリの評価は最終文章だけでは足りません。途中のartifactが実行可能か、検証済みかを見る必要があります。

読む観点stock_screeningやtrade_disciplineで、最終レポート前のartifact assertionを3から5個に絞る。

07
公式記事 / 高重要度 / 2026-07-15

OpenAI GPT-Red

何が新しいかself-playでred-teaming modelを訓練し、prompt injectionやagent攻撃のscenarioを自動生成して防御改善に使います。

なぜ重要かWeb、メール、Slack、Notion、ローカルファイルを横断するagentには、外部入力由来の攻撃fixtureが必要です。

読む観点自前導入ではなく、悪意あるmemory、README、Notionページ、Slack本文のfixture化から始める。

08
公式ドキュメント / 中重要度 / 2026-07-13 - 2026-07-16

Codex Hooks、Codex changelog、GPT-5.6 guidance

何が新しいかCodex CLIの危険コマンド検出、lifecycle hooks、Programmatic Tool Callingなど、agent loop前後に決定的処理を置く材料が増えています。

なぜ重要か週次自動化やstock_screeningのbounded processingは、tool結果のfiltering、joining、validationをコード側で畳む設計に向きます。

読む観点hookは完全な強制境界ではないため、危険コマンド、外部送信、依存導入、memory updateだけに狙いを絞る。

09
公式/OSS / 中重要度

Vercel AI SDK context、LangSmith、Cloudflare agents

何が新しいかpromptに混ぜるべきでないtenant、credentials、session dataをruntime/tool contextへ分け、trace、retry、tool lifecycleを観測対象にしています。

なぜ重要かmcp-notion-serverのDB IDやtoken、trade_disciplineの戦略設定は、modelが推論する文章ではなく実行contextです。

読む観点prompt、runtime context、tool context、trace metadata、artifact stateを分ける。

DEEP DIVE

資料別ディープダイブ

メモリは保存された命令として扱う

Bad Memoryは、長期メモリがagentの適応性を高める一方で、植え込み済みpayloadが将来セッションの行動へ影響し得ることを示します。Daily Writingの個人化やtrade_disciplineの行動履歴では、外部入力をそのまま記憶せず、保存候補、承認、差分、revert metadataを持つべきです。

セットアップ手順はpre-execution gateの対象

Setup Completeは、通常のREADMEやMakefileが依存関係攻撃の入口になることを示します。Codexで作業する前に、package名、registry、version、install script、lockfile差分を検査し、README由来の新規依存を即実行しない運用が必要です。

完了状態は証拠で作る

Proof-or-Stopは、agentの「テスト済み」「完了」宣言を状態として扱わない設計です。この週次自動化でも、Markdown、Web HTML、Gmail HTML、archive link、deploy、sendそれぞれに証拠パスや実行ログを紐づけると、false doneを減らせます。

探索状態を会話履歴から出す

SearchOSは、Frontier Task、Evidence Graph、Coverage Map、Failure Memoryを使い、検索agentが失敗queryを繰り返す問題を抑えます。週次リサーチでは、調査済みURL、未確認URL、却下理由、未解決queryを小さなYAMLに残すだけでも効果が見込めます。

Bridge EvidenceをRAG評価に足す

Bridge Evidenceは、final answerに直接使われない文書が、次の良いqueryを開くことを定量化します。stock_screeningでは、SEC本文の小さな脚注や競合名が次の調査を開く場合があるため、sourceがanswerに入ったかだけでは評価が狭すぎます。

実行contextをpromptから分離する

Vercel AI SDK context、OpenAI Hooks、Cloudflare agents releaseは、実行に必要な状態、権限、tool lifecycle、retry budgetをagent loopの外側で扱う方向を示します。秘密、tenant、対象DB、feature flagはprompt本文ではなく、typed contextやmanifestで渡すべきです。

APPLICATION

既存ワークフローへの応用可能性

HIGH / stock_screening

LLMレポートをartifact chain化

ticker snapshot、evidence table、computed metrics、risk counterarguments、final reportを保存し、ticker一致、根拠URL、投資助言表現、反証有無を検査します。まず過去10件でfixture化します。

HIGH / mcp-notion-server

tool manifestとdry-run gate

tool risk、read/write/destructive、対象resource、required context、approval、rollback、telemetry redactionをmanifestに持たせ、scope外writeをdry-runで拒否します。

MEDIUM / Daily _Writing

長期記憶は承認queueへ

投稿から保存候補を作るが自動保存しない。ユーザー承認、編集、破棄、revert metadataを持ち、命令めいた外部文は低信頼として扱います。

MEDIUM HIGH / trade_discipline

戦略設定を実行context化

売買前評価で、戦略設定や過去パターンをprompt本文から分けます。長期メモリは保存候補queueを通し、売買推奨ではなく規律支援の境界を検査します。

MEDIUM / prompt-designer-app

bridge clueを評価ログに追加

最終出力に使った根拠と、次のprompt改善を開いた用語・構造を分けて記録します。手修正回数とテンプレート再利用数で効果を見ます。

THIS REPO

週次自動化のproof化

Markdown、Web HTML、Gmail HTML、archive link、deploy、sendを証拠項目に分け、完了宣言ではなくファイル・URL・送信結果で状態を作ります。

DECISIONS

今回の判断

採用候補

メモリ更新の承認queue、依存関係install前check、証拠gate、bridge evidence記録、promptからruntime/tool contextを分離する設計。

検証候補

SearchOSのCoverage MapとFailure Memory、Programmatic Tool Calling的なbounded aggregation、ローカルtrace metadataとretry budget。

保留・却下

GPT-Red相当の導入や大規模workbench化は保留。外部入力からの自動メモリ更新、README無検証実行、agentの完了宣言だけでの公開・送信は却下。

SMALL EXPERIMENTS

今週実行する小さな実験

  1. `mcp-notion-server` 向けのtool manifest草案を作る。項目はrisk、access mode、target resource、required context、approval、rollback、telemetry redactionに絞る。
  2. `stock_screening` のLLMレポートcontract fixtureを10件作る。検査はticker一致、source count、risk counterargument、forbidden advice languageから始める。
  3. このリポジトリの週次自動化に `proof_or_stop_checklist.yaml` を追加し、レポート作成から配信までの証拠項目を定義する。

LOG

採用・保留・却下ログ

資料判断理由次アクション
Bad Memory採用候補永続メモリを持つ既存アプリ全体に直結memory update承認queueのschema
Setup Complete採用候補Codex作業の初期setupに効くdependency pre-install check仕様
Proof-or-Stop採用候補自動化の完了宣言を証拠に結びつけられる週次自動化checklist
SearchOS検証候補探索重複を減らせるが全体導入は重いCoverage MapとFailure Memoryだけ試す
Bridge Evidence採用候補RAG評価の見方を更新できる検索ログにnext query寄与を追加
StructureClaw検証候補artifact chain評価は有用だがdomain差があるstock_screeningで小さくassertion化
GPT-Red保留ツール導入よりfixture化が先悪意あるmemory/README/Notion fixture
Vercel / LangSmith / Cloudflare検証候補context、trace、retry、tool lifecycleの実装ヒントローカルtrace metadata項目を決める