AI Agent / LLM App Research Archive

AIエージェント・LLMアプリ開発リサーチ

週次で調査した研究、公式記事、OSS動向を読み物として保存するアーカイブです。メールやSlackではリンクを共有し、本文はこのページで読めるようにします。

LATEST ISSUES

ニュースレター一覧

2026
09.26週次リサーチ

手順を残し、改善を測る

手順の状態管理、修正による改悪、評価の再現性。エージェントの途中の判断を測る7つの資料。

復旧版エージェント評価
2026
09.19週次リサーチ

失敗を再現し、実行前に検証する

失敗の再生、ツール実行の監査、権限と記憶の境界を、具体的な検証手順へ。

復旧版エージェント評価
2026
08.29Weekly Brief

スキル進化と資源認識ツール利用

WikiSkill、resource-aware tool metrics、read-only telemetry fixtures、temporal corporate evidence、MCP roadmapを整理。

Skill Evolution Tool Metrics Telemetry MCP Roadmap
2026
08.22Weekly Brief

記憶とスキルは境界を評価する

agent-facing docs、memory commitment、subtask skills、RAG qrels、tool trajectory fixtureを整理。

Memory Skills RAG Eval MCP Tools
2026
08.15Weekly Brief

履歴と予算を評価対象にする

budget-aware agent eval、as-of RAG、generic-first skills、trajectory safety logsを整理。

Budget As-of RAG Skills Safety Logs
2026
08.08Weekly Brief

評価は途中判断を記録する

partial decision record、typed memory、tool argument fixture、title-chain RAGを整理。

Evaluation Memory Tool Calls RAG
2026
08.01Weekly Brief

メモリは保存から版管理へ

MemSecBench、ChronoMem、MCP 2026-07-28、OpenAI Agents SDK、Change2Taskから、長期メモリ、MCP互換性、評価fixtureを整理します。

Memory Versioning MCP Tool Runtime Agent Eval
2026
07.18Weekly Brief

メモリとセットアップを信頼境界に戻す

Bad Memory、Setup Complete、Proof-or-Stop、SearchOS、Bridge Evidenceから、永続メモリ、依存導入、証拠ゲート、Agentic RAG評価を整理します。

Memory Safety Setup Security Evidence Gates Agentic RAG
2026
07.11Weekly Brief

プロンプトから契約・ゲート・承認へ

ChatGPT Work/Codex統合、Vercel Agent、Cloudflare human-in-the-loop更新、ハーネス契約化、pre-execution gate、金融LLM評価を整理します。

Harness Engineering Tool Gates Codex Financial Eval
2026
07.04Weekly Brief

エージェント評価は境界・根拠・構成管理へ

曖昧な指示によるcoding agentの境界違反、Agent BOM、Agentic RAG poisoning、スキル利用rubricを整理します。

Agent Evaluation RAG Security MCP Skill Rubric
2026
06.27Weekly Brief

エージェントは経験・時間・権限を持つ実行基盤へ

AI SDK 7、Semantic Early-Stopping、Temporal Validity、Policy-as-Code、ShareLock、NOVAから、反復停止、時間有効なRAG、MCP tool監査、Codex検証ハーネスを整理します。

Agent Runtime Early Stopping Temporal RAG MCP Safety
2026
06.20Weekly Brief

エージェント安全性は完了率の外にある

Data Leakage Risks、GateMem、ToolPrivBench、StaminaBench、Claude Code分析、Codex Record & Replay、Vercel eveから、メモリ統治、低権限ツール、RAG監査、Codex持久力ログを整理します。

Agent Safety Memory Governance Tool Privilege RAG Security
2026
06.13Weekly Brief

自己改善ループは評価証拠から

OpenAI Tax AI、EvoArena、UMG-RAG、Instructions-as-Code、LlamaParseから、修正ログ、変化する記憶、文書根拠を既存アプリへ落とします。

Trace-to-Eval Memory RAG Codex
2026
06.06Weekly Brief

評価は長文・トレース・安全境界へ

LongJudgeBench、Agentic CLEAR、MCP RC、Cloudflare Agents SDKなどから、LLMアプリ評価とツール安全性の実装候補を整理します。

LLM-as-Judge MCP RAG Agent Safety

今後の週次レポートは、このアーカイブに新しい号として追加します。