AI Agent / LLM App Research Archive

AIエージェント・LLMアプリ開発リサーチ

週次で調査した研究、公式記事、OSS動向を読み物として保存するアーカイブです。メールやSlackではリンクを共有し、本文はこのページで読めるようにします。

LATEST ISSUES

ニュースレター一覧

2026
08.01Weekly Brief

メモリは保存から版管理へ

MemSecBench、ChronoMem、MCP 2026-07-28、OpenAI Agents SDK、Change2Taskから、長期メモリ、MCP互換性、評価fixtureを整理します。

Memory Versioning MCP Tool Runtime Agent Eval
2026
07.18Weekly Brief

メモリとセットアップを信頼境界に戻す

Bad Memory、Setup Complete、Proof-or-Stop、SearchOS、Bridge Evidenceから、永続メモリ、依存導入、証拠ゲート、Agentic RAG評価を整理します。

Memory Safety Setup Security Evidence Gates Agentic RAG
2026
07.11Weekly Brief

プロンプトから契約・ゲート・承認へ

ChatGPT Work/Codex統合、Vercel Agent、Cloudflare human-in-the-loop更新、ハーネス契約化、pre-execution gate、金融LLM評価を整理します。

Harness Engineering Tool Gates Codex Financial Eval
2026
07.04Weekly Brief

エージェント評価は境界・根拠・構成管理へ

曖昧な指示によるcoding agentの境界違反、Agent BOM、Agentic RAG poisoning、スキル利用rubricを整理します。

Agent Evaluation RAG Security MCP Skill Rubric
2026
06.27Weekly Brief

エージェントは経験・時間・権限を持つ実行基盤へ

AI SDK 7、Semantic Early-Stopping、Temporal Validity、Policy-as-Code、ShareLock、NOVAから、反復停止、時間有効なRAG、MCP tool監査、Codex検証ハーネスを整理します。

Agent Runtime Early Stopping Temporal RAG MCP Safety
2026
06.20Weekly Brief

エージェント安全性は完了率の外にある

Data Leakage Risks、GateMem、ToolPrivBench、StaminaBench、Claude Code分析、Codex Record & Replay、Vercel eveから、メモリ統治、低権限ツール、RAG監査、Codex持久力ログを整理します。

Agent Safety Memory Governance Tool Privilege RAG Security
2026
06.13Weekly Brief

自己改善ループは評価証拠から

OpenAI Tax AI、EvoArena、UMG-RAG、Instructions-as-Code、LlamaParseから、修正ログ、変化する記憶、文書根拠を既存アプリへ落とします。

Trace-to-Eval Memory RAG Codex
2026
06.06Weekly Brief

評価は長文・トレース・安全境界へ

LongJudgeBench、Agentic CLEAR、MCP RC、Cloudflare Agents SDKなどから、LLMアプリ評価とツール安全性の実装候補を整理します。

LLM-as-Judge MCP RAG Agent Safety

今後の週次レポートは、このアーカイブに新しい号として追加します。