LATEST ISSUES
ニュースレター一覧
09.26週次リサーチ
手順を残し、改善を測る
手順の状態管理、修正による改悪、評価の再現性。エージェントの途中の判断を測る7つの資料。
09.19週次リサーチ
失敗を再現し、実行前に検証する
失敗の再生、ツール実行の監査、権限と記憶の境界を、具体的な検証手順へ。
09.12Weekly Brief
評価境界と実行契約を先に置く
Substrate-aware agents、BenchShield、memory poisoning、multimodal injection、A2A、SemVerBenchを整理。
08.29Weekly Brief
スキル進化と資源認識ツール利用
WikiSkill、resource-aware tool metrics、read-only telemetry fixtures、temporal corporate evidence、MCP roadmapを整理。
08.22Weekly Brief
記憶とスキルは境界を評価する
agent-facing docs、memory commitment、subtask skills、RAG qrels、tool trajectory fixtureを整理。
08.15Weekly Brief
履歴と予算を評価対象にする
budget-aware agent eval、as-of RAG、generic-first skills、trajectory safety logsを整理。
08.08Weekly Brief
評価は途中判断を記録する
partial decision record、typed memory、tool argument fixture、title-chain RAGを整理。
08.01Weekly Brief
メモリは保存から版管理へ
MemSecBench、ChronoMem、MCP 2026-07-28、OpenAI Agents SDK、Change2Taskから、長期メモリ、MCP互換性、評価fixtureを整理します。
07.18Weekly Brief
メモリとセットアップを信頼境界に戻す
Bad Memory、Setup Complete、Proof-or-Stop、SearchOS、Bridge Evidenceから、永続メモリ、依存導入、証拠ゲート、Agentic RAG評価を整理します。
07.11Weekly Brief
プロンプトから契約・ゲート・承認へ
ChatGPT Work/Codex統合、Vercel Agent、Cloudflare human-in-the-loop更新、ハーネス契約化、pre-execution gate、金融LLM評価を整理します。
07.04Weekly Brief
エージェント評価は境界・根拠・構成管理へ
曖昧な指示によるcoding agentの境界違反、Agent BOM、Agentic RAG poisoning、スキル利用rubricを整理します。
06.27Weekly Brief
エージェントは経験・時間・権限を持つ実行基盤へ
AI SDK 7、Semantic Early-Stopping、Temporal Validity、Policy-as-Code、ShareLock、NOVAから、反復停止、時間有効なRAG、MCP tool監査、Codex検証ハーネスを整理します。
06.20Weekly Brief
エージェント安全性は完了率の外にある
Data Leakage Risks、GateMem、ToolPrivBench、StaminaBench、Claude Code分析、Codex Record & Replay、Vercel eveから、メモリ統治、低権限ツール、RAG監査、Codex持久力ログを整理します。
06.13Weekly Brief
自己改善ループは評価証拠から
OpenAI Tax AI、EvoArena、UMG-RAG、Instructions-as-Code、LlamaParseから、修正ログ、変化する記憶、文書根拠を既存アプリへ落とします。
06.06Weekly Brief
評価は長文・トレース・安全境界へ
LongJudgeBench、Agentic CLEAR、MCP RC、Cloudflare Agents SDKなどから、LLMアプリ評価とツール安全性の実装候補を整理します。
今後の週次レポートは、このアーカイブに新しい号として追加します。