一次情報読解 AI原典ノート
RSS 保存
今日の更新 2026-07-12 - Anthropic: Claude 429 誤診前に読む failure-mode runbook / OpenAPI Initiative: agent tool 接続前に読む interface contract / arXiv: shared inference 導入前に読む KV cache privacy boundary
読み方

品質を見たい

AI の良し悪し、劣化、評価方法を見たい人向け。

01 品質を見たい LangSmith の evaluation concepts は「評価を本番前だけで終わらせるな」と教える LangChain / LangGraph / page 上では公開日未記載 02 品質を見たい LlamaIndex Evaluating は「RAG が悪い」を分解して測り直させる LlamaIndex / page 上では公開日未記載 03 品質を見たい Define outcomes は「終わったはず」を rubric と grader で検査可能にする Anthropic / 公式ドキュメント上では公開日未記載 04 品質を見たい agentic coding benchmark の 2点差は、モデル差ではなく RAM の差かもしれない Anthropic / 2026-02-05 05 品質を見たい Prompt Objects 廃止は「prompt を管理画面で育てる運用」をやめる合図 OpenAI / 公式ガイド上では公開日未記載 06 品質を見たい Claude Code の品質低下報告から読む、AI coding tool 運用の現実 Anthropic / 2026-04-23