本文へ移動
一次情報読解
AI原典ノート
記事
読み方
トピック
ソース
用語集
週刊
RSS
保存
夜間
週刊メール
今日の更新 2026-07-12 - Anthropic: Claude 429 誤診前に読む failure-mode runbook / OpenAPI Initiative: agent tool 接続前に読む interface contract / arXiv: shared inference 導入前に読む KV cache privacy boundary
読み方
品質を見たい
AI の良し悪し、劣化、評価方法を見たい人向け。
01
品質を見たい
LangSmith の evaluation concepts は「評価を本番前だけで終わらせるな」と教える
LangChain / LangGraph / page 上では公開日未記載
02
品質を見たい
LlamaIndex Evaluating は「RAG が悪い」を分解して測り直させる
LlamaIndex / page 上では公開日未記載
03
品質を見たい
Define outcomes は「終わったはず」を rubric と grader で検査可能にする
Anthropic / 公式ドキュメント上では公開日未記載
04
品質を見たい
agentic coding benchmark の 2点差は、モデル差ではなく RAM の差かもしれない
Anthropic / 2026-02-05
05
品質を見たい
Prompt Objects 廃止は「prompt を管理画面で育てる運用」をやめる合図
OpenAI / 公式ガイド上では公開日未記載
06
品質を見たい
Claude Code の品質低下報告から読む、AI coding tool 運用の現実
Anthropic / 2026-04-23