一次情報読解 AI原典ノート
RSS 保存
今日の更新 2026-07-12 - Anthropic: Claude 429 誤診前に読む failure-mode runbook / OpenAPI Initiative: agent tool 接続前に読む interface contract / arXiv: shared inference 導入前に読む KV cache privacy boundary
トピック

評価・Evals

品質劣化、回帰テスト、ベンチマーク、運用監視。

01 まず知りたい Claude の rate limits は「429 が出た」だけでは原因を誤診する Anthropic / not stated on the docs page 02 作る前に確認したい Safety checks は「危ない prompt を弾く」より先に危ない user を追えるようにせよと迫る OpenAI / not stated on the guide page 03 作る前に確認したい Gemini logs and datasets は「会話履歴が勝手に残る前提」を放置するなと教える Google AI for Developers / not stated on the page 04 仕事で安全に使いたい WASP は browser agent の安全性を「承認あり」ではなく hijack 成功率で測り直す arXiv / 2025-04-22 (arXiv v1; revised 2025-05-16) 05 更新を追いたい Claude API の rate limit 統合は「安い model は細い」を前提にした運用表を壊す Anthropic / 2026-06-26 (release note entry) 06 まず知りたい Microsoft Foundry tracing は「とりあえず全部記録」をやめて、本番 telemetry の責任に戻す Microsoft Learn / Azure OpenAI / 2026-06-26 07 仕事で安全に使いたい Model Cards は「このモデル安全そうです」をやめて用途と失敗条件を書けと求めた源流 arXiv / 2018-10-05 08 作る前に確認したい AI SDK Telemetry は「全部ログに残す雑さ」をやめろと言っている Vercel AI SDK / page 上では公開日未記載 09 品質を見たい LangSmith の evaluation concepts は「評価を本番前だけで終わらせるな」と教える LangChain / LangGraph / page 上では公開日未記載 10 まず知りたい TensorRT-LLM architecture は、推論性能の主役を GPU 名から scheduler と KV cache 管理へ戻す NVIDIA TensorRT-LLM / page 上では公開日未記載(Last updated on September 15, 2025) 11 仕事で安全に使いたい TraceSafe は、guardrail を最終回答だけで評価する甘さを壊す arXiv / 2026-04-08 12 まず知りたい Long context は「長く入る」だけでは足りず、真ん中の根拠を落としやすい arXiv / 2023-07-06 13 品質を見たい LlamaIndex Evaluating は「RAG が悪い」を分解して測り直させる LlamaIndex / page 上では公開日未記載 14 作る前に確認したい Reasoning best practices は「考えてと書けば賢くなる」を止めに来ている OpenAI / 公式 docs page 上では公開日未記載 15 まず知りたい Claude のモデル移行は ID 差し替えだけでは終わらない Anthropic / 公式ドキュメント上では公開日未記載 16 まず知りたい ReAct を読むと、なぜ今の agent が途中で考えて動くのかが見える arXiv / 2022-10-06(arXiv 投稿、2023-03-10 改訂) 17 品質を見たい Define outcomes は「終わったはず」を rubric と grader で検査可能にする Anthropic / 公式ドキュメント上では公開日未記載 18 更新を追いたい Gemini の model 名は「性能ラベル」ではなく運用契約として読む Google AI for Developers / 公開日未記載(最終更新: 2026-06-15 UTC) 19 品質を見たい agentic coding benchmark の 2点差は、モデル差ではなく RAM の差かもしれない Anthropic / 2026-02-05 20 作る前に確認したい Conversations API は「前の response をつなぐだけ」の限界を超える state の器 OpenAI / 公式ガイド上では公開日未記載 21 仕事で安全に使いたい Gemini API key の制限強化は、雑な PoC 鍵運用を 403 に変える Google AI for Developers / 公開日未記載(最終更新: 2026-06-10 UTC) 22 品質を見たい Prompt Objects 廃止は「prompt を管理画面で育てる運用」をやめる合図 OpenAI / 公式ガイド上では公開日未記載 23 仕事で安全に使いたい Moderation を別APIの前処理で終わらせる時代が終わりつつある OpenAI / 公式ガイド上では公開日未記載 24 作る前に確認したい Gemini Interactions API の `steps` 移行は、SDK 更新より parser 棚卸しが本体 Google AI for Developers / 公式ガイド最終更新: 2026-06-01 UTC 25 作る前に確認したい Background mode は「長時間 reasoning を同期HTTPで待つな」という運用変更 OpenAI / 公開日未記載 26 仕事で安全に使いたい Gemini API の managed agents は「sandbox がある」だけでは安心できない Google AI for Developers / 2026-05-19 27 仕事で安全に使いたい Claude を安全に走らせる論点は、賢さより先に blast radius をどう切るか Anthropic / 2026-05-25 28 更新を追いたい GPT-Realtime-2 は、音声UIを「会話」から実行ワークフローへ寄せる OpenAI / 2026-05-07 29 品質を見たい Claude Code の品質低下報告から読む、AI coding tool 運用の現実 Anthropic / 2026-04-23 30 更新を追いたい Gemini API の release notes は、仕様変更を追うための一次情報になる Google AI for Developers / 2026-01-05