本文へ移動
一次情報読解
AI原典ノート
記事
読み方
トピック
ソース
用語集
週刊
RSS
保存
夜間
週刊メール
今日の更新 2026-07-12 - Anthropic: Claude 429 誤診前に読む failure-mode runbook / OpenAPI Initiative: agent tool 接続前に読む interface contract / arXiv: shared inference 導入前に読む KV cache privacy boundary
トピック
評価・Evals
品質劣化、回帰テスト、ベンチマーク、運用監視。
01
まず知りたい
Claude の rate limits は「429 が出た」だけでは原因を誤診する
Anthropic / not stated on the docs page
02
作る前に確認したい
Safety checks は「危ない prompt を弾く」より先に危ない user を追えるようにせよと迫る
OpenAI / not stated on the guide page
03
作る前に確認したい
Gemini logs and datasets は「会話履歴が勝手に残る前提」を放置するなと教える
Google AI for Developers / not stated on the page
04
仕事で安全に使いたい
WASP は browser agent の安全性を「承認あり」ではなく hijack 成功率で測り直す
arXiv / 2025-04-22 (arXiv v1; revised 2025-05-16)
05
更新を追いたい
Claude API の rate limit 統合は「安い model は細い」を前提にした運用表を壊す
Anthropic / 2026-06-26 (release note entry)
06
まず知りたい
Microsoft Foundry tracing は「とりあえず全部記録」をやめて、本番 telemetry の責任に戻す
Microsoft Learn / Azure OpenAI / 2026-06-26
07
仕事で安全に使いたい
Model Cards は「このモデル安全そうです」をやめて用途と失敗条件を書けと求めた源流
arXiv / 2018-10-05
08
作る前に確認したい
AI SDK Telemetry は「全部ログに残す雑さ」をやめろと言っている
Vercel AI SDK / page 上では公開日未記載
09
品質を見たい
LangSmith の evaluation concepts は「評価を本番前だけで終わらせるな」と教える
LangChain / LangGraph / page 上では公開日未記載
10
まず知りたい
TensorRT-LLM architecture は、推論性能の主役を GPU 名から scheduler と KV cache 管理へ戻す
NVIDIA TensorRT-LLM / page 上では公開日未記載(Last updated on September 15, 2025)
11
仕事で安全に使いたい
TraceSafe は、guardrail を最終回答だけで評価する甘さを壊す
arXiv / 2026-04-08
12
まず知りたい
Long context は「長く入る」だけでは足りず、真ん中の根拠を落としやすい
arXiv / 2023-07-06
13
品質を見たい
LlamaIndex Evaluating は「RAG が悪い」を分解して測り直させる
LlamaIndex / page 上では公開日未記載
14
作る前に確認したい
Reasoning best practices は「考えてと書けば賢くなる」を止めに来ている
OpenAI / 公式 docs page 上では公開日未記載
15
まず知りたい
Claude のモデル移行は ID 差し替えだけでは終わらない
Anthropic / 公式ドキュメント上では公開日未記載
16
まず知りたい
ReAct を読むと、なぜ今の agent が途中で考えて動くのかが見える
arXiv / 2022-10-06(arXiv 投稿、2023-03-10 改訂)
17
品質を見たい
Define outcomes は「終わったはず」を rubric と grader で検査可能にする
Anthropic / 公式ドキュメント上では公開日未記載
18
更新を追いたい
Gemini の model 名は「性能ラベル」ではなく運用契約として読む
Google AI for Developers / 公開日未記載(最終更新: 2026-06-15 UTC)
19
品質を見たい
agentic coding benchmark の 2点差は、モデル差ではなく RAM の差かもしれない
Anthropic / 2026-02-05
20
作る前に確認したい
Conversations API は「前の response をつなぐだけ」の限界を超える state の器
OpenAI / 公式ガイド上では公開日未記載
21
仕事で安全に使いたい
Gemini API key の制限強化は、雑な PoC 鍵運用を 403 に変える
Google AI for Developers / 公開日未記載(最終更新: 2026-06-10 UTC)
22
品質を見たい
Prompt Objects 廃止は「prompt を管理画面で育てる運用」をやめる合図
OpenAI / 公式ガイド上では公開日未記載
23
仕事で安全に使いたい
Moderation を別APIの前処理で終わらせる時代が終わりつつある
OpenAI / 公式ガイド上では公開日未記載
24
作る前に確認したい
Gemini Interactions API の `steps` 移行は、SDK 更新より parser 棚卸しが本体
Google AI for Developers / 公式ガイド最終更新: 2026-06-01 UTC
25
作る前に確認したい
Background mode は「長時間 reasoning を同期HTTPで待つな」という運用変更
OpenAI / 公開日未記載
26
仕事で安全に使いたい
Gemini API の managed agents は「sandbox がある」だけでは安心できない
Google AI for Developers / 2026-05-19
27
仕事で安全に使いたい
Claude を安全に走らせる論点は、賢さより先に blast radius をどう切るか
Anthropic / 2026-05-25
28
更新を追いたい
GPT-Realtime-2 は、音声UIを「会話」から実行ワークフローへ寄せる
OpenAI / 2026-05-07
29
品質を見たい
Claude Code の品質低下報告から読む、AI coding tool 運用の現実
Anthropic / 2026-04-23
30
更新を追いたい
Gemini API の release notes は、仕様変更を追うための一次情報になる
Google AI for Developers / 2026-01-05