Anthropic Engineering
Anthropic、1か月続いた Claude Code の品質低下を3つの別々の変更に特定
互いに無関係な3つの変更が積み重なり、モデル全体が劣化したように見えていた。まず Claude Code のデフォルトの reasoning effort が3月4日に high から medium へ静かに下がっていた(現在は Opus 4.7 で xhigh に戻っている)。次に3月26日のキャッシュ最適化は、古い thinking を一度だけ消すはずが毎ターン消してしまっており、物忘れの症状と利用上限の減りが妙に早い問題の両方はこれで説明がつく。さらに4月16日に system prompt へ加わった「回答は100語以内」という一文が、eval のスコアを3%落としていた。3つとも v2.1.116 で修正済みで、利用上限は全サブスクライバーに対してリセットされる。
- #products
- #evals
