Anthropic Engineering
Anthropic 把数月来对 Claude Code 的抱怨追溯到三处独立改动
三处互不相关的改动叠在一起,看上去就成了大面积、时好时坏的性能退化。一是 Claude Code 的默认 reasoning effort 在 3 月 4 日从 high 降到了 medium,直到 4 月 7 日才改回来,现在 Opus 4.7 默认 xhigh,其余一律 high;二是一项本该只清理一次陈旧 thinking 的缓存优化,结果在那之后的整个会话里每一轮都清一遍,Claude 因此变得健忘,还通过 cache miss 悄悄吃掉用量额度;三是 system prompt 里一句把最终回复限制在 100 词以内的话,在某项 eval 上让 Opus 4.6 和 4.7 各掉了约 3%。这些问题在 4 月 20 日的版本里全部修复,API 自始至终没受影响,所有订阅用户的用量额度都在重置。往后每一次 system prompt 改动,都要跑覆盖各个模型的完整 eval 套件、逐行做 ablation,并采用灰度发布。
- #products
- #evals
