Anthropic Engineering
Anthropic 把數月來對 Claude Code 的抱怨追溯到三處獨立改動
三處互不相關的改動疊在一起,看上去就成了大面積、時好時壞的效能退化。一是 Claude Code 的預設 reasoning effort 在 3 月 4 日從 high 降到了 medium,直到 4 月 7 日才改回來,現在 Opus 4.7 預設 xhigh,其餘一律 high;二是一項本該只清理一次陳舊 thinking 的快取最佳化,結果在那之後的整個會話裡每一輪都清一遍,Claude 因此變得健忘,還透過 cache miss 悄悄吃掉用量額度;三是 system prompt 裡一句把最終回覆限制在 100 詞以內的話,在某項 eval 上讓 Opus 4.6 和 4.7 各掉了約 3%。這些問題在 4 月 20 日的版本里全部修復,API 自始至終沒受影響,所有訂閱使用者的用量額度都在重置。往後每一次 system prompt 改動,都要跑覆蓋各個模型的完整 eval 套件、逐行做 ablation,並採用灰度釋出。
- #products
- #evals
