Anthropic Engineering
Anthropic 把一個月的 Claude Code 抱怨追溯到三處獨立改動
三處互不相關的改動疊在一起,看上去就像一次全面的質量下滑。3 月 4 日,預設 reasoning effort 從 high 降到了 medium;3 月 26 日的一次快取最佳化本意是清掉舊的 thinking 內容,結果變成整個會話裡每一輪都清一次,Claude 因此變得健忘,還在快取未命中上白白燒掉用量額度;4 月 16 日加進 system prompt 的一行把回覆限制在 100 詞以內,讓 Opus 4.6 和 4.7 的 eval 成績掉了 3%。API 自始至終沒有受影響,三處問題在 v2.1.116 中全部修復,所有訂閱使用者的用量額度正在重置。接下來的做法是:每一次 system prompt 改動都要跑分模型的 eval 套件,逐行做消融實驗,凡是可能拿智慧水平做交換的改動都要先經過一段浸泡期。
- #products
- #evals
