Anthropic Engineering
Anthropic 把 Claude Code 的質量下滑追溯到三處獨立改動
三處互不相干的改動疊在一起,看上去就像模型整體退化了:3 月 4 日預設 reasoning effort 從 high 降到 medium;3 月 26 日上線的一項快取最佳化,本該只清一次 Claude 之前的思考過程,結果每一輪都清;4 月 16 日 system prompt 里加的一句「回覆控制在 100 詞以內」,實打實地拉低了寫程式碼的質量。API 全程沒受影響,三個問題都在 4 月 20 日的 v2.1.116 裡解決。消融實驗顯示,光是那條控制篇幅的指令就讓 eval 掉了 3%;而清空思考過程的 bug 造成大量 cache miss,這正是不少人反映額度消耗比預期快的原因。所有訂閱使用者的用量限額都會重置,之後 system prompt 的每次改動都要走分模型的 eval 套件、觀察期和逐步放量。
- #products
- #evals
