Anthropic Engineering
Anthropic 把 Claude Code 的质量下滑追溯到三处独立改动
三处互不相干的改动叠在一起,看上去就像模型整体退化了:3 月 4 日默认 reasoning effort 从 high 降到 medium;3 月 26 日上线的一项缓存优化,本该只清一次 Claude 之前的思考过程,结果每一轮都清;4 月 16 日 system prompt 里加的一句「回复控制在 100 词以内」,实打实地拉低了写代码的质量。API 全程没受影响,三个问题都在 4 月 20 日的 v2.1.116 里解决。消融实验显示,光是那条控制篇幅的指令就让 eval 掉了 3%;而清空思考过程的 bug 造成大量 cache miss,这正是不少人反映额度消耗比预期快的原因。所有订阅用户的用量限额都会重置,之后 system prompt 的每次改动都要走分模型的 eval 套件、观察期和逐步放量。
- #products
- #evals
