Anthropic Engineering
Anthropic 把一个月的 Claude Code 抱怨追溯到三处独立改动
三处互不相关的改动叠在一起,看上去就像一次全面的质量下滑。3 月 4 日,默认 reasoning effort 从 high 降到了 medium;3 月 26 日的一次缓存优化本意是清掉旧的 thinking 内容,结果变成整个会话里每一轮都清一次,Claude 因此变得健忘,还在缓存未命中上白白烧掉用量额度;4 月 16 日加进 system prompt 的一行把回复限制在 100 词以内,让 Opus 4.6 和 4.7 的 eval 成绩掉了 3%。API 自始至终没有受影响,三处问题在 v2.1.116 中全部修复,所有订阅用户的用量额度正在重置。接下来的做法是:每一次 system prompt 改动都要跑分模型的 eval 套件,逐行做消融实验,凡是可能拿智能水平做交换的改动都要先经过一段浸泡期。
- #products
- #evals
