Anthropic Engineering
Anthropic atribuye meses de quejas sobre Claude Code a tres cambios distintos
Tres cambios sin relación entre sí se apilaron hasta parecer una degradación amplia e inconsistente. El reasoning effort por defecto de Claude Code bajó de high a medium el 4 de marzo y se revirtió el 7 de abril, y ahora el valor por defecto es xhigh para Opus 4.7 y high en todo lo demás; una optimización de caching que debía limpiar el thinking obsoleto una sola vez terminó limpiándolo en cada turno durante el resto de la sesión, lo que volvió olvidadizo a Claude y consumió en silencio los límites de uso a través de cache misses; y una línea del system prompt que limitaba las respuestas finales a 100 palabras costó cerca de un 3% en una eval, tanto para Opus 4.6 como para 4.7. Todo quedó corregido en el build del 20 de abril, la API nunca se vio afectada y se están reseteando los límites de uso de todos los suscriptores. De ahora en adelante, cada cambio en el system prompt pasa por una suite amplia de evals por modelo, ablaciones línea por línea y rollouts graduales.
- #products
- #evals
