Anthropic Engineering
Anthropic atribuye la caída de calidad de Claude Code a tres cambios independientes
Tres cambios sin relación entre sí se apilaron en lo que parecía una degradación general: el esfuerzo de razonamiento por defecto bajó de alto a medio el 4 de marzo, una optimización de caché lanzada el 26 de marzo borraba el razonamiento previo de Claude en cada turno en lugar de una sola vez, y una línea del system prompt del 16 de abril que limitaba las respuestas a 100 palabras costó calidad real de código. La API nunca se vio afectada, y los tres quedaron resueltos el 20 de abril en la v2.1.116. Una ablación mostró una caída del 3% en las evals solo por la instrucción de brevedad, y el bug que borraba el razonamiento provocó los fallos de caché detrás de los reportes de límites de uso que se agotaban más rápido de lo esperado. Se están reiniciando los límites de uso para todos los suscriptores, y los futuros cambios del system prompt pasan ahora por suites de evals por modelo, periodos de soak y despliegues graduales.
- #products
- #evals
