Anthropic Engineering
Anthropic atribuye un mes de quejas sobre Claude Code a tres cambios distintos
Tres cambios sin relación entre sí se acumularon en lo que parecía una única caída general de calidad. El reasoning effort por defecto pasó de alto a medio el 4 de marzo; una optimización de caching del 26 de marzo, pensada para limpiar el thinking antiguo una sola vez, terminó limpiándolo en cada turno durante el resto de la sesión, lo que volvía a Claude olvidadizo y quemaba los límites de uso en cache misses; y una línea del system prompt del 16 de abril que limitaba las respuestas a 100 palabras mostró una caída del 3% en las evals de Opus 4.6 y 4.7. La API nunca se vio afectada, los tres problemas están corregidos desde la v2.1.116 y se están reiniciando los límites de uso de todos los suscriptores. De aquí en adelante habrá suites de evals por modelo para cada cambio del system prompt, ablaciones línea por línea y periodos de soak para cualquier cosa que pueda ir en contra de la inteligencia.
- #products
- #evals
