15 entradas14 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 7 min de lectura.

Anthropic pasó el día rindiendo cuentas: un postmortem que identifica tres cambios distintos detrás de un mes de quejas sobre Claude Code, más un reinicio de los límites de uso para todos los suscriptores. OpenAI respondió a su propia versión de esa queja sobre los límites de Codex, señalando a los revendedores de suscripción a API en lugar de a un cambio silencioso de política. Por debajo de ambos, la historia de los agentes empresariales se afianzó, con sandboxes y servidores MCP que ahora corren dentro del propio perímetro del cliente.

Blog

Anthropic Engineering

Anthropic atribuye un mes de quejas sobre Claude Code a tres cambios distintos

Tres cambios sin relación entre sí se acumularon en lo que parecía una única caída general de calidad. El reasoning effort por defecto pasó de alto a medio el 4 de marzo; una optimización de caching del 26 de marzo, pensada para limpiar el thinking antiguo una sola vez, terminó limpiándolo en cada turno durante el resto de la sesión, lo que volvía a Claude olvidadizo y quemaba los límites de uso en cache misses; y una línea del system prompt del 16 de abril que limitaba las respuestas a 100 palabras mostró una caída del 3% en las evals de Opus 4.6 y 4.7. La API nunca se vio afectada, los tres problemas están corregidos desde la v2.1.116 y se están reiniciando los límites de uso de todos los suscriptores. De aquí en adelante habrá suites de evals por modelo para cada cambio del system prompt, ablaciones línea por línea y periodos de soak para cualquier cosa que pueda ir en contra de la inteligencia.

  • #products
  • #evals
X

Thibault Sottiaux

OpenAI dice que los límites de Codex no cambiaron: la reventa sub2api activó alertas de fraude

OpenAI investigó los reportes de que los límites de uso de Codex se comportaban de otra manera y afirma que no los cambia sin hablar antes con la comunidad. Lo que encontró fue otra cosa: muchos de los usuarios afectados estaban usando sub2api, convirtiendo una suscripción en tráfico de API para reservirlo o compartirlo entre muchos usuarios, algo que el sistema de prevención de fraude marca. Iniciar sesión con ChatGPT desde clientes oficiales o desde otros open source como Pi y OpenCode no da problema. También lanzaron hoy la salida de imágenes con transparencia en GPT-Image-2, tanto en ChatGPT como en la API, además de los ChatGPT Sites compartibles que puedes construir junto a otras personas.

  • #policy
  • #products
Blog

Claude Blog

Claude Managed Agents ya puede ejecutar herramientas dentro de tu propio perímetro

Los sandboxes autoalojados están en beta pública: el bucle del agente, que se encarga de la orquestación, la gestión de contexto y la recuperación de errores, se queda en la infraestructura de Anthropic, mientras que la ejecución de herramientas se traslada a infraestructura que tú controlas o a Cloudflare, Daytona, Modal o Vercel. El código, los archivos sensibles y los repositorios nunca salen de tu red, y tú defines la imagen de runtime y el dimensionamiento de recursos, algo que importa para builds largos o generación de imágenes. Los MCP tunnels, en research preview, permiten que los agentes llamen a bases de datos internas, APIs privadas y sistemas de ticketing a través de una única conexión saliente de gateway, sin reglas de firewall entrantes ni endpoints públicos. Amplitude, Clay y Rogo ya están construyendo sobre esto.

  • #agents
  • #products
X

Boris Cherny

Anthropic prepara un despliegue en el que el cliente se queda con todos los datos

Los modelos de clase Mythos exigen medidas de seguridad adicionales, y las empresas tienen sus propias reglas de privacidad y cumplimiento que satisfacer. Anthropic lleva tiempo trabajando con clientes en un esquema donde ellos son dueños de sus datos y los controlan, y Anthropic no conserva ninguno. Llega este otoño.

  • #policy
  • #products
X

Thariq

Las nuevas salvaguardas empresariales de Claude corren en la infraestructura del cliente

Las nuevas salvaguardas Fable para empresas corren en tu infraestructura, así que el control sobre dónde viven los datos y quién puede acceder a ellos queda de tu lado. Ya se han desarrollado junto a unas 100 empresas, y el despliegue más amplio está previsto para el otoño.

  • #policy
  • #agents
Blog

Anthropic Engineering

Separar el cerebro del agente de sus manos redujo un 60% el time-to-first-token p50

Managed Agents empezó con la sesión, el harness y el sandbox en un mismo contenedor, lo que convertía a ese contenedor en una mascota: cuando moría, la sesión moría con él, y depurar significaba entrar por shell a una máquina que además guardaba datos de usuario. La solución fueron tres interfaces que fallan de forma independiente, con el log de sesión viviendo fuera del harness, de modo que un harness caído se reinicia con wake(sessionId) y retoma desde el último evento. Ahora los contenedores se aprovisionan mediante una llamada a herramienta solo cuando hacen falta, así que las sesiones que nunca tocan un sandbox dejan de pagar el coste de arranque: el TTFT p50 bajó alrededor de un 60% y el p95 más de un 90%. La ganancia en seguridad es que las credenciales nunca son accesibles desde el sandbox donde corre el código generado por Claude, así que una prompt injection ya no puede simplemente leer su propio entorno.

  • #agents
  • #products
Pódcast

No Priors

Un implante de retina que devuelve visión de formas reales acaba de aprobarse en Europa

Prima es un chip implantado bajo la retina, alimentado por un proyector láser montado en las gafas del paciente, que puentea los bastones y conos muertos en personas ciegas por degeneración macular. Recibió la aprobación de comercialización europea en julio, con las primeras ventas en las próximas semanas, y los pacientes del ensayo completaron sudokus y crucigramas y leyeron libros, algo que ningún dispositivo anterior había logrado. El planteamiento de fondo: el cerebro es claramente una computadora, y tratarlo como tal produce tamaños de efecto que décadas de descubrimiento de fármacos de molécula pequeña no han conseguido, porque "si te pongo electrodos en M1, probablemente estarás usando una computadora en una hora". Los productos de cerebro como teclado no son el objetivo, y lo dicen de forma explícita, porque "si consigues visión, audición, equilibrio y un kilobit por segundo de control motor, ya estás a mitad de camino de Matrix". La hipótesis de la representación platónica se usa aquí en clave práctica, no filosófica: pueden alinear registros neuronales de animales con las representaciones internas de los modelos de AI.

  • #hardware
  • #research
X

Nikunj Kothari

FPV Ventures Partner

La verdadera razón por la que los inversores exigen ambición: omitir salió demasiado caro

Los LPs vieron a Anthropic pasar de cero a un billón de dólares de valoración más rápido que ninguna otra empresa registrada, a SpaceX salir a bolsa con 1,77 billones y a Cursor llegar a 60.000 millones en cuatro años devolviendo un DPI significativo a sus primeros fondos. Respondieron volcando dinero en megafondos, y cuando un fondo es así de grande, cada cheque, incluso una Serie A, tiene que justificarse contra un desenlace de un billón. En ese punto el precio de entrada deja de importar: 200, 300, 500, a veces 1.000 millones, todo da igual frente al desenlace que se está modelando. Así que el error de omisión pasó a ser mucho peor que el error de admisión, los fondos no pueden permitirse perderse nada que esté caliente, y la ley de potencias hace el resto. Esas son las matemáticas detrás de por qué la ambición domina el pitch.

  • #funding
X

Aaron Levie

Box CEO

El post-training se está convirtiendo en la palanca de costes de las empresas de AI aplicada

Cuando ya conoces un dominio lo bastante bien y tienes volumen en un conjunto de tareas parecidas, diseñar un modelo a medida solo para ese trabajo empieza a salir rentable. El mecanismo: reward shaping en el post-training que prefiere trayectorias que consumen menos tokens con el mismo rendimiento, lo que "nos permitió co-optimizar coste y calidad, ganando bastante rendimiento sin mover el coste". Esto no tendrá sentido en todas partes, porque los modelos frontier de propósito general muchas veces son suficientemente buenos o directamente necesarios. Pero con experiencia vertical profunda y, o bien costes demasiado altos para operar a escala, o bien un tipo de tarea que nadie más está entrenando, se convierte en una posición atractiva para las empresas que están cerca del workflow empresarial.

  • #products
  • #research
X

Madhu Guru

Meta Sr Director of AI

Las empresas se atascan con la AI porque no tienen estrategia de evals

Con una sola suite no basta. Necesitas un conjunto escalonado de evals repartido por todo el espectro de coste y realismo, ajustado a tus propios casos de uso. Las evals de hill climbing empujan la frontera del producto y hay que refrescarlas de forma continua para seguir mejorando la calidad y ampliando funciones. Las evals de regresión detectan lo que el hill climbing rompió, los smoke tests cubren lo básico que nunca puede fallar, como la identidad del producto, y las evals de lanzamiento corren cerca del tráfico real, con el menor control y el mayor realismo.

  • #evals
X

Guillermo Rauch

Vercel CEO

El posicionamiento de Vercel, dicho sin rodeos: "Estamos construyendo el AWS de los agentes"

Ese es el pitch entero, en una sola línea. Rauch también dijo que la apuesta de Bun por lo simple, lo rápido y lo abierto encaja a la perfección con Vercel y con la forma en que la empresa entiende el mundo, y felicitó a Jarred Sumner por el lanzamiento.

  • #agents
  • #products
X

Amjad Masad

Replit CEO

Replit se alía con OpenAI, y la ventaja real del Free Mode es la velocidad

Masad dice que la alianza con OpenAI llega con mucho retraso y recuerda que, antes de que Replit siquiera estuviera en YC, Paul Graham le pidió a Sam Altman que los reclutara. Lo infravalorado del nuevo Free Mode, según él, no es que sea gratis sino que es lo bastante rápido como para volver a hacer que programar sea interactivo.

  • #products
X

Peter Yang

Pon a un agente manager a picar al agente worker para sacarle mejor output

La corazonada de Yang es que buena parte del output de AI mejora con un bucle donde un agente manager simplemente presiona: "¿Seguro que esto es lo mejor que puedes hacer?", "Creo que puedes hacerlo mejor, inténtalo otra vez", "Míralo con más calma, dame un output de 11 sobre 10". También pasó los 100.000 suscriptores en YouTube, con entrevistas en cola sobre cómo los modelos de hoy cambiaron por completo las evals, qué apps hechas con vibe coding se convirtieron en negocios de verdad, y ChatGPT Finance.

  • #agents
X

Aditya Agarwal

SPC General Partner

El rasgo que SPC filtra con más dureza es la claridad, no las credenciales

Claridad significa la capacidad de ser honesto, atravesar la niebla de guerra y trazar un camino en aguas turbias, y Agarwal dice que es el atributo que más busca SPC. Su ejemplo máximo es Sridhar Ramaswamy, que escaló la publicidad de Google de 1.000 millones a 100.000 millones y ahora lidera Snowflake en plena transición hacia la AI, en un episodio de Minus One sobre cuándo asumir un riesgo profesional, qué salió mal en Neeva y hacia dónde van los modelos. Una frase relacionada: los mejores fundadores son reduccionistas.

  • #funding
X

Swyx

NVIDIA pagó 6.000 millones por una fábrica de modelos que supera a los de clase Thinky

El último episodio de Latent Space de swyx es con la persona a la que NVIDIA acaba de pagar 6.000 millones de dólares para quedarse con su fábrica de modelos, y él insiste en que decir que produce modelos capaces de superar a Thinky no es exageración: mira los números. También señala un patrón que está apareciendo en los agent skills: /wayfinder de Matt Pocock es el /grill-me de /grill-me, pensado para cuando navegas en la niebla de guerra y necesitas orquestar investigación y más sesiones de grill antes incluso de saber qué es lo que no sabes.

  • #funding
  • #agents

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.