12 entradas11 builders
Archivo

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 7 min de lectura.

Los open weights dejaron de ser un debate. La incorporación de Google coronó un mes de experimentos públicos que llevaron a la comunidad de AI en Estados Unidos a un consenso que hace cuatro semanas casi nadie sostenía. En otros frentes el tema fueron las fábricas: Rauch y Nan Yu coincidieron en que lo que construyes es el sistema de agents que mantiene tu producto, mientras Anthropic publicó tanto un postmortem sobre un mes de degradación de Claude Code como la arquitectura detrás de separar el cerebro de un agent de sus manos.

Blog

Anthropic Engineering

Anthropic rastrea un mes de degradación de Claude Code hasta tres cambios independientes

Tres cambios sin relación entre sí se acumularon hasta parecer una degradación generalizada del modelo. El reasoning effort por defecto de Claude Code bajó silenciosamente de high a medium el 4 de marzo y ahora vuelve a estar en xhigh para Opus 4.7; una optimización de caching del 26 de marzo, pensada para limpiar el thinking antiguo una sola vez, terminó limpiándolo en cada turno, lo que explica tanto los olvidos como los límites de uso agotándose más rápido; y una línea del system prompt del 16 de abril que limitaba las respuestas a 100 palabras costó un 3% en las evals. Los tres están corregidos desde la v2.1.116, y los límites de uso se han restablecido para todos los suscriptores.

  • #products
  • #evals
X

Aaron Levie

Box CEO

Con Google a bordo, los open weights reciben un respaldo completo de la industria

Con Google ya a bordo, Levie interpreta la ola actual de apoyo como un respaldo completo a la AI de open weights y no como una postura de nicho. Lo describe como un gran momento para la industria.

  • #open-source
X

Madhu Guru

La comunidad de AI en Estados Unidos convergió hacia los open weights en menos de un mes

Hace un mes el apoyo a los open weights era discutido y hoy parece evidente. Madhu Guru lo atribuye a una seguidilla de experimentos públicos que expusieron, cada uno, algo distinto sobre incentivos, innovación y geopolítica: DeepSeek, la ruptura entre Microsoft y OpenAI, GLM, Kimi, Fable y el episodio de OpenAI y Hugging Face. Su punto de fondo es metodológico. En terreno desconocido, las respuestas a las preguntas difíciles solo llegan por contacto repetido con la realidad, y así es como el campo va a resolver la mayoría de las grandes preguntas sociales de la AI en la próxima década.

  • #open-source
  • #policy
Pódcast

Unsupervised Learning

Benedict Evans: los modelos se parecen todos, así que el valor se desplaza hacia arriba en la pila

Entre tres y seis empresas están haciendo modelos frontier y todos son más o menos iguales, algo que Evans lee como prueba de que todavía no existe una barrera de entrada real: un laboratorio puede fracasar por completo y volver a estar cerca de lo más alto del leaderboard, y esa es una mala señal para los laboratorios, no una buena. Apunta al caso de las redes móviles, donde el tráfico creció más de mil veces, el capex ronda los 200.000 millones de dólares al año y todo el valor se fue hacia arriba, a Uber y YouTube. Sobre la pérdida de empleos es tajante con los gráficos que afirman que un modelo puede hacer el 93% del trabajo de un abogado junior de primer año: no puedes medir lo que hace ese abogado, ni puedes medir si el modelo puede hacerlo, así que 'es una estupidez'. El verdadero cuello de botella no es la capacidad, sino que la mayoría de la gente no construye herramientas, no ve el problema que una herramienta resolvería y, de todos modos, no está en posición de construirla.

  • #markets
  • #products
X

Guillermo Rauch

Vercel CEO

Rauch: la fábrica de software es el producto, no la app que fabrica

El planteo de Rauch es que tu producto es tan bueno como los agents que configuras para mantenerlo de forma autónoma, la misma lección que, según él, Tesla aprendió sobre manufactura. Cuando aparece una idea nueva, la jugada no es hacerle prompting improvisado a un agent, sino construir la fábrica que la va a arrancar, mantener y hacer crecer. Él ya trabaja así en su propia investigación: una simple carpeta research/, un AGENTS.md que describe el formato y las buenas prácticas que le gustan, y una CLI de agents que correlaciona conocimiento entre sesiones pasadas. Sin knowledge graph, sin app, sincronizado por iCloud o git, y el agent puede renderizar y desplegar un informe HTML cuando quiere compartir un resultado.

  • #agents
  • #products
Blog

Claude Blog

Los Claude Managed Agents ya pueden ejecutar tools dentro de tu propio perímetro

Los Managed Agents ya pueden ejecutar tools en un sandbox que tú controlas, ya sea tu propia infraestructura o un proveedor gestionado como Cloudflare, Daytona, Modal o Vercel. El bucle del agent se queda del lado de Anthropic, mientras que la ejecución de código, los archivos y los servicios permanecen detrás de tus políticas de red y tu registro de auditoría. Los túneles MCP, en research preview, permiten que los agents lleguen a bases de datos internas, APIs privadas y sistemas de tickets a través de un gateway ligero que abre una única conexión saliente, sin reglas de firewall entrantes ni endpoints públicos. Los sandboxes self-hosted están en beta pública, y Amplitude, Clay y Rogo ya están construyendo sobre esa combinación.

  • #agents
  • #products
Blog

Anthropic Engineering

Anthropic separó el cerebro del agent de sus manos para dejar de perder sesiones

Meter la sesión, el harness y el sandbox en un mismo contenedor convertía a ese contenedor en una mascota: si moría, la sesión moría con él, y depurar significaba entrar por shell a una máquina que además guardaba datos de usuario. Managed Agents ahora trata cada pieza como una interfaz separada, así que un harness caído se reinicia con wake(sessionId), reproduce el log de eventos duradero, y un sandbox muerto aparece como un error de tool call que Claude puede reintentar. Los contenedores se aprovisionan solo cuando una tool call realmente necesita uno, lo que redujo el time-to-first-token p50 cerca de un 60% y el p95 más de un 90%. La ganancia de seguridad también es real: las credenciales nunca quedan en el sandbox donde corre el código generado por Claude, con los tokens de git conectados al remoto local en la inicialización y los tokens de OAuth de MCP guardados en un vault detrás de un proxy.

  • #agents
X

Thibault Sottiaux

OpenAI, Codex and ChatGPT

ChatGPT Work ya superó a Codex en usuarios activos

Sottiaux dice que ChatGPT Work ya tiene más usuarios activos que Codex. También está impulsando una capacidad de voz que ya está viva en la app de ChatGPT y que, según su lectura, por fin hace que hablarle a tu computadora sirva de algo: 'Siempre fue posible hablarle a tu computadora. No hacía mucho a cambio. Pero arreglamos ese bug'. Lo califica de game changer desde el móvil.

  • #products
X

Peter Steinberger

Correr Codex todo el día con 12 subagents cazando 200 bugs

Steinberger viene haciendo QA masivo en paralelo de cara a un lanzamiento de OpenClaw y publicó el prompt literal: test end-to-end completo con API keys reales, 12 subagents repartiéndose la funcionalidad, gateways de desarrollo en puertos distintos para pruebas de estrés, worktrees, PRs autónomas, una meta de 200 bugs, arreglar siempre la causa raíz sin parches, y un informe de pruebas en markdown que se va actualizando. Lo que cambió es la durabilidad. Antes este flujo se caía en los límites de compactación o el modelo empezaba a hacer trampa, y ahora aguanta y encuentra problemas de comportamiento complejos. Aparte señala que OpenAI firmó la carta mientras Ant se mantuvo en silencio, junto con dos puntos que le parece que vale la pena decir sin rodeos: la competencia es buena para el ecosistema, y servir modelos a escala es difícil.

  • #agents
  • #evals
X

Nan Yu

Linear Head of Product

Si puedes construir una fábrica de software, puedes construir una fábrica de fábricas

Nan Yu lleva la idea de la fábrica un nivel más arriba: un sistema que produce software implica un sistema que produce esos sistemas. También cree que la abstracción no va realmente de software. Donde haya una intención diseñada e implementada, ya sea salud pública o derecho, aplica la misma recursión.

  • #agents
X

Amjad Masad

Replit CEO

El motor de ajedrez de Masad llega a unos 1200 de Elo con un solo LLM finetuneado

Masad desplegó un nuevo motor de ajedrez que estima en unos 1200 de Elo, con la meta de superar los 2000 bajo dos restricciones duras: un único LLM pequeño con fine-tuning, sin pretraining ni arquitectura propios, y jugadas producidas por el modelo sin ninguna ayuda de un motor de ajedrez. Es explícito en que relajar cualquiera de las dos restricciones vuelve el problema mucho más fácil.

  • #evals
X

Nikunj Kothari

Solo un fundador con control total podría comprar una app de astrología

La lectura de Kothari sobre una empresa de medios generativos que adquiere una app de astrología es que la operación solo es posible bajo dos condiciones: que el CEO tenga control completo, es decir, rentable, sin junta directiva y sin VC hasta donde él sabe, y que sea tan ambicioso como David Holz. Intenta explicar esa adquisición a un equipo amplio en una empresa normal y no sobrevive a la reunión. Su actitud es de curiosidad, no de descarte, sobre adónde lleva esto.

  • #funding

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.