13 entradas13 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 5 min de lectura.

El hilo más ruidoso de hoy fue el mismo visto desde dos ángulos: Boris Cherny, de Anthropic, mostró a Claude manteniendo aplicaciones en producción de forma silenciosa y con 180 PRs mergeados, mientras Aaron Levie y otros sostenían que justamente ese tipo de apalancamiento vuelve a los ingenieros más valiosos, no menos. Google lanzó un 3.7 Flash que cuesta la mitad y se construyó en tres semanas, Vercel propuso un solo comando para enrutar cualquier harness de programación, y un director de AI en Meta le puso nombre al nuevo modo de fallo: prompt debt. Por debajo de todo eso, el fundador de chess.com aportó el dato de treinta años sobre qué le pasa a una habilidad humana después de que las máquinas la superan.

X

Boris Cherny

Claude viene manteniendo las apps de Anthropic: 388 PRs abiertos, 180 mergeados

Durante las últimas semanas Claude ejecutó rutinas diarias de mantenimiento en iOS, Android, Desktop, web, CLI y el Agent SDK, coordinadas desde un canal de Slack. Las rutinas incluyen un fuzzer de crashes que va tocando la pantalla en un simulador hasta encontrar fallos y después rastrea su causa raíz, un unificador de duplicados que abre PRs para fusionar abstracciones levemente divergentes, y un eliminador de código muerto que agrega logging al código sospechoso y lo borra al día siguiente si nada se dispara. De 388 PRs abiertos, 180 terminaron mergeados tras pasar por Claude Code Review y revisión humana. Cuando una rutina se equivoca, la corrección consiste en pedirle a Claude que ajuste la rutina misma, algo que a veces lleva varios días de iteración.

  • #agents
  • #products
X

Josh Woodward

Google VP

Gemini 3.7 Flash llega 50% más barato y se construyó en unas tres semanas

El nuevo modelo Flash es más rápido, cuesta la mitad que su predecesor y pasó del inicio al lanzamiento en aproximadamente tres semanas. El tiempo de desarrollo es la verdadera señal acá sobre lo mucho que se comprimió el ritmo de los lanzamientos.

  • #products
X

Amjad Masad

Replit CEO

ARC-AGI-3 casi cae ante un coding harness, y Masad lo toma como vindicación

Sumar un coding harness lleva a un modelo cerca de resolver ARC-AGI-3, algo que Masad lee como confirmación de una tesis que viene empujando: programar es la capacidad que generaliza los LLM hacia todo lo demás. Lo acompañó con una predicción más filosa: que para el año que viene usar una computadora será opcional y el trabajo cambiará de manera radical.

  • #agents
  • #evals
X

Aaron Levie

Box CEO

La tesis de que los ingenieros desaparecerían era "absurdamente errónea", y la experiencia vale más

Lo que pasó en realidad es que los ingenieros consiguieron una herramienta potente, y su valor sube en lugar de bajar porque ahora la ingeniería puede aplicarse a muchísimo más trabajo que antes. Automatizar el descubrimiento de fármacos requiere ingenieros. Automatizar la manufactura requiere ingenieros. Encarar proyectos de software más grandes requiere ingenieros. La generalización: la AI hace que las empresas asuman más trabajo, lo que implica más expertos para supervisarlo, y los modelos mejores rinden más en manos de expertos que de novatos.

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

El prompt debt es la nueva deuda técnica: recortá la mitad de tu prompt en cada actualización de modelo

La mayoría de los productos de AI cargan system prompts inflados que perjudican activamente la calidad. El patrón de acumulación es conocido: el modelo falla en algo, agregás diez reglas; falla una tool call, agregás diez ejemplos; la salida se ve rara, agregás restricciones de formato. Tres meses después el system prompt es una novela, y mientras tanto el modelo de base se volvió mucho más inteligente pero tus reglas microgestionadas lo convierten otra vez en una máquina de reglas tonta. La receta es agresiva: borrá al menos el 50% de tus prompts en cada actualización de modelo. También contó más de 20 productos de AI llamados con alguna variante de "Studio".

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

Rauch apuesta a que un comando de token routing se vuelva la forma por defecto de correr AI para programar

La propuesta es un único comando que configura todos los coding harnesses que ya usás, Claude Code y Codex incluidos, en vez de reemplazarlos. Lo que te da es uptime, elección de modelo, costos más bajos, observabilidad y cero retención de datos. Predice que esto se va a convertir en la forma por defecto de usar AI para programar a escala, y por ahora ofrece GLM 5.2 gratis a hasta 500 tokens por segundo a través de esa vía.

  • #products
  • #agents
Pódcast

No Priors

El ajedrez está más vivo que nunca treinta años después de que las computadoras superaran a los humanos

Chess.com empezó como un dominio de 56.000 dólares comprado en una subasta de quiebra en 2005, después de que todos los inversores dijeran que era ininvertible, y hoy tiene 10 millones de usuarios activos diarios, 250 millones de miembros registrados y más de 200 millones de dólares de facturación anual sin haber levantado nunca capital para crecer. Lo contraintuitivo es lo que los engines le hicieron al juego: Stockfish volvió al ajedrez aburrido por un tiempo mientras los jugadores exprimían finales perfectos, y después redes neuronales autodidactas como Leela empezaron a ganarle con un juego agresivo y poco convencional, y volvieron al ajedrez más emocionante que nunca. Sobre por qué los humanos siguen jugando, Allebest es directo: "los humanos quieren hacer cosas de humanos". Sobre cómo se adquiere la maestría, sus datos de millones de jugadores arrojan una respuesta que él llama afortunada y desafortunada a la vez: no hay atajos para la repetición, solo atajos en las herramientas. Su forma de plantearlo: agarrá cualquier día de tu vida y multiplicalo por mil, porque así se ve tu vida. La empresa ahora está aplicando el mismo manual de ratings al póker en gambit.com, con la teoría de que a la gente le va a importar un rating tanto como el dinero, porque mide habilidad en vez de quién puede recomprar más fichas.

  • #products
  • #evals
X

Swyx

Agrupar las preguntas del agente como speculative decoding, y funciona para trabajo de diseño

El input humano es la parte cara de un loop de agente, así que en lugar de preguntas ronda por ronda armó una modificación /align-me que pregunta en lotes. La analogía es speculative decoding: ganás velocidad mirando 2 a 10 pasos hacia adelante en vez de esperar cada confirmación. Cuenta que funciona excepcionalmente bien para exploración de diseño en particular.

  • #agents
X

Matt Turck

FirstMark Capital VC

Quedan dos categorías de startup: cohete AI-native o dada por muerta

El medio desapareció. Ser un cohete implica estar en levantamiento de capital permanente a valuaciones cada vez más aterradoras solo para absorber capital y talento, más una pelea a muerte con otros cohetes por los clientes que se te come los márgenes brutos. Todo lo demás queda dado por muerto sin importar qué tan buena sea la empresa en realidad. Esto viene siendo cierto desde hace rato, pero Turck lee el último tramo como una escalada de un escalón más.

  • #funding
X

Nikunj Kothari

FPV Ventures Partner

¿Un agente maestro o muchos bots especializados? Kothari espera que gane el orquestador

El diseño de Grok Bot trata a los agentes como personas, compartimentando herramientas, contexto y resultados por bot, de modo que vas a uno específico para un objetivo específico. La alternativa es el modelo Jarvis: un único agente maestro que simplemente resuelve la tarea y lanza los sub-bots que necesite, lo que convierte la interfaz de 1:muchos en 1:1. Su apuesta es que el campo arranca acotado por restricciones reales de ingeniería alrededor de las ventanas de contexto, el uso de herramientas y el costo, y después converge en el orquestador maestro que lee y entiende los bots que creás.

  • #agents
  • #products
X

Thibault Sottiaux

Google Docs, Sheets y Slides ya funcionan dentro de ChatGPT

Podés abrir un documento en ChatGPT y chatear o hablar para ir haciendo cambios sin salir del flujo, algo que según él cambió su manera de escribir, hacer brainstorming y corregir. Por separado, un plugin de Computer History que se burla de tu día frente a la computadora resultó genuinamente diagnóstico: el 48% de la actividad registrada de un día fue Slack, Delete fue el atajo más usado con 1.191 pulsaciones, y la hora más ocupada fueron las 9 de la noche.

  • #products
X

Zara Zhang

Todos los puestos con demanda hoy siguen teniendo "engineer" en el título

La predicción era que la AI para programar iba a devaluar a los ingenieros. El mercado laboral observado dice otra cosa: forward-deployed engineer, design engineer, product engineer, growth engineer. La palabra sobrevivió y se multiplicó en roles nuevos en lugar de desaparecer.

  • #products
X

Peter Yang

El uso más útil de la AI en una crisis de salud familiar fue pelear con la burocracia

Al entrar en una situación de salud familiar, la expectativa era usar AI para investigar y entender la enfermedad. Lo que más ayudó en realidad fue navegar la burocracia del sistema de salud. También deja abierta una pregunta que vale la pena seguir: si las especificaciones de producto ahora necesitan dos secciones separadas, una para humanos y otra para agentes, o si un solo documento puede servir para ambos.

  • #products
  • #agents

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.