10 entradas10 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 4 min de lectura.

Las evals ya se consideran una pieza central para construir agentes. Aaron Levie, de Box, y Madhu Guru, de Meta, coinciden en que la calidad de un agente depende de probarlo en entornos de trabajo reales y de tratar las evals como la especificación. Guillermo Rauch sostuvo que los agentes rinden mejor bajo restricciones estrictas en tiempo de compilación, las mismas que a los humanos les resultaban demasiado tediosas. Garry Tan y Thariq, por su parte, se centraron en cómo gastan tokens los harnesses de agentes.

X

Guillermo Rauch

Vercel CEO

gdp-ts, de Vercel, hace que el typechecker exija una prueba de que hubo un control de autorización

Guillermo Rauch lanzó gdp-ts (Ghosts of Departed Proofs for TypeScript), que funciona a la vez como biblioteca, linter y skill de IA. Con ella, las funciones sensibles solo aceptan llamadas que llevan una «prueba» de que se ejecutó un control de autorización, y el typechecker lo verifica en tiempo de compilación. Según él, el patrón se quedó en un nicho dentro de Haskell porque los humanos tenían que revisarlo y cargar con su sobrecarga sintáctica. Ahora los agentes escriben más código del que nadie puede revisar, y rinden al máximo en ciclos cortos con restricciones duras. El README modela una regla real de Vercel: para cambiar la contraseña de un Project hace falta demostrar un rol concreto y además un entitlement concreto.

  • #agents
  • #security
  • #dev-tools
X

Aaron Levie

Box CEO

Levie: lo que frena la adopción de agentes es poder probarlos en entornos de trabajo realistas

Aaron Levie dice que muchos despliegues de agentes están frenados porque no se pueden probar, ajustar ni optimizar en entornos de trabajo reales: los archivos, el CRM, el correo y los demás sistemas que de verdad tocan. Sin eso, no puedes saber qué resultados da hoy un agente en tus evals ni cómo aguantará tras un cambio de modelo o una actualización del flujo de trabajo. Ahora mismo cada empresa construye esto por su cuenta. Su predicción es que todas las empresas tendrán a alguien a cargo de las evals y de la infraestructura de entornos simulados, y lo describe como un espacio enorme.

  • #agents
  • #evals
  • #enterprise
X

Madhu Guru

Meta Sr Director, AI

Tus evals son la especificación de tu producto, no un paso de QA después de construir el agente

Madhu Guru, que antes lideró Gemini, Veo y Nano Banana en Google, dice que el error más común de los equipos es tratar las evals como un paso extra de QA que se añade cuando el agente ya está construido. Según él, los productos de IA son fundamentalmente distintos: las evals son la especificación del producto.

  • #evals
  • #agents
X

Garry Tan

Y Combinator President & CEO

Garry Tan: los harnesses de los laboratorios tienen incentivos para quemar tokens, y las startups pueden arreglarlo

Garry Tan sostiene que los harnesses de agentes construidos por los laboratorios tienen incentivos para quemar tokens, y eso hace que los harnesses de las startups tengan una utilidad real. Su ejemplo es Grep, que observa cómo se usa un agente y sustituye automáticamente ese gasto de tokens por código determinista y probado que se ejecuta igual cada vez. También predijo que llegan los «AGI Science Loops» y dijo que Halmos está construyendo en ese espacio.

  • #agents
  • #startups
X

Thariq

«Local hands»: Claude se ejecuta en la nube pero llega a tus archivos locales

Thariq, de Claude Code, dice que uno de los patrones tiene su nombre favorito, «local hands»: Claude se ejecuta en la nube pero puede acceder a tus archivos en local. El patrón también llegará a Cowork. Por otro lado, comentó que el enfoque de planificación que mostró es mucho más eficiente en tokens que el HTML en bruto. El modelo no tiene que reconstruir componentes ni lógica para cosas habituales como máquinas de estados, diagramas y fragmentos de código.

  • #agents
  • #products
X

Ryo Lu

Ryo Lu sobre Steve Jobs: la tecnología se ha quedado puliendo detalles en lugar de crear cosas con alma

Al recordar a Steve Jobs, Ryo Lu cuenta que llegó al diseño de interfaces intentando que su PC beige se pareciera al iMac G4 que no podía permitirse. Sostiene que, desde la muerte de Jobs, la industria se ha quedado atrapada en un bucle de refinamiento constante, mejores cadenas de suministro y más formas de mantener a la gente haciendo scroll, mientras las personas están cada vez más desconectadas y solas. «Gastamos muchísima energía intentando superar a los humanos. Ojalá dedicáramos más tiempo a aprender de la vida de las personas y a mejorarla». También lanzó ryOS Subtitles, una extensión de Chrome para ver Netflix con subtítulos en dos idiomas a la vez. Incluye además guías de pronunciación para japonés, chino y coreano.

  • #design
  • #products
X

Aditya Agarwal

SPC General Partner

Aditya Agarwal: una computadora Muse/Dot en local podría ser mejor entorno para agentes que un macOS cada vez más cerrado

Aditya Agarwal dice que sería interesante ejecutar en local la «computadora» Muse/Dot, porque le parece un mejor entorno para agentes que un macOS cada vez más cerrado. SPC también recibe a Sergey Levine, profesor de Berkeley EECS desde 2016 y cofundador de Physical Intelligence. Levine desarrolla los algoritmos que permiten a los robots aprender de la experiencia vinculando lo que ven con cómo se mueven.

  • #agents
  • #robotics
X

Thibault Sottiaux

El espacio colaborativo de ChatGPT «mejora a pasos agigantados cada día»

Thibault Sottiaux, que trabaja en Codex y ChatGPT en OpenAI, le atribuye a Sergio el mérito de estar «haciendo magia» con un espacio colaborativo integrado directamente en ChatGPT. Dice que mejora a pasos agigantados cada día, y añadió que hoy quizá haya sido su mejor día en OpenAI hasta la fecha.

  • #products
X

Peter Yang

Crea un tutor de japonés por llamada de voz con Gemini Live y Nano Banana

Peter Yang publicó un tutorial sobre la app que creó y que le enseña japonés mediante llamadas de voz en tiempo real. El tutorial explica cómo usar su skill de especificación para crear los diseños clave, cómo configurar las APIs de Gemini Live para la voz y cómo hacer ilustraciones tipo diorama con Nano Banana. El objetivo es una app que te enseñe 100 frases en cualquier idioma antes de un viaje. También mencionó Gemini 3.8 Live.

  • #products
  • #voice

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.