16 entradas16 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 6 min de lectura.

La fontanería del trabajo ejecutado por agents se llevó buena parte de la atención hoy: OpenAI encadenó cinco lanzamientos de Astra en la semana previa al DevDay y, a la vez, publicó un postmortem inusualmente concreto sobre las quejas de calidad, mientras Coinbase explicaba por qué los raíles de las tarjetas no pueden soportar pagos de máquina a máquina. Por debajo de todo corría una preocupación compartida por la medición: tres builders distintos argumentaron que las puntuaciones de los benchmarks ya no te dicen si un modelo funciona para tu trabajo real. Algunos también dejaron de lado el producto un momento para recordar el aniversario del 11-S.

X

Thibault Sottiaux

OpenAI lanza cinco productos Astra en una semana y señala tres causas de la caída de calidad

Images 2.5, GPT-Live-1, una Agents API, Data Agent y ChatGPT for Financial Services aterrizaron todos antes del DevDay, y hay más previsto para la semana que viene. Las quejas sobre la calidad recibieron un postmortem de verdad en lugar de un encogimiento de hombros: las skills escritas para modelos antiguos se activaban con demasiada frecuencia e impedían que el modelo revisara su propio trabajo; un experimento opt-in de gestión de contexto provocó paradas prematuras y respuestas a mensajes antiguos en unos 4.000 o 5.000 usuarios estimados, y ya está desactivado; y se retiraron algunos engines mal configurados que degradaban una cola larga de tráfico. OpenAI también incorporó a Aidan y Sasha, del equipo de Git AI, cuya herramienta open source mide cómo contribuyen realmente los coding agents a una base de código, y se comprometió a mantenerla open source.

  • #products
  • #agents
Pódcast

No Priors

El 76% de los pagos del comercio entre agents es de menos de 30 centavos, por debajo de lo que una tarjeta puede mover

Los raíles de tarjeta cobran alrededor de 30 centavos fijos más un porcentaje, así que se rompen por completo con las transacciones que los agents hacen de verdad. La frase de Brian Armstrong: «No queremos que las AI se queden sin banco.» Coinbase ahora le entrega a cualquier agent una wallet self custodial a partir de un único prompt pegado, sin KYC, y enruta los pagos por x402, un protocolo que incubó y donó a la Linux Foundation con participación de Google, Cloudflare y AWS. Puertas adentro, la compañía persigue la automejora recursiva manteniendo un «cerebro» por repo y por equipo con cada incidente, cada control financiero, cada test AB y cada PR aceptado o rechazado, y obligando a que toda corrección humana sobre el trabajo de un agent se escriba de vuelta ahí. También revelaron que el 88% de los ingresos ya viene de trading que no es Bitcoin, que los prediction markets alcanzaron un run rate de 100 millones de dólares a los pocos meses del lanzamiento, y que las acciones tokenizadas están en vivo fuera de Estados Unidos como un valor real custodiado uno a uno.

  • #agents
  • #payments
X

Madhu Guru

Meta Sr Director of AI

La AI en la empresa fracasa cuando un equipo central construye para la gente en vez de con ella

Tres patrones de fracaso. Primero, un CEO recurre a un lugarteniente de confianza que arrastra a colegas de confianza, e importa una estructura de equipo y un manual de lanzamiento pensados para quince años de mejora incremental a un trabajo que exige experimentación e invención. Segundo, una infrainversión crónica en evals, hasta el punto de que la mayoría de las empresas ni siquiera sabe qué aspecto tiene lo bueno. Tercero, un equipo central de AI que se declara plataforma, lanza herramientas desconectadas de los flujos de trabajo y del criterio de quienes hacen la tarea, y consigue una adopción a regañadientes sin ninguna ganancia de productividad. La solución es meter a tus mejores AI builders dentro de finanzas, ventas y soporte, en lugar de construir desde fuera y hacia ellos.

  • #evals
  • #enterprise
X

Dan Shipper

Every CEO

Every convierte tres años de vibe checks a modelos en benchmarks personales

Unas mejores puntuaciones en los benchmarks no dicen casi nada sobre cómo se comporta un modelo con tu trabajo real, y por eso Every lleva tres años publicando reseñas largas y de primera mano de cada modelo nuevo. Ahora esos vibe checks se vuelven cuantitativos: Hammer y Nityesh montaron una plataforma interna donde cada persona del equipo construye un benchmark personal a partir de su propio trabajo del día a día.

  • #evals
X

Peter Yang

Las software factories todavía no funcionan, y nadie ha presentado un contraejemplo

Fuera de la verificación y el testing, la AI no puede mejorar sola un producto ni construir una feature nueva de punta a punta sin un humano en el loop. El modo de fallo es concreto: dejas algo en bucle toda la noche y una única suposición equivocada convierte la ejecución entera en tokens desperdiciados. El reto abierto merece tomarse en serio, porque nadie ha sabido nombrar un producto o una feature construida de punta a punta sin ningún humano definiendo requisitos ni revisando el resultado. Aparte, una división limpia de herramientas: las tareas programadas locales se quedan en Codex y las de cloud se van a Grok Bot.

  • #agents
X

Thariq

Claude Code añade evals de plugins para que las skills sobrevivan a los cambios de modelo

Ejecutar `claude plugin eval init` en la carpeta de un plugin responde a la pregunta de si tus skills siguen funcionando después de que salga un modelo nuevo. El punto de fondo es que las puntuaciones crudas de aprobado o suspenso se han vuelto casi ininterpretables: muchos fallos en benchmarks vienen de tests ocultos demasiado estrictos, y en algunos casos la respuesta del modelo es más sensata que el resultado esperado.

  • #evals
  • #agents
X

Aaron Levie

Box CEO

Box ya se monta directamente en los sandboxes de agents para leer y escribir archivos

Un agent puede leer y escribir archivos en su propia máquina con Box montado dentro del sandbox. El argumento detrás: a medida que los agents asumen flujos de trabajo críticos de la empresa, necesitan las mismas primitivas que las personas hemos tenido siempre, empezando por un sistema de archivos de verdad.

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

El model router de Tailscale corre sobre Vercel AI Gateway

Los AI gateways se están convirtiendo en lo que en su día fueron los CDN: puedes ir directo al origen, pero es frágil, y montarte el tuyo propio sale doloroso y caro. El model router de Tailscale ya está construido sobre Vercel AI Gateway como infraestructura subyacente.

  • #products
X

Nikunj Kothari

FPV Ventures Partner

Prepárate para ver los track records de los VC reescritos sin ruido en los próximos dos años

Las grandes salidas y las revalorizaciones son realmente escasas, y son aquello con lo que levantas el siguiente fondo, así que los VC exitosos pelean duro por la atribución de los deals calientes. La predicción es concreta: habrá nombres borrados u omitidos convenientemente a medida que la gente revise la historia para colgarse los ganadores. Los GP emergentes se llevan la peor parte, porque el track record es lo único que pueden presentar a futuros LP. La defensa es mantener cerca a tus founders, porque ellos son las referencias de verdad.

  • #funding
X

Zara Zhang

La empresa de una sola persona está sobrevalorada porque construir en solitario da mucha soledad

La AI de verdad permite que una sola persona haga muchísimo más, pero ese argumento pasa por alto para qué sirve un cofounder. Construir algo nuevo es una experiencia profundamente solitaria, y necesitas a alguien con quien hacer brainstorming, con quien sufrir y con quien celebrar. La motivación se desploma con facilidad cuando no te has atado al mástil junto a otra persona.

  • #startups
X

Peter Steinberger

Astra juega al Doom en una sesión cloud mediante computer use

Ejecutando Astra sobre OpenClaw en una sesión cloud, con CUA manejando la máquina, el modelo jugó al Doom. El veredicto de Peter Steinberger: no es AGI, pero probablemente le gana al cerebro de una mosca. Llegar hasta ahí exigió enviar un patch a trycua para que las teclas funcionaran de forma fiable bajo Linux, un framework que sigue considerando sólido en conjunto.

  • #agents
  • #open-source
X

Matt Turck

FirstMark Capital VC

El piso 53 en vez del 104, y una startup que sobrevivió al 11-S

TripleHop, una startup de búsqueda empresarial de 25 personas que hacía más o menos lo que hoy hace Glean, alquiló una oficina en la Torre Norte porque el World Trade Center estaba cortejando a las jóvenes empresas puntocom con condiciones preferentes. Eligieron el piso 53, más barato, en lugar de un espacio cerca del 104, donde las vistas eran increíbles pero el viaje en ascensor se hacía eterno. A las 8:46 de la mañana solo había un empleado en la oficina, Kenton Beerman, y salió ileso; los backups del CTO tenían el negocio otra vez en marcha antes de que acabara el día. Al visitar el memorial por primera vez hace unas semanas, el pensamiento fue lo poco que habría hecho falta: una hora más tarde, unos pisos más abajo, o la otra oficina.

  • #startups
X

Garry Tan

Y Combinator President & CEO

Sacar un 1600 debería desbloquear un examen más difícil, no terminar la medición

Una puntuación perfecta en el SAT satura el instrumento justo en el punto en que deja de ser informativo, así que debería haber un segundo examen más difícil que apile otra puntuación encima del 1600. En vez de eso se prohíbe el examen, las admisiones se convierten en una lotería aleatoria y la excelencia se vuelve imposible de reconocer.

  • #policy
X

Aditya Agarwal

SPC General Partner

SPC abre una serie de otoño sobre regulación tecnológica y una California con dos partidos

Las preguntas sobre la mesa son cómo fomentar innovación real en California, cómo habilitar un estado con dos partidos y cómo debería regularse la tecnología, con decisores sumándose a lo largo del otoño y Steve Hilton abriendo el 23 de septiembre. Aparte, una reflexión sobre el 11-S: la noticia le llegó en una clase de CMU, en Wean Hall 7500, mientras la gente entraba en pánico por un avión cerca de Pittsburgh, y queda el deseo de haber tenido el coraje de los pasajeros del United 93.

  • #policy

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.

AI Builders Digest — 2026-09-12 · LLMRates.ai