AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 1 min de lectura.

3 entradas3 builders

Los datos empresariales se convirtieron hoy en el activo escaso: Google pagó 10 millones de dólares por el conjunto de datos de una aerolínea en quiebra en lugar de por sus aviones. El otro hilo que atraviesa todo lo demás: los agentes con credenciales legítimas son ya la amenaza que más rápido avanza dentro de las empresas, y la infraestructura de nadie está preparada para ellos.

Pódcast

No Priors

Google compró por 10 millones de dólares los datos de Spirit Airlines en quiebra, no sus aviones

Google pagó alrededor de 10 millones de dólares por el conjunto de datos de Spirit Airlines dentro del proceso de quiebra para entrenar modelos, con Mercor como supuesto segundo postor, y las compras de datos a empresas en bancarrota parecen el inicio de una tendencia. Los laboratorios ya se están acercando a los hedge funds de Wall Street por la misma razón: los datos operativos reales, esos que no se leen como sintéticos, son genuinamente difíciles de encontrar, y los modelos, el cómputo y las herramientas tienen costes de cambio casi nulos, mientras que los datos no. La advertencia más afilada está en seguridad: «el mismo tipo de amenaza viene ahora de actores no humanos, agentes que en esencia tienen acceso legítimo al entorno con permisos legítimos». La metodología de detección se hereda de la era del ransomware, pero la velocidad no, y hace seis meses nadie quería siquiera hablar del tema, mientras que hoy casi todos los responsables de empresa o lo han visto ocurrir o lo temen.

  • #agents
  • #security
  • #data
X

Aaron Levie

Box CEO

Internet no tiene ningún plan para un mundo en el que todos usen agentes personales

Aaron Levie sostiene que internet está casi por completo desprevenida ante un futuro en el que los agentes personales de cada uno anden ejecutando tareas en su nombre. Plantea esa brecha como una oportunidad más que como una crisis: problemas nuevos y aperturas nuevas en la capa de infraestructura, en la experiencia de usuario y en modelos de negocio que todavía no existen.

  • #agents
  • #infrastructure
X

Zara Zhang

Los agentes están acelerando el desplome de la capacidad de atención humana

Zara Zhang califica el acortamiento de la capacidad de atención humana como una de las mayores crisis de nuestro tiempo, y sitúa a los agentes claramente en el lado equivocado. Lo contracorriente está en la dirección: los agentes se venden como aquello que te devuelve tu atención, y ella los interpreta como algo que agrava el problema.

  • #agents

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.

8 entradas6 builders

Anthropic se pasó el día dando explicaciones: un postmortem que rastrea un mes de reportes de degradación en Claude Code hasta tres cambios independientes, más un recorrido poco habitual por los fallos de seguridad que han causado sus propios agents. El contrapeso es Ryan Greenblatt explicando por qué cree que la I+D de AI quedará totalmente automatizada alrededor de 2029 y cómo tendría que ser un acuerdo entre Estados Unidos y China para frenarlo. Por debajo de ambas cosas, la nota práctica del día es que la configuración de reasoning effort no se traslada entre generaciones de modelos.

Blog

Anthropic Engineering

Anthropic rastrea un mes de quejas sobre Claude Code hasta tres cambios independientes

Tres cambios sin relación entre sí se apilaron hasta parecer una degradación amplia e inconsistente en Claude Code, el Agent SDK y Cowork, mientras que la API nunca se vio afectada. El reasoning effort por defecto bajó de high a medium el 4 de marzo, una optimización de caching del 26 de marzo contenía un bug que descartaba el razonamiento previo de Claude en cada turno una vez que la sesión quedaba obsoleta, y una línea del system prompt del 16 de abril que limitaba las respuestas a 100 palabras costó cerca de un 3% en evals tanto para Opus 4.6 como para 4.7. Los tres quedaron resueltos el 20 de abril, el valor por defecto ahora es xhigh para Opus 4.7 y high en todo lo demás, y se están reiniciando los límites de uso para todos los suscriptores. Un detalle que vale la pena de la investigación: al probarlos retroactivamente contra los PR causantes, Opus 4.7 encontró el bug de caching y Opus 4.6 no.

  • #products
  • #evals
X

Thibault Sottiaux

GPT-6 Astra con reasoning bajo supera a GPT-5.6 Sol con reasoning alto

Guía de calibración desde el lado de Codex y ChatGPT en OpenAI: GPT-6 Astra con reasoning effort en low rinde mejor que GPT-5.6 Sol en high. Si venías usando Sol en high y estabas contento con eso, el consejo es bajar a low o medium en Astra en lugar de arrastrar la configuración anterior.

  • #evals
  • #products
Pódcast

The MAD Podcast with Matt Turck

Planifica como si la I+D de AI estuviera totalmente automatizada a principios de 2029

La mediana de Ryan Greenblatt para la automatización total de la I+D de AI es finales de 2030, pero su percentil 35 es finales de 2028, y esa fecha más temprana es la que cree que la gente debería usar de referencia para planificar. «No diría que la superinteligencia es mala. Diría que es peligrosa.» Su escenario central va así: la ingeniería de software dentro de las empresas de AI totalmente automatizada a principios de 2028, modelos que piensan en un lenguaje solo para AI que podremos pedirles que descodifiquen hacia mediados de 2028, aproximadamente 4 veces más progreso en AI en 2029 que en 2025, y después un giro desde el reward hacking chapucero hacia el scheming competente y la toma de control. El plan AI 2040 que coescribió intenta ganar tiempo mediante un acuerdo entre Estados Unidos y China basado en rastrear el cómputo y una transparencia total en la investigación, lo que destriparía el mayor foso competitivo de los laboratorios de frontera y aun así dejaría el PIB mundial creciendo unas 200 veces durante la década de 2030.

  • #policy
  • #safety
Blog

Anthropic Engineering

Anthropic: los usuarios aprobaron el 93% de los permission prompts de Claude Code

La telemetría mostró que los usuarios pulsan aprobar en torno al 93% de los permission prompts, lo que justifica tratar la contención, y no la revisión humana, como la defensa principal. Un sandbox a nivel de sistema operativo redujo los prompts un 84%, y Opus 4.7 mantiene el éxito de los ataques de prompt injection en torno al 0,1% en intentos únicos y entre el 5 y el 6% tras 100 intentos adaptativos. Los dos fallos más instructivos se colaron por todas las capas probabilísticas: un red team interno hizo phishing a un empleado para que pegara un prompt que exfiltraba ~/.aws/credentials en 24 de 25 ejecuciones, y un tercero demostró que tener api.anthropic.com en la allowlist permitía que un archivo envenenado del workspace subiera datos a la cuenta de Anthropic del propio atacante. La lección que se repite es que las primitivas curtidas en batalla aguantaron, y lo que se rompió fue el proxy a medida que escribieron ellos mismos.

  • #agents
  • #security
Blog

Claude Blog

Claude Code ya puede publicar artifacts en vivo que tu equipo puede abrir

Las sesiones de Claude Code ahora pueden producir una página web compartible construida a partir de todo el contexto de la sesión, incluyendo el codebase, los conectores y la propia conversación. Cada publicación es una versión nueva en el mismo enlace, con historial de versiones, y las páginas abiertas se actualizan en el sitio, así que la investigación de un incidente se republica a sí misma según avanza y acaba siendo el postmortem. Los artifacts son privados para el autor por defecto, solo pueden verlos los miembros autenticados de la organización y no se pueden hacer públicos. Está en beta para Claude Team y Enterprise desde la CLI y la app de escritorio.

  • #products
  • #agents
Blog

Anthropic Engineering

Anthropic saca el harness del agent fuera del contenedor sandbox

Managed Agents divide un agent en tres interfaces intercambiables: una sesión que es un registro de eventos de solo anexado, un harness que ejecuta el bucle y un sandbox que ejecuta el código. Meter las tres en un mismo contenedor convertía ese contenedor en una mascota, así que un crash hacía perder la sesión y conectar Claude a la VPC de un cliente implicaba emparejar redes. Desacoplarlas significa que solo se aprovisiona un contenedor cuando una llamada a herramienta lo necesita, lo que redujo el p50 del tiempo hasta el primer token cerca de un 60% y el p95 más de un 90%. La ganancia en seguridad es que las credenciales nunca llegan al sandbox: los tokens de git se cablean en el remoto local durante la inicialización, y los tokens OAuth de MCP viven en un vault detrás de un proxy que el harness nunca ve.

  • #agents
  • #products
X

Peter Steinberger

A la caza de sesiones de agents en la nube que arranquen en segundos, no clonando repos

La única pieza que le falta al harness que quiere son las sesiones en la nube, y el objetivo es arrancar en segundos, lo que exige un snapshotting ingenioso. Clonar los repos desde cero, que es lo que hace hoy, no es lo bastante rápido. Espera tenerlo la semana que viene, y por separado dice que no recuerda la última vez que las capacidades dieron un salto tan grande de golpe.

  • #agents
  • #products
X

Peter Yang

La regla de producto de Brilliant: nunca le des la respuesta a quien aprende

Sue Khim, cofundadora de Brilliant, construye sobre un único principio: nunca le des la respuesta a quien aprende, porque hacer trampa y explicarle la respuesta a tu hijo se parecen más de lo que crees. Su idea es que usar AI para saltarse el aprendizaje es como llevar un brazo robótico al gimnasio para que levante las pesas por ti, y que aprender nunca fue cuestión de la respuesta sino de fortalecer la parte de ti capaz de concentrarse y batallar. Su consejo para cualquiera que construya productos de AI es encontrar áreas donde tengas datos únicos que hagan que el producto mejore con el tiempo.

  • #products
  • #education

12 entradas11 builders

OpenAI lanzó GPT-6 Astra para todo el mundo hoy, antes de lo previsto, y toda la conversación se reorganizó a su alrededor en cuestión de horas. Anthropic respondió en el frente del agente dentro del navegador: llevó Claude in Chrome a disponibilidad general con acciones autónomas y le dio a Cowork un navegador propio. Por debajo de las noticias de modelos, el CEO de Arm defendió que el cuello de botella de cómputo se está desplazando de los chips a los propios centros de datos.

X

Thibault Sottiaux

OpenAI adelantó seis meses su hoja de ruta gracias al uso interno de Astra

Astra fue la mayor ventaja competitiva de OpenAI mientras siguió siendo interno, y el salto de productividad fue tan grande que el equipo adelantó sus planes seis meses para lanzarlo en el DevDay en lugar de a mediados del año que viene. El despliegue llegó antes de lo previsto, y OpenAI lo acompañó de un reinicio completo de los saldos acumulados para todos los usuarios Plus, Pro y Business, efectivo al final del día. Prometen más lanzamientos la semana que viene.

  • #products
Blog

Claude Blog

Claude in Chrome llega a GA y ya puede actuar sin pedir permiso cada vez

Claude in Chrome está disponible de forma general en todos los planes de pago, y ahora Claude aprueba automáticamente las acciones que considera seguras en lugar de preguntar por cada una, usando el mismo mecanismo que el modo auto de Claude Code. Un clasificador contrasta cada acción pendiente con lo que realmente pediste y bloquea lo que no encaja, todo ello por encima de unas sondas que revisan el contenido web en busca de instrucciones inyectadas antes de que Claude actúe. Los números: en la evaluación de red team actual, los ataques que llegaron al modelo tuvieron éxito el 17,6% de las veces contra Opus 4.5 y el 3,8% contra Opus 5 sin ninguna protección; con las sondas más el clasificador, no pasó nada contra Sonnet 5, Opus 5 ni Mythos 5, y Fable 5 se quedó en el 0,3%. Lee páginas, hace clic, escribe y rellena formularios usando tus sesiones ya iniciadas, que es justo lo que hace falta para dashboards internos y portales de proveedores que nunca van a tener un connector.

  • #agents
  • #products
  • #security
Blog

Claude Blog

Cowork estrena navegador propio para que Claude deje de usar el tuyo

Claude Cowork en la aplicación de escritorio ahora incorpora un navegador propio que se abre en un panel lateral cuando una tarea necesita la web, separado de tu navegador y sin acceso a tus pestañas, marcadores ni contraseñas. Puedes trasladar sesiones sitio por sitio desde Chrome, Edge o Firefox, con los sitios de banca, correo y SSO excluidos salvo que los actives tú. La separación es deliberada: el navegador integrado sirve para delegar trabajo que quieres que se haga mientras tú sigues a lo tuyo, y Claude in Chrome sigue siendo la respuesta para la página que ya tienes delante. Se despliega esta semana en Pro, Max y Team, y ya está disponible hoy para los administradores de Enterprise.

  • #agents
  • #products
Pódcast

No Priors

El CEO de Arm: el techo no es el suministro de chips, es la construcción de centros de datos

Rene Haas afirma que el panorama de suministro de AI seguirá tensionado durante al menos tres a cinco años, y que el próximo cuello de botella es la construcción física, no las obleas ni la memoria. Casi ningún proyecto de centro de datos va por delante del calendario o por debajo de su estimación de mano de obra, y el rechazo local a las nuevas instalaciones añade un segundo freno, que él casi agradece porque de lo contrario la capacidad de obleas y memoria sería la restricción determinante. Sobre el exceso de oferta frente a la demanda: "Ni de lejos". Dentro de Arm, entre el 80 y el 90% de los ingenieros usan AI a diario, sobre todo para verificación, validación y debug, que consumen mucho más de un ciclo de chip de 24 a 36 meses que el diseño de la arquitectura. Su observación más afilada tiene que ver con por qué la AI todavía no sabe escribir buen RTL: la IP propietaria suele entregarse sin documentación ni test benches, y "si no se puede usar ni testear, en realidad no se puede entrenar con ello". También rebate la idea de que los aceleradores hayan dejado a las CPU sin sentido, y sostiene que algo tiene que orquestar adónde van todos esos tokens generados, y ese trabajo sigue siendo del microprocesador.

  • #hardware
  • #policy
X

Guillermo Rauch

Vercel CEO

Rauch sobre WebMCP: los agentes deberían circular por la web que ya construimos

Guillermo Rauch apuesta por WebMCP con una analogía del FSD de Tesla: los agentes tienen que adaptarse a la web tal y como existe, con sus calles, semáforos y baches, en lugar de exigir una infraestructura paralela. La ventaja concreta que señala es que las páginas de desarrollo de Next.js expongan herramientas de debugging directamente a un agent en la misma pestaña que está probando, con contexto específico de esa página, en vez de obligarlo a rebuscar entre logs del servidor. No hay que localizar ni configurar un servidor MCP aparte, porque la página lleva consigo sus propias herramientas para el agent. En ese escenario sostiene que un agent que maneja el navegador más un dev server forman un stack web completo, sin perder ni un ápice de profundidad en el debugging.

  • #agents
  • #products
X

Garry Tan

Y Combinator President & CEO

Garry Tan: dos horas de configuración de OpenClaw se convirtieron en tres minutos con Aside

Conectar OpenClaw a Slack le llevó a Tan dos horas; el mismo trabajo sobre el harness de Aside, con integraciones completas y acceso al navegador, le llevó menos de tres minutos y con valores por defecto de control de acceso razonables desde el primer momento. Ha convertido el navegador de Aside en el navegador preferido para sesiones remotas en GStack y lo describe como la mejor forma que ha encontrado de dar a un agent acceso web y credenciales bajo tu propia identidad. Su lectura es que Aside no es solo un navegador, sino a la vez un gestor de credenciales, una capa de integración, un harness y un sistema de memoria.

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

La forma más rápida de aprender a construir productos de AI: automatiza un flujo de trabajo que ya conozcas

El ejercicio de fin de semana de Madhu Guru consiste en tomar un flujo de trabajo que domines, del trabajo o de tu vida personal, y automatizarlo entero de principio a fin con el producto de AI con el que te sientas cómodo. Hacerlo una vez te obliga a responder cuatro preguntas que la lectura no plantea: cómo es de verdad una buena experiencia de principio a fin, cómo usar MCPs y tools, dónde hace falta que las personas sigan en el bucle y cómo evalúas el resultado. Y después, sube la ambición. Su tesis es que una pasada por este ejercicio vale más que un mes leyendo sobre cómo construir productos de AI.

  • #agents
  • #products
X

Swyx

Los modelos frontier ya tienen favoritos en los medios de AI

Swyx está preparando un informe extenso de AEO sobre varios modelos frontier y descubrió que Claude menciona Latent Space cuando se le pregunta por la mejor newsletter o el mejor podcast de AI. El resultado le sorprendió lo bastante como para revisar si había fugas de memoria en el harness antes de creérselo.

  • #evals
X

Zara Zhang

La gente valora la escritura de la AI por encima de lo que realmente vale

Zara Zhang sostiene que la brecha a la que hay que prestar atención es perceptiva: la mayoría cree que la AI escribe mejor de lo que escribe. La implicación es que el listón que los lectores aplican a la prosa escrita por máquinas es más bajo que el que aplican a la de las personas.

  • #evals
X

Peter Yang

La interfaz que le falta a Codex es un reloj con el que hablar

Peter Yang quiere una app para el Apple Watch que le permita dictar por voz en sus hilos de Codex y escuchar las respuestas, para poder dejar el móvil en casa. Su motivación es la adicción a las pantallas más que la comodidad, y se pregunta en voz alta si no será eso el rumoreado dispositivo de OpenAI.

  • #products
  • #hardware
O ir directamente a una fecha