16 entradas15 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 6 min de lectura.

La capacidad barata fue la historia del día: los nuevos lanzamientos de DeepSeek y Grok volvieron a bajar el precio de un modelo lo bastante bueno, y las voces más fuertes fueron las de quienes lo leen como algo que expande la demanda en lugar de destruir márgenes. Anthropic dedicó el día a la fontanería y a rendir cuentas, con un postmortem detallado sobre por qué Claude Code se sintió peor durante un mes, mientras lanzaba sandboxes autoalojados y una arquitectura de agentes desacoplada. Debajo de ambos hilos está la misma afirmación, planteada de forma más directa en el lado de los podcasts: los modelos ya van por delante de los productos construidos sobre ellos.

Blog

Anthropic Engineering

Anthropic atribuye la caída de calidad de Claude Code a tres cambios independientes

Tres cambios sin relación entre sí se apilaron en lo que parecía una degradación general: el esfuerzo de razonamiento por defecto bajó de alto a medio el 4 de marzo, una optimización de caché lanzada el 26 de marzo borraba el razonamiento previo de Claude en cada turno en lugar de una sola vez, y una línea del system prompt del 16 de abril que limitaba las respuestas a 100 palabras costó calidad real de código. La API nunca se vio afectada, y los tres quedaron resueltos el 20 de abril en la v2.1.116. Una ablación mostró una caída del 3% en las evals solo por la instrucción de brevedad, y el bug que borraba el razonamiento provocó los fallos de caché detrás de los reportes de límites de uso que se agotaban más rápido de lo esperado. Se están reiniciando los límites de uso para todos los suscriptores, y los futuros cambios del system prompt pasan ahora por suites de evals por modelo, periodos de soak y despliegues graduales.

  • #products
  • #evals
X

Aaron Levie

Box CEO

Los modelos más baratos de DeepSeek y Grok subirán la demanda empresarial, no la bajarán

Los lanzamientos del mismo día de DeepSeek y Grok trajeron grandes saltos de capacidad a un costo muy bajo, y el efecto sobre la demanda empresarial va en dirección contraria a lo que sugiere la caída de precios. Las empresas ya tienen muchos más casos de uso para agentes que presupuesto: escanear bases de código en busca de problemas de seguridad, revisar todos sus documentos, procesar información en buena parte de sus flujos de trabajo. Cada baja de costo o subida de capacidad desbloquea otro nivel de esos casos. También eleva el valor de estar en la capa aplicada, porque más opciones de modelos, sobre todo modelos afinados para distintos tipos o costos de trabajo, significa más que enrutar y optimizar en cada tarea.

  • #agents
  • #products
X

Claude

Las sesiones de Claude ahora te siguen de Chrome al escritorio, la web y el móvil

Las sesiones de Claude in Chrome ahora se trasladan a escritorio, web y móvil, con las conversaciones guardadas y las skills y los conectores funcionando dentro del navegador. El panel lateral ejecuta la misma sesión de Claude Cowork que el resto de las apps, así que las sesiones viven con tu cuenta y no en un dispositivo concreto. Disponible hoy en Max y Team, y llegará a Pro en las próximas semanas. Anthropic también advirtió que los agentes de navegador pueden ser engañados con instrucciones ocultas en una página, y publicó hábitos que conviene adoptar además de sus propias defensas.

  • #products
  • #agents
Blog

Claude Blog

Los Managed Agents ya pueden ejecutar herramientas dentro de tu propio perímetro

Claude Managed Agents puede ejecutar herramientas en un sandbox que tú controlas, ya sea en tu propia infraestructura o a través de Cloudflare, Daytona, Modal o Vercel. El bucle del agente, encargado de la orquestación, la gestión de contexto y la recuperación ante errores, se queda en la infraestructura de Anthropic, mientras que la ejecución de código, los archivos sensibles y los servicios permanecen dentro de tus límites, con el dimensionamiento de recursos y la imagen de runtime definidos de tu lado. Los túneles MCP, en research preview, alcanzan servidores MCP privados mediante una única conexión saliente desde un gateway ligero, y convierten bases de datos internas y sistemas de tickets en herramientas invocables sin reglas de firewall entrantes ni endpoints públicos. Los sandboxes autoalojados están en beta pública, con Amplitude, Clay y Rogo mencionados como primeras implementaciones del patrón.

  • #agents
  • #products
Blog

Anthropic Engineering

Separar el cerebro del agente de sus manos recortó un 60% el p50 de tiempo hasta el primer token

Managed Agents empezó con la sesión, el harness y el sandbox en un solo contenedor, lo que convertía a ese contenedor en una mascota: si moría, la sesión moría con él, y depurar significaba entrar por shell a una máquina que además guardaba datos de usuario. La solución fue virtualizar cada pieza, de modo que el harness llama al sandbox igual que llama a cualquier otra herramienta, y un harness caído reinicia con wake(sessionId), recupera el log de eventos duradero y retoma desde el último evento. Los contenedores ahora se aprovisionan solo cuando una sesión realmente necesita uno, lo que redujo el p50 de tiempo hasta el primer token alrededor de un 60% y el p95 más de un 90%. La ganancia de seguridad es estructural: las credenciales viven en un vault o se conectan al git remote local durante la inicialización, así que los tokens nunca son alcanzables desde el sandbox donde corre el código generado por Claude.

  • #agents
X

Josh Woodward

Google VP

Gemini suma una nueva tanda de integraciones, de OpenTable a Ticketmaster

Hoy empieza a desplegarse otro lote de integraciones en la app de Gemini: Angi, Fever, GetYourGuide, Granola, iHeartRadio, Localiza, OpenTable, Otter, Pandora, Thumbtack, Ticketmaster, Wix, Zocdoc y Zoho. El abanico, que cubre reservas, entradas, notas, medios y servicios locales, apunta a Gemini como el lugar donde las tareas se completan y no solo se responden. Google está reclutando abiertamente a la siguiente ronda de socios.

  • #products
  • #agents
Pódcast

AI & I by Every

El razonamiento de los modelos va por delante de los productos construidos sobre ellos

La brecha entre lo que los modelos pueden hacer y lo que llega a los usuarios es hoy el trabajo real de la industria, un excedente de capacidad que sacó a las leyes de escalado de la lista de temas que vale la pena discutir este año. Hacer útiles a los agentes exige un ecosistema con forma de internet, donde MCP cumple el papel de HTTP y NL Web el de HTML, más identidades de agentes y sistemas de permisos para que un agente pueda pedir acceso exactamente a los sistemas que una tarea requiere. 'Quiero que todos nuestros sistemas internos hablen un protocolo estándar con todos los agentes que estamos escribiendo dentro de Microsoft', que es la forma de evitar exportar tu organigrama a todos los demás. El siguiente cambio es el paso del prompting síncrono a la delegación asíncrona, donde un agente se va, hace muchas llamadas, itera durante un buen rato y vuelve más tarde con hasta dónde llegó.

  • #agents
X

Madhu Guru

Meta Sr Director, AI

El alfa de los próximos años en IA está en la capa de aplicación

Los modelos seguirán siendo más baratos, mejores y más locales, así que la diferenciación se desplaza hacia quien entienda un flujo de trabajo concreto con suficiente profundidad y tenga la imaginación para rediseñar la experiencia a su alrededor. El grupo de gente capaz de construir productos de IA está a punto de volverse enorme, y justo por eso estar en el 0,1% superior de builders importa más, no menos. Aparte, un lamento: años de Zoom y Meet le quitaron a los equipos el instinto de ir a la pizarra, junto con esos dibujos a medio hacer y esas interrupciones que antes daban forma a las ideas.

  • #products
X

Garry Tan

Y Combinator President & CEO

GBrain v0.45.6.0 suma 17 skills y ya funciona en Codex y Claude Code

GBrain publicó la v0.45.6.0 con 17 nuevas brain skills, endurecidas con un agente personal de OpenClaw corriendo sobre cientos de miles de archivos markdown, y ahora funciona con Codex y Claude Code. La guía de uso importa tanto como el lanzamiento: ejecútalo como un agente aparte, no dentro de tu agente principal de código. Piénsalo como una versión personal de ChatGPT o Claude que mantiene su propio repositorio git para memoria y skills personalizadas. La dirección del viaje, en sus palabras: de aquí en adelante vamos a hacer markdown skill-maxxing.

  • #agents
  • #products
X

Guillermo Rauch

Vercel CEO

Vercel Sandbox ya viene con un toolchain por defecto que puedes personalizar

Sandbox ahora incluye un conjunto razonable de herramientas preinstaladas, totalmente personalizable, y npx sandbox@latest sh te deja dentro directamente. La afirmación que vale la pena poner a prueba: se siente más rápido que tu propia máquina. Seedance 2.5 también está disponible en el AI Gateway de Vercel.

  • #products
X

Peter Yang

El argumento de que la voz será la capa de orquestación de los agentes en la nube

Un nuevo ensayo sostiene que la forma en que usamos las computadoras está a punto de cambiar de manera permanente, pasando del trabajo manual con teclado, ratón y laptop a dirigir agentes en la nube con la voz. Lo sostienen tres afirmaciones: la voz se convierte en la capa de orquestación, las computadoras personales se mudan a la nube, y la confianza termina siendo el diferenciador clave entre los sistemas que hacen el trabajo.

  • #agents
X

Aditya Agarwal

SPC General Partner

La primera apuesta de SPC fuera de Estados Unidos es India

SPC India fue el primer movimiento de la firma fuera de Estados Unidos, apoyado en la idea de que algunos de los proyectos más ambiciosos de la década se construirán allí. El encuadre es estructural más que oportunista: el dinamismo indio llegó para quedarse.

  • #funding
X

Peter Steinberger

La superficie de los agentes pasó de la CLI a las apps y a los servicios en cerca de un año

Una línea de tiempo comprimida de dónde han aterrizado los productos de agentes: la CLI fue hace un año, las apps quizá hace seis meses, y ahora son servicios, web y sesiones en la nube. Cada superficie llegó más rápido que la anterior.

  • #agents
X

Swyx

Un paper recién compartido es calificado como uno de los más importantes del año

El paper ya es uno de los más importantes del año, con la salvedad de que su metodología no está explicada con claridad, así que viene acompañado de un conjunto de notas y una destilación adicional en lugar de un enlace a secas. Además, un recordatorio programado: Perplexity ofreció comprar Chrome hace hoy justo un año.

  • #research
X

Matt Turck

FirstMark Capital VC

Graph engineering es el nuevo loop engineering, que es el nuevo prompt engineering

Graph engineering es el nuevo loop engineering, que es el nuevo harness engineering, que es el nuevo context engineering, que es el nuevo prompt engineering. Espero que esto aclare cualquier confusión. El chiste funciona porque cada una de esas etiquetas pareció por un momento una disciplina, hasta que llegó el siguiente cambio de nombre.

  • #agents

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.