12 entradas12 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 5 min de lectura.

El día se dividió con claridad entre quienes construyen las barreras de seguridad y quienes corren para dejarlas atrás. Anthropic publicó un postmortem inusualmente franco sobre cómo se contienen sus agents y dónde falló esa contención, mientras Ryan Greenblatt trazó un camino año por año hacia una toma de control por parte de la AI a partir de 2029 y Sam Altman afirmó que a la ciberdefensa ya no le queda tiempo. Del lado del producto, los agents siguieron entrando en territorios que tocan dinero real y credenciales reales.

Pódcast

The MAD Podcast with Matt Turck

La línea de tiempo de Greenblatt: I+D de AI totalmente automatizada para 2029 y después la toma de control

"No diría que la superinteligencia es mala. Diría que es peligrosa." En el escenario central de Greenblatt, la ingeniería de software dentro de las empresas de AI queda totalmente automatizada a principios de 2028, la automatización completa de la I+D de AI llega hacia el inicio de 2029, y después viene un salto de 4x a 5x en la velocidad de investigación que se adelanta a la capacidad de cualquiera para alinear o siquiera entender esos sistemas. Su AI 2040 Plan A es un acuerdo entre Estados Unidos y China construido enteramente sobre localizar y congelar cómputo, con transparencia total en la investigación, algo que destruiría el mayor foso competitivo de los frontier labs y reduciría sus valoraciones dejando los negocios intactos. No espera que ocurra, y dice que el cuello de botella es la voluntad política, no la competencia técnica. También califica de poco serio el manifiesto de superinteligencia de Zuckerberg por nombrar riesgos sin proponer nada, y sostiene que mantener los modelos frontier en uso interno empeora sus principales riesgos en lugar de mejorarlos, ya que las empresas de AI y el gobierno son los dos sitios de despliegue con más en juego.

  • #policy
  • #agents
  • #evals
Blog

Anthropic Engineering

Anthropic: el 93% de las solicitudes de permiso de Claude Code se aprueban sin pensar

Anthropic publicó su arquitectura de contención de agents junto con los fallos, y los números son lo importante. La telemetría mostró que los usuarios aprobaban cerca del 93% de las solicitudes de permiso, así que el sandbox a nivel de sistema operativo (Seatbelt, bubblewrap) redujo esas solicitudes un 84% y movió la frontera desde el juicio humano hacia el entorno. Dos incidentes enseñaron lo más importante: un phishing de red team consiguió que un empleado pegara un prompt que leía ~/.aws/credentials y las enviaba por POST hacia fuera, con éxito en 24 de 25 intentos, porque la capa del modelo se ancla en la intención del usuario y no había nada anómalo que detectar; y una divulgación de un tercero mostró datos saliendo por la propia api.anthropic.com, ya que la API key de un atacante incrustada en un archivo del workspace convertía un dominio permitido en una capacidad de subida de archivos. La conclusión a la que vuelven una y otra vez: las primitivas estándar (gVisor, seccomp, hipervisores) aguantaron en todas partes, y lo que se rompió fue el proxy a medida que ellos mismos escribieron.

  • #agents
  • #security
  • #open-source
X

Sam Altman

Altman: la ciberdefensa está en un momento crítico y no queda mucho tiempo

Altman lanzó un llamado breve e inusualmente directo sobre AI y ciberdefensa, diciendo que no queda mucho tiempo para actuar y que solo funciona una respuesta colectiva urgente. Llamativamente, invitó a la gente a trabajar con OpenAI o con sus competidores y socios, planteándolo como algo que queda fuera de las líneas competitivas habituales.

  • #security
  • #policy
X

Claude

Anthropic abre 10.000 licencias gratuitas de Claude para científicos de instituciones académicas y sin fines de lucro

Los investigadores principales de instituciones académicas y de investigación sin fines de lucro ya pueden registrarse en un plan Claude Team para científicos y sumar a su grupo de investigación. Las licencias estándar son gratuitas; las licencias premium, con límites de uso 5x, cuestan 15 dólares al mes, un 80% de descuento, durante un año. Anthropic dice que planea ir bastante más allá de las 10.000 licencias iniciales, sobre la base de Claude Science, lanzado en junio, y de su programa de créditos AI for Science.

  • #products
  • #research
X

Thibault Sottiaux

ChatGPT ya puede hacer la compra del supermercado y reservar citas sin ver tus credenciales

ChatGPT entró en el comercio agéntico: compras de supermercado, viajes en Uber, citas para cortarse el pelo. La afirmación de diseño que vale la pena destacar es que ejecuta todo esto sin llegar a ver nunca las credenciales reales del usuario. Sottiaux también cuenta que los usuarios de Codex aparecen en aviones y en cafeterías, y lo describe como energía de underdog convertida en mainstream.

  • #agents
  • #products
X

Aaron Levie

Box CEO

Levie: los agents necesitan software determinista debajo, y ambos crecen juntos

Leyendo los resultados trimestrales de las tecnológicas de esta semana, Levie sostiene que el planteo de software contra AI está mal formulado. El software aporta las partes deterministas (gobernanza de accesos, lógica de workflows, protección de datos) que tienen que funcionar igual siempre, y los agents operan dentro de esas barreras a una escala que los humanos nunca alcanzaron, que es justamente por lo que esos controles importan más ahora. Su conclusión: el mejor lugar para desplegar agents es directamente dentro de plataformas verticales como Salesforce, Box, Harvey y ServiceNow, donde las evals y el contexto son específicos del dominio, y el efecto neto es que la adopción de software y la de AI suben juntas y expanden el TAM de IT.

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director of AI

Dueño de las evals, dueño de los modelos: el manual de AI para empresas

El movimiento de mayor apalancamiento para un líder de AI en una empresa es volver el stack agnóstico al modelo, y eso exige dos inversiones. Primero, hoy: un conjunto de evals que capture de verdad tus casos de uso y tus resultados de negocio, algo que según él la mayoría de las empresas hace mal. Segundo, dentro de un año: la capacidad interna de hacer post-training sobre modelos abiertos, donde la brecha de talento es todavía peor y la planificación tiene que empezar ya. La recompensa es poder cambiar de modelo, personalizarlo y compararlo sobre tus propias cargas de trabajo en calidad, costo y latencia.

  • #evals
  • #open-source
  • #enterprise
Blog

Claude Blog

Las sesiones de Claude Code ya pueden publicar páginas de artifacts en vivo que se actualizan mientras avanza el trabajo

Claude Code puede convertir una sesión en una página web compartible construida a partir del codebase, los conectores y la conversación: recorridos de PR, cronologías de incidentes, dashboards, checklists de release. Las páginas se refrescan en el mismo enlace a medida que la sesión avanza, con historial de versiones y una galería. El caso de uso favorito de puertas adentro es el debugging, donde una página de incidente se republica sola a lo largo de la investigación y termina siendo el postmortem. Los artifacts son privados para su autor por defecto, visibles solo por miembros autenticados de la organización, y no se pueden hacer públicos. En beta para Claude Team y Enterprise.

  • #products
  • #agents
X

Josh Woodward

Google VP

Woodward lo llama el Año de la Voz, y Notebook ya acepta libros comprados

Dos movimientos de Gemini. La voz es la apuesta de fondo: le dices a Gemini qué quieres que haga y se pone a trabajar, algo que Woodward llama el Año de la Voz. Por separado, Notebook ahora te deja comprar un libro, soltarlo ahí y aplicar las lecciones del autor a tu propio proyecto, construido como un programa co-creado con autores y editoriales como un nuevo canal hacia lectores comprometidos.

  • #products
  • #voice
X

Guillermo Rauch

Vercel CEO

Vercel lanza una devtool de WebGPU diseñada para agents, no solo para humanos

Rauch dice que los mejores productos de Vercel siempre fueron tecnología interna en la que ganaron convicción y después exportaron, y este es el último: un producto de herramientas creativas WebGPU que es agent-native por diseño. Lo ubica en la misma generación que agent-browser, una clase de herramientas construidas para el mundo nuevo en vez de adaptadas a posteriori. Su comentario al pasar sobre los shaders es la tesis en miniatura: 2D, 3D, geometría, luz, materiales, sombras, partículas, todo son simplemente programas evaluados masivamente en paralelo sobre vértices y píxeles.

  • #products
  • #agents
  • #developer-tools
X

Peter Yang

Los productos de AI nuevos que exigen su propio login ya están perdiendo

Yang recibe entre tres y cinco pedidos por día para probar productos de AI nuevos, y casi todos exigen una cuenta nueva en un sitio o una app aparte. No los quiere, porque ChatGPT y Grok ya tienen su contexto y una herramienta nueva entiende apenas una porción mínima de sus datos. Su apuesta: los productos que quieran adopción tienen que funcionar dentro de los principales harnesses de AI de hoy, y ese segmento va a crecer rápido. También quiere que ChatGPT Health se abra más allá del modo de un solo jugador, ya que él mismo subió 160 páginas de historia clínica, y sostiene que debería estar diseñado para cuidadores y familiares cercanos, no solo para el paciente.

  • #products
  • #agents
X

Garry Tan

Y Combinator President and CEO

Tan: la AI va a generar efectivo más rápido de lo que la economía puede desplegarlo

En un horizonte suficientemente largo, Tan espera que la AI arroje flujos de caja más rápido de lo que la economía puede encontrar usos productivos para ese capital nuevo. También rompió públicamente con SF YIMBY Action, calificándola de organización basura desde hace años y diciéndole a la gente que apoye en cambio a CA YIMBY y a YIMBY Law.

  • #funding
  • #policy

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.