Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 6 min de lectura.
Hoy el tono lo marcó la capacidad, no las capacidades del modelo: OpenAI pausó las nuevas suscripciones Pro de 200 dólares porque la demanda superó a sus servidores, mientras Vercel publicó cómo recuperó un 91% en p99 bajo la carga de despliegues agénticos. El otro hilo fue la disciplina, con Boris Cherny defendiendo que el código de producción escrito por Claude merece un listón más alto que el código humano, y Madhu Guru insistiendo en que las evals califican la trayectoria, no la respuesta. Y Richard Socher puso 650 millones de dólares detrás de la idea de que el camino más rápido para curar enfermedades pasa por una AI que primero mejore a la AI.
X
Thibault Sottiaux
OpenAI pausa las nuevas suscripciones Pro de 200 dólares porque la demanda de Astra supera su capacidad
Las nuevas altas en el plan Pro de 200 dólares quedan en pausa porque esos usuarios son los que más tensionan los sistemas, y pausarlas se presentó como el paso más pequeño que mantiene intacto el acceso más amplio. Las cuentas existentes, todos los demás planes y la API no se tocan, y se está añadiendo capacidad lo más rápido posible. Por separado, la infraestructura que corre por debajo de ChatGPT Work ya está expuesta como API para agents a escala bajo demanda, presentada como algo que puedes empezar a usar en menos de un minuto.
Notas de campo de Levie: las empresas arrancan a sus proveedores de AI en cuanto uno decepciona
Tras reunirse con un par de docenas de líderes tecnológicos de banca, medios, seguros y consultoría, el patrón más nítido fue una crudeza total con la arquitectura: las empresas han cambiado de sistema varias veces en el último año o dos, y nadie se queda esperando a que un proveedor lo haga bien. La mayoría corre varios modelos frontier porque estandarizar resultó demasiado difícil, aunque el dinero sigue concentrándose en unos pocos proveedores y los open weights siguen en pañales por falta de opciones frontier nacionales. La seguridad y la identidad de los agents dominan la ansiedad, y el ROI real solo aparece cuando las empresas rediseñan el propio workflow en lugar de montar agents encima del que ya tienen. Las evals apenas aparecieron, solo unos pocos de esas dos docenas de clientes las mencionaron, algo que él califica de oportunidad enorme y abierta. Box además se está asociando más a fondo con OpenAI para que el contenido empresarial se pueda trabajar de forma segura dentro de ChatGPT.
Hay que exigirle al código de producción de Claude un listón más alto que al humano, dice Cherny, de Claude Code
Los prototipos y el código desechable se pueden tratar como una caja negra total cuando el radio de daño es bajo, pero el código de producción escrito por Claude debería superar un listón más alto que el código escrito por humanos. En Anthropic eso significa reglas de lint, tests, tests end to end dirigidos por Claude, fuzzers con Claude corriendo a diario, revisiones de código automatizadas, revisiones de seguridad y refactorización automatizada; sin eso acabas con un desastre difícil de mantener. Cuando la salida no da la talla, sus arreglos son concretos: pasar a un modelo frontier, subir el effort a high o xhigh, e invertir en CLAUDE.md y en skills en vez de aceptar la deuda. También señaló el último informe de Threat Intelligence como aterrador e importante, apuntando que la capacidad es de doble uso, porque un modelo que programa bien puede hackear infraestructura crítica y uno que asiste en investigación biológica puede ayudar a diseñar una pandemia.
Richard Socher levantó 650 millones de dólares apostando a que la investigación en AI se automatiza a sí misma primero
Recursive arranca con AI para la AI: construir un sistema con el equivalente a 50.000 doctorados de capacidad investigadora antes de soltarlo sobre la física, la química y la biología. La razón de que el progreso científico se frenara es que un cuerpo de conocimiento se convirtió en un laberinto, 34.000 revistas que bien podrían llevar carteles de prohibido el paso, y ya nadie abarca suficientes subcampos como para recombinarlos. Su predicción es tajante: todo lo que puedas simular, la AI lo resolverá, y por eso las matemáticas y la programación caen primero mientras las ciencias naturales van por detrás hasta que podamos simular una célula. La alucinación queda reformulada como una virtud, ya que generar secuencias de proteínas fuera de la distribución de entrenamiento es exactamente el objetivo, y dice explícitamente que no cree en un despegue abrupto porque los ensayos clínicos siguen tardando los años que la física exige. La cuestión del empleo la reduce a elasticidad de la demanda: los ilustradores perdieron porque el mundo no necesita mil veces más ilustraciones, los programadores ganaron porque sí necesita mil veces más software. Su Eureka Machine se apoya en cuatro pilares, el conocimiento humano dentro de los LLM, la medición científica, la simulación y los laboratorios robóticos que recogen datos reales, con un enjambre de agents por encima, y cree que a los laboratorios autónomos les faltan dos o tres años para ser la inversión adecuada.
Vercel hizo su almacén global de metadatos del CDN un 91% más rápido en p99
Cada día aterrizan en Vercel unos 10 millones de despliegues, 2.350 millones hasta la fecha, todos coexistiendo y enrutables a la vez en el CDN. El almacén global de metadatos que sincroniza rollbacks, cambios de configuración y nuevas rutas en cientos de milisegundos a escala mundial acaba de volverse un 91% más rápido en p99, lo que además aceleró el pipeline de build a deploy. El trabajo se hizo con el sistema bajo una presión inmensa por el crecimiento de los despliegues agénticos, y el equipo de ingeniería del CDN publicó las tripas.
Califica la trayectoria del agent, no solo su respuesta
Dos ejecuciones de un agent pueden llegar a la misma respuesta mientras una busca en las fuentes correctas, recupera el documento correcto y hace cuatro llamadas limpias a herramientas, y la otra hace 17 llamadas, repite la misma búsqueda tres veces y se recupera de dos errores por el camino. Es obvio cuál es mejor, y una eval que solo mira el resultado no las distingue. La receta es definir el workflow completo, nombrar las tareas de cada paso, decidir si cada paso lleva su propia eval o una porción de una mayor, y fijar tareas tanto medianas como difíciles. Después, invertir el orden de lectura: primero estudiar los pasos, y los resultados finales en segundo lugar.
Masad: el riesgo real de la AI es la ciberseguridad, la extinción no lo es ni de lejos
Hay bastantes cosas de la AI que le preocupan, la ciberseguridad especialmente, pero el riesgo de extinción en el sentido literal de que muera el 100% de los humanos no entra en su lista para nada. Es una separación deliberada del marco apocalíptico habitual en su rincón de la industria, que distingue el daño concreto a corto plazo de los finales civilizatorios.
Gemini ya está disponible en Windows, lo que lleva el asistente de Google al escritorio, donde de verdad ocurre la mayor parte del trabajo empresarial, en vez de dejarlo en el navegador y el móvil.
Toda ronda seed caliente por tramos acaba, de algún modo, en una valoración de 300 millones
Ahora mismo hay tres cosas ciertas a la vez en el venture de etapa temprana: todo el mundo quiere levantar una seed de 50 millones de dólares, todo el mundo cree que llegará a 30 millones de ARR el año que viene, y toda seed caliente por tramos converge mágicamente en una valoración de unos 300 millones. El patrón se plantea como observación y no como queja, lo que hace que pegue más fuerte. Ese mismo día publicó además un post que pasó de nota de voz en el coche a publicado en una sola jornada, admitiendo que le falta su pulido habitual.
Dreambeans se vuelve gratis para todos los usuarios de EE. UU. y se conecta con Gemini
Dreambeans ya está disponible sin coste para todos los usuarios de EE. UU. mayores de 18 años en iOS y Android, sin necesidad de suscripción. Puedes conectarle la app de Gemini, de modo que Dreambeans se apoye en los matices y el conocimiento de tus chats para ofrecerte historias diarias más personalizadas.
Un prompt que hace que Claude te entreviste para su propia memoria
Pídele a Claude que te entreviste a fondo sobre las partes relevantes de tu vida que todavía no conoce, usando texto libre o la herramienta askuserquestion cuando encaje una opción múltiple, y que lo guarde todo en memoria. Convierte la construcción del contexto de algo que escribes a mano en algo que el modelo te saca a base de preguntas.
Duplicar lógica dejó de doler, las abstracciones siguen doliendo
La estructura de costes del código se ha dado la vuelta. Cuando un modelo te escribe el duplicado, repetir sale barato, pero una mala abstracción todavía tiene que ser entendida, mantenida y a la larga deshecha por una persona. Eso invierte una década de instinto DRY sobre cuándo conviene factorizar algo.
¿Cuánto PIB gastarías en una máquina que solo cura enfermedades?
Planteado como experimento mental con respuesta inmediata: si una máquina pudiera hacer exactamente una cosa, encontrar curas para nuestras enfermedades más acuciantes, la parte del PIB que valdría la pena dedicarle es altísima. El fondo del asunto es que esto ya no es hipotético, es el mundo en el que vivimos, lo que convierte el gasto en cómputo en una cuestión de salud pública y no en un capex tecnológico.
Los Build Days de Fable 5.1 recorren ciudades de todo el mundo hasta el 25 de septiembre
Los buildathons organizados por la comunidad empiezan esta semana y van del 11 al 25 de septiembre en ciudades de todo el mundo. Lleva un problema, una idea o nada en absoluto y mira qué acaba construyéndose.
Los normies viven todo el día en Google y Doordash, así que la AI sigue en pañales
El contraargumento al pesimismo sobre la adopción de la AI es que la gente corriente ya usa Google, Instagram, Zillow y Doordash sin parar, todos los días, sin pensarlo. Medido contra ese listón, el uso actual de AI no está ni cerca de la saturación. También acuñó el mejor eufemismo del día para una compra de salida a precio rebajado, llamándola una despedida a la italiana en lugar de una adquisición de private equity muy por debajo de la valoración máxima.
Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.
Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.