Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 5 min de lectura.
OpenAI hizo que el ChatGPT gratuito sea prácticamente ilimitado para texto, mientras que Anthropic tuvo su propio día de lanzamientos: salvaguardas de biología más flexibles para Fable 5 y la llegada de Claude al framework Foundation Models de Apple. Las ideas más afiladas del día, eso sí, giraron en torno a los agentes. Basis liberó como código abierto su enfoque para evaluar el proceso de los agentes, y Aaron Levie argumentó que trabajar con un agente se parece más a gestionar a una persona que a consultar un chatbot.
X
Thibault Sottiaux
OpenAI hace ilimitados los chats de texto del ChatGPT gratuito, impulsados por GPT-5.6 Luna
OpenAI eliminó el límite de las conversaciones de texto en el ChatGPT gratuito, que ahora funcionan con GPT-5.6 Luna. Sottiaux también describió el nuevo listón para Codex con GPT-5.6 Sol: le hablas cinco minutos de algo que parece semanas de trabajo, te levantas a asaltar la nevera y acariciar al perro, y al volver te lo encuentras terminado.
La versión de Altman del anuncio del día: GPT-5.6 Sol ahora es mucho mejor en chat, y los usuarios gratuitos tienen conversaciones de texto ilimitadas. Llama la atención que OpenAI esté promocionando su modelo de frontera por la calidad de la conversación, no solo por la programación.
Anthropic recorta un 85% los fallbacks de biología en Fable 5 y amplía las preguntas de salud
Anthropic actualizó las salvaguardas de biología de Claude Fable 5 para reducir los falsos positivos, recortando en torno a un 85% los fallbacks relacionados con biología en las pruebas, de modo que el modelo pueda atender un rango mucho más amplio de preguntas cotidianas de salud y educación. El terreno de doble uso, como la virología, la toxicología y el diseño molecular, sigue derivándose a Opus 5, con la promesa de vías de acceso confiable para investigadores profesionales y el desarrollo de fármacos.
Claude llega al framework Foundation Models de Apple con un nuevo paquete de Swift
Un nuevo paquete de Swift permite a los desarrolladores de Apple llamar a Claude a través del framework Foundation Models de Apple: el modelo en el dispositivo se encarga del trabajo local rápido, como resúmenes y extracción, y luego le pasa el relevo a Claude para razonamiento de varios pasos, generación de código, búsqueda web o análisis de datos. Como el framework devuelve valores tipados de Swift a partir de anotaciones @Generable, Claude recibe entradas estructuradas y limpias en lugar de texto crudo del usuario. Se lanza mañana en iOS, iPadOS, macOS, visionOS y watchOS 27.
Basis libera los behavior specs: evaluar a los agentes por el proceso, no solo por los resultados
Aprobar los evals no significa que tu agente generalice: "Aunque aciertes cien de cien veces, si una persona solo acierta porque va a Wikipedia, la firma contable no la contrataría, así que tampoco debería contratarnos a nosotros". Basis, cuyos agentes contables trabajan de forma autónoma durante horas o días en tareas como declaraciones de impuestos completas, evalúa a sus agentes tanto por el proceso como por los resultados usando behavior specs: archivos markdown sencillos que establecen cómo debe comportarse un agente, verificados por un juez que es a su vez un agente, y que ahora se publican como estándar abierto junto con Braintrust. El marco más amplio de Troyanovsky es que el contexto son datos de entrenamiento en tiempo de ejecución, y cree que la mayoría de quienes construyen agentes tratan su código como algo más valioso que su contexto cuando es justo al revés, porque solo el contexto afecta al rendimiento.
Levie: darle un prompt a un agente es escribir un spec, y el flujo de trabajo en sí tiene que cambiar
Citando un post que recomienda, Levie sostiene que "darle un prompt a un agente se parece más a escribir un spec que a hacer una pregunta", y que el verdadero potencial llega cuando las empresas cambian el flujo de trabajo de fondo en lugar de encajar un agente sobre los procesos existentes. Predice que la gran mayoría del consumo de tokens en las empresas serán agentes desplegados para ejecutar tareas dentro de flujos de trabajo, no chat. También leyó el gran trimestre de Atlassian como evidencia de que los agentes que generan 100 veces más código hacen que los sistemas de registro sean más importantes, no menos, porque las empresas siguen necesitando gobernanza, seguridad y acceso seguro a los datos.
Masad: el no code está muerto porque la respuesta siempre fue resolver el código en sí
Airtable marca el principio y el fin del auge del no code, según lo cuenta Masad: discutió sin parar con inversionistas que la UI nunca iba a permitirte construir software arbitrario, y que hacer el software accesible pasaba por resolver el código en sí, algo que sonaba delirante hasta ahora. También compartió algo de historia: en 2021 y 2022 propuso a Google, Meta y a todo el mundo en el valle entrenar modelos específicos de código con Replit, nadie pensó que importara frente al NLP, así que Replit entrenó su propio Replit-code-3b antes de que la industria comprara la tesis del código.
Rauch: el estándar Plugin hace universalmente extensibles a los agentes de programación con IA
La tesis de Rauch: las herramientas de desarrollo deben ser de código abierto y universalmente extensibles, y los agentes de programación con IA son las herramientas de desarrollo más importantes en la historia de la industria. El estándar Plugin permite que cualquiera los extienda de manera uniforme, así que construir un solo plugin te da distribución en toda la marea de creación de software que viene de CLIs, IDEs, agentes en la nube y asistentes personales.
Yang: la IA de consumo es de ChatGPT y Google, y solo ellos pueden perderla
La IA de consumo es un mercado que solo ChatGPT y Google pueden perder: ambos rondan los mil millones de usuarios, y las verdaderas barreras son que los usuarios comunes no confían en darle a la IA acceso total a sus apps y datos, y que no se dan cuenta de lo que ya puede hacer, lo que vuelve el marketing y el mensaje tan importantes como el producto. Su afirmación más contundente es que tener el mejor modelo apenas le importa a la gente normal; a sus amigos ajenos a la IA les da exactamente igual Sol o Fable mientras el precio sea justo y el trabajo salga bien de forma confiable.
Madhu Guru: grábate explicando la idea en voz alta y entrega eso como el documento
La gente es mucho más clara cuando explica una idea nueva hablando que cuando escribe un documento sobre ella; en algún punto entre la boca y la página, la idea central queda enterrada bajo contexto y pulido. Su solución para sus equipos: grábate explicando la idea exactamente como se la contarías a un amigo, usa IA para una limpieza básica manteniendo la estructura y el flujo originales en bruto, y comparte eso como el documento.
Kothari: consejos para levantar capital que ningún VC te dirá, empezando por el piso del 10%
Un volcado de la mecánica de levantar capital que los fundadores rara vez escuchan: consigue intros cálidas con GPs de verdad, idealmente de fundadores a los que ya hayan respaldado, ten claro que ningún fondo líder establecido bajará del 10% de dilución, y nunca ancles tu valuación a lo que levantó un competidor, lo que él llama la mejor forma de hundir un trato. Tampoco mientas sobre term sheets, porque verificar uno está a un mensaje de distancia en un mercado donde todos hablan y todos los decks se filtran. Dice que este es el mercado más de consenso que ha visto en mucho tiempo, así que los fundadores fuera de los sectores de moda deberían llegar armados con su tesis contraria y un plan para ser default alive.
Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.
Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.