10 entradas10 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 4 min de lectura.

Dos laboratorios de frontera bajaron precios el mismo día: GPT-6 Sol y Luna llegaron con un recorte permanente del 50% en la API, y Opus 5.5 pasó a ser el modelo por defecto en los productos de Claude, con límites de uso que rinden un 25% más. Después, las nuevas evaluaciones de Next.js de Vercel dejaron a Opus 5.5, GPT-6 Sol y Fable 5.1 empatados al 97%. La lectura más útil vino de Box, que midió qué compran realmente los tokens más baratos: las mismas tareas, más precisión y una fracción del gasto.

X

Thibault Sottiaux

GPT-6 Sol y Luna llegan con un recorte permanente del 50% en el precio de la API

GPT-6 Sol y Luna ya están disponibles, y OpenAI reduce a la mitad los precios de la API de forma permanente, no como promoción de lanzamiento, lo que abre ambos modelos a un tipo de casos de uso que no soportaban el coste por token anterior. La mejora se describe como generalizada, y donde primero se nota es en la escritura y en la sensación general de uso. Las cuentas Plus, Pro y Business reciben además un reinicio del uso acumulado. El planteamiento es eficiencia financiada por capacidad: solo puedes abaratar todo lo que está por debajo de la frontera si tienes modelos increíbles en la cima.

  • #products
  • #pricing
X

Cat Wu

Opus 5.5 pasa a ser el modelo por defecto en Claude Code y en la app de Claude

Opus 5.5 ya es el modelo por defecto para Pro, Max y Team en Claude Code, la app de Claude y Cowork. El nivel de esfuerzo por defecto es medium, descrito como comparable a Fable 5.1 en inteligencia pero más rápido, y los límites de uso rinden un 25% más que con Opus 5. La invitación a los usuarios es que le den una tarea ambiciosa en lugar de una pequeña.

  • #products
  • #agents
X

Aaron Levie

Box CEO

Box midió que Opus 5.5 usa un 63% menos de tokens que Opus 5

Box probó Opus 5.5 en trabajo de conocimiento empresarial complejo y observó un 63% menos de tokens, un 42% menos de verbosidad y un 30% menos de tiempo de finalización que con Opus 5, además de mejoras de precisión del 39% en due diligence financiera y del 65% en análisis de costes de cloud. En una tarea de diagnóstico clínico, el modelo detectó que las desviaciones estándar de dos grupos diferían en más de 100 veces, rehizo la comparación correctamente y descubrió que la diferencia en la estación seca en realidad no se sostenía. Levie interpreta los recortes de precio simultáneos de ambos laboratorios como la paradoja de Jevons aplicada a los agents: el coste por tarea en AI cae más rápido que en ninguna tecnología anterior, y cada bajada desbloquea otro nivel de despliegue, desde escanear todo tu código en busca de problemas de seguridad hasta leer cada línea de los logs.

  • #pricing
  • #agents
  • #enterprise
X

Guillermo Rauch

Vercel CEO

Las evaluaciones de Next.js de Vercel terminan en un triple empate al 97%

Las nuevas evaluaciones de Next.js sitúan a Opus 5.5, GPT-6 Sol y Fable 5.1 al 97%, con Grok 4.7 justo detrás con un 94% y entre 2 y 7 veces más barato que los líderes. La tesis de fondo es que la generación barata cambia lo que es el software: ¿te gustaba Google Reader? Genera y despliega el tuyo, y consérvalo para siempre. Rauch sostiene además que por fin ha llegado el momento del headless en la web, ya que cualquier página puede adoptar ahora la forma caprichosa que quieras y no queda excusa para no empujar la frontera del diseño.

  • #evals
  • #pricing
X

Boris Cherny

16 PRs de correcciones de condiciones de carrera al apuntar Opus 5.5 a Lean

Verificar formalmente el Claude Agent SDK en Lean llevó un par de prompts breves y produjo 16 PRs que corrigen bugs y condiciones de carrera, escritos por alguien que no domina Lean. TLA+ también funciona, y combinar ambos resulta útil para problemas de flujo de datos, concurrencia y gestión de estado que un revisor humano probablemente nunca detectaría. Por separado, Opus 5.5 y Fable 5.1 portaron cada uno HAProxy de C a Rust y ambos pasaron casi todos los tests de HAProxy, pero Opus 5.5 terminó en 9,5 horas frente a 12 y con un 51% menos de coste. La pregunta abierta: ¿acabará la búsqueda de bugs convertida en verificación formal?

  • #coding
  • #research
X

Alex Albert

Un solo prompt reconstruye la Market Street de 1906 en Blender a partir de fuentes de archivo

El mejor modelado 3D y la mejor visión de Opus 5.5 hacen que un único prompt pueda producir un mundo entero: Market Street en San Francisco la tarde anterior al terremoto de 1906, desde el Ferry Building hasta la Quinta, incluyendo el Palace Hotel, el Call Building y la Lotta's Fountain. El prompt prohíbe mallas, texturas y HDRIs descargados, y exige generadores reutilizables para fachadas victorianas, tejados de mansarda, tranvías de cable y farolas de gas, ensamblados a partir de un archivo de fuentes construido con los mapas de seguros contra incendios de Sanborn, el metraje que los hermanos Miles rodaron aquel abril y archivos fotográficos de la época, con cada dato acompañado de su fuente y un nivel de confianza.

  • #coding
  • #products
X

Peter Steinberger

Un fallo de ChatGPT en macOS 27 se remonta a un bug de libuv de hace 14 años

ChatGPT empezó a fallar de forma intermitente tras la actualización a macOS 27, y Astra rastreó la causa hasta un bug que lleva unos 14 años en libuv. La actualización del sistema operativo es lo que lo sacó a la luz; el defecto en sí es anterior a la mayor parte del código que depende de él.

  • #open-source
  • #agents
X

Nikunj Kothari

FPV Ventures partner

Da por hecho que una cifra de ronda llamativa es en buena parte dinero de SPVs

El volumen de SPVs que están organizando incluso los mejores inversores es lo bastante grande como para que, cuando leas la cifra de una ronda en un titular, puedas asumir razonablemente que buena parte vino de SPVs, diga lo que diga el anuncio. Súmale valoraciones por tramos y cifras de ingresos que no significan lo que parecen, y la conclusión es tajante: deja de creerte los titulares. La prueba está en los hechos, y los hechos no se ven públicamente en ninguna parte.

  • #funding
X

Aditya Agarwal

SPC General Partner

El verdadero logro de Waymo es la infraestructura de evaluación, no la conducción

El debate de hoy sobre seguridad y alineamiento gira en torno a los modelos, pero la discusión original sobre seguridad en machine learning fueron los vehículos autónomos, y ese campo tuvo que zanjarla con evidencia. Lo más llamativo de tener a Dmitri Dolgov en SPC fue la enorme infraestructura de evaluación y testing que Waymo construyó para ganarse la confianza necesaria para soltar robots de 2 toneladas circulando a 30 mph por las ciudades. El primer viaje en un Waymo sigue sintiéndose como una experiencia religiosa: tecnología que de verdad funciona en carreteras reales. El vídeo completo llegará pronto.

  • #evals
  • #hardware
X

Thariq

Los modelos mejores deberían comprar prototipos, no 10 veces más features en producción

La respuesta equivocada a un salto de capacidad es empujar diez veces más funcionalidades a producción. La correcta es gastar ese excedente en entender a tus usuarios, hacer experimentos, construir prototipos y aprender sobre cosas que no entiendes, para que lo que lanzas funcione de verdad. Aplicado a los juegos y a la generación 3D: es estupendo para imaginar tu juego hasta hacerlo existir, pero primero sigues teniendo que encontrar un bucle de juego satisfactorio.

  • #products
  • #agents

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.