11 entradas11 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 5 min de lectura.

Los rate limits y los cache hits dominaron la conversación entre builders hoy: el equipo de Codex de OpenAI estuvo depurando en público por qué el consumo se agota más rápido de lo esperado. Anthropic lanzó un escáner de seguridad que caza vulnerabilidades en todo un repositorio y devuelve parches. Y el tema de fondo, más silencioso: evals, simulación y ratings como la verdadera infraestructura para juzgar sistemas que ya son demasiado buenos como para resumirlos en un solo número.

X

Thibault Sottiaux

OpenAI Codex & ChatGPT

Los rate limits de Codex se agotan más rápido porque empeoró la tasa de cache hits

Algunos usuarios de Codex quemaron su cuota más rápido esta semana, y la causa es una tasa de cache hits degradada, no un cambio de política. Acertar en la caché de forma consistente es parte central de la matemática de eficiencia, así que cuando eso se resbala, el consumo se dispara. La investigación sigue en curso y prometieron una actualización para el día siguiente. Por separado, el reset acumulado se desplegó antes de las 8pm PST para todos los usuarios de pago de ChatGPT Work y Codex.

  • #products
  • #agents
X

Claude

Claude Security escanea repos de GitHub con Mythos y devuelve parches sugeridos

Apúntalo a un repo y Mythos rastrea los datos a través de los archivos, razona sobre cómo interactúan los componentes y devuelve hallazgos etiquetados con categoría CWE más calificaciones de confianza y severidad. Las correcciones sugeridas se abren directamente en Claude Code en la web, usando los modelos que tu equipo ya tiene en marcha, y los escaneos se facturan como uso normal de tokens dentro de tu plan actual. El diseño mantiene al modelo detrás del escaneo: solo devuelve hallazgos, sin acceso directo. Junto a esto, un Defender Advantage Fund que destina 35 millones de dólares en créditos a la seguridad open source, integraciones de partners que llevan Mythos 5 a productos de seguridad de terceros, y un Cyber Verification Program en expansión.

  • #security
  • #products
X

Madhu Guru

Meta Sr Director, AI

Reducir una suite de evals a un solo score esconde regresiones en tu caso de uso más exigente

La tiranía del promedio: un modelo que sube de 85 a 89 en summarization y de 80 a 85 en QA factual mientras cae de 70 a 63 en análisis financiero complejo va a seguir pareciendo una mejora bajo un número único. Los scores ponderados no son la solución, porque envuelven una decisión de criterio en falsa precisión matemática. La alternativa es una escalera priorizada de evals, gente dispuesta a leer los detalles en lugar de exigir abstracción, y una decisión humana sobre si el sistema es genuinamente mejor para los usuarios. Esto pasó en los primeros días de Gemini y les sigue pasando a los equipos hoy.

  • #evals
X

Swyx

Simular humanos es la última barrera para la automejora recursiva

Si te tomas en serio la automejora recursiva, con modelos automatizando partes cada vez más grandes de la investigación en ML y de la ingeniería de AI, entonces simular humanos y su feedback es el cuello de botella que queda. Eso reencuadra a Smallville, que en su momento no tenía ninguna aplicación comercial, como la razón por la que Karpathy y Fei-Fei Li apoyaron al equipo detrás del proyecto. Simile ya está encontrando product-market fit en empresas Fortune 100 en una etapa muy temprana. La admisión es inusualmente directa: dos años tarde en entenderlo, y nunca más contento de haberse equivocado.

  • #agents
  • #research
X

Aaron Levie

Box CEO

A medida que la inteligencia se vuelve demasiado barata para medirla, la oportunidad se mueve a la difusión

Los modelos se abaratan tarea por tarea, se vuelven más capaces en general, más rápidos y más profundos en casi todos los dominios al mismo tiempo, a un ritmo sin precedentes en la historia de la tecnología. Una vez que la inteligencia se acerca a ser demasiado barata para medirla, el valor se desplaza hacia meter la AI en la economía real en lugar de hacia producir la inteligencia. Eso convierte a este momento en uno muy bueno para las empresas de AI aplicada, donde la competencia y la innovación aguas arriba funcionan como viento a favor en vez de como amenaza.

  • #products
  • #agents
X

Guillermo Rauch

Vercel CEO

Vercel corrió is-agentic en bucle contra su propia documentación hasta sacar 100/100

Ejecutar la evaluación is-agentic repetidamente contra su sitio de documentación cerró varias brechas reales, con trabajo deliberado para mantener los criterios lo bastante buenos como para justificar los tokens gastados en ello. Ahora también soportan suscripciones de Grok y Codex, instalables al instante en un sandbox. El equipo de Python además avanza rápido.

  • #evals
  • #products
X

Thariq

La skill interna ELI5 de Anthropic explica código con dibujos grandes y pocas palabras

El prompt es simple: explícamelo como si no supiera nada del tema, usando un artifact HTML con dibujos grandes y pocas palabras. Internamente se usa para explicaciones y para meterse a fondo en problemas, con prompts del tipo cómo funciona este módulo, por qué tomamos este tradeoff y qué causó este incidente. Ya se puede instalar desde el marketplace de plugins de la comunidad, y queda abierta la pregunta de si debería convertirse en un plugin oficial.

  • #agents
  • #open-source
X

Peter Yang

Instinct clava el onboarding pero indexa tu correo sin forma de borrarlo

Conectar iMessages, Google Workspace y MCPs es inusualmente fluido, y el asistente es más proactivo que sus pares: sugiere acciones apenas se conecta un MCP. El bloqueo está en el manejo de datos: indexa y retiene correos sin permiso y no ofrece ninguna forma de eliminarlos de sus registros, lo que lo vuelve no recomendable hasta que lo arreglen. La otra limitación es estructural, todo vive en un solo hilo, así que sirve para recados sueltos pero no para trabajo de verdad. ChatGPT Work y Codex siguen siendo los caballos de batalla reales.

  • #products
  • #privacy
Pódcast

No Priors

El ajedrez se hizo más popular después de que las computadoras ganaran a los humanos, no menos

Chess.com empezó como un dominio de 56.000 dólares comprado en una subasta de bancarrota de 2005 que prácticamente todos los inversores calificaron de no invertible, y hoy tiene 10 millones de usuarios activos diarios, 250 millones de miembros registrados y más de 200 millones de dólares en ingresos, sin haber levantado nunca capital para crecer. Que las máquinas cruzaran el umbral sobrehumano volvió el juego brevemente aburrido, cuando todos se dedicaban a moler finales aprobados por Stockfish, y después mucho más emocionante cuando redes neuronales como Leela empezaron a jugar un ajedrez agresivo y poco convencional que empujó hacia adelante el juego humano. Sobre la maestría no hay atajos en el proceso, solo en las herramientas: "si tomas un día cualquiera de tu vida y lo multiplicas por mil, así se ve más o menos tu vida". El consejo para fundadores es ignorar los consejos para fundadores, porque el manual de 2005 decía contrata a un cofundador técnico de Stanford, levanta dinero y persigue un mercado grande, y hacer exactamente lo contrario funcionó. Lo próximo es Gambit, un sitio de póker que lleva el manual del ajedrez, el de los ratings, a un juego que suele medirse en fichas: qué tan bueno eres de verdad, no cuántos M&Ms puedes volver a comprar.

  • #products
  • #founders
X

Nikunj Kothari

Claude Code hizo ingeniería inversa a un sitio de comedor escolar y lo convirtió en un feed para el bot de casa

Un jardín de infantes publicaba los menús diarios en un sitio web cualquiera, con datos sin estructurar. Claude Code encontró la API subyacente inspeccionando las peticiones de red, descubrió que no requería autenticación, dedujo el formato de la respuesta y la conectó a un bot de Hermes ya existente. Ahora el bot de casa anuncia el desayuno y el almuerzo cada mañana para que la familia prepare las cosas en consecuencia. La automatización personal a pequeña escala como esta sigue estando muy subvalorada.

  • #agents
  • #products

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.