7 entradas7 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 3 min de lectura.

Las evals fueron el hilo conductor del día: dos builders distintos argumentaron que lo que las empresas pueden medir, y no lo que los modelos pueden hacer, es el verdadero techo de la adopción de la AI. El equipo de Codex de OpenAI hizo público cuáles son los bugs concretos detrás de las quejas por los rate limits y prometió un reseteo completo del consumo. Y una conversación con el CTO de Microsoft que volvió a circular sostiene que la brecha entre la capacidad de los modelos y el producto que llega al usuario ya es mayor que la brecha entre los propios modelos.

X

Thibault Sottiaux

OpenAI identifica tres bugs de Codex que quemaban rate limits y resetea todo el consumo de pago

Codex venía consumiendo cuota en silencio en tres puntos: las imágenes en sesiones largas con varias compactaciones, un p95 de consumo elevado en Computer History, y un generador de títulos de conversación que costaba más de lo previsto. Las correcciones salen mañana junto con un reseteo completo del consumo para todas las suscripciones de pago. Hay además un enfoque de eficiencia distinto y sin relación con esto que queda en cola para la semana que viene.

  • #products
  • #agents
Pódcast

AI & I by Every

Kevin Scott: el cuello de botella ahora es el capability overhang, no el escalado

El razonamiento de los modelos se ha adelantado a lo que los productos entregan de verdad, y cerrar esa brecha es el trabajo real de la industria en este momento. La solución pasa por una web agéntica con protocolos abiertos que hagan lo que HTTP y HTML hicieron por internet, siendo MCP y la NL web los primeros destellos creíbles, sumado a sistemas de identidad y de permisos para agents, de modo que un agent pueda pedir exactamente los permisos que la tarea necesita. Hay que esperar que el modelo de interacción pase del prompting síncrono a agents que se van, hacen muchas llamadas y vuelven bastante más tarde. Sobre la objeción del oficio frente al coding agéntico: "Si valoras el proceso más de lo que valoras el resultado, a veces tomarás decisiones distintas a las de quienes valoran el resultado más que el proceso".

  • #agents
  • #open-source
  • #products
X

Aaron Levie

Box CEO

El mercado real de las evals son los workflows de cada empresa, no los leaderboards de modelos

Las evals públicas de modelos solo te dicen qué forma tiene el progreso general y cómo se ordenan los modelos entre sí. El espacio mucho mayor son las evals sobre los workflows concretos que ejecutan las empresas, hasta las particularidades de una compañía individual. No puedes automatizar aquello sobre lo que no puedes medir progreso, y las empresas no van a desplegar a base de intuiciones.

  • #evals
  • #agents
X

Madhu Guru

Meta Sr Director, AI

Hill climbing sobre evals: elige la dimensión que importa y trabájala a fondo

La sexta entrega de una serie en curso sobre evals sostiene que el trabajo se reduce a mejores harnesses y a la selección de modelo mediante prompt engineering, context engineering, memoria, post training y código determinista de toda la vida. Tu taxonomía de modos de fallo te dice hacia dónde apuntar: si el tool calling es el fallo principal, probablemente metiste 20 tools en el context cuando la tarea necesitaba entre 3 y 5. Sobre el coste, lanza con el mejor modelo, sube la calidad, y luego haz hill climbing hacia esa misma calidad con algo más pequeño y barato una vez que sepas que a los usuarios les encanta.

  • #evals
  • #agents
X

Zara Zhang

La AI le da 10x a quien construye en solitario, y un 20% a esa misma persona dentro de una gran empresa

El apalancamiento que la AI concede a un individuo se evapora en buena medida dentro de una organización grande, donde esa misma persona con talento gana como mucho un 20 por ciento y a veces incluso retrocede. Esa asimetría explica por qué cada vez más gente valiosa está dejando las grandes empresas, con labs punteros como OpenAI y Anthropic como probables excepciones. Otra idea que conviene tener a mano: todos los que de verdad van por delante en AI creen que van por detrás.

  • #agents
  • #products
X

Peter Yang

Usa un coding agent para auditar qué apps siguen teniendo tus datos de Google

Abre tu página de conexiones de Google en Chrome, apunta Codex o Claude Code a esa pestaña abierta y deja que revoque las que ya no quieres. Hacerlo desconectó aproximadamente la mitad de las apps que aún tenían acceso. Por otro lado, el equipo de Instinct lanzó el borrado de datos externos tras la presión pública, así que por fin se pudieron eliminar 36 registros de Gmail desde la sección de Data Privacy.

  • #products
  • #policy
X

Nikunj Kothari

FPV Ventures Partner

Provocar a los inversores y luego mandarles los documentos del SAFE no es una estrategia de fundraising

Un DM en frío que no debería haber pasado el filtro acabó convertido en espectáculo público, y el mensaje dirigido a los fundadores jóvenes es directo: provocar a los inversores y después pedirles que te transfieran dinero no es como funciona invertir. Hacerle doxxing al remitente no era la respuesta, pero elegir de quién aceptas consejos sí es la parte que importa. Gente con talento y con sustancia real sigue quemándose en estos juegos.

  • #funding

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.