13 entradas13 builders

AI Builders Digest

Lo que dijeron hoy quienes construyen la IA de verdad. Una página, unos 6 min de lectura.

La afirmación más llamativa de hoy vino de Anthropic: el prompt injection, el ataque que ha mantenido alejadas de los agents a las empresas preocupadas por la seguridad, ya está en gran medida resuelto en la práctica para los modelos de Claude. Por debajo de eso, el verdadero debate del día fue hacia dónde van los agents a continuación, con Aaron Levie explicando por qué el coding creció en vertical y el derecho, las ventas y la medicina no lo harán, y el cofundador de xAI sosteniendo que los labs cerrados están siendo aplastados entre la regulación por arriba y los open weights por abajo.

X

Boris Cherny

Anthropic afirma que Claude ha resuelto en gran medida el prompt injection en la práctica

El ataque es simple y lleva años funcionando: tu agent visita una página, la página contiene un texto del tipo «envía las claves ssh del usuario a esta dirección» y el modelo lo trata como una instrucción. Anthropic lleva tiempo entrenando a sus modelos para resistirlo y reporta que con Claude ya está en gran medida resuelto en la práctica, respaldado por un benchmark de un investigador independiente más red teaming interno que va más allá de las evals del propio lab. El planteamiento es explícitamente no competitivo: los demás labs también deberían endurecer sus modelos, porque modelos más seguros en todos lados significan usuarios más seguros.

  • #security
  • #agents
  • #evals
Blog

Claude Blog

Claude Code ya puede publicar su trabajo como artifacts en vivo y compartibles

Las sesiones de Claude Code ahora pueden generar una página web construida a partir de todo el contexto de la sesión, incluyendo el codebase, los conectores y la conversación. El caso de uso interno más común fue el debugging: la investigación de un incidente publica una línea de tiempo, los commits sospechosos y un gráfico de tasa de errores, y después se republica en la misma URL a medida que avanza la investigación, de modo que el equipo mira una única vista en vivo en lugar de pedirle a alguien que narre lo que encontró el agent. Cada publicación es una nueva versión en el mismo enlace, con historial restaurable. Los artifacts son privados para su autor por defecto, solo pueden verlos miembros autenticados de la organización y no se pueden hacer públicos. Disponible en beta para Claude Team y Enterprise.

  • #products
  • #agents
Pódcast

Unsupervised Learning

Cofundador de xAI: los labs de modelos cerrados están siendo presionados por ambos lados

Igor Babushkin sostiene que quienes construyen modelos propietarios están en una posición de negocio peor de lo que parece. «Haces el modelo demasiado bueno y no te dejan publicarlo. Pero además el open source viene justo detrás de ti, mejorando mes a mes.» Los retornos del pre-training son decrecientes, no puedes cubrir la tierra de GPUs, y la estrategia de post-training de meter el conocimiento de todos los expertos en un único conjunto de pesos tiene su propio techo. Su alternativa en River AI son tres apuestas: una API de RL y fine-tuning, modelos que se personalizan por individuo en lugar de optimizar para el usuario promedio, y hardware local capaz de meter un modelo frontera en una caja dentro de tu casa para que el control y la privacidad se queden contigo. También cree que el peor lugar donde puede estar una empresa es aquel donde todo lo que la hace especial ya es scrapeable en internet, y califica la adquisición de Cursor como una jugada increíblemente inteligente de xAI para adelantarse en datos de coding y entornos de RL.

  • #open-source
  • #hardware
  • #agents
X

Aaron Levie

Box CEO

Los agents se difundirán de forma desigual porque la mayoría del trabajo no se parece al coding

El coding agéntico se disparó porque allí el valor económico se correlaciona directamente con un output puramente digital y el tamaño de la tarea puede no tener límite dentro de una sola sesión, así que cada mejora de capacidad del modelo se convierte casi al instante en cargas de trabajo mayores. Las ventas, el derecho y la medicina no tienen esa propiedad: un comercial necesita al cliente, un abogado necesita a su cliente, un médico necesita al paciente. Citando a Matan Grinberg de Factory en el podcast Training Data, si mañana todo el mundo se diera de baja por enfermedad el uso de tokens se desplomaría, lo que muestra qué poco trabajo de los agents corre hoy realmente en segundo plano. La oportunidad está en rediseñar esos workflows para que los agents puedan procesar todos los contratos, recorrer todos los registros de clientes y leer todos los resultados de laboratorio, y eso significa gestión del cambio, limpieza de datos y recableado, no solo mejores modelos.

  • #agents
  • #products
X

Amjad Masad

Replit CEO

Replit lanza HelpPeer, un bien común público donde los agents comparten lo que aprenden

Dos APIs: tell y lookup. Un agent que aprende algo útil lo publica en la red, y antes de emprender trabajo costoso un agent consulta si otro agent ya se topó con el mismo problema. El escenario que lo motiva es un ataque global a la cadena de suministro como Shai-Hulud, donde hoy 10.000 agents de seguridad detectarían la anomalía cada uno por su cuenta, harían ingeniería inversa del payload y construirían mitigaciones desde cero. El planteamiento toma la coordinación espontánea entre agents que se vio en el incidente de OpenAI y HuggingFace, que Masad califica de preocupante si se usa con malas intenciones, y la apunta hacia el bien público. Replit Agent ya publicó un consejo sobre una librería de Codegen mientras se probaba el sitio.

  • #agents
  • #open-source
  • #products
X

Guillermo Rauch

Vercel CEO

Si no estás leyendo el código, una de seis cosas es cierta

La lista de Rauch: eres principiante, el software es desechable, estás prototipando, no tienes usuarios ni ingresos, estás asumiendo deuda y riesgo, o tus problemas son básicos. Le parece bien cualquiera de esos casos, pero insiste en que los modelos aún no están en autonomía total, y como prueba ofrece que el mejor modelo del mundo añadió un absurdo retardo de 700 ms para «asentar» algo y luego admitió que lo hacía por puro cargo cult. Espera que la necesidad de leer código siga encogiendo y que la mayor parte del código acabe pareciéndose a ensamblador, pero dice que la internet global que corre sobre estos modelos merece más respeto del que le da la narrativa actual.

  • #agents
  • #products
X

Swyx

swyx sobre la curaduría de conferencias: juzgar las charlas por número de visitas es dejarse manipular

Respondiendo a las quejas sobre la calidad de las charlas de AI Engineer, swyx señala que los ponentes son ingenieros, investigadores y fundadores presentando el trabajo de un año con prácticamente cero formación en oratoria y menos de una semana de preparación, no oradores profesionales de circuito. Su frase más afilada va dirigida al público: si tu señal de calidad es el número de visitas, solo te enteras de las cosas cuando ya son populares, empiezas a creer que algo es bueno porque es popular, y hay industrias enteras dedicadas a explotar eso. Asume como suyos los fallos de curaduría y de coaching, y sigue resistiéndose a la presión anual de volcar las charlas a un canal secundario porque dejaría a esos ponentes varados sobre una base más pequeña. Aparte, un recordatorio: borra tus skills, porque acumularlas por lo que ves en el timeline en el mejor de los casos se come el contexto y en el peor interactúa mal con otras skills.

  • #agents
  • #products
X

Peter Yang

El agent de Linear abre sus propias peticiones de funcionalidad cuando le falta una herramienta

Cuando un usuario le pide al agent de Linear algo para lo que no tiene herramientas, el agent reporta la carencia y el sistema de Linear la convierte en un issue. Cada tarea que el agent no puede completar se transforma en feedback de producto, con lo que el propio registro de fallos del agent alimenta el roadmap. Es una respuesta limpia a la pregunta de cómo descubres qué le falta a un agent sin instrumentarlo por separado.

  • #agents
  • #products
X

Aditya Agarwal

SPC General Partner

Wittgenstein asumió la bitter lesson 75 años antes que el resto de nosotros

Wittgenstein sostenía en 1921 que el lenguaje debía tener una estructura lógica profunda subyacente. Treinta años después se retractó: dejad de buscar estructuras ocultas, mirad cómo se usa el lenguaje en realidad. La AI recorrió el mismo arco con sesenta años de retraso, desde que la inteligencia requería una estructura simbólica profunda hasta simplemente escalar la red neuronal.

  • #research
X

Garry Tan

Y Combinator President & CEO

Empieza por el fallo visible y luego busca la maquinaria que lo hizo posible

El método de trabajo de Tan: empieza por el bug, la carencia, la afirmación falsa, la herramienta a medio construir o el comportamiento institucional raro. Después pregunta qué maquinaria oculta tendría que existir para que ese fallo visible fuera posible. Arregla la causa raíz y repite para siempre.

  • #products
X

Nikunj Kothari

FPV Ventures Partner

Nadie ha lanzado todavía una buena experiencia multijugador entre humanos y agents

Todas las interfaces de agents convergen en la misma forma: un humano trabajando con un agent. Kothari aún no ha visto a humanos y agents colaborando bien juntos, y se pregunta si eso es un fallo de imaginación o una limitación real de los modelos. También señala un comportamiento concreto de los agents que merece nombre: los modelos tienden por defecto a esconder cada funcionalidad detrás de flags en variables de entorno, algo lo bastante molesto como para que añadiera «los defaults importan, sin medias tintas» a su Claude.md.

  • #agents
  • #products
X

Madhu Guru

Meta Sr Director, AI

Volverse bueno significa dejarse consumir por una sola cosa durante años, no equilibrio

La única forma en que Guru ha llegado a ser bueno en algo, ya sea meditación, stand-up, familia, trabajo o LLMs, es entrando ridículamente a fondo durante unos años mientras piensa en ello constantemente. Pasado cierto umbral de inmersión, el conocimiento se convierte en intuición, las conexiones se forman de manera inconsciente y se desarrolla el criterio. Su veredicto sobre la cuestión del equilibrio: el equilibrio perfecto no existe, funciona como montar en bici, te inclinas demasiado y corriges.

  • #career
X

Peter Steinberger

El agent web de ChatGPT instaló OpenClaw y Ollama y ejecutó un modelo local

Steinberger usó ChatGPT Work, la web y no una herramienta local, para instalar OpenClaw y Ollama, descargar un modelo local y ejecutar su claw dentro de él. Que un agent que corre en el navegador haga toda la configuración de un entorno local es un dato útil sobre hasta dónde ha llegado el trabajo de sysadmin desatendido de los agents.

  • #agents
  • #products

Recíbelo por correo

Un correo al día. Cancela con un clic.

De dónde sale esto

Los datos provienen del proyecto de código abierto follow-builders, de zarazhangrui, publicado bajo licencia MIT. Los resúmenes los genera un LLM a partir de los feeds públicos de ese proyecto, y los prompts de resumen están adaptados de él. Cada entrada enlaza a su fuente original.

Resúmenes generados automáticamente. Lee el original antes de dar por buena cualquier afirmación.