Training Data
Grinberg, de Factory: un harness agnóstico al modelo le gana a uno codiseñado junto con un modelo
La afirmación contraintuitiva, dirigida directamente a sus amigos en OpenAI y Anthropic: construir el modelo y el harness a la vez no hace que funcionen mejor juntos. "Lo que los datos son para un modelo, los modelos lo son para un harness." Exponer un harness a muchos modelos evita que haga overfitting a las manías de uno solo, y en Factory vieron que los nuevos lanzamientos de Opus y GPT puntuaban mejor en TerminalBench dentro de Droid que en Claude Code o Codex. También dice que adelantarse dos años es simplemente equivocarse, y lo respalda con la historia de cuando devolvieron casi 2 millones de dólares de ingresos enterprise porque el producto no estaba haciendo felices a los desarrolladores. Los modelos abiertos pasaron de menos del 1% de los tokens de sus clientes a principios de año a cifras de dos dígitos hoy, con GLM 5.2 como el gran destacado, y él espera que el 90% de los tokens sean asíncronos dentro de 12 a 24 meses.
- #agents
- #open-source
- #evals
