No Priors
Diffusion ganará por la economía de la inferencia, no por inteligencia bruta
La apuesta de Stefano Ermon es que los modelos autoregresivos tienen un problema estructural que ninguna ingeniería puede quitar de en medio: generar un token cada vez está limitado por memoria y encaja mal en las GPU, mientras diffusion procesa muchos tokens a la vez y mira la inferencia igual que mira el entrenamiento. «La bitter lesson es que la solución más paralela es la que al final va a ganar.» Los modelos Mercury de Inception ya igualan en benchmarks a los tiers optimizados para velocidad de los laboratorios de frontera, y corren bastante más rápido; y Open Call, una empresa de voice agents, dejó el silicio propio de Cerebras para conseguir una velocidad comparable en GPU NVIDIA corrientes. Calcula que hoy entre el 20 y el 30 por ciento de las cargas de trabajo están limitadas por latencia, y señala una segunda ventaja: como diffusion refina de grueso a fino, puedes puntuar y dirigir una salida parcial en lugar de esperar al objeto terminado.
- #hardware
- #open-source
- #products
