No Priors
La difusión le gana a la autorregresión en inferencia porque las GPU odian el trabajo secuencial
La generación autorregresiva está limitada de raíz por la memoria: no puedes producir el décimo token antes del noveno, así que te pasas la mayor parte del tiempo moviendo pesos de un lado a otro y haciendo muy poca aritmética. Los modelos de difusión procesan muchos tokens a la vez, lo que hace que su carga de trabajo en inferencia se parezca a la de entrenamiento, que es justo aquello en lo que las GPU son buenas de verdad. Los modelos Mercury de Inception igualan a Haiku, Flash y a los de clase mini/nano en los benchmarks, y además corren bastante más rápido; un cliente de voz dejó el silicio a medida de Cerebras por ellos porque el paralelismo por software alcanzó la misma velocidad en GPU NVIDIA corrientes. "La lección amarga es que la solución más paralela es la que al final va a ganar."
- #research
- #hardware
- #products
