No Priors
推理阶段 diffusion 赢过 autoregression,因为 GPU 最讨厌串行
Autoregressive 生成本质上是 memory bound:第九个 token 没出来,第十个就生不出来,于是大部分时间都花在搬运权重上,真正做的算术少得可怜。Diffusion 模型一次处理很多 token,推理时的负载形态和训练时一样,而那正是 GPU 真正擅长的事。Inception 的 Mercury 系列在 benchmark 上能和 Haiku、Flash 以及 mini/nano 这一档的模型打平,速度却快出一大截;有个做语音的客户干脆放弃了 Cerebras 的定制芯片改用它,因为靠软件层面的并行,在普通 NVIDIA GPU 上就能跑出同样的速度。「bitter lesson 告诉我们,更并行的那个方案,最终总会赢。」
- #research
- #hardware
- #products
