No Priors
推理階段 diffusion 贏過 autoregression,因為 GPU 最討厭序列
Autoregressive 生成本質上是 memory bound:第九個 token 沒出來,第十個就生不出來,於是大部分時間都花在搬運權重上,真正做的算術少得可憐。Diffusion 模型一次處理很多 token,推理時的負載形態和訓練時一樣,而那正是 GPU 真正擅長的事。Inception 的 Mercury 系列在 benchmark 上能和 Haiku、Flash 以及 mini/nano 這一檔的模型打平,速度卻快出一大截;有個做語音的客戶乾脆放棄了 Cerebras 的定製晶片改用它,因為靠軟體層面的並行,在普通 NVIDIA GPU 上就能跑出同樣的速度。「bitter lesson 告訴我們,更並行的那個方案,最終總會贏。」
- #research
- #hardware
- #products
