No Priors
GPU は逐次処理が苦手だから、inference では diffusion が autoregression に勝つ
autoregressive な生成は本質的に memory bound だ。9 番目より先に 10 番目の token は作れないので、時間の大半は重みを行き来させることに費やされ、実際の演算はほとんどしていない。diffusion モデルは多数の token を一度に処理するため、inference の負荷が training の負荷と似た形になる。それこそ GPU が本当に得意なものだ。Inception の Mercury モデルは Haiku、Flash、mini/nano クラスのモデルとベンチマークで肩を並べながら、はるかに速く動く。ある音声系の顧客は Cerebras のカスタムシリコンをやめて乗り換えた。ソフトウェア側の並列化だけで、普通の NVIDIA GPU でも同じ速度が出たからだ。「bitter lesson が教えているのは、より並列な解がいずれ勝つということだ」
- #research
- #hardware
- #products
