No Priors
diffusion が勝つのは知能の絶対値ではなく推論の経済性
Stefano Ermon が賭けているのは、autoregressive なモデルには誰も工学的に取り除けない構造的な問題がある、という点だ。1 token ずつ生成する方式はメモリ帯域に縛られ、GPU とも相性が悪い。一方 diffusion は多数の token を同時に処理し、推論を訓練と同じ目で見る。「bitter lesson が教えているのは、最終的に勝つのはより並列な解法だということだ」。Inception の Mercury モデルは、ベンチマークではフロンティアラボの速度最適化ティアと肩を並べながら、実行速度は大幅に速い。音声エージェントの Open Call は Cerebras の専用シリコンをやめ、ふつうの NVIDIA GPU で同等の速度を得た。彼の見立てでは、現在のワークロードの 20〜30 パーセントはレイテンシに縛られている。さらにもう一つの利点も挙げる。diffusion は粗いところから細かいところへと refine していくため、完成物を待たずに途中の出力を採点し、方向づけできる。
- #hardware
- #open-source
- #products
