No Priors
diffusion 會贏在推理經濟學,不是贏在智力本身
Stefano Ermon 押的是:autoregressive 模型有一個誰也繞不過去的結構性問題,一次只生成一個 token,受制於記憶體頻寬,跟 GPU 的特性也對不上;而 diffusion 一次處理很多個 token,對待推理的方式和對待訓練是一樣的。「bitter lesson 告訴我們,更並行的那個方案最終會贏。」Inception 的 Mercury 系列現在在 benchmark 上已經追平前沿實驗室那些主打速度的檔位,實際跑起來還要快出不少;做語音 agent 的 Open Call 把 Cerebras 的定製晶片換掉了,在普通 NVIDIA GPU 上拿到了差不多的速度。他估計今天有 20% 到 30% 的負載是被延遲卡住的,還點出第二個優勢:diffusion 是由粗到細地打磨結果,所以你可以對一個還沒完成的輸出打分、給方向,不必等最終成品出來。
- #hardware
- #open-source
- #products
