No Priors
diffusion 会赢在推理经济学,不是赢在智力本身
Stefano Ermon 押的是:autoregressive 模型有一个谁也绕不过去的结构性问题,一次只生成一个 token,受制于内存带宽,跟 GPU 的特性也对不上;而 diffusion 一次处理很多个 token,对待推理的方式和对待训练是一样的。「bitter lesson 告诉我们,更并行的那个方案最终会赢。」Inception 的 Mercury 系列现在在 benchmark 上已经追平前沿实验室那些主打速度的档位,实际跑起来还要快出不少;做语音 agent 的 Open Call 把 Cerebras 的定制芯片换掉了,在普通 NVIDIA GPU 上拿到了差不多的速度。他估计今天有 20% 到 30% 的负载是被延迟卡住的,还点出第二个优势:diffusion 是由粗到细地打磨结果,所以你可以对一个还没完成的输出打分、给方向,不必等最终成品出来。
- #hardware
- #open-source
- #products
