Thibault Sottiaux
按 token 计价,根本没法拿来横向比较模型
两个披萨,一个切 8 块每块 2 美元,一个切 16 块每块 1.25 美元:看着便宜的那块,整个披萨算下来反而更贵。tokenizer 也是一个道理。在一次涵盖英文、技术文本、多语种和数字内容的对比中,同样的文本,GPT-5.6 Sol 的 tokenizer 用了 766 个 token,Claude Opus 5 估算下来是 1170 个,差了大约 34.5%。真正该看的指标是「每次成功产出花了多少钱」,这意味着 benchmark 只是起点,你自己的实际场景才是真正的考卷。
- #pricing
- #evals
