Thibault Sottiaux
按 token 計價,根本沒法拿來橫向比較模型
兩個披薩,一個切 8 塊每塊 2 美元,一個切 16 塊每塊 1.25 美元:看著便宜的那塊,整個披薩算下來反而更貴。tokenizer 也是一個道理。在一次涵蓋英文、技術文字、多語種和數字內容的對比中,同樣的文字,GPT-5.6 Sol 的 tokenizer 用了 766 個 token,Claude Opus 5 估算下來是 1170 個,差了大約 34.5%。真正該看的指標是「每次成功產出花了多少錢」,這意味著 benchmark 只是起點,你自己的實際場景才是真正的考卷。
- #pricing
- #evals
