Training Data
Levie:補貼的 token 撐不久,模型和工作流之間的落差才是生意
「LLM 套殼」這個嘲諷沒經得起時間檢驗,因為企業裡真正的活兒是把模型能力接到一個真實的工作流上,而這座橋比想象中寬得多。Box 對每個模型跑兩套 eval:一套覆蓋生命科學、金融服務和公共部門的複雜任務 eval,另一套是留出來的 holdback,看 Box 員工怎麼用自己的資料。結果和程式設計 benchmark 基本一致,只有一個例外:Gemini 表現超出預期,大概贏在 tool use 上。token 補貼不可能一直燒下去,上市公司同樣要服從資本主義那套規律,訓練的錢最終得自己掙回來。有一個預測值得記下來:五年後,企業消耗的 token 裡會有 90% 來自沒人主動觸發的任務,使用者看到的只是一個等著他審閱的結果。說到擴散,程式設計之所以先贏,是因為它創造價值幾乎全靠文字,而且每個工程師都自己 debug MCP 連線,不會去叫 IT;銷售代表的速度上限則卡在客戶回不回訊息。知識工作裡沒有「把你的 GitHub 給我們」這種入口。
- #agents
- #evals
- #open-source
