Training Data
Levie:补贴的 token 撑不久,模型和工作流之间的落差才是生意
「LLM 套壳」这个嘲讽没经得起时间检验,因为企业里真正的活儿是把模型能力接到一个真实的工作流上,而这座桥比想象中宽得多。Box 对每个模型跑两套 eval:一套覆盖生命科学、金融服务和公共部门的复杂任务 eval,另一套是留出来的 holdback,看 Box 员工怎么用自己的数据。结果和编程 benchmark 基本一致,只有一个例外:Gemini 表现超出预期,大概赢在 tool use 上。token 补贴不可能一直烧下去,上市公司同样要服从资本主义那套规律,训练的钱最终得自己挣回来。有一个预测值得记下来:五年后,企业消耗的 token 里会有 90% 来自没人主动触发的任务,用户看到的只是一个等着他审阅的结果。说到扩散,编程之所以先赢,是因为它创造价值几乎全靠文本,而且每个工程师都自己 debug MCP 连接,不会去叫 IT;销售代表的速度上限则卡在客户回不回消息。知识工作里没有「把你的 GitHub 给我们」这种入口。
- #agents
- #evals
- #open-source
