Training Data
Factory 的 Grinberg:与模型解耦的 harness,比跟模型一起设计出来的更强
这个反直觉的观点直接冲着 OpenAI 和 Anthropic 的朋友们去:把模型和 harness 放在一起做,并不会让两者配合得更好。「数据之于模型,就相当于模型之于 harness。」让一套 harness 见过足够多的模型,它才不会过拟合到某一个模型的脾气上。Factory 就发现,新版 Opus 和 GPT 在 Droid 里跑 TerminalBench 的分数,比在 Claude Code 或 Codex 里还要高。他还说,早了两年其实就等于做错了,并用一段亲身经历来佐证:因为产品没能让开发者满意,他们退掉了将近 200 万美元的企业收入。开源模型在他们客户的 token 用量里,年初还不到 1%,现在已经是两位数,其中 GLM 5.2 表现最突出。他预计 12 到 24 个月内,90% 的 token 都会是异步产生的。
- #agents
- #open-source
- #evals
