Training Data
Factory の Grinberg:モデル非依存の harness は、モデルと一緒に設計された harness に勝る
直感に反する主張であり、しかも狙いは OpenAI や Anthropic にいる友人たちにまっすぐ向けられている。モデルと harness を一緒に作ったからといって、その組み合わせが良くなるわけではない、というのだ。「モデルにとってのデータが、harness にとってのモデルだ」。harness をたくさんのモデルにさらすことで、特定のモデルの癖への overfitting を避けられる。実際 Factory では、新しい Opus や GPT のリリースが、Claude Code や Codex の中よりも Droid の中で TerminalBench のスコアが高かったという。さらに彼は、2年早すぎるというのは結局のところ間違っているのと同じだと言い、その裏付けとして、製品が開発者を満足させられていなかったために約200万ドルのエンタープライズ売上を返金した話を挙げる。オープンモデルは年初には顧客の token の1%未満だったが、いまでは二桁に達しており、中でも GLM 5.2 が際立っている。そして彼は、12〜24か月以内に token の90%が非同期になると見ている。
- #agents
- #open-source
- #evals
