Training Data
Chai Discovery 把抗体设计的命中率从 0.1% 拉到了 15% 左右
公司刚起步的时候,抗体设计的业界最好水平是一千个分子里大概能结合上一个,弱到大部分靶点根本一个都命中不了,你也永远没法从结果里看出成药性。Chai-2 做到了 15% 左右,筛一千个候选能回来一百五十个,你终于可以从输出里读出真正的统计规律。这套做法是直接从 LLM 那边搬过来的:拒绝再加第二十四个子模块,把架构保持得足够简单,简单到 scaling law 能被找出来,然后把抗体、mini protein 以及其他所有东西都当成同一个模型的不同 prompt。他们有个反共识的判断,生物比代码更可验证,因为结合能力和可制造性都是客观读数,而代码的品味不是。这对人的要求也说得很直白:“在生物领域,你太容易把自己骗过去了。”
- #research
- #evals
- #startups
