Training Data
Chai Discovery 把抗體設計的命中率從 0.1% 拉到了 15% 左右
公司剛起步的時候,抗體設計的業界最好水平是一千個分子裡大概能結合上一個,弱到大部分靶點根本一個都命中不了,你也永遠沒法從結果裡看出成藥性。Chai-2 做到了 15% 左右,篩一千個候選能回來一百五十個,你終於可以從輸出裡讀出真正的統計規律。這套做法是直接從 LLM 那邊搬過來的:拒絕再加第二十四個子模組,把架構保持得足夠簡單,簡單到 scaling law 能被找出來,然後把抗體、mini protein 以及其他所有東西都當成同一個模型的不同 prompt。他們有個反共識的判斷,生物比程式碼更可驗證,因為結合能力和可製造性都是客觀讀數,而程式碼的品味不是。這對人的要求也說得很直白:“在生物領域,你太容易把自己騙過去了。”
- #research
- #evals
- #startups
