Training Data
Chai Discovery、抗体設計のヒット率を0.1%から約15%へ
同社が始めた当時、最先端の抗体設計が結合させられるのは1000分子に1つ程度でした。ほとんどのターゲットではヒットがゼロになり、結果から drug-like な性質を読み取ることなど到底できない水準です。Chai-2 は約15%に届きます。1000個をスクリーニングすれば150個ほど返ってくるので、ようやく出力から本物の統計が読めるようになりました。アプローチは LLM の仕事からそのまま持ち込んだものです。24個目のサブモジュールを足すのを拒み、scaling law が見つかる程度にアーキテクチャをシンプルに保ち、抗体もミニタンパク質もそれ以外もすべて同じモデルへの違う prompt として扱う。彼らの逆張りの主張は、生物学はコードよりも検証可能だ、というものです。結合性も製造可能性も客観的な読み出しがある一方、コードの良し悪しにはそれがないからです。そこで求められる規律は身も蓋もありません。「生物学では、人はいくらでも自分を騙せる」
- #research
- #evals
- #startups
