国産新薬開発AI「K-フォールド」の基盤モデルが誕生
国内研究陣が開発した新薬開発人工知能(AI)基盤モデル「K-フォールド」が、誰もが自由に利用できるオープンソースライセンス(Apache 2.0)で公開された。新薬候補物質の探索まで数年と膨大な費用を要する創薬プロセスをAIで短縮できるという点で注目に値する。開発を主導したキム・ウヨン・ヒッツ代表(KAIST化学科教授、元韓国製薬バイオ協会AI新薬開発支援センター長)は、研究者30名とともにモデルを構築し、韓国製薬バイオ協会記者団との会見で開発の意義と技術的な差別化ポイントを説明した。
キム代表は開発の動機について「海外のビッグテックが独占している技術力を国内の独自技術にできればという思いだった」と述べた。独自技術が生まれれば、誰もが利用できるサプライチェーンが形成され、それを高度化しながら競争できるという説明だ。彼は「バイオ分野においてK-フォールドは始発点だ」と語った。
K-フォールドの核心的な技術的差別化ポイントは、アルファフォールド1からロゼッタフォールドなどが用いてきたマルチプルシークエンスアライメント(MSA)を使用しない方式を採用したことだ。MSAは全体予測に26~27分かかる場合、そのうち約25分を占めるほど時間がかかるプロセスであり、これを省けば速度が向上する。K-フォールドはMSAを使わずに同等の性能を達成することを目標に掲げた。
2番目の目標は、構造そのものではなく構造の変化を予測することだった。薬物がタンパク質に結合すると構造が変わり機能が変化するため、実際の新薬開発で合わせるべき課題は構造変化だという判断に基づくものだ。K-フォールドは、タンパク質A・B・Cがそれぞれ離れている場合と結合した場合の構造を2段階で予測し、結合前後の変化を同時に捉える。その結果、コフォールディングモデルのベンチマークにおいて、既存モデルと同等かそれ以上の性能を示した。
抗体分野やプロテアーゼ系、キナーゼ予測、FDA承認薬のメカニズムの3分の1を占めるGPCRなどにおいて高い予測精度を示した。GPCRはどの薬物が結合するかによって構造の変わり方が異なるが、K-フォールドがこれを的確に予測したとキム代表は説明した。
キム代表は「始めた時から、アルファフォールド バージョン3.1を作るのではなく、私たちのアルファフォールド4を作ろうということだった」「DeepMindがアルファフォールド4を作ったならこうではなかったかと思えるほど差をつけることが目標だった」と語った。こうした趣旨から、K-フォールドはアルファフォールド3以降に登場した海外モデルとは一線を画す。アルファフォールド3は論文のみ公開されコードは公開されていないため、開発者たちが推測しながら再現しなければならず、同一の性能を達成することは難しいという。
公開方式にも差別化ポイントがある。一部のAIはソースコードを公開したとされるが、実際には学習済みのコードのみが公開されているケースが多い。学習済みコードでは新たに学習することが難しく、公開データも多くの加工を必要とするという指摘だ。キム代表は「今回、学習用のコードをすべて公開したのはそうした理由からだ」「公開されたデータはK-フォールドに内在化されており、学習用コードもあるため、次の段階に進むことができる」と述べた。
彼はこれをカメラに例えた。アルファフォールドはカメラの位置だけを教えたものであり、学習済みコードのみを公開したモデルはカメラを見せたものの、作り方を真似させないものだという説明だ。K-フォールドは、より優れたカメラを完全に新しく設計して作り上げたケースだという比喩だった。
