이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
생물학의 어려운 문제를 풀어야 신약 개발이 10배, 100배 빨라진다 (푸시미트 콜리)
미래의 프런티어 모델이 알파폴드 2의 활성값을 읽고 작동 이론을 내놓을 수 있다 (푸시미트 콜리)
콜리는 단백질이 실제로 갖는 바닥 상태와 구조의 분포, 맥락에 따라 바뀌는 움직임을 들었습니다. 딥마인드의 2021년 논문에서도 인간 단백질 잔기 가운데 확신할 만한 예측은 58%였습니다.
바이오허브가 4월 시작한 공개 데이터 사업으로, 10월 7일 DOE와 NIH, 구글 딥마인드, 아이소모픽 랩스, 메타가 합류해 약정이 18억 달러가 됐습니다. 세포가 유전자나 약물에 어떻게 반응하는지 예측하는 모델을 학습시킬 데이터를 만듭니다.
알파폴드가 예측한 구조의 잔기마다 붙이는 0~100 신뢰도 점수입니다. 딥마인드는 50 미만의 긴 구간을 구조로 읽지 말고 무질서 영역의 예측으로 보라고 권했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
32분짜리 이 패널은 브랜던 앤더슨(Brandon Anderson)이 진행한 모델링 세션입니다. Latent Space는 녹화 날짜를 밝히지 않았지만, 칸디도는 '오늘 여기서 이야기하는' 계획을, 콜리는 '오늘 발표된 노력'을 언급했습니다. 바이오허브와 미국 에너지부(DOE), 국립보건원(NIH)이 구글 딥마인드 등과 함께 가상 생물학 이니셔티브(VBI) 확대를 발표한 날은 10월 7일(미국 시각)입니다.
@biohubX 게시물 · 원문 보기
발표문에 나온 약정을 더하면 18억 달러입니다. DOE가 제네시스 미션을 통해 5년 동안 5억 달러 넘게 측정과 모델링, 연산에 쓰고, NIH는 5억 달러 넘는 기존 연방 투자로 만든 데이터셋과 저장소를 모으며, 바이오허브가 이를 AI 학습용으로 표준화합니다. 바이오허브는 4월 VBI를 시작하며 약정한 5억 달러(새 측정 기술 4억 달러, 외부 연구 1억 달러)를 대고, 구글 딥마인드와 아이소모픽 랩스, 메타가 합쳐 3억 달러를 넣습니다. 목표는 세포가 유전자나 약물 같은 개입에 어떻게 반응하는지 예측하는 모델, 이른바 가상 세포를 학습시킬 공개 데이터입니다. NIH가 내는 5억 달러는 이미 집행한 예산의 결과물을 내놓는 현물입니다.
앤더슨의 첫 질문은 리치 서튼의 「쓴 교훈」을 데이터에도 적용할 수 있느냐였습니다. 서튼은 2019년 3월 글에서 70년 AI 연구의 가장 큰 교훈으로, 연산을 활용하는 일반적인 방법이 큰 차이로 가장 효과적이라는 점을 들었습니다.
칸디도는 스케일링 법칙이 어디에나 있는 것은 아니며, 일의 대부분은 그 법칙이 성립하는 조건을 찾는 것이라고 답했습니다. 연산과 데이터를 더 넣으면 결과가 좋아지는 상황을 찾으면 그때부터는 손잡이를 돌리는 공학 문제가 된다는 설명입니다.
저는 게을러서 있는 데이터로 일합니다.— 샐 칸디도, 바이오허브 (Latent Space)
그가 든 예는 메타게놈 서열(흙이나 바닷물 같은 환경 시료에서 미생물 유전체를 통째로 읽은 서열)입니다. 품질이 높지 않고 상당수는 온전한 단백질도 아니지만, 단백질 언어 모델을 여기에 학습시키면 실제로 작동하는 단백질을 설계하는 성능이 올라갔다고 했습니다. 다만 만들기 쉬운 데이터만 늘리는 쪽으로 흐르는 것은 경계했고, VBI가 문제를 푸는 데 필요한 데이터가 무엇인지부터 묻는 점을 반겼습니다.
콜리는 서튼이 딥마인드에 있을 때 직접 들은 강연을 떠올리며 교훈을 다르게 읽었습니다. 모델러냐 데이터 생산자냐를 종교처럼 정해 두고 문제에 다가가는 태도가 실패를 부르고, 문제가 먼저라는 겁니다. 서튼의 원문에도 연구자들이 한쪽 접근에 심리적으로 매여 다른 쪽에 시간을 쓰지 못한다는 대목이 있습니다.
콜리가 든 사례가 알파폴드입니다. 딥마인드에는 PDB를 열 배쯤 늘릴 전문성도 자원도 없었고, 그래서 세계 과학자들이 쌓아 온 데이터 위에서 모델링에 힘을 쏟았다는 설명입니다. 2020년 11월 딥마인드 블로그에 따르면 알파폴드 2는 PDB 구조 약 17만 개와 구조가 알려지지 않은 서열 데이터로 학습했고, TPUv3 16개(GPU 100~200개 수준)로 몇 주가 걸렸습니다. 같은 방식을 세포 유전체학에 적용해 보니 가상 세포를 만들 데이터는 아직 없다는 결론이 나왔다고도 했습니다.
앤더슨이 알파폴드 2를 공들여 깎은 작품이라고 부르자, 콜리는 아미노산 잔기가 다른 잔기의 영향을 받는다는 생화학 지식을 모델 구조에 넣어 불공정한 이점을 준 덕분에 데이터를 덜 쓰고도 배울 수 있었다고 설명했습니다. 같은 데이터를 복제해 늘려 봐야 소용이 없고, 필요한 범위를 덮는 좋은 데이터를 고르는 일 자체가 기술이라고도 했습니다. 칸디도는 데이터가 적을 때는 이런 귀납 편향(모델 구조에 미리 넣은 가정)이 도움이 되지만, 데이터가 많아지면 정확하지 않은 가정이 발목을 잡는 때가 온다고 덧붙였습니다. 트랜스포머 이후의 세계에 들어선 것은 전혀 아니고, 지금은 트랜스포머를 목적에 맞게 고쳐 쓰는 단계라고 했습니다.
알파폴드 2가 처음 나온 2020년 11월 30일, 딥마인드 블로그의 제목은 '50년 묵은 생물학 난제의 해법'이었습니다. 단백질 구조 예측 대회 CASP14에서 전체 목표의 중앙값 92.4 GDT(정답 위치 가까이 놓인 아미노산 잔기의 비율에 가까운 0~100 점수)를 냈고, CASP 공동창립자 존 몰트는 90 안팎이면 실험으로 얻은 결과와 견줄 만하다고 봤습니다. 2024년 노벨 화학상 발표문도 데미스 허사비스와 존 점퍼가 50년 묵은 문제를 풀었다고 적었습니다.
앤더슨이 뉴스는 구조 예측이 풀렸다고 하지만 현장의 연구자들은 할 일이 많다고 말한다며 다음 도약을 묻자, 콜리는 자신도 즐겨 쓰는 표현부터 문제 삼았습니다.
단백질은 블록이 아니고 블록처럼 움직이지도 않습니다. 저도 단백질이 구성 블록이라는 말을 늘 하지만, 실제로 그렇게 믿지는 않습니다.— 푸시미트 콜리, 구글 딥마인드 (Latent Space)
단백질은 무질서하고 맥락에 따라 모양이 바뀌며, 존 점퍼와 자주 나눈 이야기처럼 단백질이 실제로 갖는 바닥 상태와 구조의 분포를 우리는 모른다는 겁니다. 콜리는 9월 30일과 10월 5일(미국 시각) X에 팀의 단백질 워터마크 연구와 효소 설계 시스템 AlphaProtein Novo를 소개하면서 단백질을 '생명의 구성 블록'이라고 적었습니다.
@pushmeetX 게시물 · 원문 보기
우리가 하려던 일은 누군가 얻어서 PDB에 올린 구조를 재현하는 것이었습니다. 우리가 한 일은 그것이고, 그게 마침 쓸모가 있었습니다.— 푸시미트 콜리, 구글 딥마인드 (Latent Space)
그는 대중에게는 진전을 알리는 편이 쉽지만 행사장의 과학자들은 남은 일이 얼마나 많은지 안다며, 이제 막 시작했으니 단백질 구조 예측과 동역학 연구 지원을 멈추지 말자고 했습니다. 딥마인드의 2020년 블로그와 2021년 7월 Nature에 낸 인간 단백질체 논문의 숫자를 모으면 이렇습니다.
| 항목 | 값 |
|---|---|
| 알파폴드 2 학습 데이터 (2020) | PDB 구조 약 17만 개 |
| CASP14 전체 목표 중앙값 | 92.4 GDT |
| 실험 구조가 있는 인간 단백질 (2021) | 35% (잔기 기준 17%) |
| 알파폴드가 예측한 인간 단백질 | 98.5% |
| 확신할 만한 예측 (잔기 기준) | 58% (매우 높음 36%) |
| 인간 단백질체의 무질서 잔기 (선행 연구 추정) | 37~50% |
콜리가 해석 가능성보다 앞에 둔 것은 보정입니다. 알파폴드 2는 당시 시험에서 GDT 90 안팎을 냈는데, 그는 그 숫자보다 예측마다 붙는 신뢰도 점수 pLDDT가 맞게 보정된 것이 더 중요했다고 했습니다.
GDT 점수가 95였더라도 pLDDT 점수가 전혀 보정되지 않았다면 누가 그 모델을 믿겠습니까.— 푸시미트 콜리, 구글 딥마인드 (Latent Space)
모델이 자신 있다고 해서 1년을 매달렸는데 완전히 틀린 답으로 드러나는 일을 막는 것이 이 점수의 역할이라는 설명입니다. 그는 가중치를 공개한 뒤 사람들이 알파폴드 2가 단백질의 무질서한 부분을 잘 짚어 낸다는 것을 알게 됐다고 했습니다. 인간 단백질체 논문은 pLDDT를 무질서 예측 평가(CAID)에 그대로 넣어 AUC(1에 가까울수록 잘 가려내는 지표) 0.897을 얻었다며 당시 최고 수준 도구와 겨룰 만하다고 적었고, pLDDT 50 미만의 긴 구간은 구조로 읽지 말고 무질서의 예측으로 보라고 권했습니다. 콜리는 존 점퍼, 데미스 허사비스와 함께 이 논문의 마지막 저자 세 명 가운데 한 명입니다.
해석 가능성에 대해서는 누구에게 해석 가능한가를 되물었습니다. 사람의 뇌로는 알파폴드 2가 어떻게 답을 내는지 이해할 수 없지만, 훨씬 큰 언어 모델에 활성값을 보여 주고 알파폴드의 행동을 예측하게 하면 미래의 프런티어 모델이 그 작동 이론을 내놓을지도 모른다는 겁니다. 그래서 지금 사용자에게 필요한 것은 모델이 무엇을 할 수 있고 없는지를 행동으로 확인해 두는 일이고, 그러지 않으면 모델이 도움 대신 해가 될 수 있다고 했습니다.
칸디도는 지금의 단백질 모델을 자전거가 어떻게 움직이는지 알고 싶은데 바퀴살 하나를 모델링하는 일에 빗댔습니다. 바퀴살에서 바퀴로, 다시 자전거 전체로 가야 하는데, 사람들은 자전거 모델로 픽업트럭 부품을 설계하려 든다는 비유를 이어 갔습니다. 앤더슨이 원리를 몰라도 결합 단백질을 한 번에 설계해 내는 블랙박스를 언급하자, 칸디도는 AI 이전에도 사람들은 블랙박스로 물건을 설계해 왔다면서 이해를 꺼내는 일이 그래도 중요하다고 했습니다. 8월에는 클로드가 혼자 설계한 결합 단백질 1,320개 가운데 354개가 실험에서 붙었다는 앤트로픽의 결과가 나오기도 했습니다.
이 모델들 안에는 우리가 아는 것보다 훨씬 많은 정보가 들어 있습니다.— 샐 칸디도, 바이오허브 (Latent Space)
바이오허브가 자기 모델로 해석 가능성 연구를 해 보니, 단백질 언어 모델의 표현에는 구조 말고도 기능과 움직임에 관한 정보가 들어 있었다는 설명입니다. 칸디도는 메타 FAIR에서 수학·과학 AI 부문을 함께 이끌고 EvolutionaryScale을 공동창업해 CTO를 지낸 뒤 바이오허브로 왔습니다. 바이오허브는 5월 약 28억 개 서열로 학습한 단백질 언어 모델 ESMC와 구조 예측 모델 ESMFold2를 공개했습니다.

바이오허브가 직접 잰 값으로는 항체-항원 결합 자세 예측에서 서열 하나만 쓴 ESMFold2의 통과율이 51%로, 진화 정보를 담은 다중 서열 정렬을 쓴 AlphaFold 3(47%)보다 높았습니다. 단백질 간 결합에서는 서열만 쓴 ESMFold2(71%)가 AlphaFold 3(73%)보다 낮았고, 같은 진화 정보를 넣은 ESMFold2가 77%였습니다.
무엇이 더 있으면 가장 빨라지겠느냐는 물음에 보안 연구자로 시작해 컴퓨터 비전을 거쳐 과학 AI로 온 콜리는 크라이오 전자현미경(크라이오EM)의 원본 이미지를 들었습니다. PDB에 정리된 구조에는 원본에 담긴 정보가 빠져 있을 것이라며, 현미경 사진에서 바로 단백질의 움직임과 구조 분포를 뽑아내는 모델을 시도해 봤지만 일이 더 필요했다고 했습니다.
데이터를 만드는 쪽에서도 같은 방향의 투자가 나옵니다. 바이오허브는 6월 UC 버클리와 함께 레이저 위상판으로 크라이오EM 이미지의 대비를 크게 높였다고 발표하면서, 사람 세포 단백질의 90% 이상이 기존 크라이오EM으로 또렷하게 찍기에는 너무 작다는 추정을 소개했습니다. VBI에 들어가는 바이오허브 기술 투자 4억 달러에도 세포 안을 원자에 가까운 해상도로 보는 크라이오 전자 단층촬영이 들어 있습니다.
마지막 질문은 AI의 성과가 언제 임상에 나오느냐였습니다. 콜리는 질문이 잘못 세워졌다고 답했습니다. AI는 이미 신약 개발의 모든 단계에 쓰이고 있고, 10배나 100배 빨라지는 것을 묻는 것이라면 선도물질 최적화인지, 표적 발굴인지, 전임상이나 독성 시험인지에 따라 답이 다르다는 겁니다. 큰 가속은 생물학의 어려운 문제를 풀어야 열리고, 그래서 이날 발표된 노력이 중요하다고 했습니다.
칸디도는 AI가 처음부터 끝까지 만든 약이 언제 나올지는 모르지만, 도구가 이미 쓰이고 있어 빠른 진전은 곧 보일 것이라고 했습니다. 그러면서 구글에서 일하던 시절 배운 교훈으로, 10% 개선 대신 10배 개선을 물으면 처음 원리로 돌아가 다른 해법이 보인다는 말을 꺼냈습니다. 그는 구글 X의 성층권 기구 인터넷 프로젝트 룬에서 CTO를 지냈고, 모든 질병을 고치겠다는 바이오허브의 사명에는 10배 접근이 필요하다고 했습니다.
10월 7일 발표문에 이름이 나온 기관은 DOE와 NIH, 앨런연구소, 브로드연구소, 글래드스톤연구소, 인간 세포 지도, 인간 단백질 지도, 웰컴 생어연구소, 엔비디아, 르네상스 필랜스로피, 그리고 구글 딥마인드·아이소모픽·메타이고, 한국 기관은 없습니다. 데이터가 언제부터 공개되는지와 국외 연구자의 이용 조건도 발표문에 나오지 않았습니다. 바이오허브가 5월 공개한 ESMC와 ESMFold2는 지금도 바이오허브 플랫폼에서 누구나 무료로 쓸 수 있습니다.
읽어 주셔서 고맙습니다.
초이 드림