URL: https://www.youtube.com/watch?v=NufiHZfMwaw 날짜: 2026-10-10 채널: latentspacepod (Latent Space) 원문 제목: The Bitter Lesson of Biology: Why Scaling AI Isn't Enough — Pushmeet K, DeepMind & Sal C, Biohub 출연: Pushmeet Kohli (Google DeepMind), Sal Candido (Biohub), 진행 Brandon Anderson
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==AlphaFold의 성공은 단백질을 완전히 이해했다는 뜻이 아니며, 생물학에서 진정한 도약을 이루려면 컴퓨트와 데이터의 양을 기계적으로 키우는 것보다 문제에 맞는 데이터·과학적 편향·모델 구조·전문성을 함께 설계해야 한다.==
- 리처드 서튼(Richard Sutton)의 ‘쓴 교훈(Bitter Lesson)’은 충분히 확장되는 방법이 결국 승리한다는 명제지만, 생물학에서는 먼저 실제로 확장 법칙(scaling law)이 존재하는 문제와 필요한 정보를 찾아야 한다.
- AlphaFold 2는 PDB에 이미 등록된 정적 구조를 재현하는 데 큰 성공을 거뒀지만, 단백질의 진짜 에너지 상태·구조 분포·동역학·기능을 모두 설명한 것은 아니다.
- 단백질 언어 모델(protein language model)은 낮은 품질의 메타게놈 서열에서도 유용한 정보를 학습할 수 있지만, 어떤 데이터를 모을지는 모델러와 실험가가 문제 중심으로 함께 결정해야 한다.
- 인간이 모델의 내부 작동을 완전히 해석하지 못하더라도 불확실성 보정(calibration), 강점, 한계, 행동 특성을 파악해야 모델이 과학적 의사결정을 해치지 않는다.
생물학의 다음 단계는 개별 단백질의 구조를 맞히는 모델에서 단백질이 세포와 맥락 속에서 어떻게 상호작용하는지 설명하는 모델로 이동하는 것이다. Biohub의 ‘모든 질병을 치료한다’는 목표에는 10% 개선을 반복하는 태도와 함께, 문제를 처음 원리부터 다시 보고 10배(10x) 도약의 경로를 찾는 태도가 필요하다.
1. 생물학에 적용한 ‘쓴 교훈’과 데이터의 조건
문제를 해결하는 데 필요한 것은 무조건 더 큰 모델이 아니라, 컴퓨트·데이터·아키텍처를 늘릴 때 실제 성능이 좋아지는 구조를 발견하는 일이다.
1.1. 쓴 교훈을 데이터의 관점에서 다시 묻기
-
확장되는 방법이 결국 이긴다는 명제
- 쓴 교훈의 핵심: AI 분야에 익숙하지 않은 사람에게 쓴 교훈은 “확장되는 방법(methods that scale)이 결국 승리한다”는 말이다. 충분히 키울 수 있다면 결국 이긴다는 뜻이다.
- 생물학의 추가 질문: 데이터에 컴퓨트를 더하고 데이터를 더 넣을 때 결과가 실제로 좋아지는 상황이 어디에 있는지 먼저 찾아야 한다. 그런 확장 법칙을 발견하면 그다음은 반복 가능한 엔지니어링 문제로 바뀐다.
-
확장 법칙은 어디에나 자동으로 존재하지 않는다
- 문제에 맞는 통계: 모델은 보유한 데이터에서 정보를 뽑아내고 그 정보로 일반화한다. 원하는 능력과 이해를 뒷받침하는 정보 통계가 데이터에 없으면 컴퓨트를 늘려도 원하는 모델이 나오지 않는다.
- 아키텍처와 데이터의 결합: 어떤 확장이 가능한지는 모델 구조에 달렸지만, 필요한 정보가 데이터에 들어 있는지도 똑같이 중요하다. 따라서 ‘모델 크기’만을 독립 변수로 놓는 사고는 생물학에 충분하지 않다.
1.2. 모델러는 왜 ‘가장 중요한 데이터’보다 ‘구할 수 있는 데이터’를 택하는가
-
사용 가능한 데이터로 기우는 편향
- 솔직한 출발점: Sal Candido는 자신도 게으르기 때문에 구할 수 있는 데이터를 사용할 것이라고 농담한다. 전통적인 머신러닝에서는 가장 깨끗하고 품질 높은 예시를 찾지만, 실제 연구자는 뒷방의 잡동사니를 뒤져 이미 있는 것을 찾기도 한다.
- 메타게놈의 의외의 가치: 단백질 언어 모델을 메타게놈 서열(metagenomic sequences)로 학습하면 서열 상당수가 온전한 실제 단백질조차 아닐 수 있다. 그런데도 실제로 작동하는 단백질을 설계하거나 이미 알려진 단백질을 이해하는 성능이 좋아진다.
-
손쉬운 데이터 확장의 함정
- 긍정적인 면: 낮은 품질의 데이터에도 진화와 단백질 공간에 관한 정보가 들어 있어, 모델이 실험으로 손쉽게 얻은 정제 데이터만 사용할 때보다 넓은 일반화에 도움을 줄 수 있다.
- 부정적인 면: 이 성공을 잘못 일반화하면 쉽게 생성할 수 있는 데이터만 계속 늘리게 된다. 중요한 것은 데이터의 양이 아니라 해결하려는 문제에 필요한 데이터와 정보의 종류다.
-
커뮤니티가 함께 데이터의 목표를 정해야 한다
- Biohub의 공개 협업 방향: Biohub는 연구를 공개적으로 수행하고 커뮤니티와 함께 전체 분야를 전진시키려 한다. 당일 발표된 BBI 이니셔티브도 문제 해결에 필요한 자원뿐 아니라 적절한 커뮤니티를 모으는 데 초점을 둔다.
- 서로 다른 편향의 결합: 모델을 만드는 사람만 있으면 기존 데이터 쪽으로 기울고, 데이터를 만드는 사람만 있으면 쉽게 생성할 수 있는 것 쪽으로 기운다. 두 집단이 처음부터 끝까지 공개적으로 협력해야 실제로 필요한 데이터를 정의하고 그 데이터에 맞는 확장 법칙을 찾을 수 있다.
1.3. Pushmeet Kohli가 해석한 리처드 서튼의 교훈
-
방법론에 대한 종교적 집착을 버리기
- 문제보다 정체성을 앞세우는 오류: Pushmeet Kohli는 DeepMind에서 Richard Sutton과 함께 일할 때 얻은 교훈이 단순히 “데이터가 유용한가”에 대한 답이 아니었다고 설명한다. 사람은 자신을 모델러 또는 데이터 생성자로 규정하고 그 해결책을 종교처럼 고집하기 쉽다.
- 문제가 먼저다: 해결하려는 문제가 무엇인지부터 이해한 뒤 모델링이 필요하면 모델링하고, 데이터 수집이 필요하면 데이터를 모아야 한다. 최종 목표가 문제 해결이라면 데이터와 모델뿐 아니라 과학적 전문성도 과정의 일부다.
-
AlphaFold와 가상 세포의 대비
- PDB에 집중한 이유: AlphaFold 팀은 기존 데이터셋으로 무엇이 가능한지 먼저 봤다. 전 세계 과학자들이 막대한 시간과 자원을 들여 만든 PDB(Protein Data Bank)를 한 자릿수 이상의 규모로 즉시 증강할 자원과 핵심 전문성이 없었기 때문에, 기존 구조 데이터에서 모델링으로 가장 큰 효과를 내는 길을 택했다.
- 세포 유전체학의 다른 결론: cell-by-gene 수준의 세포 유전체학에서는 충분한 데이터가 아직 없다는 점이 드러났다. 가상 세포(virtual cell)라는 큰 목표에 도달하려면 모델만 키우는 접근으로는 부족했고, 어떤 데이터를 새로 확보해야 하는지 자체가 핵심 과제가 됐다.
-
문제 중심의 학습 태도
- 다학제적 연구자: 생물학 AI를 시작하는 사람은 자신을 다학제적 연구자라고 생각해야 한다. 왜 이 문제를 풀고 싶은지, 어떤 결과를 만들려는지, 모델링·컴퓨트 확장·데이터 생성 중 무엇이 필요한지를 차례로 물어야 한다.
- 제약을 인정하고 빠르게 실패하기: 생성할 수 있는 데이터의 양이나 감당할 수 있는 모델 크기에는 제약이 있다. 장기적으로 실행 가능하면서 목표한 영향 수준에 도달할 방법인지 일찍 점검하고, 가능성이 낮은 접근은 빠르게 실패해 방향을 바꿔야 한다.
2. 정교한 장인정신과 범용 확장의 균형
AlphaFold 2의 수작업 설계는 확장의 반대편에 있는 낡은 예술이 아니라, 과학적 지식을 모델에 주입해 데이터 효율을 높인 사례다. 다만 데이터가 커지면 특정 편향이 새로운 발견을 가로막을 수 있다.
2.1. AlphaFold 2의 ‘예술적’ 설계가 준 이점
-
과학적 직관을 귀납적 편향으로 바꾸기
- 아미노산 잔기의 상호작용: 단백질의 아미노산 잔기(residue)는 서로 독립적으로 행동하지 않고 다른 잔기의 영향을 받는다. 생물물리학(biophysics)과 생화학(biochemistry)에서 얻은 이 직관을 모델 구조에 반영하면 모델이 그 사실을 처음부터 활용할 수 있다.
- 불공정한 출발점의 장점: 과학적 지식을 귀납적 편향(inductive bias)으로 넣으면 모델이 모든 관계를 데이터만으로 다시 발견할 필요가 없다. 이는 적은 데이터에서도 더 효율적으로 학습하는 ‘불공정한 이점(unfair advantage)’이 된다.
-
좋은 데이터 큐레이션도 장인 기술이다
- 반복 데이터의 한계: 같은 종류의 데이터를 더 많이 복제한다고 진전이 생기지는 않는다. 어떤 범위와 사례를 덮어야 문제를 풀 수 있는지 파악하고, 데이터의 커버리지(coverage)를 설계하는 일이 그 자체로 어렵고 중요하다.
- 양보다 정보의 질: ‘빅 데이터’라는 말만으로 충분하지 않다. 무엇을 측정했고 무엇이 빠져 있는지, 데이터가 실제 목표를 대표하는지 이해해야 좋은 모델과 실험을 설계할 수 있다.
2.2. 데이터가 커질수록 달라지는 귀납적 편향
-
작은 데이터에서는 편향이 필요하다
- 적은 규모의 문제: 데이터가 적을 때는 더 강한 구조적 가정과 과학적 직관을 넣어야 모델이 의미 있는 결과를 낸다.
- 지식의 재발견을 줄이기: 이미 알려진 생화학적 관계를 모델에 주면 제한된 데이터와 컴퓨트로도 같은 관계를 매번 재학습하는 비용을 줄일 수 있다.
-
큰 데이터에서는 편향이 발견을 제한할 수 있다
- 새로운 패턴의 발견: 데이터가 충분히 많아지면 모델이 연구자가 몰랐던 규칙을 찾을 가능성이 커진다. 이때 편향이 정확하지 않으면 모델의 탐색 공간을 가로막는다.
- 규모에 따른 전환점: 좋은 설계는 무조건 손으로 만든 구조도, 무조건 범용 확장도 아니다. 데이터 규모와 문제의 성격에 따라 과학적 편향과 모델의 자유도를 조절해야 한다.
2.3. 확장 자체에도 장인정신이 필요하다
-
스케일링은 단순한 버튼 누르기가 아니다
- 알고리즘·인프라 작업: 더 많은 데이터와 컴퓨트로 더 큰 모델을 학습하려면 알고리즘과 인프라를 개선해야 한다. 모델의 추론(inference)을 빠르게 하고, 훈련을 안정화하며, 규모에 맞는 시스템을 만드는 데 상당한 설계가 필요하다.
- 목적에 맞는 구조: 트랜스포머(Transformer) 이후의 세계가 완성됐다는 뜻은 아니지만, 트랜스포머를 목적에 맞게 변형한 독특한 아키텍처들이 등장하고 있다. 인터넷 규모의 데이터에서도 실제 목적에 맞게 작동하도록 구조를 조정하는 일은 여전히 진행 중이다.
-
다음 데이터와 다음 아키텍처를 동시에 찾기
- 정보의 다음 배치: 더 큰 데이터셋을 무작정 추가하는 대신 모델이 다음으로 필요로 하는 정보가 무엇인지 정하고 그 배치를 수집해야 한다.
- 단계마다 최적 구조 찾기: 데이터가 늘어날 때마다 가장 많은 정보를 뽑아내는 아키텍처가 달라질 수 있다. 데이터 큐레이션과 모델 설계를 각 규모에서 함께 반복해야 한다.
3. 단백질 접힘은 왜 아직 끝나지 않았는가
과학은 하나의 하위 문제를 고립해 단계적으로 푼다. AlphaFold 2의 정적 구조 예측 성공은 거대한 진전이지만, 단백질이라는 동적인 시스템 전체를 설명한 결론은 아니다.
3.1. ‘접힘 문제 해결’이라는 표현의 한계
-
정적인 블록이 아닌 단백질
- 복잡성과 무질서: 단백질은 단순한 건축 블록이 아니다. 매우 복잡하고 본질적으로 무질서한(disordered) 부분을 가질 수 있으며, 주변 맥락에 따라 모양이 바뀔 수 있다.
- 상태의 분포: 단백질 하나에는 하나의 영원한 모양만 있는 것이 아니라 여러 구조 상태와 그 분포가 있을 수 있다. 실제 ground state와 구조 분포를 정확히 아는 일은 여전히 열린 문제다.
-
AlphaFold 2가 실제로 해결한 것
- PDB 재현: 누군가 실험으로 구조를 얻어 PDB에 등록하면, 모델은 그 구조를 재현하는 능력을 학습했다. 그것이 매우 유용한 이유는 실험 구조를 얻기 어려운 단백질에 대해 강력한 예측을 제공하기 때문이다.
- 이해와 재현의 구분: 알려진 구조를 맞히는 일은 단백질의 모든 동역학(protein dynamics)과 기능을 이해했다는 뜻이 아니다. 정적 구조의 예측을 단백질 접힘 전체의 해답으로 확대 해석하면 안 된다.
-
다음 과제와 연구비의 필요성
- 남은 영역: 기능(function), 동역학(dynamics), 단백질 설계(design)는 여전히 크게 열려 있다. 구조 예측의 진전은 이 문제들을 풀기 위한 출발점이다.
- 연속적인 지원: 과학자들은 큰 성취를 축하하면서도 단백질 구조 예측과 동역학 연구의 지원을 중단해서는 안 된다. 이제 막 시작했기 때문이다.
3.2. 마법의 지팡이로 추가하고 싶은 데이터: cryo-EM
-
PDB보다 원천 관측에 가까이 가기
- 컴퓨터 비전 연구자의 직관: Pushmeet는 자신의 컴퓨터 비전 배경에서 cryo-EM(cryo-electron microscopy) 마이크로그래프에 관심을 가졌다. 가공되어 PDB에 들어간 구조보다 현미경 원천 이미지에서 더 많은 정보를 직접 활용하고 싶다는 생각이다.
- 동역학과 분포 정보: cryo-EM 마이크로그래프를 충분히 확장 가능한 모델로 처리하면 정적인 하나의 구조로 압축되기 전의 동역학과 구조 분포를 끌어낼 가능성이 있다.
-
아직 남은 공학적 난제
- 시도했지만 미완성: Pushmeet는 이 방향을 실제로 시도했지만, 그 규모의 데이터를 처리하고 유용한 표현을 추출하려면 더 많은 작업이 필요하다고 말한다.
- 장기적 가능성: 현재 한 사람이 해결하지 못했더라도 더 뛰어난 연구자들이 도전해 돌파구를 만들 수 있는 경로라고 본다.
3.3. 자전거 바퀴에서 생물학적 시스템 전체로
-
부분 모델이 전체 문제를 대신할 수 없다
- 살의 자전거 비유: 지금의 모델은 자전거가 어떻게 작동하는지 알고 싶은 사람이 자전거의 바퀴살 하나를 모델링하는 것과 비슷하다. 바퀴살 모델을 계속 개선할 수 있지만, 실제 이해 대상은 바퀴와 자전거 전체다.
- 잘못된 전이: 자전거 모델로 픽업트럭의 부품을 설계하려는 것처럼, 특정 단백질 구조 모델을 더 넓은 생물학적 맥락을 벗어난 곳에 바로 적용하면 목적과 모델 사이에 간극이 생긴다.
-
맥락 속 상호작용으로 확장하기
- 개별 단백질에서 시스템으로: 단백질이 놓인 세포와 생물학적 맥락을 모델에 포함해야 더 넓은 상호작용을 학습할 수 있다.
- 기존 모델도 계속 필요하다: 개별 단백질 접힘 모델은 여전히 개선될 것이며, 더 큰 생물학적 시스템 모델로 가는 구성 요소로서 계속 가치가 있다.
4. 만들 수 있다는 것과 이해한다는 것
리처드 파인만(Richard Feynman)의 “만들 수 없는 것은 이해하지 못한 것이다(What I cannot create, I do not understand)”라는 원칙은 AI 시대에 역설적으로 흔들린다. 이제는 이해하지 못한 채로도 새로운 분자를 생성할 수 있기 때문이다.
4.1. 마법 같은 블랙박스 설계의 가치와 위험
-
블랙박스는 AI 이전에도 있었다
- 실용적 설계: AI가 등장하기 전에도 내부 원리를 완전히 이해하지 못한 설계 도구로 유용한 결과를 만들었다. 따라서 블랙박스가 항상 쓸모없다고 말할 수는 없다.
- 이해의 과학적 가치: 과학자에게는 최종 산출물만큼 내부 원리와 새로운 지식을 알아내는 일이 중요하다. 더 깊이 파고들수록 다음 개선을 위한 올바른 방향을 찾을 가능성도 커진다.
-
모델 내부에는 아직 꺼내지 못한 지식이 있다
- 구조·기능·운동: Sal은 단백질 언어 모델의 표현이 단백질 구조뿐 아니라 기능과 운동(motion)에 대한 정보도 담고 있다고 설명한다. 지금의 모델에서 이미 알려진 것보다 훨씬 많은 정보가 발견을 기다리고 있다.
- 진화 정보의 압축: 단백질 모델은 진화가 축적한 정보를 모델 안에 압축한다. 유용한 단백질을 생성하는 것뿐 아니라 그 압축된 정보의 내부를 살펴보는 일 자체가 과학적 성과가 될 수 있다.
4.2. 설계와 이해 사이에서 필요한 수준
-
완벽한 메커니즘 해석과 실용적 이해는 다르다
- 모델의 성능만으로는 부족하다: 모델이 정답을 잘 내더라도 언제 틀리는지 모르면 과학적 의사결정에 사용할 수 없다.
- 행동 특성의 이해: 실제로 필요한 최소 수준은 모델이 무엇을 할 수 있고 무엇을 할 수 없는지, 어떤 입력과 맥락에서 신뢰할 수 있는지 파악하는 것이다.
-
생물학의 목표가 이해의 기준을 바꾼다
- 번역 의학(translational medicine): 순수 과학에서는 메커니즘 이해 자체가 종착점일 수 있지만, 번역 의학에서는 환자와 치료로 이어지는 결과도 중요하다.
- 두 목표의 병행: 실용적인 설계 모델과 내부 지식을 추출하는 연구는 서로 대체 관계가 아니다. 설계의 속도를 높이면서도 더 나은 이해를 통해 다음 도약의 방향을 확보해야 한다.
5. 해석 가능성보다 먼저 확보할 신뢰성
사람이 모든 내부 계산을 설명하지 못해도, 불확실성을 제대로 표현하고 행동 범위를 검증하면 모델을 책임 있게 사용할 수 있다.
5.1. AlphaFold의 점수와 불확실성 보정
-
높은 평균 점수가 완전성을 뜻하지 않는다
- GDT 성능: AlphaFold 2는 당시 평가에서 약 90 GDT(Global Distance Test)를 기록했지만 완벽한 예측기는 아니다.
- 틀릴 때의 위험: 예측이 95 GDT 수준으로 더 좋아져도 pLDDT(예측된 LDDT) 점수가 보정되지 않았다면 위험하다. 모델이 확신한다고 말한 구조를 1년 동안 연구한 뒤 완전히 틀렸음을 알게 될 수 있다.
-
불확실성 보정이 실제 사용의 핵심이다
- 신뢰의 조건: pLDDT 같은 불확실성 지표가 실제 정답 가능성과 맞아야 사용자가 어떤 결과를 믿고 어떤 결과를 검증할지 판단할 수 있다.
- 두 종류의 이해: 모델이 왜 그런 해답을 냈는지 내부 메커니즘을 이해하는 문제와, 모델의 행동·강점·한계를 이해하는 문제는 다르다. 후자는 모델을 안전하게 사용하는 데 즉시 필요하다.
5.2. 일반화가 보여준 숨은 능력
-
공개 이후 발견된 무질서 예측
- 출시 당시 몰랐던 능력: AlphaFold 2가 공개되고 가중치(weights)가 풀린 뒤, 사람들이 모델이 무질서한 단백질의 영역을 찾아내는 데 뛰어나다는 것을 발견했다.
- 일반화의 의미: 연구자가 설계 단계에서 명시하지 않았던 능력이 나타났다는 사실은 모델이 구조 예측을 넘어 데이터에 담긴 더 넓은 생물학적 규칙을 학습했음을 보여준다.
-
행동 특성화가 해석 가능성의 실용적 형태다
- 인간 사용자를 위한 검증: 인간 과학자가 모델이 어떤 방식으로 예측하는지 모두 설명하지 못하더라도, 예측이 잘 작동하는 조건과 무너지는 조건을 실험으로 밝혀야 한다.
- 모델의 오용 방지: 이런 특성화 없이 모델을 무조건 유용하다고 취급하면 도움을 줘야 할 시스템이 오히려 연구와 치료 결정을 해칠 수 있다.
5.3. ‘누구에게 해석 가능한가’라는 질문
-
인간과 더 큰 모델의 차이
- 인간의 한계: 인간의 인지적·계산적 한계를 기준으로 보면 AlphaFold 2의 내부 추론은 해석 가능하지 않다.
- 모델이 모델을 읽는 가능성: 훨씬 크고 정교한 미래의 프런티어 LLM에 AlphaFold 2의 활성화 계층(activation layers)을 보여주면, 그 모델이 AlphaFold 2의 행동을 예측하고 작동 원리에 대한 이론을 만들어낼 가능성이 있다.
-
해석 가능성은 관찰자의 능력에 의존한다
- 보편적인 해석 가능성은 없다: ‘해석 가능하다’는 말은 누가 해석하는지를 전제로 한다. 인간 과학자에게 이해 가능한 것과 대규모 AI에게 이해 가능한 것은 서로 다른 기준이다.
- 현재의 책임: 미래 AI가 더 깊은 이론을 만들어주기를 기다리지 말고, 현재 사용자는 행동 특성·신뢰도·불확실성·제한을 확인한 뒤 모델을 사용해야 한다.
6. 임상과 신약개발에서 10배의 도약이 일어나는 시점
AI는 이미 신약 발견의 각 단계에 쓰이고 있지만, 10배 또는 100배의 시간 단축은 생물학의 어려운 문제를 풀고 더 나은 생물학적 모델을 만드는 데 달려 있다.
6.1. ‘AI가 임상에 들어오는 때’는 이미 시작됐다
-
현재 진행 중인 활용
- 전 과정에 존재하는 AI: AI는 이미 신약 발견 프로세스의 모든 부분에서 사용되고 있다. 따라서 AI 결과가 임상에 언제 나타나느냐는 질문에 대한 한 답은 이미 그렇다는 것이다.
- 가속의 위치를 구분해야 한다: 리드 최적화(lead optimization), 표적 발견(target discovery), 전임상(pre-clinical), 독성(toxicity) 연구 중 무엇을 가속하는지에 따라 시간표와 필요한 모델이 달라진다.
-
진짜 변혁의 조건
- 앞으로 수년의 과제: 향후 몇 년 동안 당일 발표된 이니셔티브가 생물학의 어려운 문제들을 공략해야 한다. 그래야 신약 발견 과정 전체를 바꿀 정도의 진정한 가속이 열릴 수 있다.
- 생물학적 모델의 개선: 임상으로 가는 각각의 물질에 AI가 계속 영향을 주는 것과, 신약 발견의 시간표를 10배·100배 줄이는 것은 다른 수준의 변화다. 후자는 생물학을 더 잘 이해하고 표현하는 모델에서 나온다.
6.2. 10% 개선과 10x 개선을 함께 추구하기
-
완전히 AI가 만든 약의 시점은 예측하기 어렵다
- 신중한 답변: AI가 처음부터 끝까지 만든 약이 언제 나올지는 알기 어렵다. 다만 도구들이 이미 실제 과정에 투입되고 있어 빠른 진전은 매우 가까운 시기에 나타날 가능성이 크다.
- 결과 중심의 평가: 중요한 것은 AI라는 라벨이 붙은 약이 나오는 날짜만이 아니라, 실제 환자 건강 결과와 신약 발견 과정의 시간이 얼마나 개선되는지다.
-
10x 질문이 시야를 넓힌다
- Google에서 얻은 교훈: Sal은 10% 개선보다 10배 개선에 무엇이 필요한지를 물어보는 편이 때로 더 생산적이라고 말한다. 10x가 반드시 더 쉬운 길이어서가 아니라, 지금까지 접근하지 않은 해법을 넓은 시야로 보게 만들기 때문이다.
- 처음 원리로 돌아가기: 어떻게 하면 진짜로 이 일을 할 수 있는지, 무엇이 경로를 막고 있는지를 처음 원리(first principles)에서 다시 묻는다. 10%와 10x 접근은 모두 가치 있으며 서로 대체되지 않는다.
-
Biohub의 사명과 큰 도약
- 모든 질병을 치료한다는 목표: Biohub가 내세운 아름답고 야심찬 사명은 모든 질병을 치료하는 것이다. 그 목표를 진지하게 받아들이려면 작은 개선의 누적뿐 아니라 10x 경로를 찾아야 한다.
- 기초 이해와 응용 결과의 연결: 기초 생물학을 이해하는 일과 치료 결과를 만드는 일은 분리되지 않는다. 더 넓은 생물학 모델이 두 목표를 연결하는 핵심 기반이다.
주요 발언 모음
“확장되는 방법이 결국 승리한다. 충분히 확장할 수 있다면 결국 이긴다.”
“문제가 먼저다. 모델러인지 데이터 생성자인지에 종교적으로 매달리지 말고, 문제를 풀기 위해 필요한 것을 하라.” — Pushmeet Kohli의 해석
“단백질은 블록이 아니다. 매우 복잡하고 무질서하며, 맥락에 따라 형태가 바뀔 수 있다.”
“우리가 한 일은 PDB에 누군가 등록한 구조를 재현한 것이다. 유용하다는 사실이 단백질 동역학을 모두 이해했다는 뜻은 아니다.”
“만들 수 없는 것은 이해하지 못한 것이다.” — Richard Feynman
“해석 가능성은 누구에게 해석 가능한가의 문제다.” — Pushmeet Kohli
“10% 개선이 아니라 10배 개선에 무엇이 필요한지 물으면, 지금까지 보지 못한 해법을 볼 수 있다.” — Sal Candido
핵심 데이터 & 수치
- 약 32분 37초: 패널의 전체 재생 시간이다.
- 약 90 GDT: AlphaFold 2가 당시 평가에서 기록한 구조 예측 성능으로 언급된 수치다. 완벽한 예측을 뜻하지 않는다.
- pLDDT: 구조 예측의 신뢰도 지표다. 점수가 실제 정답 가능성과 보정되지 않으면 높은 성능 자체가 위험한 확신으로 바뀐다.
- 10% 대 10x, 100x: 신약 발견에서 점진적 개선과 시간표를 근본적으로 바꾸는 가속을 구분하는 기준이다.
- PDB와 cryo-EM 마이크로그래프: PDB는 실험 구조를 정제해 등록한 데이터베이스이고, cryo-EM 마이크로그래프는 구조 분포와 동역학 정보에 더 가까운 원천 관측으로 제시된다.
- 구조·기능·동역학·설계: AlphaFold 2의 정적 구조 예측 이후에도 크게 남아 있는 네 가지 생물학적 과제다.
결론 및 시사점
- AlphaFold 2는 단백질 구조 예측을 크게 진전시켰지만, 정적 PDB 구조의 재현과 단백질 전체의 접힘·기능·동역학 이해를 구분해야 한다.
- 생물학에서 쓴 교훈은 ‘무조건 더 크게’가 아니라, 문제를 정의하고 확장 법칙이 실제로 작동하는지 발견한 뒤 컴퓨트와 데이터를 키우라는 뜻으로 읽어야 한다.
- 낮은 품질의 메타게놈 서열도 유용할 수 있지만, 손쉽게 생성되는 데이터만 늘리면 중요한 생물학적 목표에서 멀어질 수 있다.
- 모델러·실험가·생물학 전문가가 공개적으로 협력해 필요한 데이터를 정의해야 가상 세포와 같은 목표에 접근할 수 있다.
- AlphaFold의 과학적 귀납 편향은 작은 데이터에서 효율을 높였고, 데이터가 커질수록 새로운 발견을 막지 않도록 편향과 자유도를 조정해야 한다.
- 데이터 큐레이션과 모델 확장은 모두 알고리즘·인프라·도메인 지식을 요구하는 장인 작업이다.
- cryo-EM 원천 이미지에서 구조 분포와 동역학을 직접 추출하는 모델은 정적 구조를 넘어서는 유망한 연구 방향이다.
- 개별 단백질의 바퀴살 모델에서 세포와 생물 전체의 자전거 모델로 확장해야 실제 생물학적 상호작용을 설명할 수 있다.
- 완전한 내부 해석보다 모델의 불확실성 보정, 행동 특성화, 강점과 한계 검증이 안전한 과학적 사용에 먼저 필요하다.
- AI는 이미 신약 발견 전 과정에 관여하지만, 10배·100배의 임상 가속은 더 나은 생물학적 이해와 모델이 만들어낼 진정한 돌파구에 달려 있다.
- 모든 질병을 치료하려면 10% 개선과 10x 도약을 함께 추구하고, 때로는 처음 원리에서 문제를 다시 설계해야 한다.
