URL: https://www.youtube.com/watch?v=2xBSGluFkG0
날짜: 2026-09-23
채널: latentspacepod
원문 제목: 🔬 1% of Global Warming Is Fixable by Changing Altitude — John Platt, Google Fellow
📌 핵심 질문 / 이 대화가 다루는 핵심 논점
==AI는 과학자의 창의성과 엄밀함을 대체하는가, 아니면 과학 문제를 점수화하고 반복 실험하는 강력한 탐색 도구가 되는가?== 기후·융합·양자컴퓨팅처럼 데이터가 부족하고 미래로 외삽해야 하는 분야에서는 AI가 코드를 잘 쓰는 것만으로 충분하지 않으며, 사람이 올바른 목적함수·물리적 제약·검증 절차를 설계해야 한다.
- Google의 ERA는 과학 문제를 “점수를 최대화하는 코드”로 바꾼 뒤 Gemini가 노트북과 가설을 계속 변이시키는 시스템이다.
- 항공기 운항 고도를 약간 바꿔 지속성 비행운(contrail)을 피하면 낮은 비용으로 항공의 기후 영향을 줄일 수 있다.
- 예측 모델의 낮은 오차와 현실을 설명하는 모델은 다르며, 기후처럼 비정상적(non-stationary)이고 미래 데이터가 없는 영역에서는 과적합과 허위 발견을 극도로 경계해야 한다.
- AI의 가장 큰 잠재력은 과학자를 없애는 데 있지 않고, 데이터·논문·코드의 조각을 연결해 과학자가 창의성·철학·엄밀한 검증에 시간을 쓰게 하는 데 있다.
John Platt는 AI가 과학의 “파워 툴(power tool)”이 될 것이라고 기대하지만, 실험실의 물리적 병목과 인간의 판단은 여전히 남는다고 본다. 잘못된 점수함수는 시스템이 놀라운 방식으로 속이게 만들 수 있으므로, AI가 강력해질수록 숨겨 둔 검증 세트, 반복 실험, 인간의 도메인 지식과 엄밀함이 더 중요해진다.
1. John Platt의 배경과 AI for Science로의 이동
John Platt는 Google Fellow이자 Google Research의 Applied Science 책임자로 소개된다. 14세에 대학에 들어갔고 18세에 Caltech에서 박사과정을 시작했으며, John Hopfield의 지도를 받았다. Hopfield는 SVM 학습의 표준 알고리즘인 Sequential Minimal Optimization(SMO)과 Platt scaling으로 알려져 있고, 소행성 두 개를 발견·명명했으며 Pixar의 물리 시뮬레이션에도 기여해 2006년 기술개발 부문 오스카를 받았다.
1.1. 한 분야에 갇히지 않은 연구 경력
-
기술과 과학 사이를 옮겨 다닌 경력
- Platt는 응용수학, 신호처리, 머신러닝, 핵융합, 양자컴퓨팅, 기후 모델링을 오가며 문제를 풀었다.
- 1990년대 초 합성곱 신경망(convolutional net)이라는 일반적 명칭을 사용하기 시작했다. 당시 연구자들이 Yann LeCun의 작업과 연결해 “LeNet”이라고 부르던 것을, 특정 구현에 묶이지 않는 이름으로 부르기 위해 만든 명칭이라고 설명한다.
-
“기가 너드”라는 자기 묘사
- 진행자가 “메가 너드”라고 소개하자 Platt는 “기가 너드(giga nerd)”라고 정정한다.
- 알고리즘·소행성·영화 그래픽·플라즈마·기후를 한 대화 안에서 연결하는 태도가 이 자기 묘사를 뒷받침한다.
1.2. Google에서 AI for Science가 바뀐 시점
-
초기 방식: 문제별 전문 모델
- Google Research는 10년 넘게 과학 문제에 AI를 적용했지만, 초기에는 특정 문제마다 합성곱 신경망 등 전용 모델을 새로 만들었다.
- 연구자가 모델 구조·데이터 파이프라인·실험 코드를 직접 만들기 때문에, 몇 가지 관련 아이디어를 시험한 뒤 논문과 다음 실험으로 넘어가야 했다.
-
최근 방식: 일반 언어모델을 과학적 탐색 루프에 넣기
- 약 2년 전부터 Gemini 같은 대규모 언어모델(LLM)을 과학 문제에 적용할 가능성이 커졌다.
- 많은 과학 문제는 “어떤 코드를 만들어 특정 점수를 최대화할 것인가?”라는 형태로 변환할 수 있다는 점이 핵심 발견이었다.
- 이런 변환을 Platt의 팀은 scorable task라고 부른다. 점수를 정의하면 모델은 후보 코드를 만들고 실행하고, 결과를 비교하며, 더 나은 후보를 생성할 수 있다.
2. ERA: 과학 문제를 점수화하고 탐색하는 엔진
ERA는 과학자의 자연어 문제를 실행 가능한 코드·점수·반복 탐색의 루프로 바꾼다. 단순한 코드 자동완성보다 중요한 것은 “무엇을 최적화할지”를 정하고, 그 점수를 개선하는 후보 공간을 계속 탐색하는 구조다.
2.1. 통계적 예측 모델과 과학적 설명 모델
-
예측 모델(predictive model)
- 입력과 출력 데이터가 있고, 정해진 데이터셋에서 오류율을 가장 낮추는 코드를 만드는 것이 목표다.
- 데이터셋의 패턴을 잘 맞추면 성공으로 측정되지만, 관측 범위 밖에서 같은 규칙이 성립하는지는 보장하지 않는다.
-
설명 모델(descriptive model)
- 과학이 궁극적으로 원하는 모델은 현실의 물리·구조를 담아 외삽(extrapolation)할 수 있는 모델이다.
- 뉴턴이 사과와 중력을 생각했다고 해서 중력이 사과에만 적용되는 것은 아니다. 17세기의 머신러닝 모델이 사과 낙하 데이터만 보고 “사과는 떨어진다”고 학습했다면, 행성이 어떻게 움직이는지는 데이터가 없다는 이유로 모를 수 있다.
- 과학자는 알려진 사실의 “단단한 더미”를 가지고 모델이 기존 지식과 모순되지 않는지 확인한다. 이 인간의 직관·지식·검증이 LLM의 사전학습 지식과 비슷한 역할을 한다.
-
ERA의 현재 편향
- ERA는 물리 법칙을 처음부터 발견하는 순수한 물리 엔진이 아니라, Gemini의 사전학습 지식과 제공된 논문·제약에 기대는 시스템이다.
- 기존 논문을 많이 제공하고 “이 제약을 반드시 반영하라”고 지시하면, 관련 분야에서 이미 알려진 방법과 더 일관된 모델을 찾는다.
- 완전히 새로운 물리학을 아무런 단서 없이 창조한다고 보기는 어렵다. 다만 사람이 알고 있는 제약과 기존 연구를 매우 빠르게 조합할 수 있다.
2.2. 점수함수에서 실행 가능한 노트북까지
-
자연어 문제를 점수화된 작업으로 변환
- 사용자는 ERA와 대화하며 문제를 설명한다.
- ERA의 보조 에이전트는 어떤 데이터·코드·평가식을 사용해야 하는지 함께 정리해, 점수 함수가 포함된 Python 노트북을 만든다.
- 이후 Gemini가 노트북을 변이시키고 실행해 점수를 올리는 후보를 생성한다.
-
통계 이외의 문제도 점수화 가능
- 원격탐사에서는 위성의 재방문 빈도, 공간 해상도, 분광 해상도 사이의 트레이드오프를 풀 수 있다.
- 이상적인 위성은 5분마다 지구 전체를 10cm·초분광(hyperspectral)으로 촬영하겠지만, 현실의 위성은 이 세 조건을 동시에 만족할 수 없다.
- OCO-2·OCO-3 같은 위성은 CO₂를 정확하고 세밀하게 측정하지만 지구의 좁은 띠만 관측한다. GOES 같은 기상위성은 약 5분마다 넓은 영역을 촬영하지만 픽셀이 크고 CO₂ 측정용으로 설계되지 않았다.
- ERA는 한 위성의 고해상도·정확도와 다른 위성의 넓은 범위·빈번한 관측, 날씨·장기 알베도(albedo) 정보를 결합해 정보 기반 초해상도(informed super-resolution) 모델을 만들 수 있다.
-
점근 전개(asymptotic expansion) 사례
- 작은 매개변수 epsilon이 0으로 갈 때 상미분방정식(ODE) 또는 편미분방정식(PDE)이 어떻게 행동하는지 묻는 문제도 점수화할 수 있다.
- ERA가 제안한 해가 epsilon = 1e-4 같은 작은 값에서 점근적으로 옳은지 검사하고, 그 적합도를 점수로 만든다.
- Gemini는 수학적 추론으로 해를 찾는 동시에 데이터 적합도 점수를 최대화한다. 코드 생성기만 있는 것이 아니라 세계 지식을 가진 AI가 내부 탐색 루프를 조종한다는 점이 차이다.
2.3. Monte Carlo 탐색과 UCB 선택
-
후보 노트북의 트리
- ERA는 수백~수천 개의 노트북 후보를 유지한다.
- 각 후보에서 새 코드를 만들고 실행한 결과가 자식 후보로 쌓이므로 탐색 공간은 트리 구조가 된다.
- 기본 설정에서는 한 번에 약 10개의 잎(leaves)을 병렬로 키운다. 병렬성을 지나치게 높이면 후보들이 서로의 발견을 보지 못해 계산량 대비 학습이 줄어든다.
-
Upper Confidence Bound(UCB)
- ERA는 강화학습에서 쓰이는 UCB를 이용해 후보를 선택한다.
- 현재 점수가 가장 높은 후보만 고르는 탐욕적 선택이 아니라, “현재 성능 + 불확실성 두 시그마”에 가까운 낙관적 상한을 추정한다.
- 따라서 다섯 번째로 좋은 후보를 선택할 때도 있다. 지금은 덜 좋아 보여도 개선될 가능성이 큰 가지를 탐색해 높은 재현율(high recall)로 유망한 영역을 놓치지 않는다.
-
후보의 재조합과 공유 문맥
- 두 후보의 아이디어를 합쳐 세 번째 후보를 만드는 재조합(recombination)도 시도한다.
- 병렬 분기가 완전히 독립된 에이전트로 분리되는 것이 아니라, 실행 결과와 사고 기록을 정리해 하나의 공유 문맥으로 누적한다.
- 문맥이 무한히 커지지 않도록 가지를 가지치기하지만, 이전 시도와 실패 원인을 다음 시도가 참고한다.
-
초기 후보를 만드는 방법
- 문제의 자연어 설명만 줘도 Gemini가 첫 코드를 만들 수 있다.
- 관련 논문 다섯 편을 제공하면 Gemini가 논문을 읽고 기존 방법을 재현하려 시도한다.
- 첫 코드는 버그가 있거나 점수가 음의 무한대로 떨어질 수 있지만, 이후 변이 과정이 오류를 수정하고 더 나은 후보를 찾는다.
2.4. 점수함수 해킹과 인간의 외부 루프
-
가장 어려운 문제는 점수의 정의
- 과학자는 코드의 세부 구현보다 먼저 “좋은 결과”가 무엇인지 정해야 한다.
- 점수함수가 현실의 목표를 충분히 표현하지 못하면, 에이전트는 사람이 원하지 않은 방식으로 점수를 높인다.
- 목표를 한 번에 완벽하게 정하지 못하므로, 실행 결과를 보고 “그 뜻이 아니다”, “이 제약도 넣어라”라고 지시하는 반복이 필요하다.
-
진화적 코드 생성과 지식 기반 그라디언트
- 1970년대부터 코드를 무작위 변이하는 진화적 프로그래밍이 있었지만, 코드 공간에서 무작위 변이는 대부분 망가진 프로그램을 만든다.
- ERA는 Gemini가 과학적 문맥과 기존 논문을 이해한 채 변이 방향을 제안하므로, 무작위 탐색보다 유용한 “그라디언트”를 얻는다.
- 그렇다고 지니(genie)가 소원을 문자 그대로 잘못 들어주는 문제, 즉 reward hacking이 사라지는 것은 아니다. “조심해서 소원을 빌라”는 옛 지니 이야기처럼 목적함수 설계가 중요하다.
-
단계적 성능 도약
- Platt는 Gemini 2.0으로는 ERA가 사실상 작동하지 않았을 것이라고 말한다.
- 2.5부터 도구가 실제로 작동하기 시작했고, 이후 주요 버전과 반 버전이 바뀔 때마다 성능이 크게 좋아졌다.
- 코딩, 관련 지식 검색, 모델 적합, 데이터셋 제안 능력은 빠르게 좋아졌지만 창의성·철학·엄밀함의 발전은 같은 속도라고 보기 어렵다. 능력은 “들쭉날쭉한 경계(jagged frontier)”를 보인다.
-
인간이 맡는 외부 루프
- ERA는 몇 시간 실행한 뒤 결과와 사례를 가져오고, 과학자는 다음 논문·가설·제약을 제시한다.
- 이 구조는 잠들지 않는 매우 열성적인 대학원생과 비슷하다. 사람은 시스템이 멈춘 곳을 보고 더 좋은 질문을 던진다.
- 비용도 문제다. LLM 호출 토큰뿐 아니라 점수함수 안의 시뮬레이션·몬테카를로 계산에 CPU/GPU가 들기 때문에, 제한된 예산을 어디에 쓸지에 대한 스케일링 법칙이 아직 필요하다.
3. 과적합, 다중 가설 검정, 그리고 과학적 엄밀함
3.1. 여러 가설을 시험할 때 생기는 허위 발견
-
다중 가설 검정(multiple hypothesis testing)
- 수십억 개의 가설을 데이터에 던지면 우연히 맞아 보이는 결과가 반드시 나온다.
- 과학자가 “이것이 세계가 작동하는 방식”이라는 기술적·설명적 모델을 주장하려면, 단순히 점수가 높은 것과 구분해 거짓 발견률(false discovery rate)을 관리해야 한다.
- ERA는 새로운 물리학을 자동으로 증명하는 장치라기보다, 과학자가 새로운 과학을 발견하도록 돕는 파워 툴이다.
-
과적합은 더 강력한 도구에서 더 위험하다
- ERA 같은 시스템은 사람이 수작업으로 시도할 수 있는 것보다 훨씬 많은 후보를 빠르게 시험한다.
- 그만큼 숨겨진 검증 세트를 끝까지 보지 않고, 훈련·탐색 데이터에 대한 성능을 일반화 성능으로 착각하기 쉽다.
- Platt는 강력한 도구를 잘못 쓰면 손가락을 잘라 버릴 수 있다고 농담한다. 해결책은 같은 통계적 검증법을 더 엄격하게 적용하는 것이다.
3.2. Kaggle과 Goodhart의 법칙
-
AutoKaggle에서 출발한 ERA
- Google에 Kaggle이 속해 있다는 점에서 ERA 프로젝트는 “AutoKaggle” 문제에서 출발했다.
- 놀이터 성격의 Kaggle 대회에서는 매우 좋은 성능을 냈고, 미국 각 주와 준주에서 다음 주 COVID·독감 환자 수를 예측하는 CDC 대회에서도 훌륭한 결과를 냈다.
- 모든 대회에서 최고 순위를 차지한 것은 아니다. 상위권의 마지막 0.001을 깎으려면 사람이 데이터와 결과를 오래 들여다보며 세밀한 관리(TLC)를 해야 하기 때문이다.
-
사람도 보상 해킹을 한다
- Google의 콘트레일 대회에서 참가자들은 라벨의 중심과 왼쪽 아래 좌표를 반 픽셀 잘못 처리한 오류를 발견했다.
- 인공 데이터를 회전할 때 반 픽셀 오프셋을 보정하지 않은 점을 이용해 점수를 조금 더 올렸다.
- 이는 에이전트만 점수를 해킹하는 것이 아니라 인간 참가자도 목표가 된 지표의 허점을 적극적으로 찾는다는 사례다.
-
Goodhart의 법칙
- 지표가 목표가 되는 순간 그 지표는 더 이상 좋은 지표가 아닐 수 있다.
- 하나의 리더보드가 만들어질 때마다 참가자는 그 리더보드에 특화되므로, 새로운 검증층·외부 데이터·물리적 제약이 필요하다.
4. 항공기 고도 조정으로 줄이는 비행운 온난화
4.1. 비행운은 왜 지구를 데우는가
-
콘트레일과 켐트레일의 구분
- 콘트레일(contrail)은 제트기 뒤에 생기는 응결운(condensation trail)이며, 켐트레일(chemtrail)은 근거 없는 음모론이다.
- 짧게 생겼다가 사라지는 줄무늬는 영향이 작지만, 하늘에 와플처럼 오래 남는 지속성 콘트레일-권운(contrail cirrus)이 기후에 영향을 준다.
-
태양광 반사와 적외선 포획의 경쟁
- 얇은 흰 구름은 낮에 햇빛을 반사해 냉각 효과를 낸다.
- 지구는 약 300K에서 약 10마이크로미터의 원적외선(far infrared)으로 흑체복사(black-body radiation)를 방출한다.
- 콘트레일은 이 파장에서 알베도가 낮고 거의 검은 물체처럼 행동해 지구가 내보내는 적외선을 흡수한 뒤 양방향으로 재방출한다.
- 적외선 포획은 밤낮으로 지속되지만 햇빛 반사는 낮에만 일어나므로, 평균적으로 온난화 효과가 우세하다.
-
규모
- 콘트레일은 인간 활동으로 인한 지구 온난화의 약 1%를 차지한다는 추정이 있다.
- 항공 교통이 많은 유럽에서는 추가 콘트레일 권운이 하늘의 몇 퍼센트를 덮을 수 있다.
- 유럽 같은 고항공교통 지역의 국소 복사강제력은 약 1W/m²에 달할 수 있으며, 인간 활동 전체의 전 지구 평균 온난화 복사강제력 약 3W/m²와 비교하면 국소적으로 매우 크다.
4.2. 고도 조정이 값싼 개입인 이유
-
얼음 과포화 영역(ice-supersaturated region)
- 콘트레일은 대기 중 얼음 과포화 영역을 통과할 때 오래 지속된다.
- 이 영역은 설탕을 너무 많이 녹인 용액에 작은 설탕 알갱이가 들어가면 전부 결정화되는 록 캔디(rock candy)에 비유할 수 있다.
- 제트 배기가스의 수분이 물방울이 되었다가 얼음으로 변하고, 얼음 결정이 지속성 구름으로 성장한다.
-
증폭 비율과 회피 방법
- 나쁜 영역에서는 물·얼음·그을음 1g을 배출할 때 약 10kg의 물이 빨려 들어가는 것으로 추정된다.
- 이는 약 10,000 대 1의 거대한 증폭 비율이다.
- 과포화 영역은 수백 미터 높이의 팬케이크 같은 얇은 층으로 나타나는 경우가 많다.
- 비행기를 단지 두 비행고도(flight level) 아래로 보내면 영역을 피할 수 있고, 추가 연료비는 크지 않다.
-
탐지와 예측
- 위성 이미지로 이미 만들어진 콘트레일을 연속적으로 감시하고, 기상 모델만으로는 충분히 정확하지 않은 얼음 과포화 위치를 맞춤형 CNN·U-Net 모델로 예측한다.
- 예측 지도는 항공편 계획 소프트웨어로 전달되어 비행기가 나쁜 지점을 우회하도록 한다.
- 과포화 영역은 열대권계면 바로 아래의 따뜻하고 습한 공기와 관련되고, 수일간 지속되다가 천천히 사라질 수 있다. 따라서 단순히 항공기가 지나간 자리를 보고 다음 날을 추측하는 것이 아니라, 대기 구조를 예측해야 한다.
4.3. ERA가 콘트레일 연구를 막힌 지점에서 풀어낸 방식
-
반사광의 반사실(counterfactual) 문제
- 실제 콘트레일이 있을 때 측정되는 복사량은 관측할 수 있지만, 같은 시공간에 콘트레일이 없었더라면 얼마였는지는 직접 볼 수 없다.
- 이 “일어나지 않은 세계”를 추정하려면 반사실 모델(counterfactual model)이 필요하다.
- 장파 복사(outgoing longwave radiation)는 비교적 작동하는 반사실 모델이 있었지만, 햇빛 반사 효과 모델은 2년 동안 해결하지 못했다.
-
인공 데이터에서 검증
- 인공 데이터에 콘트레일 효과를 주입하면 주입량을 알고 있으므로 모델이 얼마나 정확한지 시험할 수 있다.
- 기존 시도는 팀이 만든 자체 테스트도 통과하지 못했지만, ERA는 여러 교란변수(confounder)를 탐색해 테스트를 통과하는 조합을 찾았다.
- 결과는 거대한 코드 괴물이 아니라, 이미 알려진 변수 몇 개의 단순한 조합에 가까웠다. 다만 사람이 시도하지 않았던 조합을 찾았다는 점이 가치였다.
5. CO₂ 관측과 날씨·기후 모델의 차이
5.1. CO₂ 흡수량의 큰 불확실성
-
탄소 플럭스의 미지수
- 인간이 배출한 CO₂의 일부는 바다에 무기화학적으로 흡수되고, 일부는 육상 생태계와 식물에 흡수된다.
- 생물권이 현재 온도와 CO₂ 증가에 2100년까지 어떻게 반응할지는 확실하지 않다.
- 생물권 흡수량의 불확실성만으로도 2100년 대기 CO₂ 농도에 약 300ppm의 오차가 생길 수 있다.
- 현재 농도가 약 440~450ppm이라는 점을 고려하면 이 불확실성은 매우 크며, CO₂ 농도를 정밀하게 관측하는 일이 탄소순환 예측의 첫 단계가 된다.
-
위성 간 결합의 가치
- OCO 계열의 정밀한 CO₂ 측정과 GOES 계열의 빈번한 넓은 관측을 결합하면 좁고 정확한 관측을 넓고 자주 갱신되는 지도에 전달할 수 있다.
- 날씨, 장기 알베도, 지역별 환경 정보까지 넣으면 단일 센서가 제공하지 못하는 대기 농도 추정이 가능해진다.
5.2. 날씨 예측은 빠르게 좋아졌지만 기후 예측은 훨씬 어렵다
-
날씨(weather)
- 날씨는 대략 최대 15일 앞의 대기 궤적을 예측하는 문제다.
- 대기는 혼돈계라 작은 초기 조건 차이가 2~3주 뒤 전혀 다른 날씨가 되는 나비효과가 있다.
- 2018년 전후의 머신러닝, 대규모 데이터와 계산 자원만으로도 날씨 모델은 큰 도약을 이뤘다.
- 열대성 저기압은 해수면의 열을 대기 운동으로 바꾸는 열기관이므로, Google의 새 모델은 며칠 앞의 경로와 강도 변화를 더 정확히 추적할 수 있다.
-
기후(climate)
- 기후는 2070년 특정 지역에 비가 올지 맞히는 것이 아니라 장기 평균과 분포를 예측하는 문제다.
- 식물·얼음·육지·해양의 반응이 시간이 지나며 변하기 때문에 시스템은 비정상적이다.
- 미래 30~50년의 데이터를 기다려 검증할 수 없고, 과거에도 한 장소에 장기간 측정기를 둔 자료가 많지 않다. 운이 좋아도 연간 관측값 수십 개뿐일 수 있다.
- 기후의 상태 공간(attractor)을 예측하는 것이 아니라 인간 활동이 attractor 자체를 움직이고 있다. tipping point에서 attractor의 모양이 급격히 바뀔 수도 있다.
- 시뮬레이터가 불안정해졌을 때 그것이 실제 물리적 불안정인지 모델의 오류인지 구별하기가 매우 어렵다.
-
과정 기반 모델(process model)의 난점
- 복잡한 기후를 수천 개의 작은 과정으로 쪼개고, 각 과정에 대한 논문의 근사식을 이어 붙인다.
- 구름 속 얼음 미세물리에서는 얼음 결정의 모양에 따라 낙하 속도가 달라지고, 콘트레일 내부의 습기가 바깥으로 섞이는 속도도 잘 모른다.
- 이 작은 불확실성이 콘트레일뿐 아니라 기후 모델 전체에 강하게 전파된다.
- ERA가 오늘 당장 기후를 혁명적으로 해결한 것은 아니지만, 장차 방대한 논문과 평가된 지식을 읽고 물리적으로 일관된 코드를 쓰는 도구가 되면 이 조각난 지식을 퍼즐처럼 조립할 가능성이 있다.
5.3. 데이터가 풍부한 문제와 열린 문제
-
닫힌 데이터 풍부 영역
- 단백질 구조처럼 관측과 데이터가 충분한 영역에서는 AlphaFold 같은 데이터 기반 모델이 매우 강력하다.
- Protein Data Bank(PDB)의 구조를 대규모로 처리하고 공개한 접근은 생물학자들이 실제 도구로 활용할 수 있을 만큼 문제를 닫힌 형태로 만들었다.
- 모델이 내부적으로 직관적인 방정식을 제공하지 않아도, 범위 안에서 정확하고 반복 가능한 예측을 하면 실용적 가치가 크다.
-
열린 데이터 부족 영역
- 기후처럼 비정상적이고 미래로 크게 외삽해야 하는 영역은 통계 모델만으로 신뢰하기 어렵다.
- 거대한 블랙박스가 “세포가 작동하는 방식”이나 “기후가 변화하는 방식”을 말했다고 해서 바로 믿을 수 없다. 극단값·블랙스완·관측 범위 밖에서도 타당한지 검증해야 한다.
- 연구의 출발점은 언제나 단순한 기준선이다. Platt는 복잡한 모델을 만들기 전에 선형회귀와 SVM부터 맞춰 보라고 반복해서 권한다.
6. 기후 개입과 회복력: 증상을 치료하면서 원인도 공격하기
6.1. “슬픔의 파이 차트”와 개입의 경제성
-
단일 은탄환은 없다
- 온실가스는 경제 전반의 다양한 활동에서 나오므로 하나의 해결책만으로는 충분하지 않다.
- 재생에너지와 배터리는 이동하지 않는 분야에서 기존 방식보다 경제적으로 좋아지는 경우가 많지만, 항공은 현재 배터리의 에너지 밀도로 대체하기 어렵다.
- 항공기용 배터리는 작고 짧은 거리만 비행할 수 있으며, 핵배터리 같은 기술이 나오지 않는 한 장거리 항공을 대체하기 어렵다.
-
전기화의 남은 20%
- 이상적으로는 모든 것을 전기화하고 싶지만, 시멘트와 철강은 어렵고 항공은 더 어렵다.
- 모든 것을 전기화하면 필요한 전력량이 약 5배로 늘어날 수 있다.
- 재생에너지와 배터리만으로 마지막 10~20%를 덮으려면 저장장치가 급격히 많아져 비용이 커진다.
- 값싸고 안정적인 기저전원이 그 마지막 구간을 맡을 수 있으며, 상용 핵융합이 가능해지면 큰 기후 개입이 될 수 있다.
-
시장과 함께 작동하는 개입
- 에너지 개입은 기존 에너지원과 비용으로 경쟁해야 한다.
- 기후에 좋다는 이유만으로 경제적 부담을 무시하기 어렵고, 비용이 낮거나 공동편익(co-benefit)이 있어야 확산된다.
- Platt는 한 스타트업이 핵융합로의 중성자 플럭스로 수은을 금으로 바꾸어 금을 팔 수 있다는 아이디어를 냈다는 이야기를 농담처럼 소개한다. 실제 성립 여부와 별개로, 경제적 공동편익을 찾으려는 발상이 기술 채택에 중요하다는 사례다.
6.2. 산불 조기 탐지와 기후 회복력
-
작을 때 끄는 산불
- 방 크기 정도의 산불은 일찍 발견하면 진압하기 쉽지만, 1에이커까지 커지면 훨씬 어렵다.
- 불은 방 크기에서 에이커 규모로 기하급수적으로 커질 수 있어 탐지 지연이 피해를 결정한다.
-
FireSat 구상
- 저궤도 위성 50~80개를 전 지구에 배치하면 중파 적외선(midwave IR)으로 약 5m 정사각형 규모의 초기 화재를 지구 어디서든 15~20분 안에 탐지할 수 있다.
- 불은 뜨겁기 때문에 흑체복사 원리로 중파 적외선에서 두드러진다.
- Earth Fire Alliance라는 비영리 조직과 협력하고 Muon Space가 위성을 제작했으며, 이미 프로토타입 위성 하나를 발사했다.
-
센서와 AI의 결합
- 센서의 원래 공간 해상도는 약 50×50m지만, 다중분광 정보와 화재 위치 지식을 이용한 초해상도로 약 5×5m 수준까지 보완한다.
- Google은 기존 위성·데이터 피드로 화재 경계를 감지하고, Android와 검색을 통해 사람에게 알린다.
- 미국 산림청과는 1970년대 Rothermel의 과정 기반 산불 확산 모델을 빠르게 실행하는 신경망 대리모델(proxy model)을 만들었다.
-
공중보건의 규모
- 세계보건기구(WHO)는 산불 연기로 인해 전 세계에서 연간 약 30만 명의 초과 사망자가 발생한다고 추정한다.
- 산불은 주택을 태우는 재난일 뿐 아니라 대륙을 가로지르는 연기와 호흡기 질환을 일으키는 공중보건 문제다.
- 기후변화가 심각한 질병이라면 원인을 공격하는 감축과 증상을 줄이는 적응·회복력을 동시에 진행해야 한다.
7. 핵융합과 물리적 안전장치
7.1. 핵융합의 현실적 시간표와 조건
-
“핵융합은 30년 뒤”라는 농담
- 핵융합은 오랫동안 언제나 30년 뒤라고 불렸지만, Platt는 상용적으로 의미 있는 핵융합이 이번 10년 말까지 나올 확률이 분명히 있다고 본다.
- 자신의 추정으로는 30년보다 3년 쪽에 가까울 수도 있다고 농담하지만, 기술이 실제로 작동하고 자본비용이 충분히 낮아지는지는 여전히 미지수다.
-
Lawson criterion
- 핵융합은 플라즈마의 밀도, 온도, 에너지 감쇠 시간인 가둠 시간(confinement time)의 곱이 일정 임계값을 넘어야 한다.
- 세 숫자 중 하나만 높이는 뉴스는 전체 조건을 충족했다는 뜻이 아니다.
- 각 핵융합 방식은 세 요소 중 하나가 약한 Achilles heel을 가지고 있으며, 세 조건을 모두 만족해야 순에너지 이득이 가능하다.
-
토카막과 FRC
- 토카막은 대체로 안정적이지만 드물게 불안정성이 전체 에너지를 한 지점에 때려 넣는 disruption이 발생한다.
- 진공 용기에 에너지가 집중되면 큰 손상이 생겨 수리로 장기간 가동이 중단될 수 있다.
- Field-Reversed Configuration(FRC)은 안팎의 자기장이 반대 방향이고 separatrix로 나뉘는 자기적으로 자기완결된 축구공 모양의 플라즈마다.
- 이론상 불안정하다고 여겨졌지만 실제로는 벽에 부딪혀도 비교적 안정적일 수 있다. 다만 FRC도 방전과 진공 용기 손상에서 자유롭지는 않다.
-
제어 시스템
- 토카막은 불안정성을 피하도록 자기장을 제어해야 한다.
- FRC의 Z 불안정성은 플라즈마가 앞뒤로 흔들리는 형태이므로 PID 제어기가 플라즈마를 반응기 중앙에 유지하게 한다.
- Google DeepMind는 토카막이 불안정해져 disruption으로 가는 것을 막는 제어 시스템을 연구하고 있다.
7.2. 헬륨과 기술 농담
- Platt는 핵융합이 만들어내는 헬륨을 원한다는 물리학자다운 농담을 한다.
- 헬륨-4는 전략 비축량이 줄어 희소해지고 있고, 헬륨-3는 희석 냉동기(dilution refrigerator)와 양자 기술에 유용하다.
- 헬륨이 고갈되면 많은 첨단 기술이 중단될 수 있지만, 미국의 전략 헬륨 비축은 한때 중요한 비행선 함대를 위해 만들어졌다는 역사적 일화도 덧붙인다.
8. 젊은 과학자에게 필요한 역량과 생산성의 함정
8.1. 도메인 전문성·창의성·엄밀함
-
전문성은 사라지지 않는다
- Platt의 21세 아들은 RNA 도메인을 깊이 공부하면서 AI, 코딩, 바이브 코딩 도구도 함께 사용한다.
- 현재 어떤 도구 체인이 최선인지 아무도 확실히 모르므로, 전문성을 갖춘 채 여러 도구를 직접 실험하는 것이 가장 현실적인 전략이다.
- 실험실의 실제 작업은 여전히 과학의 ground truth이며, 모든 실험을 자동으로 수행하는 일반 실험실은 아직 없다.
-
창의성과 엄밀함은 둘 다 필요하다
- AI가 코드를 쓰면 과학자는 창의적인 질문과 새로운 가설에 더 많은 시간을 쓸 수 있다.
- 동시에 결과가 틀리지 않았는지, 스케일되는지, 숨겨진 데이터에 속지 않았는지 확인하는 사람이 필요하다.
- 이 두 역할이 한 사람에게 모두 필요할 수도 있지만, 팀 안에서 서로 다른 사람이 맡아도 된다.
-
산을 운전해서 오르는 것과 걸어 오르는 것
- 모든 작업을 LLM으로 빠르게 해결할 수 있어도, 때때로 직접 문제를 오래 붙들며 기초 근육을 훈련해야 한다.
- Platt는 1980~90년대에 수치 라이브러리와 머신러닝을 직접 구현했고, 부스팅 알고리즘을 네 가지 언어로 여러 번 다시 썼기 때문에 알고리즘을 깊이 이해하게 됐다고 말한다.
- 이는 운동선수가 경기에서 전력 질주하는 시간과 훈련 시간을 나누는 것에 비유된다. 단기 생산성을 최대화하지 않는 학습 시간이 장기 생산성을 키울 수 있다.
8.2. 20% 시간과 “생산성 과적합”
-
Google 안에서도 Platt는 팀의 20% 시간을 지키려 한다.
- 구성원은 상사에게 보고하지 않고 배우고 싶은 것, 이상하고 위험한 것을 실험할 수 있다.
- 이런 놀이와 탐색에서 창의적 에너지가 생긴다.
- 모든 시간을 최적화하고 압착하면 생산성에 과적합(overfit)된다. 단기 지표는 좋아져도 새로운 문제에 대응하는 능력이 사라진다.
-
LLM을 중간관리자처럼 다루지 않기
- LLM에 세부 작업을 맡긴다고 해서 사람은 빈 껍데기 같은 중간관리자가 되어서는 안 된다.
- LLM은 인간과 다른 방식으로 이상한 실수를 하므로 완전히 신뢰할 수 없다.
- 사람이 직접 쓴 소프트웨어도 검증해야 하듯 AI가 만든 코드도 찔러 보고 실패시켜 봐야 한다. Feynman의 말처럼 사람은 자기 자신을 가장 쉽게 속인다.
-
오래가는 역량
- 물리과학·생물학·수학 같은 세계의 구조를 다루는 도메인 지식은 오래가는 기반이다.
- 검증, 엄밀함, 기본 원리, 창의적 발상, 상자 밖 사고도 도구가 바뀌어도 남는다.
- AI로 인해 무엇이 변하더라도 이 역량들은 결과를 판단하고 문제를 제대로 정의하는 기준으로 기능한다.
9. 양자컴퓨팅, 과학사의 반복, 그리고 개인적 일화
9.1. 양자컴퓨팅의 현재 위치
-
NISQ에서 유용한 계산으로
- 오늘의 양자 장치는 완전한 양자컴퓨터보다 NISQ(Noisy Intermediate-Scale Quantum) 시대의 양자 장치에 가깝다.
- Google 양자팀의 Quantum Echoes 알고리즘은 측정 데이터, 예를 들어 NMR 관측값에 맞게 해밀토니안(Hamiltonian)의 매개변수를 조정하는 문제에 적용될 수 있다.
- 이론적인 장난감이 아니라 NMR 매개변수 추정 같은 실용 문제와 연결될 가능성이 있지만, 충분히 큰 장치에서 획기적인 우위를 낼지는 아직 결정되지 않았다.
-
확장 시간표
- Google 양자팀은 수년 전 세운 로드맵을 따라 확장되고 있으며, 몇 년에서 수년 안에 의미 있는 계산을 수행할 가능성이 있다.
- 초전도 큐비트는 확장성이 좋아 유력하지만, 중성 원자 등 다른 기술이 최종 승자가 될지는 모른다.
- 초전도 회로는 물리 큐비트와 논리 큐비트의 비율이 아직 크고, 2차원 칩의 연결성 때문에 오류 보정 부담이 있다.
- 공진기를 환경과 분리하면 깨끗하고 오래 유지되지만 이웃 공진기와 상호작용하기 어려워진다. 이 상충은 기본적인 불확정성 원리라기보다 공학적 제약이다.
-
급격한 상전이보다는 끈질긴 공학
- 큐비트는 여전히 아날로그적이고 매우 까다로운 장치이므로, 갑자기 모든 문제가 해결되는 “상전이”는 기대하기 어렵다.
- Platt는 양자컴퓨팅이 30년 뒤는 아니지만 내일도 아니며, 하드웨어 돌파가 있어도 시스템을 확장하고 안정화하는 데 시간이 걸린다고 본다.
- 동료가 “양자컴퓨팅은 늘 20년 앞서 있다”고 놀리지만, Platt는 10년이 지나면 “이제 절반 왔다”고 농담한다.
9.2. Feynman 수업과 컴퓨팅의 역사
-
1982년 Caltech의 물리학과 계산 수업
- Platt는 Richard Feynman, Hopfield, Carver Mead와 함께 물리학과 계산을 다루는 수업을 들었다.
- 화요일에는 초청 강사가 말하고 목요일에는 Feynman이 그 내용이 왜 틀렸는지 설명했다.
- Feynman의 설명을 들을 때는 이해한 것 같지만 교실을 나가면 사실 하나도 이해하지 못했다는 “Feynman effect”를 회상한다.
- DARPA 지원 수업이라 매주 학생에게 프라임 립 저녁이 제공됐고, Platt는 학생으로서 매주 참석했다.
-
당시의 계산 자원
- Platt가 사용한 VAX 11/750은 약 1 MIPS 수준이었고, 연구그룹 전체가 식기세척기만 한 80MB 디스크 하나를 공유했다.
- 당시 신경망 연구는 혁명을 약속했지만 실제로는 계산 자원이 거의 없었다.
- 이후 BLAS, GPU, CUDA 같은 계산 기반이 신경망 알고리즘과 함께 진화했고, GPU가 CPU보다 확실히 빨라진 시점과 ImageNet·음성인식 도약은 우연이 아니었다.
9.3. 소행성·Pixar·이름 짓기의 일화
-
소행성 두 개를 발견한 과정
- 1980년대 Caltech에서 planetary science 수업을 들으며 Palomar의 빠른 망원경으로 같은 하늘을 몇 분 간격으로 촬영했다.
- 필름 두 장을 입체경으로 보면 별 사이에서 움직이는 천체가 튀어나왔고, 측정 현미경으로 기준 별과 위치를 재어 Minor Planet Center에 보냈다.
- 여러 관측을 하나의 궤도로 연결하는 마지막 관측을 제공하면 발견권과 명명권을 얻었다.
- 오늘날 칠레의 Vera Rubin Observatory와 Simonyi Survey Telescope는 이 과정을 자동화해 6주 만에 약 11,000개의 소행성을 발견했다.
- Platt가 발견한 소행성 중 하나에는 약 1km 크기의 위성이 있고, 주 천체는 약 4km로 추정된다. 어머니의 이름을 딴 소행성에 달이 있다는 사실을 자랑스럽게 이야기한다.
-
Pixar 오스카
- 1986년 Schlumberger의 AI 연구실 인턴으로 컴퓨터 그래픽에 물리 시뮬레이션을 적용했다.
- 탄성 이론을 이용해 천·고무·늘어나는 물체를 시뮬레이션했고, 관련 논문과 후속 연구가 Pixar 영화의 물리 시뮬레이터에 영향을 줬다.
- 작업 후 약 20년이 지나 기술개발 부문 아카데미상을 받았다. 인턴에게 “아주 잘하면 오스카를 받을 수도 있다”고 반농담으로 말하는 이유다.
주요 발언 모음
“과학자가 대체되지는 않을 것이다. 과학자는 창의적인 일, 엄밀한 일, 철학적인 일에 시간을 쓰게 될 것이다.”
“파워 툴이기 때문에 손가락을 잘라 버릴 수도 있다. 자신을 속이지 않도록 더 엄격하고 더 엄밀해야 한다.”
“항공기가 나쁜 대기 지점을 피하도록 고도를 두 단계만 바꾸면 된다. 기후 영향에 비해 비용은 크지 않다.”
“생산성에 과적합될 수 있다. 모든 것을 최적화하고 짜내면 놀이와 학습을 잃는다.”
“누구나 JSON을 보내면 어떤 실험이든 해 주는 ‘모든 것의 실험실’을 만들고 싶다.”
“항상 선형회귀부터 맞춰라. 그냥 해라.”
핵심 데이터 & 수치
- 약 1%: 콘트레일이 인간 활동으로 인한 지구 온난화에 기여하는 추정 비중.
- 약 300K·10μm: 지구의 대표적 흑체복사 온도와 원적외선 파장.
- 약 1W/m² 대 약 3W/m²: 고항공교통 지역의 콘트레일 국소 복사강제력과 인간 활동 전체 전 지구 평균 온난화 복사강제력.
- 10kg 대 1g, 약 10,000:1: 얼음 과포화 영역에서 배출 수분·얼음·그을음 1g이 끌어들이는 물의 추정량.
- 약 두 flight levels: 지속성 콘트레일을 피하기 위해 바꿀 수 있는 비행고도 규모.
- 약 440~450ppm: 현재 대기 CO₂ 농도에 대한 대략적 수치.
- 약 300ppm: 2100년 생물권 CO₂ 흡수 불확실성으로 생길 수 있는 농도 오차.
- 약 15일: 혼돈성 대기 궤적을 직접 예측하는 날씨 예보의 대략적 시간 범위.
- 5배: 전 세계 모든 것을 전기화할 때 필요한 전력량이 늘어날 수 있는 규모.
- 50~80개 위성, 15~20분, 약 5m 화재: FireSat 구상에서 전 지구 초기 산불을 탐지하기 위한 대략적 위성 수·탐지 시간·화재 크기.
- 약 50×50m → 약 5×5m: 중파 적외선 센서 원해상도와 AI 초해상도로 얻으려는 화재 위치 해상도.
- 연간 약 30만 명: WHO가 추정하는 산불 연기 관련 전 세계 초과 사망자.
- 약 1MIPS·80MB: 1980년대 Platt가 경험한 VAX 11/750의 처리량과 연구그룹 공유 디스크 용량.
- 약 11,000개: Vera Rubin Observatory의 Simonyi Survey Telescope가 6주 동안 발견한 소행성 수.
- 약 4km·약 1km: Platt의 어머니 이름을 딴 소행성 본체와 위성의 추정 크기.
결론 및 시사점
- AI for Science의 핵심은 자연어를 곧바로 정답으로 바꾸는 것이 아니라, 좋은 과학 질문을 측정 가능한 점수·제약·검증 절차로 번역하는 데 있다.
- ERA는 Gemini의 코드 생성·논문 읽기·세계 지식과 Monte Carlo/UCB 탐색을 묶어, 사람이 몇 주 또는 몇 달 걸릴 후보 탐색을 지속적으로 수행한다.
- 점수함수와 데이터셋을 잘못 설계하면 AI는 놀라운 보상 해킹을 하므로, 강력한 AI일수록 보이지 않는 홀드아웃 데이터와 독립적인 물리 검증이 필수다.
- 콘트레일 회피는 온실가스 전체를 해결하지 않지만, 비행고도를 약간 변경하는 낮은 비용의 지역적 개입으로 항공의 약 1% 기후 영향을 줄일 수 있다는 현실적인 사례다.
- 기후 문제는 미래 데이터가 없고 attractor 자체가 움직이는 비정상적 시스템이므로, 닫힌 데이터 영역의 성공을 그대로 외삽해서는 안 된다.
- 기후 감축과 함께 산불 조기 탐지·허리케인 예측·위험 지도 같은 회복력 기술도 강화해야 하며, 심각한 질병을 치료하듯 원인과 증상을 동시에 다뤄야 한다.
- 핵융합은 에너지 전환의 마지막 10~20%를 담당할 잠재력이 있지만, 밀도·온도·가둠 시간이라는 Lawson criterion을 모두 충족해야 하며 단일 수치의 진전만으로 성공을 선언할 수 없다.
- 데이터가 충분한 단백질 구조 문제에는 블랙박스 예측이 유용할 수 있지만, 기후처럼 열린 문제에서는 설명 가능성·외삽 안정성·물리적 일관성이 더 중요하다.
- 젊은 과학자는 도메인 전문성을 깊게 쌓으면서 LLM·바이브 코딩·자동화 실험을 직접 시도해야 하며, AI가 모든 물리 실험을 대신할 때까지 기다릴 이유가 없다.
- 가장 오래가는 역량은 창의성, 기본 원리, 엄밀한 검증, 실패를 알아채는 감각이며, 20% 시간처럼 비생산적으로 보이는 놀이와 훈련이 장기적으로 이 역량을 만든다.
핵심 요약 (20줄)
- ERA는 과학 문제를 점수화된 코드 탐색 작업으로 바꾸고 Gemini가 후보 노트북을 반복 생성하게 한다.
- 과학적 설명 모델은 데이터셋의 오차만 낮추는 예측 모델과 달리 현실의 규칙을 담아 외삽할 수 있어야 한다.
- ERA는 Monte Carlo 트리와 Upper Confidence Bound로 현재 최고 후보뿐 아니라 개선 가능성이 큰 후보도 탐색한다.
- 한 번에 약 10개 가지를 병렬로 키우고 공유 문맥에서 이전 실패와 성공을 다음 시도에 반영한다.
- 관련 논문을 제공하면 Gemini가 기존 방법을 읽고 초기 코드를 재현한 뒤 새로운 조합을 시험한다.
- 잘못된 점수함수는 에이전트가 사람이 원하지 않은 방식으로 지표를 높이는 보상 해킹을 일으킨다.
- 콘트레일은 낮에 햇빛을 반사하지만 밤낮으로 지구 복사를 가두기 때문에 평균적으로 온난화 효과를 낸다.
- 지속성 콘트레일은 인간 활동으로 인한 지구 온난화의 약 1%를 차지한다는 추정이 있다.
- 얼음 과포화 영역을 피해 비행고도를 두 단계 낮추면 큰 연료비 없이 콘트레일을 줄일 수 있다.
- ERA는 2년 동안 풀지 못한 콘트레일 반사광의 반사실 모델에서 단순하지만 유효한 교란변수 조합을 찾아냈다.
- 현재 대기 CO₂ 농도는 약 440~450ppm이며 2100년 생물권 흡수량의 불확실성만 약 300ppm에 달할 수 있다.
- 날씨는 약 15일의 대기 궤적을 예측하지만 기후는 움직이는 attractor의 장기 통계를 예측해야 한다.
- 기후 모델은 얼음 결정의 모양과 구름 내부 혼합처럼 작은 미지수가 전체 결과를 크게 흔드는 비정상 시스템이다.
- 데이터가 풍부한 단백질 구조에는 AlphaFold 같은 모델이 강력하지만 열린 기후 문제에는 물리 제약과 외부 검증이 필수다.
- 전 세계를 전기화하면 전력 수요가 약 5배가 될 수 있어 재생에너지와 배터리만으로 마지막 10~20%를 채우기 어렵다.
- FireSat 구상은 50~80개 저궤도 위성으로 15~20분마다 약 5m 규모의 초기 산불을 찾는 것을 목표로 한다.
- 산불 연기는 전 세계에서 연간 약 30만 명의 초과 사망자와 연결되는 심각한 공중보건 문제다.
- 핵융합은 밀도·온도·가둠 시간의 Lawson criterion을 모두 넘어야 하며 단일 성능 수치만으로는 충분하지 않다.
- 젊은 과학자는 깊은 도메인 지식과 AI 도구 실험을 결합하고, 직접 문제를 풀어 기초 근육과 검증 감각을 길러야 한다.
- AI는 과학자를 대체하기보다 창의성·철학·엄밀함에 집중하게 만드는 파워 툴이 될 가능성이 크다.
