URL: https://www.youtube.com/watch?v=xc2FTBGRSJo 날짜: 2026-10-03 채널: ycombinator
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==GPU·Transformer·역전파에 맞춰진 현재의 하드웨어-소프트웨어 결합을 넘어, 빛·뉴로모픽 회로·살아 있는 신경세포처럼 각 물리 기질의 강점을 살리는 계산 체계를 만들 수 있는가?==
- Transformer의 확장은 연산량보다 메모리 용량과 메모리 대역폭을 빠르게 요구하고, 최근 GFLOP/J 개선은 정체되어 있다.
- 인간의 뇌는 약 20W로 언어·추론·창의성·감각·행동·평생학습을 수행하므로, 인간 수준 계산에는 FLOP당 비용을 크게 낮출 방법이 필요하다.
- 광학 계산은 빛의 전파 자체로 대규모 선형 연산을 수행하고, 뉴로모픽 컴퓨팅은 기억과 계산·사건 기반 신호·적응을 결합하며, 생물학적 컴퓨팅은 실제 신경세포를 동적 시스템으로 다룬다.
- 세 접근 모두 범용 GPU를 그대로 대체한다기보다, 알고리즘·하드웨어·입출력 인터페이스를 함께 설계하고 특정 업무부터 확장해야 한다.
GPU 중심 컴퓨팅의 다음 단계는 단순히 더 큰 칩을 만드는 일이 아니다. 빛은 계산과 대역폭에 강하지만 저장·비선형성·변환에 약하고, 뉴로모픽 기질은 뇌의 원리를 빌리되 실리콘에 맞는 고유한 모델을 찾아야 하며, 배양 신경세포는 지능을 보일 가능성과 함께 학습·복제·서비스화라는 난제를 안는다.
1. GPU 시대의 효율 한계와 대안 탐색
하드웨어 아키텍처와 최적화 알고리즘은 서로를 바꾸며 발전해 왔지만, 현재의 결합은 에너지와 메모리 비용의 벽에 접근하고 있다.
1.1. 외계 문명에게 물을 질문과 GPU의 역사
-
계산을 둘러싼 저녁 식사 질문
- 초지능 외계인에게 질문 하나만 할 수 있다면 전력 문제를 어떻게 해결하는지, 또는 부동소수점 연산(FLOP)을 어떻게 계산하는지 묻게 된다.
- 다이슨 스피어나 핵에너지처럼 전력을 얻는 방법은 어느 정도 상상할 수 있지만, 어떤 물리적 기질로 연산하는지가 더 근본적인 질문이 된다.
-
2012년 이후의 하드웨어-소프트웨어 공진화
- AlexNet이 등장한 2012년부터 2019~2020년까지는 CNN이 중심이었고, CNN은 메모리나 대역폭보다 연산 효율이 중요한 구조였다.
- Focal Systems가 NVIDIA 관련 대회에서 12만 5,000달러를 받은 경험과 Jensen Huang과의 접점을 통해, 당시 NVIDIA의 관심이 AI보다 암호화폐에 가까웠다는 개인적 관찰이 소개된다.
- 여기서 암호화폐는 Bitcoin이 아니라 Ethereum이었다는 정정이 나온다. 당시 실리콘밸리에서는 암호화폐가 AI보다 훨씬 큰 수익 기회로 보였고, SBF 사태 전까지 그 분위기가 이어졌다.
-
CNN에서 Transformer로의 전환
- 2020년 이후 GPT-2·GPT-3 계열이 NVIDIA의 관심을 AI로 돌렸고, Transformer는 이전보다 훨씬 큰 메모리 용량과 메모리 대역폭을 요구했다.
- Ampere는 이런 요구에 맞춘 초기 세대였고, GPU 설계의 우선순위는 FLOP/J 같은 순수 연산 효율에서 메모리 용량·대역폭으로 이동했다.
- Attention의 (n^2) 성격이 메모리 요구의 폭증을 설명하는 요인으로 제시된다. 연산만 수행되면 세계의 바다를 끓일 만큼 전력을 써도 괜찮다는 식의 과장이 현재의 우선순위를 비꼰다.
1.2. 역전파와 뇌의 학습 방식 사이의 간극
-
하드웨어와 최적화기의 실시간 공진화
- 하드웨어 아키텍처와 optimizer가 서로의 요구에 맞춰 실시간으로 변하는 상황이 현재 AI 생태계의 핵심이다.
- GFLOP/J의 장기 추세는 최근 2년 동안 뚜렷한 개선이 거의 없는 상태로 정체됐고, 같은 방향의 확장만으로는 부족하다.
-
10년 안에 역전파를 쓰지 않을 가능성
- 발표자는 역전파를 널리 쓰기 전부터 딥러닝을 접했고, 10년 안에 역전파(Backprop)를 더 이상 사용하지 않을 수 있다고 전망한다.
- 인간 수준 계산을 위해서는 기가플롭당 비용을 크게 낮춰야 한다. 인간의 뇌는 전구 하나와 비슷한 약 20W로 매우 많은 일을 수행한다.
- 학습 칩과 추론 칩이 분리되면서 서로 다른 요구를 최적화할 여지는 생겼지만, 대부분은 여전히 Transformer를 중심으로 SRAM을 많이 넣는 방향에 머문다. HBM이 항상 필요한지는 의문이다.
-
뇌는 대규모 순전파에 가깝다
- 뇌에서 한 뉴런이 앞으로 발화한 뒤 똑같은 경로를 거꾸로 발화해 시냅스 가중치를 갱신한다는 설명은 실제 뇌의 작동 방식과 맞지 않는다.
- Hebbian learning 계열이 마주치는 weight-transfer problem은 한 시냅스 쌍에서 순전파한 뒤 다른 경로로 돌아와 가중치를 정확히 맞춰야 하는 문제다.
- 양쪽 회로가 같은 신호를 보고 활성화 장치를 두면 어느 정도 작동할 수 있지만, 그것은 역전파가 아니라 순환 그래프에 가깝다.
-
화학적 상태와 피질 기둥의 억제
- 뇌에는 활성화 뒤 남는 화학적 잔여, 발화 타이밍 같은 상태가 있어 단순한 순수 디지털 신호와 다르다.
- 뇌는 연결이 무작위로 뒤엉킨 거대한 거미줄이 아니다. 피질 기둥(cortical column) 같은 반복적 조립체가 서로 강하게 억제해 각 조립체가 독립적으로 학습하도록 한다.
1.3. 역전파 없는 optimizer와 SOMA 구상
-
빛·뉴로모픽·뉴런이라는 세 가지 희망
- 45억 년의 진화가 약 20W에서 구현한 뇌의 원리를 빌릴 수 있다.
- 빛은 데이터센터 안에서 전기와 빛을 반복 변환하는 비용을 줄일 수 있고, 뉴로모픽 회로는 뇌의 아날로그적 작동을 흉내 낼 수 있다.
- 다만 빛에 비트를 저장하거나 어느 기질에서든 역전파를 수행하는 일은 어렵기 때문에, 각각의 물리적 특성에 맞는 학습 절차가 필요하다.
-
SPSA와 영차(zeroth-order) 최적화
- 박사과정 초반 6개월 동안 영차 최적화 교과서에 나온 방법을 거의 모두 구현하고, 10억 파라미터 LSTM의 다음 토큰 예측을 학습시키는 실험을 했다.
- 가장 잘 작동한 방법은 James Spall과 제자들이 만든 SPSA(Simultaneous Perturbation Stochastic Approximation)였다.
- 모델 파라미터를 무작위 방향으로 반지름 ε만큼 더한 경우와 뺀 경우에 두 번 순전파하고, 두 결과의 유한차분을 무작위 방향에 곱해 업데이트한다.
- 유한차분이 0이면 해당 방향을 갱신하지 않고, 차이가 크면 그 방향으로 크게 움직인다. 중앙차분법·유한차분법 등으로도 불리며 명시적인 gradient가 필요 없다.
-
비매끄러운 손실 지형에서의 장점
- SPSA는 0/1 손실처럼 미분 불가능한 지형도 최적화할 수 있다.
- 예시로 든 비매끄러운 그릇 모양 함수에서 역전파는 빠르게 국소 최솟값에 갇히지만, 영차 방법은 바닥을 빠르게 찾는다.
-
SOMA: 피질 기둥처럼 모델을 분할하기
- LSTM은 원래 gradient가 흐르도록 설계됐지만 영차 최적화에는 그 이유가 사라진다. Transformer 역시 역전파와 GPU 병렬 학습을 염두에 둔 구조라 그대로 쓰기 어렵다.
- 제안 중인 SOMA(Soma Sharded Optimization, Mixture of Assemblies)는 Common Crawl을 TF와 SVD 계열 방법으로 군집화한 뒤, 군집별 Parquet 파일을 세계 여러 GPU에 하나씩 보낸다.
- 각 GPU는 약 4만 1,000개 규모의 작은 LSTM 전문가를 학습하고, 추론 시 모든 전문가를 모아 작은 router가 입력을 적절한 전문가로 보낸다. 하나의 거대한 모델이 아니라 여러 조립체가 분산 학습하는 구조다.
- SPSA의 gradient 추정 오차는 모델 크기가 커질수록 선형적으로 커져 100억 파라미터를 한 번에 학습하기는 비현실적이다. 모델을 분할하면 각 전문가의 크기가 오차와 잡음을 제한하므로 단계당 64회 이하의 섭동만으로도 작동할 가능성이 있다.
- 배치 크기를 키우면 gradient 추정 잡음이 줄어드는 것처럼, 모델을 더 많이 분할할수록 성능이 계속 좋아지는 세 번째 scaling law가 관찰됐다.
- 약점은 여전히 순전파 자체가 비싸다는 점이다. 순전파를 빛에서는 거의 공짜로, 뉴런에서는 20W로, 아날로그 회로에서는 투입 전류 수준으로 수행할 수 있다면 영차 방법의 계산 부담이 크게 줄어든다.
2. 광학 컴퓨팅: 빛의 전파를 연산기로 만들기
빛은 통신에서 이미 검증됐고, 저장과 비선형성보다 선형·병렬 연산에 강하다. 따라서 범용 CPU보다 특정 AI 업무에 맞춘 광학 장치가 현실적인 첫 목표가 된다.
2.1. 광자의 물리적 이점
-
이미 데이터센터 통신의 표준인 광자
- AI 데이터센터 랙 사이의 전송 대부분은 광섬유를 통해 이뤄지고, 대륙 간 데이터 전송의 약 99%도 광학 방식이다.
- 광자는 전자보다 손실이 약 1만 배 낮고 대역폭이 약 1만 배 크다. 일반적으로 1m를 넘는 정보를 전송할 때 전기 신호를 광자로 바꿔 보내는 이유다.
-
AI의 저정밀 연산과 광통신의 고비트화가 만나는 지점
- 전통적 전자 프로세서는 32비트·64비트 표현으로 계산한 뒤 낮은 비트 수로 바꿔 광학 전송을 했다.
- AI는 점점 낮은 비트 정밀도로 더 많은 연산을 빠르게 수행할 수 있고, 광통신은 더 큰 비트 깊이를 지원하므로 두 기술 사이에 계산 인터페이스가 형성되고 있다.
-
상호작용하지 않는 광자의 대규모 병렬성
- 광자는 서로 상호작용하지 않으므로 같은 공간에서 수많은 빛의 빔이 서로 영향을 주지 않고 공존할 수 있다.
- 전자 회로는 신호마다 경로를 분리해야 하지만, 광학 시스템은 공간·파장·위상 등 여러 차원에서 병렬성을 활용할 수 있다.
2.2. 광학 행렬 연산의 구조와 숨은 비용
-
전자식 행렬-벡터 곱과 광학식 행렬-벡터 곱
- 전자 회로는 전선을 충전하고 트랜지스터로 상태를 바꾼 다음 방전하면서 각 단계마다 에너지를 쓴다. 입력·출력 차원이 (n)이면 에너지 사용량이 대체로 (n^2)에 비례한다.
- 광학 회로는 (n)개의 변조기에 입력을 실어 설계된 weight mask를 통과시킨다. 빛의 전파와 수동 위상 변조가 곱셈을 수행하고, 검출기가 물리적으로 합산하므로 에너지가 (n)에 더 가깝게 증가한다.
-
Lightmatter 사례가 보여준 현실
- Lightmatter는 GPU에 가까운 계산량과 전력 효율을 보이는 전기-광-전자 PCIe 보드를 시연했다.
- 그러나 전체 에너지 예산에서 광자 계산 자체가 차지하는 비중은 작았다. 디지털 메모리와 광학 장치 사이를 오가는 변환, 제어, 보정이 더 큰 비용을 만들었다.
-
ADC·DAC와 보정의 병목
- 디지털 메모리의 모델을 광학 처리 장치로 보내려면 디지털→아날로그→광 변환이 필요하고, 결과를 되돌릴 때도 광→아날로그→디지털 변환이 필요하다.
- 장치를 정밀하게 프로그래밍하고 보정 상태를 유지하려면 능동적인 에너지가 계속 든다.
- 수동 광학은 대규모 선형 연산에 강하지만, AI의 비선형 활성화 함수는 트랜지스터나 디지털 회로처럼 쉽게 얻을 수 없다.
- 다중모드 광섬유에 짧고 강한 빛의 펄스를 넣어 빛-물질 상호작용으로 비선형성을 만드는 방법이 시도됐지만, 추가 장치와 복잡성을 요구한다.
2.3. 확산 모델을 위한 애플리케이션 전용 광학 장치
-
왜 이미지 생성인가
- 확산 모델은 학습된 신경망으로 무작위 데이터 분포를 목표 분포로 조금씩 변환한다. 이미지에서는 무작위 픽셀에서 시작해 같은 신경망을 반복 적용하며 깨끗하고 사실적인 이미지를 만든다.
- 이미지 한 장을 만들 때 같은 신경망을 최대 1,000회 적용할 수 있으므로 범용 전자 하드웨어에서 같은 연산을 반복하는 중복이 크다.
- 이 반복을 수동 광학 장치의 물리적 전파로 수행하면, 빛이 한 번 통과할 때 확산 과정의 한 단계를 공짜에 가깝게 계산할 수 있다.
-
노이즈 예측과 광학적 제거
- 물리 시스템에 노이즈가 있는 샘플을 넣고, 그 안의 예측 노이즈 항을 출력하게 만든다.
- 광선이 여러 투명 위상 변조층을 통과하면 회절을 거쳐 원하는 정보만 전달되고, 출력된 노이즈 항을 반복적으로 빼면서 깨끗한 이미지를 얻는다.
- 시스템을 설계할 때는 물리 법칙과 조작 방법을 알고 목표 함수를 정한 뒤, 여전히 디지털 역전파로 물리 장치의 파라미터를 학습한다.
-
고정 가중치에 맞춘 시간 분할
- 광학 weight는 바꾸기 어렵기 때문에 시간에 따라 활성화를 바꾸는 디지털 네트워크 대신, 전체 1,000단계(발표 중 한 대목에서는 10,000단계로 잘못 말함)를 100단계 단위의 하위 구간으로 나눈다.
- 각 하위 구간에서는 파라미터를 고정하고, 10개의 장치를 순서대로 사용해 한 장치가 100회씩 반복 처리하게 한다.
- 그러면 물리 하드웨어의 가중치를 바꾸지 않고도 서로 다른 노이즈 제거 단계를 모두 수행할 수 있다.
-
실험 결과와 스케일링
- 제한된 파라미터 수 때문에 MNIST 숫자와 Fashion-MNIST 같은 작은 데이터셋으로 실험했다.
- 무작위 분포에서 원래 데이터와 비슷한 이미지를 점진적으로 만들었고, FID가 낮아지면서 다양성과 품질을 함께 확인했다.
- 회절층 수나 층별 픽셀 수를 늘리면 디지털 신경망과 비슷한 power-law scaling이 나타났다. 파라미터를 추가할수록 이미지 품질이 예측 가능하게 좋아졌다.
- 비슷한 성능의 상용 GPU와 비교했을 때 단일 이미지 생성의 에너지 효율에서 광학 시스템이 유의미한 우위를 보였다. 다만 가중치가 한 번 제작되면 영구히 고정된다는 가정이 붙은 결과다.
- 프로토타입에서는 위상층을 직접 제작하는 대신 프로젝터에도 쓰이는 spatial light modulator와 거울을 사용했다. 카메라 이미지와 입력 레이저 분포를 관찰하며 디지털 역전파로 가중치를 현장에서 갱신할 수 있었다.
- 실제 광학 컴퓨팅 유닛은 고정 위상층을 제작하는 방향으로 가야 하며, 관련 제조가 가능하다는 연구가 이미 있다. 다음 단계는 10억 파라미터 규모의 종단 간 시스템에서 에너지·지연시간 우위가 유지되는지 검증하는 일이다.
2.4. 광학 계산 Q&A: 인터페이스·제조·저장
-
Lightmatter가 계산에서 HBM 인터커넥트로 이동한 이유
- 한 참석자는 Lightmatter의 실리콘 포토닉스 가속기에서 대부분의 tensor 연산을 담당할 photonic core와 ADC·DAC를 다뤘다고 설명했다.
- ADC·DAC 해상도와 정확도가 실제 운용에서의 예측 정확도에 영향을 줬고, 공개할 수 없는 프로젝트에서 문제가 확인된 뒤 Lightmatter는 멀티스펙트럴 계산 연구를 접고 HBM 인터커넥트로 방향을 틀었다.
- 파라미터가 많거나 광학 장치로 보내야 하는 데이터가 많아지면 변환 비용이 계산 이득을 압도하므로, 초기 광학 장치는 CPU 같은 범용기가 아니라 비트 깊이·정밀도·데이터율을 줄일 수 있는 애플리케이션 전용 가속기여야 한다.
-
역전파와 전자 인터페이스를 줄이는 방법
- 광학 시스템에서 여러 번 순전파한 뒤 빛을 뒤집어 역방향으로 보내는 방식 대신, 해당 연구는 완전한 디지털 twin을 보정하고 디지털 전자 회로에서 역전파를 수행했다. 현재 가장 큰 병목이 바로 이 부분이다.
- 확산 과정을 매 단계 teacher forcing을 받는 RNN으로 보고, 광학·아날로그 영역에서 더 오래 정보를 순환시키면 전자 인터페이스를 줄일 수 있다.
- 보고된 약 7배의 이득이 아니라 수백 배 이상으로 커질 가능성이 있지만, 실제로 시도하지 않은 미래 방향이다.
-
제조와 공간 해상도
- 식각·증착 같은 전자 제조와 비슷한 공정으로 광학 장치를 만들 수 있다.
- 빛의 파장이 전자보다 길어 단위 구조가 더 크지만, 수 마이크로미터급 구조를 수 나노미터급 트랜지스터처럼 쓰는 대신 수백 개 파장을 이용하는 optical comb로 공간이 아닌 파장 차원에서 weight를 다중화할 수 있다.
- 따라서 광학 소자의 feature size가 더 큰 것은 사실이지만, 파장 다중화로 처리량을 보완할 여지가 있다.
-
광학 저장 장치의 난제
- CD·DVD처럼 광학은 장기·보관 저장에는 적합하지만, 광학 영역에서 메모리를 빠르고 싸게 쓰고 읽는 문제는 해결되지 않았다.
- 홀로그래픽 메모리와 photorefractive material이 시도됐지만 NAND나 전자 메모리만큼 저렴하고 접근하기 쉽지 않았다.
- 고정 weight를 사용한 이유도 광학 영역에서 가중치를 다시 쓰거나 유지하는 비용이 너무 크기 때문이다. Phase-change material은 전자와 광학 양쪽에서 유망한 연구선이다.
-
편광을 이용한 비선형성
- 빛의 자유도에는 강도와 위상 외에 편광이 있으며, 편광 필터를 조합하면 삼각함수적 관계를 이용한 비선형성을 만들 수 있다.
- 편광 조작은 검출기의 진폭 영역에 비선형 응답으로 나타날 수 있어 좋은 아이디어지만, 층을 깊게 쌓은 신경망에서 각 층마다 비선형성을 유지하는 방법은 아직 불분명하다.
3. 뉴로모픽 컴퓨팅: 뇌의 원리를 회로에 옮기기
뉴로모픽의 핵심은 뇌를 그대로 복제하는 것이 아니라, 기억·계산·사건·적응이 결합된 뇌의 조직 원리와 물리 기질의 특성을 함께 설계하는 데 있다.
3.1. 뇌가 제공하는 계산 모델
-
발표자와 연구 배경
- Standard의 공동창업자 겸 파트너로서 운용자산 15억 달러 규모의 초기 기술 투자사를 운영한다.
- UT Austin에서 전기공학 학부를, Stanford에서 석사와 박사를 마쳤고 반도체·펫토닉스·나노소재를 연구했다.
- 한때 이 기술들이 쓰일 곳을 찾지 못할 것이라 생각해 떠났지만, 지금은 오히려 그 기술이 필요한 시점이 됐다.
-
뇌의 놀라운 효율
- 뇌는 언어·추론·창의성을 동시에 수행하고, 시각·청각·신체 행동을 아우르는 다중모달 실시간 시스템이다.
- 대화 중 다음에 할 말을 미리 계산하면서 수 밀리초에서 수백 밀리초의 반응으로 상호작용한다.
- 평생 계속 학습하고 context window가 없으며, 진화가 사전 학습하지 않은 자동차와 컴퓨터도 몇 가지 사례만으로 배운다.
- 16세 청소년에게 정지 표지판을 한두 번 보여주면 여러 개의 9(수준)의 정확도로 평생 인식하지만, 자율주행차에는 각도·사진·그림자 변형을 훨씬 많이 보여줘야 한다.
- 이 모든 기능을 약 20W, 즉 iPhone 충전기 정도의 전력으로 수행한다.
-
뉴로모픽이라는 이름과 범위
- 1980년대 후반 신경생물학과 전자공학이 함께 발전하면서 뇌에서 회로 설계 원리를 배울 수 있다는 생각이 커졌다.
- Caltech의 반도체 선구자 Carver Mead가 뉴로모픽이라는 용어를 만들고 뇌의 작동을 회로 모델로 옮기는 기초 연구를 이끌었다.
- 정의는 목적에 따라 넓어지거나 좁아지지만, 핵심은 뇌의 조직 원리를 회로·칩·계산 장치에 빌리는 것이다.
3.2. 스파이킹 뉴런과 뇌의 하드웨어-소프트웨어 결합
-
기억과 계산의 결합
- 뇌의 연결은 단순히 신호를 전달하는 전선이 아니라 weight를 기억하고 계산 자체에 참여한다.
- 디지털 전자 시스템에서는 메모리와 계산이 분리되는 경향이 있지만, 뇌에서는 둘이 얽혀 있다.
-
스파이크 기반 사건 처리
- 뇌의 상태 전이는 연속적인 감각 입력에서 생성·전파되는 사건인 spike로 이뤄진다.
- 스파이크는 완전한 디지털도 완전한 아날로그도 아닌 혼합 신호적 성격을 가진다.
- 학습 경험은 연결의 기능뿐 아니라 구조 자체를 다시 배선한다. 반면 제조된 칩은 기본적으로 고정돼 있다.
-
누설 적분-발화(leaky integrate-and-fire) 모델
- 회로 관점에서는 전하가 서서히 새는 축전기로 생각할 수 있다.
- 입력 스파이크가 세포막에 전하를 쌓지만 시간이 지나면 누설되고, 여러 스파이크가 동시에 들어와 임계값을 넘으면 새로운 스파이크를 출력한다.
- 임계값에 못 미치면 전위가 이완되고 초기화된다. 누설은 아날로그적이고, 임계값을 넘는 출력은 디지털적이다.
- 스파이크의 진폭과 발생 시간 사이의 관계가 중요하므로, 일반 회로의 단순한 0/1 표현으로 완전히 대체하기 어렵다.
-
현대 신경망은 뇌에서 이미 멀어졌다
- 큰 상호연결 뉴런망, 학습에 따른 연결 강도 변화, 여러 뉴런에 분산된 지식 표현은 생물학에서 영감을 받았다.
- 그러나 역전파·Transformer attention·대규모 디지털 GPU 학습은 뇌에 대응하는 과정이 아니다.
- 디지털 실리콘을 잘 만들고 병렬화하는 능력에 맞춰 신경망을 최적화하면서, 생물학적 원리보다 실리콘의 고유한 장점을 따르는 방향으로 이탈했다.
- 뇌 자체가 하드웨어와 소프트웨어가 함께 진화한 궁극적 model hardware co-design이므로, 다른 물리 기질에 일부 원리만 옮길 때는 그 기질에 고유한 방식을 찾아야 한다.
3.3. 2026년 뉴로모픽 연구의 세 방향
-
에너지 효율을 위한 기억-계산 결합
- 뇌의 20W 효율에서 영감을 받아 메모리와 계산을 같은 위치에 두고, 학습·추론까지 아날로그 방식으로 수행하려는 연구가 있다.
- 넓은 정의에서는 SRAM과 로직을 결합한 순수 디지털 칩도 뉴로모픽으로 볼 수 있다. D-Matrix와 IBM이 이런 방향의 사례다.
-
엣지 센싱·적응·사건 기반 계산
- 드론처럼 센서 입력을 계속 받고 실시간으로 반응해야 하는 장치에 뇌의 연속 감각과 스파이크 네트워크를 적용한다.
- 스파이크로 신경망을 학습하고, 장치 자체에서 학습하며, 지각한 내용에 따라 네트워크가 스스로 개선되는지가 연구 질문이다.
- Intel은 이 분야에서 가장 많은 작업을 한 기업 중 하나이며, 연구개발 칩으로 스스로 비행하는 드론을 시연했다.
-
새로운 물리 기질과 생물학의 결합
- 저항성 메모리, 멤리스터, 결합 발진기, 펫토닉스 등 반도체 연구실에서 나온 소자는 비선형성과 아날로그 특성을 가진다.
- 먼저 이 물리 소자의 특성을 이해한 뒤, 그 특성에 맞는 모델을 만들고 하드웨어와 알고리즘을 공동 설계하는 방식이다.
-
연구 단계의 현실과 유망한 프로젝트
- 2026년 뉴로모픽은 여전히 R&D 단계이며, 실제로 뇌를 닮은 컴퓨터가 상용 시스템에 쓰이는 경우는 거의 없다.
- 신경망도 유용해지기까지 오랜 잠복기가 있었으므로, 뉴로모픽에도 인내와 운이 필요하다.
- 넓은 정의로 가장 현실적인 방향은 메모리와 계산을 가깝게 둔 D-Matrix 같은 순수 디지털 칩이다. 제조 가능하고 시장이 받아들일 여지가 있다.
- 더 과감한 방향으로는 Naveen Ralph의 회사처럼 순수 CMOS에서 결합 발진기를 만들어 색다른 동역학을 구현하는 시도가 있다. 규모 있게 제조할 수 있다는 제약을 처음부터 지킨다는 점이 중요하다.
3.4. 뉴로모픽 Q&A: 패키징·모방·재료·잡음
-
패키징에서 가장 큰 에너지 비용
- SRAM을 연산 가까이에 배치하면 패키징 면적이 늘어 데이터센터에 넣을 수 있는 서버 수가 줄어든다.
- 근본적으로 트랜지스터 게이트보다 인터커넥트의 정전용량이 훨씬 크기 때문에, 트랜지스터 하나를 뒤집는 것보다 먼 거리를 따라 비트를 옮기는 일이 에너지를 더 쓴다.
- 이 문제를 해결할 가장 유력한 수단으로 광학 인터커넥트가 제시된다.
-
뇌를 흉내 내기보다 뇌를 직접 쓰면 되지 않는가
- 사인파를 직선 여러 개로 근사하기보다 사인파를 쓰는 편이 낫듯이, 뇌를 흉내 내는 회로보다 실제 뉴런을 쓰는 편이 낫다는 질문이 나온다.
- 뇌는 컴퓨터보다 느린 clock과 생물학적 메모리 한계를 갖지만, 컴퓨터는 훨씬 빠른 속도와 사실상 무한한 저장 공간을 제공한다.
- 실제 뉴런을 쓰는 방향은 가능하지만, 충분한 지능을 얻고 규모 있게 확장할 수 있는지는 아직 가지 않은 연구 경로다.
-
모델을 먼저 고를까, 기질을 먼저 고를까
- 광학 컴퓨터처럼 물리적 특성과 제약을 먼저 이해한 경우에는 그 장점에 맞춰 모델을 설계하고, 기존 모델을 맹목적으로 이식하면 안 된다.
- 반대로 뛰어난 모델 구조를 먼저 발견했다면 그 모델을 가장 잘 구현할 물리 기질을 찾아야 한다.
- 출발점에 따라 하드웨어-모델 공동 최적화의 순서가 달라진다.
-
실리콘과 탄소
- 뇌가 탄소 기반인데 실리콘으로 뇌를 흉내 내는 이유는 실리콘에서 계산을 매우 잘하고 제조·확장해 왔기 때문이다.
- 칩에는 점점 더 이질적인 재료가 들어가고 있고, 탄소 기반 다이아몬드를 기판으로 쓰려는 연구팀도 있다.
- 핵심은 실리콘과 탄소의 대립보다 특정 물리 기질에서 계산을 어떻게 구현하느냐이다.
-
잡음·재현성·열역학적 계산
- 전통적인 디지털 계산은 같은 입력에서 같은 결과를 내는 재현성을 중시하지만, 뇌는 저수준에서 완전히 재현 가능한 계산을 목표로 하지 않는다.
- 열역학적 계산은 Boltzmann machine을 연구했던 초기 신경망의 흐름을 되살려, 잡음 일부를 유용한 계산 자원으로 쓰려 한다. 잡음이 너무 많으면 정보가 흐려진다는 균형 문제가 있다.
- SPSA도 같은 무작위 seed를 재현할 수 있으면 전진차분 두 번, 중앙차분 세 번으로 학습 가능하지만, 생물학적 시스템에서 같은 seed를 같은 벡터에 다시 전달하는 방법은 매우 어렵다.
4. 살아 있는 신경세포로 Doom을 플레이하기
실제 뉴런을 행렬 곱셈 장치로 억지로 만들기보다, 입력 자극과 출력 행동 사이의 동적 시스템으로 다루면 생물학적 기질의 예측 불가능성을 계산에 활용할 수 있다.
4.1. Doom을 신경세포에 연결하는 입출력 구조
-
동적 시스템으로서의 생물학적 컴퓨터
- Sean은 Cortical Labs와 협력해 인간 뇌세포가 Doom을 플레이하게 한 작업에 참여했고, 신경세포를 칩 위에 배양한 뒤 알고리즘을 작성했다.
- 목표는 뉴런에 행렬 곱셈 같은 선천적 계산을 강요하는 것이 아니라, 특정 자극 집합이 유용한 지능적 출력을 만드는 입출력 시스템으로 다루는 것이다.
-
게임 상태의 인코딩과 행동 디코딩
- Doom의 상태는 탄약·체력 같은 스칼라 벡터와 화면 이미지로 구성된다.
- 상태를 2차원 다중전극 배열의 자극 채널, 진폭, 주파수로 변환해 신경세포에 전달한다.
- 신경세포가 발화한 스파이크는 특정 행동으로 디코딩된다. 이 과정을 통해 생물학적 기질에서 실용적 계산 출력을 얻는다.
-
Pong에서 Doom으로
- Cortical Labs는 약 4년 전 Pong에서 배양 뇌세포를 학습시켰다. 공과 패들이 단순해 가장 좋은 자극 채널과 패들의 상하 행동을 사람이 직접 매핑할 수 있었다.
- Doom은 초기 3D 게임이지만 핵심적으로 더 복잡한 공간, 여러 적, 큰 행동 공간을 가진다.
- 이동·후진·좌우 선회·공격·strafe 같은 여러 공동 행동을 처리해야 하며, 59개 채널로 54개 행동에 분리된 출력을 만들기 어렵다. 뉴런이 비슷한 채널을 공유하면 행동이 서로 결합된다.
4.2. PPO 기반 폐루프 학습
-
인코더·신경 배양·디코더
- 초기 구조는 PPO(Proximal Policy Optimization)를 이용한 폐루프 강화학습이었다.
- Doom 상태를 인코더가 자극으로 바꾸고, 배양세포의 스파이크를 디코더가 게임 행동으로 변환한다.
- 실리콘 critic은 세포에 줄 피드백을 안정화하기 위해 추가된다. 관찰값을 신경 하드웨어에 넣고 스파이크를 디코더로 보내며 약 2,000스텝마다 모델을 갱신한다.
-
인코더의 구성과 학습
- 화면 이미지는 CNN을 거치고, 탄약·체력 같은 스칼라 관찰과 결합한 뒤 MLP를 거쳐 각 전극의 자극 주파수와 진폭을 출력한다.
- 초기 공개 코드에서는 채널을 고르기보다 주파수와 진폭을 정했고, 후속 실험에서는 MLP가 자극 채널도 선택하게 했다.
- 다중전극 배열을 통과해 gradient를 전파할 수 없으므로, 최적 진폭·주파수를 찾기 위해 베타 샘플링 기반의 확률적 자극을 사용한다.
- 이는 고정된 reservoir computing과 다르다. 같은 자극도 매번 배양세포의 구조를 바꾸므로 출력이 달라지고, 시스템의 모든 움직이는 부분이 정보 처리 방식을 바꾼다.
-
디코더를 작게 만들어 속임수 방지
- 처음에는 선형 디코더가 너무 커서 스파이크를 0으로 만들어도 디코더의 bias만으로 게임을 플레이할 수 있었다.
- 디코더를 크게 줄이고 여러 ablation을 수행해 스파이크 자체에 게임을 플레이하는 정보가 있는지 확인했으며, bias를 0으로 설정했다.
- 큰 디코더는 생물학적 기질이 학습하지 않아도 실리콘이 모든 일을 하게 만든다. fly brain 실험처럼 과도하게 큰 디코더를 사용하면 실제로는 파리 뇌가 아무것도 하지 않는다는 비판이 나온다.
- 최종 선형 readout은 전진·후진·정지·좌우 strafe·좌우 회전·공격 행동의 공동 확률에 softmax를 적용한다.
4.3. 동기·비동기 자극과 놀람 기반 피드백
-
좋고 나쁜 행동의 물리적 표현
- 언론 보도가 크게 혼동한 부분은 좋은 피드백을 동기(synchronous) 자극, 나쁜 피드백을 비동기(asynchronous) 자극으로 정의한 방식이다.
- Karl Friston의 free-energy principle에 기대면 뇌는 비동기적 자극을 피하려는 경향이 있다고 보고, 게임에서 좋은 행동에는 동기 자극을, 원치 않는 행동에는 비동기 자극을 보낸다.
- 비동기 자극은 여러 채널이 서로 다른 시점에 무작위로 발화하는 방식이고, 동기 자극은 함께 발화하는 방식이다.
-
초기 강화학습의 문제와 critic
- 게임 초반 세포는 행동을 거의 못하므로 나쁜 행동을 반복하고, 현재 세포는 장기 credit assignment를 처리할 만큼 강하지 않다.
- 따라서 critic이 예상한 가치와 실제 행동 결과의 차이, 즉 놀람(surprise)을 계산한다.
- 예상보다 크게 나쁜 행동에는 큰 음의 피드백을, 예상과 비슷하거나 좋은 행동에는 약한 피드백을 주어 음의 자극을 계속 쏟아붓지 않는다.
- TD error로 놀람을 스케일하고, 보상의 부호뿐 아니라 자극의 주파수와 진폭까지 조절한다. 인코딩 채널과 피드백 채널은 별도로 둘 수 있다.
-
엔트로피와 평형이 없는 동역학
- 세포가 고통을 느끼는 것은 아니다. 신경세포에는 통증 수용기가 없고 독성 물질을 넣는 것도 아니다. 긍정·부정은 게임 행동에 대한 외부적 평가다.
- 세포는 쾌감·고통을 최대화하는 대신 배양체 내부의 엔트로피를 줄이는 방향으로 자기조직화한다. 비동기 고엔트로피 자극의 빈도를 낮추려 한다.
- 실리콘 critic과 배양세포라는 두 동적 시스템이 제어권을 두고 움직이므로 진정한 평형에는 도달하지 않는다.
- 일반 PPO는 탐색을 위해 entropy bonus를 넣지만, 이 실험에서는 세포 자체가 충분한 엔트로피를 제공했기 때문에 entropy penalty를 넣어 엔트로피를 적극적으로 억제했다.
4.4. 생물학적 컴퓨팅의 정체성과 확장성
-
자연의 감각 입력과 다른 자극
- 전극에서 보내는 주파수·진폭 자극은 눈과 귀가 실제로 보내는 전기 신호와 매우 다르다.
- 인간 지능은 계산 최적화가 아니라 생존·번식·종의 존속에 맞춰 최적화됐지만, 뉴런이라는 기질이 지능을 담기에 좋은 물질인 것은 우연히 드러났다.
- 같은 기질에서 인간과 계속 다른 형태의 지능이 나타날 가능성이 높고, 인간 감각과 비슷한 입력으로 수렴한다면 오히려 무서울 수 있다.
-
눈 오가노이드와 인간 재현의 경계
- 미니 눈 오가노이드를 배양하고 신경세포와 연결하려는 시도가 있었으며, 실제 생체 전기 신호로 학습시키는 방향도 상상할 수 있다.
- 그러나 감각기관과 뇌를 처음부터 연결해 나가면 인간을 제1원리에서 재현하는 문제에 가까워져 윤리적·철학적으로 매우 무서운 영역이 된다.
-
두 가지 확장성 문제
- 첫째는 배양세포에서 frontier 수준의 지능을 얻는 일이다. 현재 세포가 게임에서 보이는 학습과 세계 최고 수준의 지능 사이에는 큰 간극이 있다.
- 둘째는 그 지능을 세계 수십억 명에게 서비스하는 일이다. 같은 생물학적 기질에서 지능을 얻는 방법은 어느 정도 보였지만, 분산 생물학적 컴퓨팅은 아직 근본적으로 알려지지 않았다.
- 확장성에 대한 정직한 답은 아직 모른다는 것이지만, 이를 알아내기 위해 전담 팀을 구성해 단계적으로 시도하고 있다.
주요 발언 모음
“초지능 외계인에게 하나만 물을 수 있다면, 그들은 FLOP를 어떻게 계산하는지 묻고 싶다.”
“10년 안에 우리는 역전파를 사용하지 않게 될 것이라고 생각한다.”
“뇌는 하드웨어와 소프트웨어가 하나로 진화한 궁극적인 모델-하드웨어 공동 설계다.”
“빛으로 계산하는 일은 거의 공짜지만, 빛에 무언가를 저장하는 일은 어렵다.”
“광학 컴퓨팅의 기회는 하드웨어와 알고리즘을 함께 설계하는 데 있다.”
“뉴로모픽은 2026년에도 아직 연구개발 단계에 있다. 인내와 약간의 운이 필요하다.”
“세포는 고통을 느끼지 않는다. 긍정과 부정은 게임의 행동에 대한 피드백이며, 세포는 배양체의 엔트로피를 줄이려 한다.”
“생물학적 컴퓨팅의 어려움은 세포에서 지능을 얻는 것뿐 아니라, 그 지능을 수십억 명에게 서비스하는 것이다.”
핵심 데이터 & 수치
- 20W: 인간 뇌가 사용하는 대략적인 전력이며 iPhone 충전기 또는 전구 하나와 비슷하다.
- 2012~2019/2020: AlexNet 이후 CNN이 중심이었던 시기다.
- 12만 5,000달러: Focal Systems가 NVIDIA 관련 대회에서 받은 상금이다.
- (n^2) 대 (n): 전자식 행렬 연산의 에너지 증가와 광학식 수동 전파가 목표로 하는 증가율의 비교다.
- 약 1만 배: 광자가 전자보다 낮다고 설명된 손실과 크다고 설명된 대역폭의 규모다.
- 약 99%: 대륙 간 데이터 전송에서 광학 방식이 차지하는 비중이다.
- 최대 1,000회: 확산 모델이 이미지 한 장을 만들 때 같은 네트워크를 반복 적용할 수 있는 횟수다.
- 10개 장치 × 100회: 고정 weight 광학 장치로 확산 단계를 처리하는 예시다.
- MNIST·Fashion-MNIST: 제한된 파라미터의 광학 확산 실험에 사용한 작은 데이터셋이다.
- 10억 파라미터: 광학 시스템의 에너지·지연시간 우위를 검증하기 위해 제시된 다음 규모다.
- 약 45억 년: 뇌와 생물학적 계산 원리를 만든 진화의 시간 규모다.
- 59개 채널·54개 행동: Doom 실험에서 인코딩·디코딩을 손으로 매핑하기 어려웠던 규모다.
- 약 2,000스텝: 공개된 PPO 구조에서 모델을 갱신하는 간격이다.
- 약 7배에서 수백 배 이상: 광학·아날로그 영역에서 정보 순환 시간을 늘릴 때 기대하는 인터페이스 개선 가능성이다.
결론 및 시사점
- GPU를 없애는 단일 승자는 아직 없다. GPU는 범용성과 성숙한 소프트웨어 생태계가 강하고, 대안 기질은 특정 물리적 이점을 얻는 대신 변환·저장·제조·학습 문제를 감수해야 한다.
- 가장 현실적인 출발점은 반복이 많고 정밀도 요구가 낮으며, weight를 자주 바꿀 필요가 없는 업무다. 확산 이미지 생성처럼 같은 선형 변환을 수백~수천 번 반복하는 문제는 광학 장치와 잘 맞는다.
- 광학 시스템은 행렬 곱 자체보다 ADC·DAC, 메모리 이동, calibration, 비선형 활성화가 병목이므로, 전체 시스템의 전자-광학 경계를 먼저 줄여야 한다.
- 뉴로모픽 설계는 뇌의 모양을 복사하는 문제가 아니라 기억과 계산을 결합하고, 이벤트·시간·적응을 각 칩의 고유한 물리와 맞추는 문제다.
- 역전파를 버리려면 optimizer·모델 분할·물리 기질을 함께 바꿔야 한다. SPSA와 SOMA는 이 방향을 시험하는 한 가지 경로이며, 광학·뉴런에서 순전파 비용이 낮아질 때 특히 의미가 커진다.
- 살아 있는 신경세포는 강력한 범용 컴퓨터가 아니라 변화하는 동적 물질이다. 실리콘 디코더가 대신 플레이하지 않도록 ablation과 작은 readout으로 생물학적 기여를 검증해야 한다.
- 실제 제품화의 기준은 논문 속 연산량이 아니라 입력·출력 변환까지 포함한 에너지, 지연시간, 재현성, 제조 수율, 유지보수 비용이다.
- 장기적으로는 모델을 만든 뒤 하드웨어를 고르는 순서와, 새로운 물리 기질을 먼저 이해한 뒤 모델을 만드는 순서가 모두 필요하다. 어떤 순서가 맞는지는 출발점과 업무의 구조에 달려 있다.
- 대안 컴퓨팅의 핵심 질문은 “GPU를 무엇으로 대체할까”가 아니라 “각 물리 기질이 가장 잘하는 계산을 어떻게 발견하고, 알고리즘과 시스템 전체를 그에 맞게 공동 설계할까”다.
