URL: https://www.youtube.com/watch?v=1Q_7yU7FZ1k 날짜: 2026-10-11 채널: a16z
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==AI가 칩 설계를 쉽게 만든 뒤 차세대 병목은 제조·메모리·광학·전력·냉각으로 이동하며, AI 인프라는 개별 칩이 아니라 랙과 에너지 시스템 전체의 경쟁이 된다.==
- AI 도구는 논리 설계와 소프트웨어 계층 생성을 빠르게 하지만 아날로그 설계, 실리콘 제조, 첨단 패키징, 검증에는 여전히 긴 시간이 걸린다.
- HBM은 현재 최선의 메모리이지만 밀도·대역폭·전력·열 측면에서 AI 메모리 컴퓨팅의 근본 해법이 아니다.
- 대규모 AI 클러스터는 광학 I/O, 예측 가능한 플로우 기반 네트워크, 800V DC 전력망, 새로운 냉각·발전 기술을 요구한다.
AI 하드웨어의 황금기는 설계 자동화만으로 완성되지 않는다. 설계 주기가 짧아질수록 제조와 시스템 조립이 상대적으로 더 큰 제약이 되고, 메모리와 전력은 컴퓨팅 성능을 실제로 사용할 수 있게 만드는 물리적 조건이 된다. 현재 수많은 AI 가속기 스타트업이 등장했지만, 변화하는 워크로드와 대규모 자본·전력·소프트웨어 통합의 압력 때문에 장기적으로는 상당한 통합이 일어날 가능성이 높다. 최종적으로는 에이전트를 안전하고 효율적으로 실행·이동·관리하는 새로운 가상화 계층도 필요하다.
1. Intel에서 시작한 칩 설계자의 경력과 실리콘밸리의 학습 문화
Pat Gelsinger의 초기 경력은 기술 교육, 현장 설계, 대학 연구를 동시에 수행하는 방식이 새로운 컴퓨팅 시대를 여는 인재를 만들 수 있음을 보여준다.
1.1. 16세에 시작한 기술 교육과 Intel 입사
-
장학금과 기술학교가 컴퓨터 산업으로 들어가는 문을 열었다
- 예상 밖의 출발: 16세에 우연히 장학금을 받아 기술학교(tech school)에 진학했고, 고등학교 마지막 1년 반을 건너뛰었다.
- Intel과의 첫 만남: 18세에 Intel 채용 담당자를 만났을 때 비행기를 한 번도 타본 적이 없었지만, 기술학교에서 이미 컴퓨터에 매료된 상태였다.
- 채용 평가: 하루에 12명을 연달아 면접한 Ron Smith는 Gelsinger의 평가란에 “Smart, aggressive, arrogant. He’ll fit right in.”이라고 적었다.
-
현장 설계와 학업을 병행했다
- 역할의 확장: Intel에서 기술자(technician)로 시작해 286 말기의 설계팀으로 이동했고, 386에서는 네 번째 엔지니어로 참여했으며, 486에서는 아키텍트이자 설계 관리자가 됐다.
- 일과 학습의 결합: 낮에는 실제 칩을 만들고 밤에는 학사·석사·박사 과정을 수행했다. 새 지식을 즉시 실리콘에 적용하고 현장에서 얻은 문제를 다시 학업으로 가져가는 순환이 경력의 핵심이었다.
1.2. 대학 이론을 현장 현실로 검증한 경험
-
386 설계가 Stanford 강의의 가정을 반박했다
- Carry-lookahead adder 논쟁: Stanford 수업에서 교수가 새 가산기 설계를 제시했지만, Gelsinger는 실제로 작업 중인 386의 carry-lookahead adder에 적용해 보니 작동하지 않는다고 판단했다.
- 두 수업에 걸친 논쟁: 교수의 책 출판 일정까지 걸린 시점에 설계가 왜 실용적이지 않은지 두 수업 시간 동안 논쟁했다.
-
Built-in self-test를 실제 칩에 적용했다
- 이론과 제조 가능성의 차이: Built-in self-test의 대가였던 Ed McCluskey의 아이디어도 실제 칩에 넣을 때는 대부분 비현실적이라고 판단했고, 구현 가능한 형태로 다듬었다.
- 학문과 산업의 왕복: John Hennessy가 박사 논문 지도교수였다는 일화와 함께, Silicon Valley의 강점은 대학의 아이디어가 기업으로 나가고 산업의 반례가 다시 교실로 들어오는 왕복에 있다고 설명했다.
1.3. 486과 현대 EDA의 토대
-
Verilog 이전에 설계 언어부터 만들어야 했다
- 하드웨어 기술 언어: 486 시기에는 오늘날의 EDA(electronic design automation) 산업도, Verilog도 없었다. Intel hardware description language(HDL)를 직접 만들었다.
- 컴파일러 구축: 만든 언어를 실제 설계에 사용하려면 그 언어를 번역하는 컴파일러까지 직접 작성해야 했다.
-
자동화된 배치·배선·타이밍을 개척했다
- EDA의 핵심 기능: 자동 place-and-route가 없었기 때문에 직접 만들었고, Berkeley의 Alberto Sangiovanni-Vincentelli와 학생들과 함께 최초의 배치·배선·자동 타이밍 관리 작업을 진행했다.
- 486의 역사적 의미: 486은 단순히 호환 가능한 파이프라인 마이크로프로세서가 아니라, 이후 현대 EDA 산업이 된 설계 자동화의 기반을 함께 만든 제품이었다.
2. AI가 칩 설계를 바꾸고 옮겨 놓는 병목
AI는 논리 설계의 상당 부분을 자동화하지만, 설계를 빠르게 하는 기술은 곧 다른 단계의 지연을 더 선명하게 만든다.
2.1. AI 기반 설계의 현재 범위
-
논리 설계와 추상화는 AI에 잘 맞는다
- 높은 수준의 목표 번역: 설계 목표를 높은 수준에서 지정하면 AI가 이를 Verilog와 논리 구조로 번역하는 흐름이 가능해졌다.
- 소프트웨어 계층 자동화: 커널(kernel) 작성, 소프트웨어 계층 생성, 논리 함수 구성은 AI가 특히 강한 영역이다.
- 충분한 트랜지스터 예산: 트랜지스터 예산과 설계 도구의 지능이 충분해져 소수의 전문가가 방향을 제시하면 AI가 많은 구현 공간을 탐색할 수 있다.
-
아날로그는 여전히 실리콘 경험을 요구한다
- AI화하기 어려운 영역: 아날로그 회로와 회로의 세부 특성은 충분한 silicon data 없이는 자동화하기 어렵다.
- 두 가지 우회법: 아날로그 설계를 지나치게 보수적으로 만들어 AI가 다룰 수 있게 하거나, 전문가가 전통적인 방식으로 직접 설계해야 한다.
- 새로운 486의 가능성: Jalapeno처럼 AI를 칩 설계의 first-principles 과정에 사용하는 사례는 현대 설계가 486 때처럼 새로운 시대에 진입하고 있음을 보여준다.
2.2. 설계가 쉬워진 뒤의 제조·패키징 병목
-
설계 3개월과 실사용 9개월의 격차
- 실리콘 처리 시간: AI 도구를 충분히 활용하면 훌륭한 설계를 약 3개월 안에 만들 수 있지만, 실리콘을 fab에서 처리해 실제 칩으로 얻는 데 약 9개월이 걸린다.
- 첨단 패키징: 3D 패키징과 고급 패키지 조립에도 추가 시간이 필요하며, 칩은 더 이상 단품이 아니라 랙 단위의 시스템으로 완성된다.
- 전체 시스템의 지연: 설계 후 랙에 넣고 소프트웨어를 올려 실제 규모로 쓰기까지는 9개월에서 1년 반에 가까운 시간이 걸릴 수 있다.
-
속도와 비용을 함께 줄여야 한다
- 워크로드의 유효기간: AI 워크로드는 빠르게 변한다. 설계에 1년 반이 걸리면 완성 시점에는 설계자가 전제한 모델과 workload가 이미 바뀌어 있을 수 있다.
- 마스크 비용: 프로토타입에 도달하기 전에 약 5,000만 달러의 mask 비용을 부담해야 하는 흐름은 실험 속도를 제한한다.
- 필요한 방향: 새로운 lithography와 한두 달 안에 초기 결과를 얻을 수 있는 설계·제조 플로우가 필요하다.
- Graphcore의 사례: Graphcore가 나쁜 설계를 해서 실패한 것이 아니라, 칩이 실제 규모로 배치될 때까지 업계와 AI 세계가 이동해 버린 사례가 설계-제조 지연의 위험을 보여준다.
2.3. 메모리·전력·열이 새 병목이 된다
-
HBM은 최선이지만 만족스럽지 않다
- 메모리 대역폭: AI는 본질적으로 memory-compute workload이므로 계산 유닛보다 데이터를 공급하는 능력이 성능을 제한한다.
- HBM의 약점: HBM(high-bandwidth memory)은 현재 가장 좋은 선택이지만 bit density가 낮고 shoreline bandwidth에 묶이며 전력과 열 문제가 크다.
- 열 집중: DRAM은 뜨거운 환경을 싫어하는데 HBM은 메모리를 계산 칩 가까이 한곳에 집중시킨다.
-
전력 모델링과 공급 방식도 바뀌어야 한다
- 부정확한 시뮬레이션: 현재 전력 시뮬레이션과 3D 전력 소산 hotspot 모델이 충분히 좋지 않다.
- Guard band 손실: 불확실성을 피하려고 전체 전력 예산의 약 40%를 guard band로 잃고 있으며, 더 정확한 전력 모델링이 필요하다.
- 전력 전달의 재설계: 칩 내부에서부터 패키지와 랙, 데이터센터까지 power delivery model 자체를 바꿔야 한다.
3. AI 가속기 100개 시대와 아키텍처의 통합
수많은 AI inference accelerator는 일시적인 실험의 폭을 보여주지만, 대규모 배치와 변화하는 모델은 극단적 전문화를 오래 유지하기 어렵게 만든다.
3.1. 현재의 이질성이 만들어진 이유
-
워크로드 단계별 전문화
- Prefill과 decode: 동일한 AI 서비스 안에서도 prefill과 decode에 특화된 컴퓨팅이 달라지고, 최근에는 midfill까지 별도 계층으로 나누려는 움직임이 생겼다.
- Reasoning 모델: reasoning 모델은 다시 CPU에 가까운 성격을 요구할 수 있어, 특정 단계에 맞춘 설계가 곧 전체 용량의 중심이 된다고 보기 어렵다.
-
모델과 알고리즘이 바뀐다
- LLM의 한계: 평면적인 LLM 구조는 분자·화학·이미징처럼 3D 구조를 다루는 데 잘 맞지 않을 수 있으며, 새로운 알고리즘 영역이 아키텍처 요구를 바꾼다.
- HPC의 귀환: AI 시스템이 과학 문제를 좁혀 주면 실제 화학 알고리즘은 64-bit precision을 요구할 수 있다.
- 화학 분석 사례: AI가 화학 분석에서 가장 흥미로운 다섯 개의 영역을 골라내고, 고정밀 알고리즘이 서로 다른 화학·생물학 시스템을 분석하는 조합이 가능하다.
3.2. Pat이 보는 세 가지 통합 압력
-
극단적 전문화는 지속되기 어렵다
- 워크로드 이동: 2~4년 뒤 workload가 지금의 prefill·decode 구분과 달라지면 한 부분에만 최적화한 칩의 장점이 사라진다.
- 역사적 패턴: 역사적으로 컴퓨팅 workload를 지나치게 세분화한 구조는 지속되지 않았고, 어느 시점에는 범용성과 이동성이 다시 중요해진다.
-
자본과 규모가 승자를 가른다
- 100개 모두의 생존은 불가능하다: 광학, probabilistic 등 여러 계열을 합쳐 AI 가속기가 약 100개 존재하지만, 모든 업체가 자본과 workload를 확보해 규모를 만들 수는 없다.
- 소프트웨어까지 포함한 규모: 칩을 만드는 것만으로는 부족하고 컴파일러, 커널, 런타임, 실제 workload가 함께 진화해야 한다.
-
대형 고객과 플랫폼이 승자를 선택한다
- 플랫폼 선택: OpenAI, Nvidia, Anthropic 같은 대형 고객은 하드웨어 자체뿐 아니라 하드웨어와 소프트웨어가 함께 진화할 수 있는 팀을 선택할 가능성이 높다.
- 통합의 결과: 자본시장 점유율, 실제 workload, 아키텍처의 승패가 겹치면서 가속기 숫자는 좁혀질 것이다.
3.3. AI가 소프트웨어 병목을 완화하는 반론
-
기존 표준화의 이유가 약해질 수 있다
- 컴파일러 비용: 과거에는 instruction set과 하드웨어 플랫폼이 달라질 때 컴파일러를 여러 개 만들어야 했기 때문에 한두 개 아키텍처로 표준화할 수밖에 없었다.
- 에이전트가 커널을 작성한다: AI 시대에는 사람이 최적화 커널을 직접 작성하지 않아도 에이전트 swarm이 밤새 특정 칩을 활용하는 소프트웨어 계층을 만들 수 있다.
- 더 많은 이질성의 가능성: 소프트웨어를 각 칩에 맞춰 쉽게 만들 수 있다면 AI는 과거보다 다양한 하드웨어를 감당할 수 있다.
-
대규모 배치 비용은 여전히 강한 제약이다
- 1년 반의 구축 지연: 소프트웨어가 빨라져도 칩을 랙 규모로 만드는 데는 여전히 약 1년 반이 걸린다.
- 500억 달러의 문제: 대형 데이터센터, 전력 계약, 칩 구매를 포함하면 유용한 규모로 배치하기 위해 약 500억 달러 수준의 자본 약정이 필요할 수 있다.
- 숨겨진 이질성: Nvidia가 Groq를 흡수한 사례처럼 대형 플랫폼이 특화 아키텍처를 내부에 편입할 수 있다. 사용자는 2년 뒤 Groq가 Nvidia 내부 어디에 있는지 구분하지 못하고, 계층화와 추상화가 이질성을 감춘다.
4. 30년 만의 메모리 혁신과 메모리 장벽
AI 자본이 메모리 문제를 다시 경제적으로 매력적인 영역으로 만들면서, 오랫동안 정체된 메모리 물리학에 돌파구가 나타날 가능성이 커지고 있다.
4.1. 왜 HBM이 “끔찍하지만 최선”인가
-
현재의 선택지가 제한적이다
- 주요 메모리의 정체: 지난 30년 동안의 주요 메모리는 DRAM, SRAM, flash 정도였으며, flash stacking도 근본적인 새 메모리라고 부르기에는 제한적이다.
- 실패한 시도들: Gelsinger는 개인적으로 다섯 가지 이상의 새 메모리 아키텍처에 관여했고, 업계에서 지난 30년간 약 100개의 시도를 보았지만 주요 메모리로 자리 잡은 것은 0개라고 했다.
-
메모리 산업의 경제성이 나빴다
- 5년 주기: 메모리 업체는 5년 중 1년만 돈을 벌고 나머지 4년은 잃는 식의 잔혹한 commodity cycle을 겪었기 때문에 지속적인 R&D가 어려웠다.
- AI가 만든 변화: AI는 계산 문제가 아니라 메모리 문제라는 인식이 커졌고, 세 대형 메모리 업체가 세계 시가총액 상위 20개 기업에 들어갈 정도로 자본의 흐름이 바뀌었다.
- 시장 규모: 메모리 산업의 시가총액은 최근 4년 동안 약 2.5조 달러 증가했다고 언급됐다.
4.2. 차세대 메모리의 방향
-
메모리와 계산을 더 가깝게 묶는다
- HBM의 shoreline 한계: HBM은 칩과 메모리 사이의 물리적 연결면이 제한되어 근본적인 bandwidth ceiling을 가진다.
- Stacked memory-compute: D-Matrix와 같은 업체를 비롯해 메모리와 compute를 구조적으로 함께 배치하고 새 연결 구조를 만드는 접근이 주목받고 있다.
- 자본과 물리학의 결합: AI에 투입되는 자본이 커졌기 때문에 과거에는 불가능했던 재료·제조 문제도 돌파할 수 있는 조건이 만들어졌다.
-
새로운 재료와 셀 구조
- Ferroelectric: 강유전체(ferroelectric)를 포함한 새 재료가 검토되고 있다.
- 비커패시터형 메모리: 고밀도·고성능·제조 가능성을 동시에 갖춘 비커패시터(non-capacitive) 메모리 셀을 찾는 연구가 진행된다.
- Flash와 MRAM의 한계: 저가 flash는 매력적일 수 있지만 셀의 속도와 성능이 문제이며, MRAM도 같은 이유로 Gelsinger가 특별히 낙관하지 않는 방향이다.
- 새로운 회사들: Gelsinger는 아직 공개하지 않은 stealth 메모리 회사를 설립했으며, 30년 만의 실질적 메모리 혁신이 가까워졌다고 판단한다.
4.3. 적층 높이와 제조 수율의 현실
-
높이가 늘수록 수율 요구가 기하급수적으로 커진다
- 수율의 곱셈: 적층의 가치가 높아질수록 어느 한 층의 불량이 전체 스택을 망가뜨리므로 각 층의 수율은 선형이 아니라 기하급수적으로 좋아져야 한다.
- 8·16단의 난이도: 8단이나 16단 스택은 결함 특성과 제조 흐름이 거의 완벽해야 하므로 매우 어렵다.
- 중복 설계의 한계: DRAM의 bad-block replacement와 spare line처럼 일부 결함을 흡수하는 설계는 가능하지만, 금이 간 die 자체를 살릴 수는 없다.
-
현실적인 sweet spot은 중간 높이다
- 3~5단 구조: 제조·복잡성·수율을 고려하면 3~5단 정도가 실용적인 sweet spot이 될 가능성이 높다.
- 메모리 2~4단: compute tile에 붙는 메모리 스택은 2단 또는 4단이 유력하며, 8단 이상은 비현실적일 수 있다.
- Reticle과 chiplet: compute tile이 reticle 한계에 걸리기 때문에 chiplet으로 쪼개 수율과 열 특성을 개선해야 한다.
- Z축 통합: 전력 레일을 Z축으로 공급하고 RDL(redistribution layer)이 신호를 분배해야 한다. 메모리, 전력, RDL을 합치면 표준적인 구조도 이미 약 8개 층이 된다.
-
열과 광학까지 더하면 제조 난도가 폭증한다
- 열의 병목: 전력을 넣는 것과 열을 빼는 것을 동시에 해결해야 하며, 현재의 hotspot을 그대로 두고는 적층을 높일 수 없다.
- 냉각 재료: diamond 같은 신소재와 칩 위에 직접 놓는 liquid cooling이 검토될 수 있다.
- 엔지니어가 배관공이 된다: 전력·열·냉각·패키지를 모두 통합해야 하므로 반도체 엔지니어가 점점 “plumber”처럼 일하게 된다는 농담이 나왔다.
4.4. 광학 메모리와 PIM에 대한 회의론
-
메모리를 패키지 밖으로 보내는 광학 연결
- O-E-O 손실: compute와 먼 메모리를 광학으로 연결하면 O-E-O(optical-electrical-optical) 변환이 반복되고, 변환마다 전력과 비용이 든다.
- 에너지 격차: compute 자체의 femtojoule당 에너지는 매우 좋아졌지만 bit 통신의 에너지는 상대적으로 약 1,000배 나쁘다.
- 결론: 큰 메모리 풀에 접근하는 자유는 얻지만 이동 과정에서 전력을 너무 많이 쓰므로 핵심 compute-memory 복합체에는 매력적이지 않다.
-
Processing-in-memory는 범용 해법이 되기 어렵다
- 워크로드 제약: PIM(processing in memory)은 메모리 안에 작은 계산 조각을 넣어 메모리 bandwidth 요구를 줄이지만, workload를 그 구조에 맞게 재작성해야 한다.
- 오래된 아이디어: PIM 아이디어는 25~30년 전부터 존재했고 앞으로도 계속 남겠지만, 모든 변화하는 workload를 포괄하는 해법은 아니다.
- 선호하는 방향: 고밀도·고성능 메모리 bandwidth를 실제 compute engine 가까이 제공하는 방식이 더 일반화하기 쉽다.
5. 광학 I/O와 AI 네트워크의 재구성
구리 배선의 물리적 한계와 AI 트래픽의 예측 가능성이 결합하면서, scale-up과 scale-out의 경계가 광학 네트워크 안에서 흐려진다.
5.1. 구리에서 광학으로 이동하는 이유
-
구리는 짧아지고 광학은 상대적으로 싸진다
- 거리의 역전: scale-up 환경에서 구리는 점점 짧은 waveguide처럼 사용되고 있으며, 5m 구리를 작동시키는 비용이 100m 광학 링크보다 비싸지는 지점에 도달한다.
- Pat의 오래된 선언: Gelsinger는 약 25년 전에 copper의 죽음을 선언했고, 언젠가는 그 예측이 맞을 것이라고 농담했다.
- 범위: 모든 I/O는 광학으로 가야 하지만, core compute-memory 복합체까지 즉시 광학화하는 것은 전력·변환 손실 때문에 별도의 문제다.
-
2028~2029년이 전환점이 될 수 있다
- NPO·CPO: NPO(near-package optics)와 CPO(co-packaged optics)를 포함한 공급망이 2028~2029년 무렵 대규모 scale-up에 필요해질 것으로 전망했다.
- NVL72의 교훈: Nvidia NVL72는 공학적 경이(engineering marvel)이지만 제조 악몽(manufacturing nightmare)이었다. 업계가 이를 규모 있게 소화하는 데 약 1년 반이 더 걸렸다.
- 공급망 미성숙: 광학 공급망이 더 성숙했다면 더 낮은 전력·비용·에너지로 scale-up 환경을 이미 만들 수 있었지만, 레이저 생산량과 패키지 통합 경험이 부족했다.
- 10 million GPU 문제: 미래의 광학 부품은 수백만, 궁극적으로 약 1,000만 GPU 규모에서 작동해야 하며, 열·패키지·레이저 생산능력까지 동시에 해결해야 한다.
5.2. 예측 가능한 AI 플로우와 Optical Circuit Switching
-
AI 트래픽은 전통적 패킷 네트워크와 다르다
- 기존 네트워크: 전통적인 네트워크는 어떤 패킷이 어디로 갈지 모르는 상태에서 모든 경로를 처리하도록 만들어졌다.
- AI workload: AI는 크고 예측 가능하며 관리 가능한 flow를 반복해서 발생시킨다.
- 스위치에 가까운 구조: 이 성격은 임의의 패킷을 처리하는 네트워크보다 circuit switch에 더 가깝다.
-
Scale-up과 scale-out의 경계가 약해진다
- OCS 방향: 광학을 compute complex 안으로 가져오고 OCS(optical circuit switching) 같은 구조로 예측 가능한 대형 flow를 연결하는 방향이 자연스럽다.
- 경계의 해소: scale-up 클러스터가 충분히 커지면 다른 대형 클러스터와 연결하는 순간 scale-up과 scale-out의 구분은 인위적인 경계가 된다.
- 프로토콜의 수렴: 현재는 front-end와 back-end 네트워크 프로토콜이 달라 실무상 차이가 크지만, 시스템 관점에서는 같은 목표를 달성하므로 시간이 지나며 수렴할 수 있다.
5.3. 학습·추론 통합과 관리 복잡성
-
Training과 inference의 분리가 약해진다
- 지속 학습: 뇌가 학습을 멈추지 않는다는 비유처럼, inference 환경이 model weight를 계속 업데이트하는 continuous learning이 일부 알고리즘의 기본이 될 수 있다.
- 작은 데이터셋: formal training이 아닌 운영 환경에서 더 작은 데이터셋으로 모델이 계속 개선되면 training과 inference용 하드웨어를 엄격히 나누기 어렵다.
- 남는 차이: 오늘날에는 inference에 필요한 노드 수와 통신 직경이 training보다 작다는 차이가 여전히 남아 있다.
-
워크로드별 이질성은 일부 지속될 수 있다
- 계산 제한과 메모리 제한: 작은 diffusion workload는 memory bandwidth 중심의 대형 카드가 필요할 수 있고, 15조(15 trillion) parameter급 LLM은 거대한 규모의 계산과 연결을 요구한다.
- 운영비의 문제: 백만 GPU를 가진 데이터센터에서 workload별 카드 1,000개·2,000개씩 따로 넣으면 업그레이드, 연결, fault domain, 관리 비용이 커진다.
- 에이전트의 한계: 에이전트가 업그레이드와 fleet management를 자동화할 수 있다는 반론이 나왔지만, Pat은 모든 문제가 쉬워진다는 식의 농담으로 응수했다.
6. 전력·발전·냉각이 AI 확장의 상한을 정한다
AI 데이터센터의 물리적 상한은 GPU 수가 아니라 그 GPU에 안정적으로 공급할 수 있는 전력과 열을 처리할 수 있는 인프라다.
6.1. 에너지 용량은 경제 용량이다
-
미국 전력 용량의 정체
- 10~15년의 평탄화: 미국은 석탄 발전을 줄이는 속도만큼 재생에너지를 추가하는 데 그쳐 전체 에너지 용량이 10~15년 동안 사실상 정체됐다.
- AI 시대의 등식: 디지털 AI 시대에는 energy capacity가 economic capacity와 같으므로 국가의 경제 용량도 그 기간 정체됐다는 논리다.
- 최근 증가율: 최근에는 대규모 수요 유입으로 국가 에너지 용량이 연간 약 4% 증가하는 정도까지 올라왔지만, 수요에 비해 충분하지 않다.
-
GPU 구매보다 전력 확보가 먼저다
- 투자의 전제: 전력을 공급할 수 없다면 새 데이터센터를 짓고 백만 GPU를 구매할 이유가 없다.
- 프로젝트 부도: 전력 확보에 실패한 데이터센터 프로젝트의 default가 늘어날 수 있으며, Oracle 관련 프로젝트가 초기 신호로 언급됐다.
- 자본 약정의 재평가: 기업은 데이터센터 랙·시멘트·GPU 구매에 약정한 자본을 실제 전력이 뒷받침하는지 먼저 확인해야 한다.
6.2. 발전원과 공급망의 재건
-
원자력과 공급망
- Base load: 원자력은 안정적인 base load로서 대규모 AI 전력 수요에 적합한 후보이며, 미국에서 더 많이 건설해야 한다.
- 재생에너지 의존성: 현재 재생에너지 공급망은 중국에 깊이 의존하는 문제가 있다.
- 가스터빈 시간: 가스터빈의 lead time도 약 8년에 달해 빠른 용량 확대가 어렵다.
- 원전 건설 공백: 미국에서 마지막 원자로가 가동된 지 약 20년이 지났을 만큼 유능했던 산업의 재건이 필요하다.
-
800V DC와 전력 변환
- 변환 단계 제거: 800V DC 데이터센터로 전환하면 역사적 표준과 여러 변환 단계 때문에 생기는 손실을 줄일 수 있다.
- Edison의 복수: 800V DC의 등장은 교류 중심으로 정착한 전력 인프라에 대한 “Edison의 revenge”로 표현됐다.
- 수직 GaN: vertical GaN은 800V를 48V, 12V, 심지어 5V로 한 단계에서 바꾸는 power conversion을 가능하게 해 효율을 높일 수 있다.
- Solid-state 변환기: solid-state transformer와 고속 switch를 포함해 전력 전달 네트워크 전체를 다시 설계해야 한다.
6.3. 냉각과 물리학을 바꾸는 기술
-
냉각 시스템도 혁신 영역이 된다
- 새로운 구성요소: 터빈, refrigerant, 전력 변환기, 냉각 시스템이 모두 AI 인프라의 핵심 기술이 된다.
- 현장의 변화: 25년 동안 하드웨어에 집중했던 엔지니어들이 열역학과 Carnot efficiency를 다시 공부해야 할 만큼 전력과 냉각이 중요해졌다.
-
전력당 성능의 정체를 깨야 한다
- Nvidia 세대의 평탄화: Nvidia 칩의 최근 5세대에서 power per teraflop이 사실상 개선되지 않고 평탄화됐다는 지적이 나왔다.
- 초전도체: Snowcap 같은 superconducting 기술은 물리 법칙 자체를 바꿔 약 1,000배 더 나은 power performance를 제공할 가능성이 있다.
- 하드웨어 르네상스: 메모리·광학·전력·냉각이 동시에 열리면서 하드웨어 업계가 르네상스에 들어섰다는 결론으로 이어진다.
7. VMware의 다음 추상화: 에이전트를 위한 가상 머신
가상 머신은 사라진 추상화가 아니라, 인간이 아니라 에이전트를 서비스하는 방향으로 다시 설계될 수 있는 컴퓨팅 계층이다.
7.1. 가상 머신은 여전히 핵심 추상화다
-
혁신은 다음 추상화를 만든다
- 기초 개념의 지속성: 새로운 기술이 등장해도 data structure, algorithm, abstraction이라는 기초 개념은 반복된다.
- VM의 위치: 인프라 수준에서든 애플리케이션 수준에서든 virtual machine abstraction은 compute hierarchy에 계속 자리 잡을 수 있다.
-
VMware가 관리했던 계층
- 통합 관리: VMware는 workload뿐 아니라 network와 storage까지 컴퓨팅 계층의 여러 요소를 추상화하고 관리했다.
- AI 계층의 재현: agent swarm이 등장하면 에이전트를 누가 관리하고, 보안 프로필을 만들고, 성능을 모니터링할지 같은 문제가 다시 나타난다.
7.2. 인간용 VM과 에이전트용 VM은 달라진다
-
에이전트가 VM을 선택하는 시장
- 형태의 변화: 에이전트가 직접 VM 서비스를 선택하게 되면 form factor와 제품을 마케팅하는 방식이 인간 중심 서비스와 달라진다.
- 복잡성의 변화: 에이전트는 인간보다 더 많은 복잡성을 다룰 수 있지만, 시작 속도(startup latency)에는 인간보다 훨씬 덜 인내심이 있다.
-
VM for agents의 설계 제약
- 정책과 헌법: Dario가 말한 constitution이나 guardrail처럼 인간이 에이전트의 정책과 운영 경계를 설정할 수 있어야 한다.
- 에이전트의 기본 요구: 에이전트를 secure하고 performant하게 만들고, 추상화하고, 다른 호스트로 migrate하며, 상태를 관리하는 기능이 필요하다.
- V-motion for agents: VMware의 vMotion에 대응하는 에이전트 이동·재배치 추상화가 새롭게 등장할 수 있다.
- 인간의 역할: 인간은 정책·constitution을 기술하고 대시보드를 통해 전체 시스템을 감독해야 한다. 에이전트 실행 자동화와 인간의 통제 설정이 함께 필요하다.
주요 발언 모음
“무언가를 쉽게 만드는 기술이 생길 때마다 병목은 다른 곳으로 이동한다.”
“이제 아무것도 단순한 칩이 아니다. 랙이다.”
“HBM은 끔찍한 메모리다. 다만 우리가 지금 가진 것 중에서는 단연 가장 좋다.”
“지난 30년 동안 주요한 새 메모리는 몇 개였나? 0개다.”
“AI 디지털 시대에는 에너지 용량이 곧 경제 용량이다.”
“NVL72는 공학적 경이지만 제조의 악몽이다.”
“구리의 죽음을 25년 전에 선언했다. 언젠가는 우리 하드웨어 엔지니어 모두에게 그 말이 맞을 것이다.”
“우리는 에이전트를 위해 하드웨어와 운영을 추상화해야 한다. 에이전트를 안전하고, 빠르고, 이동 가능하게 만들어야 한다.”
핵심 데이터 & 수치
- 16세: 장학금을 받아 기술학교에 진학하고 고등학교 마지막 1년 반을 건너뛴 시점이다.
- 18세: Intel 채용에 들어간 시점이며, 286·386·486 설계 경력으로 이어졌다.
- 3개월: AI 도구로 새로운 칩 논리 설계를 완성할 수 있다고 가정한 기간이다.
- 약 9개월: 실리콘 처리와 패키징을 거쳐 칩을 실제로 사용하기까지 걸리는 핵심 지연으로 제시됐다.
- 약 1년 반: 칩을 랙 규모로 배치하고 소프트웨어를 올려 실제 workload에 적용하는 전체 지연의 상한으로 언급됐다.
- 5,000만 달러: 전통적 프로토타이핑의 mask 비용 예시다.
- 약 100개: 현재 등장한 AI inference accelerator의 대략적인 수다.
- 약 500억 달러: 대형 데이터센터·전력·칩을 유용한 규모로 배치하는 데 필요한 자본 약정의 예시다.
- 0개: 지난 30년 동안 DRAM·SRAM·flash를 넘어선 주요 새 메모리의 수다.
- 약 2.5조 달러: 최근 4년 동안 메모리 산업 시가총액이 증가한 규모로 언급됐다.
- 25~30년: PIM 아이디어가 업계에 존재해 온 기간이다.
- 2~4단: compute tile에 붙는 메모리 스택의 현실적인 후보로 제시된 높이다.
- 2028~2029년: NPO·CPO와 광학 scale-up 공급망이 본격적인 전환점에 이를 것으로 전망한 시기다.
- 약 1,000만 GPU: 광학·패키지·열·레이저 공급망이 장기적으로 감당해야 할 규모의 예시다.
- 약 4%/년: 최근 미국 국가 에너지 용량 증가율로 언급된 수치다.
- 약 8년: 가스터빈 lead time의 예시다.
- 약 20년: 미국에서 마지막 원자로가 가동된 뒤 지난 기간이다.
- 약 1,000배: Snowcap 초전도 기술이 목표로 하는 power performance 개선 폭이다.
결론 및 시사점
- AI 설계 자동화의 다음 투자는 제조 속도다: 논리 설계가 3개월로 줄어도 fab·패키징·랙 통합이 9개월에서 1년 반을 차지하면 빠른 모델 변화에 대응할 수 없다. 새로운 lithography, 저비용 프로토타이핑, 빠른 실리콘 검증이 필요하다.
- 메모리는 AI 인프라의 중심 경쟁력이다: HBM을 단순히 더 쌓는 것만으로는 shoreline bandwidth와 열 문제를 해결하기 어렵다. 새 재료, 2~4단 적층, compute-memory 근접 배치가 현실적인 탐색 공간이다.
- 광학은 선택이 아니라 물리적 귀결이다: 5m 구리가 100m 광학보다 비싸지는 구간에서 all-I/O optics와 OCS가 대형 scale-up의 기본 구조가 된다. 다만 패키지·열·레이저 공급망이 먼저 성숙해야 한다.
- 전력 확보가 데이터센터 투자보다 앞서야 한다: 백만 GPU를 주문하는 능력보다 그 GPU를 돌릴 발전·송전·변환·냉각 능력이 중요하다. 원자력, 800V DC, vertical GaN, solid-state transformer가 미국 공급망 재건과 함께 검토돼야 한다.
- 가속기 숫자보다 플랫폼 통합이 중요하다: AI가 칩별 소프트웨어 생성을 쉽게 해 더 많은 이질성을 허용할 수 있지만, 자본·전력·운영·업그레이드 비용은 승자를 좁힌다. 장기적으로는 특화 설계가 큰 플랫폼 아래 추상화될 가능성이 높다.
- 에이전트 시대에는 가상화가 다시 핵심이 된다: 인간이 아니라 에이전트를 실행 대상으로 삼는 VM은 보안 정책, 성능, 이동성, fleet 관리, 인간 감독을 한 계층에서 묶어야 한다. 차세대 인프라의 추상화는 하드웨어를 숨기는 데서 끝나지 않고 에이전트의 행동과 권한까지 관리해야 한다.
핵심 요약 (20줄)
- Pat Gelsinger는 16세에 기술학교에 진학하고 18세에 Intel에 들어가 286·386·486 설계를 거치며 성장했다.
- 486 개발팀은 Verilog와 현대 EDA가 없던 시절 HDL·컴파일러·자동 배치·배선을 직접 만들었다.
- Stanford의 이론을 실제 386 설계에 적용해 반례를 찾은 경험은 산업과 학계의 왕복 학습을 보여준다.
- AI는 높은 수준의 설계 목표를 Verilog와 논리 구조로 번역하고 커널과 소프트웨어 계층을 빠르게 생성한다.
- 아날로그 회로는 충분한 silicon data가 필요해 AI 자동화만으로는 아직 다루기 어렵다.
- AI로 칩 논리 설계를 3개월에 끝내도 fab·패키징·랙 통합에는 약 9개월에서 1년 반이 걸린다.
- 제조 지연과 5,000만 달러 mask 비용은 빠르게 변하는 AI workload의 유효기간을 단축한다.
- HBM은 현재 최선의 메모리지만 낮은 밀도와 shoreline bandwidth, 전력·열 문제를 동시에 안고 있다.
- 전력 모델링이 부정확해 전체 전력 예산의 약 40%를 guard band로 잃는 문제가 있다.
- 약 100개의 AI 가속기가 등장했지만 극단적인 전문화는 workload 이동과 자본 규모의 압력을 받는다.
- OpenAI·Nvidia·Anthropic 같은 대형 고객은 하드웨어와 소프트웨어를 함께 진화시키는 플랫폼을 선택할 가능성이 높다.
- AI가 커널 작성을 쉽게 해 더 많은 하드웨어 이질성을 허용해도 데이터센터의 자본·전력·운영 비용은 남는다.
- 지난 30년 동안 DRAM·SRAM·flash를 넘어선 주요 메모리는 없었지만 AI 자본이 혁신의 경제성을 되살리고 있다.
- Ferroelectric과 비커패시터형 고밀도 셀, 메모리와 compute의 근접 배치가 차세대 메모리의 후보가 된다.
- 제조 수율 때문에 현실적인 메모리 적층의 sweet spot은 2~4단 또는 3~5단에 가까울 가능성이 높다.
- PIM은 메모리 대역폭을 줄이지만 workload를 제약하므로 범용적으로는 빠르고 밀도 높은 근접 메모리가 더 유리하다.
- 5m 구리가 100m 광학보다 비싸지는 구간에서 NPO·CPO와 OCS가 2028~2029년의 핵심 전환점이 된다.
- AI의 대형 예측 가능 flow는 임의의 패킷 네트워크보다 optical circuit switching에 더 잘 맞는다.
- 에너지 용량이 경제 용량인 시대에 원자력·800V DC·vertical GaN·냉각 기술이 GPU 확장의 상한을 결정한다.
- 에이전트용 VM은 보안·성능·이동·정책·대시보드를 묶어 AI 시대의 새로운 추상화 계층이 된다.
