URL: https://www.youtube.com/watch?v=fGRd5gYhztg 날짜: 2026-09-25 발행일: 2026-09-25 채널: latentspacepod 영상 ID: fGRd5gYhztg 원문 제목: The Endgame of AI Video Is a World Model — Anastasis Germanidis, Runway Co-founder
📌 핵심 질문 / AI 비디오의 종착점은 무엇인가
==AI 비디오의 종착점은 영상을 만들어 주는 도구가 아니라, 세계의 동역학을 예측하고 사용자의 행동에 반응하며 인터페이스와 로봇의 행동까지 생성하는 실시간 월드 모델(World Model)이다.==
- 영상 생성의 품질을 키우면 물리학, 인간의 움직임, 카메라와 장면의 인과관계를 더 잘 시뮬레이션하게 된다는 Scaling 가설이 있다.
- 비디오 모델은 RGB 프레임을 넘어 오디오, 깊이(Depth), 열(Heat), 텍스트, IMU, 과학 시뮬레이션까지 같은 기반 모델에서 학습하고 다른 양식으로 지식을 전이할 수 있다.
- 월드 모델은 사람을 위한 콘텐츠·소프트웨어 인터페이스와 에이전트를 위한 합성 데이터·강화학습·로봇 시뮬레이터라는 두 방향으로 확장된다.
대화의 중심에는 Runway의 여정이 있다. 예술가에게 연구 모델을 제공하던 도구가 영상 생성 모델을 직접 연구하는 회사가 되었고, Gen 1·Gen 2·Gen 3·Gen 4.5를 거치며 영상 모델을 현실의 물리 세계와 연결하는 GWM(World Model)으로 확장됐다. 최종 형태는 언어 모델만 제공하는 애플리케이션이 아니라, 언어 모델이 의도와 계획을 만들고 영상 모델이 그 결과인 픽셀·소리·상호작용을 실시간으로 렌더링하는 신경 운영체제(Neural OS)에 가깝다.
1. Runway가 출발한 두 세계: 예술과 계산
Runway의 출발점은 생성 모델과 시뮬레이션을 창작 도구로 바꾸려는 문제의식이었다. Germanidis는 예술 실천과 ML·백엔드 엔지니어링을 병행하며 두 분야를 연결했다.
1.1. 창작과 ML을 함께 다룬 배경
-
인터랙티브 아트와 시뮬레이션
- 2015년 갤러리 프로젝트: 관람객에게 음성으로 정체성을 부여했다. 프로그램은 한 사람을 “건축가, 30세, 스포츠를 좋아함”처럼 묘사하고 다른 사람과 짝지어 완전히 생성된 상호작용을 만들었다.
- 언어 모델 이전의 생성 방식: 직업·성격·나이 목록을 조합하는 템플릿과 Markov chain 생성 텍스트로 갤러리 전체의 가벼운 대화를 시뮬레이션했다.
- 핵심 관심사: 생성 모델로 새로운 표현을 만드는 일과, 단순한 상호작용·행동 모델로 인간을 무엇까지 이해할 수 있는지 탐구하는 일이 같은 축에 놓였다.
-
초기 생성 모델의 예술적 전용
- Pix2PixHD: NVIDIA가 2016~2017년 공개한 초기 image-to-image 모델로, 장면의 semantic map을 photorealistic 이미지로 변환했다.
- 데이터의 원래 용도: self-driving 데이터로 학습해 pedestrian, traffic sign, bike, stop light 등 도로의 범주만 다뤘고 당시로서는 1K 해상도를 생성할 수 있었다.
- 분포 밖의 창작: 예술가들은 모델에 백만 명의 보행자, 백만 개의 교통 표지판, 거대한 인간처럼 학습 데이터에 없던 입력을 넣어 초현실적 이미지를 만들었다.
- Runway의 초기 명제: 평범한 데이터로 학습한 모델도 관점을 바꾸고 흥미로운 도구로 포장해 예술가에게 건네면 예상하지 못한 표현을 만들 수 있다.
1.2. “언제”가 아니라 “얼마나 빨리”의 문제
-
생성 콘텐츠에 대한 초기 전망
- 2016~2017년의 추론: 해상도와 품질이 예측 가능한 속도로 올라가면 대부분의 콘텐츠가 생성될 시점이 올 것이라고 봤다.
- 창작 도구의 재설계: 생성 모델이 보편화되면 기존의 창작 소프트웨어를 그대로 유지할 수 없고, 생성 모델에 맞는 새로운 creative tool이 필요하다는 것이 Runway의 초기 thesis였다.
-
예술적 실험에서 회사로
- 초기 팀의 결합: Chris를 포함한 공동창업자들과 생성 모델을 만들고 예술가가 쉽게 조작할 수 있는 빈 캔버스형 UX를 실험했다.
- 초기 바이럴의 기억: 2018~2022년에는 창작 AI 연구자가 작은 커뮤니티 안에서 만든 프로젝트가 즉시 화제가 됐다. Neural Style Transfer와 DeepDream의 “puppy slide”, 뉴욕 지하철과 Williamsburg Bridge를 촬영해 회화 스타일로 변환한 작업이 대중에게 생성 모델의 가능성을 처음 직관적으로 보여줬다.
2. 연구 조직, Green Screen, 그리고 영상 생성 모델
Runway는 오픈소스 모델을 예술가에게 연결하는 서비스에서 자체 모델을 연구하는 조직으로 이동했다. 가장 먼저 해결한 문제는 화려한 생성보다 영상 제작 현장에서 반복되는 segmentation과 rotoscoping이었다.
2.1. post-production에서 생성 모델로
-
모델을 예술가에게 전달하는 문제
- 초기 제품: 당시 공개된 Pix2Pix 계열 모델을 ML 엔지니어가 아니어도 사용할 수 있게 만들었다.
- 연구 조직의 필요: 1년 차부터 Runway 안에 research organization을 꾸렸다. 당시 image generation은 물론 video generation도 실제 제작 workflow에 넣기에는 품질·제어·서빙이 부족했다.
-
Green Screen
- 핵심 문제: VFX는 피사체를 배경에서 분리하는 일이 대부분이며, rotoscoping은 극도로 수작업이고 누구도 즐기지 않는 작업이다.
- 현장 검증: image·video segmentation을 해결한 Green Screen은 오랫동안 Runway의 대표 도구였고 Everything Everywhere All at Once를 비롯한 고가시성 영화와 시리즈에 사용됐다.
2.2. Scaling과 Gen 1의 선택
-
대규모 학습에 대한 베팅
- 2022년의 판단: 이미지 생성과 영상 생성에도 언어 생성과 같은 Scaling laws가 적용될 것이라고 봤다.
- 1,000개 A100 클러스터: Series B 단계의 회사로서는 비합리적으로 보일 수 있는 투자를 결정했지만, 큰 규모로 학습한 video model이 큰 도약을 만들 것이라고 믿었다.
- 당시 기준점: video generation의 대표적인 공개 모델 CogVideo는 256×256 해상도였고 품질도 제한적이었다. 목표는 Stable Diffusion이 이미지에 만든 순간을 영상에서 재현하는 것이었다.
-
Text-to-video 대신 Video-to-video
- 문제의 난이도: 아무 조건 없이 영상을 처음부터 생성하는 것보다 강한 conditioning이 있는 기존 영상을 다른 스타일로 변환하는 편이 훨씬 쉽다.
- Gen 1: 2023년 1월 공개된 depth-conditioned video model이다. 입력 영상을 depth map으로 바꾸고, latent diffusion model로 새 픽셀을 생성했다.
- 실제 사용: 책이나 상자로 만든 도시를 휴대전화로 촬영해 photorealistic 장면으로 바꾸고, Blender render나 Unity 장면을 photorealistic하게 restylize하는 storyboard workflow가 빠르게 나타났다.
- Video-to-video의 의미: ground-truth video를 초기 영감으로 사용하면 스타일과 출력만 바꾸면서 실제 움직임과 구도를 유지할 수 있어 여전히 강력한 작업 방식이다.
-
Gen 2로의 해킹적 진화
- 출발점: Gen 1은 depth를 RGB로 변환했지만 text-to-video나 image-to-video를 직접 구현하기 어려웠다.
- 주말 프로젝트: 텍스트를 depth map으로 변환하는 모델을 만들고 그 결과를 Gen 1에 넣는 2단계 pipeline을 구성했다.
- Gen 2: 이 hackathon식 조합이 Gen 2가 됐다. depth를 먼저 예측해 구조가 다소 어긋나는 흔적은 있었지만, 사용자에게 text-to-video를 신속하게 제공할 수 있었다.
- 현재의 재평가: 텍스트를 곧바로 픽셀로 보내기 전에 planner가 bounding box나 상세한 설명을 만들고 diffusion transformer가 생성하도록 하는 2단계 구조가 이후 모델의 표준 pipeline이 됐다. DALL·E 3의 synthetic caption과 Sora의 prompt rewriting이 같은 방향의 사례다.
2.3. Stable Diffusion의 회고
-
Latent Diffusion에서 Stable Diffusion으로
- 연구 계보: 2021년 말 latent diffusion 논문이 나왔고, Runway에서 일하던 Patrick Esser가 Robin Rombach 및 CompVis 연구자들과 연구를 이어갔다.
- 확장된 학습: Stable Diffusion은 latent diffusion을 더 많은 compute와 데이터로 학습하고, 2022년 초 공개된 classifier-free guidance 같은 기법을 추가한 모델이었다.
- 데이터: LAION 중 aesthetic subset을 사용해 시각적 품질을 개선했다.
-
공개 연구와 상업화 사이
- 학습 run: Stability AI가 클러스터와 자금을 제공했고, 모델 학습은 latent diffusion 연구를 이어가는 open-source research project로 진행됐다.
- 오해와 해결: 모델 성공 이후 상업화 경로를 둘러싼 긴장이 있었지만, Stable Diffusion을 계속 공개한다는 원래 목표를 지키는 방향으로 정리됐다. Stable Diffusion 1.5 공개를 둘러싼 오해도 수 시간 안에 해소됐다.
- 그 이후: Stability AI와 Runway는 서로 다른 길을 갔으며, 당시의 사건은 과거의 일이 됐다.
3. Text-to-video에서 World Model로
Gen 2의 가장 중요한 교훈은 좋은 영상 한 편을 만드는 능력만으로는 제작 workflow를 완성할 수 없다는 점이었다. 사용자는 장면을 조종하고 참조를 넣고 반복해서 수정해야 하며, 이 제어 가능성이 곧 세계를 내부적으로 시뮬레이션하는 능력과 연결된다.
3.1. 품질보다 먼저 등장한 Controllability
-
제작자가 요구한 것
- 참조의 부재: 순수 text-to-video는 무엇을 만들어야 하는지 설명할 수 있지만, 장면을 고정할 기준이 없어 탐색적 사용에 머물렀다.
- 조작의 필요: 카메라 궤적, 초기 프레임, 물체의 움직임, 장면 구성과 같은 입력을 직접 제어해야 실제 film workflow에 들어갈 수 있었다.
-
2023년의 Control 기능
- Motion Brush: 화면에 화살표를 그려 피사체가 움직일 방향을 지정했다.
- Camera Control: 카메라가 장면 안에서 어떻게 이동할지 기술했다. 초기 Camera Control은 단순한 콘텐츠 생성보다 “세계 안을 이동한다”는 감각을 제공했고, World Model 연구의 씨앗이 됐다.
- 두 가지 해석: 생성 모델을 content creation machine으로 볼 수도 있지만, 영상을 잘 예측하려면 물리·인간 행동·동역학을 점점 더 정확히 시뮬레이션해야 한다는 관점도 가능하다.
3.2. 인간의 설명이 아니라 세계의 관측에서 학습하기
-
Human mind에서 world로
- 새로운 초점: 최근 AI가 인간의 언어와 선호를 모방하는 데 집중했다면, 다음 단계는 인간이 말로 표현하지 못하는 세계의 복잡한 구조를 모델링하는 일이다.
- DeepMind의 명제와의 대비: “intelligence를 해결한 뒤 다른 모든 것을 해결한다”는 방향 대신, 세계의 구체적 현상에서 출발해 지능과 다른 문제를 함께 얻는 접근이다.
-
텍스트가 포착하지 못하는 지식
- 운동의 암묵성: 신발끈 묶는 법은 말로 설명하기 어렵지만 시범으로는 쉽게 보여줄 수 있다.
- 관측의 장점: 사람들이 세계에 대해 쓴 글은 2020년대 인간의 이해를 담지만, 낮은 수준의 물리와 무의식적 행동의 세부까지 기록하지 않는다. 직접 관측한 영상은 그 빈틈을 학습 데이터로 제공한다.
-
초기 영상 모델을 보는 법
- 현재 품질의 한계: Gen 2는 제한된 움직임, 낮은 fidelity, 부정확한 인간 해부학을 보였다. 출력만 보면 일반 세계 시뮬레이터로 이어질 이유가 약해 보였다.
- 추세의 중요성: 32×32 얼굴 이미지가 1K street image로 발전한 것처럼, Gen 2도 GPT-2가 짧고 어색한 문장을 만들던 단계에 비유할 수 있다. 개별 버전보다 시간에 따른 품질과 능력의 기울기를 봐야 한다.
3.3. Pixel prediction과 Bitter Lesson 논쟁
-
Runway의 실용주의
- 현재의 증거: video prediction 자체가 scale되지 않는다는 증거가 없으므로, 새 아키텍처를 발명하기보다 데이터와 모델·compute scale을 키우는 편이 낫다는 판단이다.
- 로보틱스의 사례: 가장 유망한 robotics 연구도 video prediction model에서 시작해 action model로 적응시키는 흐름을 보인다.
-
Yan LeCun식 반론과 답변
- 반론: 관측된 픽셀은 사물의 내부 과정이 아니라 결과에 불과하며, Plato’s cave처럼 noisy한 그림자만 학습하게 될 수 있다. 중력과 운동 법칙을 이미 알고 있는데도 모든 것을 데이터에서 다시 배우는 방식은 비효율적으로 보인다.
- 답변: 머신러닝의 역사는 계속 “틀려 보이는 단순한 방법”이 더 잘 작동하는 Bitter Lesson의 반복이었다. 현재까지는 직접적인 video prediction을 버려야 할 이유가 없다.
- 주의점: 모델이 연속 장면을 이어 붙이거나 어려운 물리를 감춰 성능이 좋은 것처럼 보일 수 있다. 선택된 예시만 보고 World Model의 발전을 과대평가해서는 안 된다.
-
Physics IQ와 Scaling 증거
- 측정 방식: mechanics, fluid dynamics, optics 등 현상을 담은 영상의 첫 프레임을 image-to-video model에 입력하고 다음에 일어날 일을 rollout하게 한다.
- 직관적 물리: 천장에 매달린 공을 놓거나 물체를 떨어뜨렸을 때 어디로 움직일지 예측하는 능력을 측정한다.
- 추세: 서로 다른 compute scale에서 Physics IQ 점수가 예측 가능하게 향상된다. 기법으로 점수를 더 올릴 수 있지만, scale만으로도 물리 학습이 좋아진다.
4. Sora 충격과 Gen 3, 그리고 실시간화
Sora가 등장한 2024년 초는 Runway가 영상 모델의 규모와 인프라를 다시 설계해야 했던 분기점이었다. 몇 달 만에 언어 모델 업계가 수년 동안 쌓은 distributed training의 교훈을 따라잡아야 했다.
4.1. Gen 3가 만든 3개월의 추격
-
Diffusion Transformer로 전환
- 기존 구조: 초기 latent diffusion 모델의 diffusion 부분은 주로 convolutional network였다.
- 새로운 방향: 2023년 공개된 diffusion transformer 연구가 image diffusion에도 Scaling law가 있음을 보였고, Runway는 수십억 파라미터를 넘어 학습할 model parallelism과 distributed training 인프라를 만들었다.
- 실패의 축적: 2023년 가을 동안 image·video diffusion transformer를 확장하려고 여러 번 실패하며 인프라를 완성했다.
-
Sora 이후의 대응
- 2024년 2월: Sora가 Gen 2보다 훨씬 뛰어난 결과를 공개했고, Runway가 끝났다는 반응이 나왔다.
- 조직의 위기와 적응: 처음에는 몇 시간 동안 existential crisis가 있었지만, 8년 동안 반복해 온 빠른 학습과 적응이 작동했다.
- Gen 3: 모델 규모와 학습 compute를 10배 키우고 model parallelism을 새로 익혀 약 3개월 만에 Sora보다 나은 모델을 목표로 했고, 2024년 여름 Gen 3를 공개했다.
4.2. Distillation과 실시간 비디오
-
Gen 3 Turbo
- 서빙 문제: Gen 3의 최초 버전은 품질은 높았지만 inference 비용이 컸다.
- 해법: Gen 3 Turbo는 production에서 사용된 초기 step-distilled model 중 하나로, 큰 모델의 결과를 적은 diffusion step으로 생성하도록 했다.
-
두 가지 Distillation 축
- 모델 축소: 언어 모델처럼 더 작은 모델로 지식을 옮길 수 있다.
- Step 축소: 50 diffusion steps를 4 steps로 줄일 수 있다. 약간의 성능 저하가 있어도 frontier model과 비슷한 출력이 가능하다.
-
Characters와 Real-time
- 구조: Runway의 Characters는 talking avatar를 위한 causal autoregressive video model이며, step distillation을 거쳐 24fps로 생성한다.
- World Model의 전환: 양방향 diffusion이 전체 영상을 한 번에 만들던 방식에서, 한 프레임 또는 몇 프레임씩 생성하는 autoregressive 방식으로 옮긴다.
- 전망: 실시간 video generation은 사용자 경험이 좋고 서빙 비용이 낮으므로 불가피하다. 품질 격차는 더 나은 distillation으로 줄어들며, 2년 뒤에는 real-time model이 주류가 될 가능성이 높다.
- 현재의 길이: Characters는 autoregressive로 최대 약 30분을 생성할 수 있지만, GWM Worlds 같은 개방형 탐색 모델은 수분 정도에서 품질 저하가 나타난다. Genie의 약 1분보다 길지만, 게임처럼 수분마다 재시작해야 하는 경험은 해결해야 한다.
5. Interface World Model과 Neural OS
World Model은 픽셀을 출력하는 생성기가 아니라, 상호작용의 다음 상태를 예측하는 실행 환경이 될 수 있다. HTML·CSS·React가 픽셀을 렌더링하는 대신, 모델이 사용자의 클릭과 드래그를 받아 다음 픽셀과 오디오를 직접 생성한다.
5.1. 픽셀로 직접 렌더링하는 소프트웨어
-
Interface World Model의 동작
- 입력: click, drag, scroll을 직접 받는다.
- 출력: 특정 상호작용 다음에 나타날 픽셀을 real-time video model이 생성한다. 오디오도 함께 생성해 버튼을 눌렀을 때의 sound effect까지 표현할 수 있다.
- 동작의 기술: 어떤 버튼을 누르면 어떤 일이 일어나야 하는지를 prompt로 설명한다. markup language로 HTML 구조를 일일이 정의하는 대신, 인터페이스의 행동과 시각적 결과를 기술하는 방식이다.
-
기존 프런트엔드와의 비교
- LLM의 한계: Figma 화면을 참고해 Claude 같은 LLM에게 특정 drag interaction을 구현하게 하면 느리고, 복잡한 상호작용을 정밀하게 포착하기 어렵다.
- 새로운 장점: camera transition, 장면의 변화, 개방형 탐색을 픽셀 생성과 함께 설계할 수 있다.
5.2. 사용처와 비용
-
유망한 사용처
- Creative tool: 생성 모델을 인터페이스 자체로 만들어 새로운 창작 도구를 만들 수 있다.
- 교육: 새로운 개념을 시각화하고, 정해진 메뉴가 아니라 사용자의 질문과 탐색에 따라 인터페이스를 바꿀 수 있다.
- Industrial design: 기존 소프트웨어로 만들기 어려운 상호작용과 카메라 이동을 real-time으로 시험할 수 있다.
- Personalization: 방문자마다 prompt를 바꾸고, 텍스트를 크게 하거나 접근성을 높이며, 개인의 학습 선호에 맞게 같은 기능을 다르게 표현할 수 있다.
-
해결해야 할 비용 문제
- 계산량: HTML을 렌더링하는 것과 매 프레임 real-time video model을 실행하는 것은 비용 차이가 크다.
- 상시 생성: 입력이 없을 때는 계산을 멈출 수 있지만, 화면에 사람이 걷는 등 ambient motion이 있으면 계속 생성해야 한다.
- 최적화 방향: 반복 가능한 장면에는 loop를 사용하고, 먼저 전통적인 인터페이스보다 명확히 매력적인 사용처를 찾은 뒤 inference 비용을 낮춰야 한다.
-
게임 엔진과의 비교
- 구조화된 대안: Unity나 Godot와 NPC 행동을 결합하면 실제로 가능한 동작을 효율적으로 제어할 수 있다.
- World Model의 차이: Neural interface는 “무엇이든 가능한 UI”를 만들 수 있다. 반대로 작은 모델이 물고기의 움직임처럼 좁은 현상을 예측하게 만드는 방향도 가능하다.
5.3. Neural Operating System의 방향
-
새로운 소프트웨어 추상화
- 현재의 application 개념: 각 도구와 기능마다 별도의 codebase가 있어야 한다는 전제에서 생겼다.
- 통합된 생성: video model이 사용자 context와 LLM의 출력을 받아 그때그때 인터페이스를 만들면, 전통적으로 여러 애플리케이션에 나뉜 기능을 하나의 흐름으로 조합할 수 있다.
- End-to-end delivery: 애플리케이션은 language model만 전달하는 것이 아니라, render와 pixels까지 함께 학습해 제공해야 한다.
-
사람과 에이전트의 양면성
- World models for humans: 사람이 탐색하고 배울 수 있는 유연한 화면과 경험을 제공한다.
- World models for agents: 실제 소프트웨어의 화면을 다양하게 생성해 computer-use agent를 훈련하는 synthetic data generator가 된다.
- Online RL: 에이전트가 인터페이스 안에서 클릭과 drag를 수행하고 결과를 받아 개선하는 live reinforcement-learning 환경으로 쓸 수 있다.
- 다양성: 여러 종류의 UI와 상호작용을 즉석에서 생성하면 특정 화면에 과적합되지 않는 agent를 만들 수 있다.
6. 로보틱스: 영상 사전학습에서 World Action Model로
Runway는 Gen 4.5 기반의 GWM-1을 통해 양방향 video diffusion을 autoregressive simulation으로 바꾸고 action을 받게 했다. 그 결과는 콘텐츠 생성과 별개로 로봇 학습·평가의 기반이 된다.
6.1. GWM-1과 Real-to-sim correlation
-
GWM-1의 구성
- 기반 모델: 고양이와 개를 생성하던 Gen 4.5 video diffusion backbone에서 출발한다.
- 변환: 모델을 autoregressive하게 만들고, action을 입력으로 넣어 한 시점의 행동 이후 세계가 어떻게 변할지 rollout한다.
- Counterfactual: 같은 시작 장면에서 action A와 action B를 각각 취했을 때의 결과를 비교할 수 있다.
-
로봇에서의 첫 사용처
- 합성 데이터: 실제 로봇으로 얻기 어려운 작업 변형을 world model 안에서 생성해 robotic policy를 학습시킨다.
- 시뮬레이터: 로봇의 action을 world model에 넣어 결과를 보고, 다음 action을 정하는 closed-loop simulation을 만든다.
- 상관관계의 조건: 모델 안에서 행동한 결과와 실제 세계에서 같은 행동을 한 결과가 비슷해야 한다. 이것이 real-to-sim correlation이다.
-
평가 실험
- 벤치마크: 널리 사용되는 로보틱스 벤치마크의 같은 scenario와 embodiment를 world model 안에 구성했다.
- 측정: 실제 세계에서 action model이 보인 성능과 GWM-1에서 보인 성능의 상관관계를 비교했다.
- 효과: 실제 하드웨어를 반복해서 움직이는 것보다 훨씬 빠르게 policy를 평가할 가능성을 확인했다.
6.2. 전통적 시뮬레이터보다 유리한 지점
-
Rigid body 시뮬레이션의 강점과 한계
- 전통적 도구: 물체의 물리를 정확히 기술할 수 있으면 Isaac Sim이나 MuJoCo로 rigid object를 잘 시뮬레이션할 수 있다.
- 어려운 상호작용: cloth, slippery surface, 복잡한 manipulation은 환경과 task마다 디지털 도메인을 손으로 만드는 데 시간이 오래 걸린다.
-
World Model의 단순화
- 입력 준비: 3D scan으로 환경과 모든 개별 물체를 복제하는 대신 환경의 첫 프레임이나 사진을 넣는다.
- 행동의 rollout: 첫 프레임에 policy를 적용하고, world model이 그 장면에서 가능한 후속 프레임을 생성한다.
- 적용 범위: 시뮬레이션 제작 비용을 줄이면서 실제 물체가 미끄러지거나 천이 접히는 등 수식화하기 어려운 현상까지 다룰 수 있다.
6.3. 데이터의 양과 Curriculum
-
로봇 학습 데이터의 세 가지 원천
- Teleoperation: 사람이 실제 로봇을 원격 조작하며 얻는 데이터다. 품질은 좋지만 하드웨어와 운영 비용 때문에 확장하기 어렵다.
- Yumi·egocentric video: 사람이 로봇식 gripper를 사용해 작업하는 인간 중심 영상을 활용한다.
- GoPro 영상: 사람의 머리에 카메라를 달아 작업을 촬영하는 방식이다. teleoperation보다 확장하기 쉽지만 third-person video보다는 훨씬 적다.
-
Third-person pre-training의 논리
- 인간의 학습 방식: 사람은 다른 사람이 스포츠나 집안일을 수행하는 모습을 보면서 많은 행동을 배운다. 순수한 first-person trial-and-error만으로 배우지 않는다.
- 데이터 규모: egocentric data조차 세상에 존재하는 third-person video에 비해 약 3자릿수 적다.
- Runway의 thesis: 가장 풍부한 데이터가 결국 이긴다. 대규모 third-person video로 세계·물리·인간 동작을 사전학습한 뒤 적은 로봇 데이터로 특정 embodiment에 적응시키는 편이 일반화에 유리하다.
-
Post-training의 규모
- 현재 방식: 특정 파트너의 single-arm, bimanual, 다른 형태의 로봇에 맞춰 GWM Robotics를 post-train한다.
- 데이터 차이: 수십만~수백만 시간으로 robotics model을 사전학습하는 방식과 달리, 기반 video model 위에 수백 시간 정도의 로봇 데이터를 추가해도 빠르게 성능을 얻는다.
- 일반화: 한 task를 외우는 대신 사전학습에서 익힌 물리·세계·인간 동작을 사용해 새로운 환경과 task로 확장한다.
- 통합 전망: 1~2년 뒤에는 manipulation, navigation, human behavior를 각각 나눈 세 모델보다, 환경을 이동하고 조작하고 사람과 대화하는 과정을 하나의 real-time video model로 통합할 가능성이 있다.
6.4. Self-driving, Action Head, 그리고 실패의 학습
-
자율주행으로의 확장
- 현재 초점: Runway의 주력은 robotic manipulation이지만, video/world model은 ADAS와 self-driving 연구의 평가 시뮬레이터로도 사용될 수 있다.
- World Action Model: 장면의 첫 프레임에서 “로봇 팔로 물체를 집어라”라고 요청하고 정확한 영상을 만들 수 있다면, 같은 행동에 필요한 3D pose와 action도 예측할 수 있다. 여기에 action head를 붙인 것이 policy로 작동한다.
-
Lucid Dream Test
- 설정: VR headset을 쓰고 실제 방을 passthrough로 보는지, 실시간 video model이 생성한 방을 보는지 모르는 상태에서 걸어 다니고 물체와 상호작용한다.
- 통과 기준: 마지막에 어느 쪽이었는지 확실히 구분하지 못하면, 월드 모델이 충분히 현실적인 수준에 도달한 것이다.
-
Counterfactual의 중요성
- 성공 편향: 축구선수가 골을 넣는 영상은 실패하는 영상보다 많으므로, 현재 모델은 성공 장면을 더 그럴듯하게 만든다.
- 로봇의 요구: action A와 action B를 했을 때 각각 현실적인 결과를 만들어야 한다. 특히 policy 평가와 online RL에는 실패를 정확히 시뮬레이션하는 능력이 필수다.
- 역설: 다른 영역과 달리 video model에는 성공 사례가 너무 많고 실패 사례가 부족하다. 실패를 생성해 주는 것이 어렵지 않아 보이지만, 현실적인 실패의 분포를 배우는 일은 별도 문제다.
7. Harness에서 Omni Model로
생성 모델을 실제 workflow에 연결하는 데에는 한 모델의 능력뿐 아니라 여러 모델을 조합하는 harness가 중요하다. 그러나 harness에서 해결하던 절차는 장기적으로 모델 내부에 학습될 가능성이 높다.
7.1. Video Agent와 제작 pipeline
-
End-to-end 광고 제작
- 시작점: 광고 brief를 입력한다.
- 중간 단계: Video Agent가 storyboard를 만들고 image model·video model을 호출한다.
- 후속 단계: 광고 성과 데이터를 분석하고, 잘 된 광고의 특성을 반영해 새로운 출력을 만든다.
-
Harness의 역할
- Prompt completion: 현재 production video model은 입력 prompt를 더 긴 묘사로 확장한다. 사람이 프롬프트를 쓰는 것보다 synthetic caption과 자동 재작성에 의존하는 편이 효과적이다.
- 다중 shot: 초기에는 여러 단일 shot을 병렬 생성해 편집하는 orchestrator가 필요했다. 현재는 다중 shot을 직접 생성하는 방향으로 모델에 video editing instinct를 학습시키고 있다.
- 한계: LLM에게 여러 영상을 편집해 달라고 하면 pacing과 장면 전환이 어색하다. 영상 편집은 모델 내부에서 end-to-end로 배워야 한다.
7.2. Omni Model의 형태
-
언어와 픽셀의 연결
- 가능한 구조: autoregressive text model이 reasoning과 scene planning을 수행한 뒤 diffusion head가 픽셀을 생성한다.
- 반복 루프: 생성된 결과를 다시 같은 모델로 넣어 평가하고 수정하는 loop를 모델 안에서 수행할 수도 있다.
- 현재 위치: Gemini와 일부 Qwen 계열이 이러한 omni 방향에 가까우며, 아직 보편적인 구조는 아니다.
-
Harness가 Model이 되는 과정
- 초기 단계: chain-of-thought나 다중 shot 조합처럼 복잡한 system prompt와 외부 orchestrator가 필요하다.
- 다음 단계: 모델이 스스로 reasoning trace와 편집 순서를 생성한다.
- 장기 방향: 외부 harness로 반복하던 일을 단일 모델이 end-to-end로 학습하면서, 언어·계획·영상·오디오를 같은 루프에서 처리한다.
8. 창작 생태계, 회사의 운영, 공개 연구
Runway의 강점은 연구자와 창작자가 같은 모델을 서로 다른 방식으로 검증하는 조직 구조에 있다. 기술의 품질만큼 caption의 cinematography 정보와 실제로 쓸 수 있는 결과를 판별하는 taste가 중요하다.
8.1. Creative team과 뉴욕의 역할
-
창작자의 참여
- Captioning: video를 묘사할 때 단순히 “사람이 걷는다”가 아니라 cinematography, aesthetic, camera direction을 최대한 자세하게 담아야 inference 때 다시 꺼낼 수 있다.
- Evaluation: creative team이 모델 결과가 실제로 쓸 수 있는지 평가한다.
- 조직의 조합: 연구자와 예술가가 나란히 일하며 다음 세대 모델을 만든다는 점이 Runway 운영의 중요한 특징이다.
-
뉴욕의 효과
- 산업의 교차점: 미디어, 광고, 예술 장면이 교차하고 실제 창작 현장과 가까운 인력 풀이 있다.
- 외부자 관점: Bay Area의 AI hive mind 바깥에서 다른 관점을 유지하며 시간을 들여 팀을 의도적으로 키웠다.
- 채용: video model·world model·robotics의 software, hardware, research를 폭넓게 채용한다. 직접적인 robotics 경력이 없어도 learned policy 경험과 빠른 학습 능력, generalist 성향이 중요하다. Enterprise video model 수요에 대응하기 위해 go-to-market 조직도 확장한다.
8.2. Cosmos Coalition과 공개 생태계
-
NVIDIA와의 공개 연구
- 목표: NVIDIA와 함께 Cosmos Coalition을 공동 설립해 physical AI와 world model 연구를 공개 영역으로 가져온다.
- 공개 대상: open-weight model, 물리와 월드 모델의 능력을 측정하는 benchmark, 연구자가 사용할 infrastructure를 포함한다.
- 생태계 효과: 이제 막 시작하는 개발자와 연구자도 world model 연구에 기여하기 쉽게 만드는 것이 목적이다.
-
중국 모델과 경쟁
- 현재 격차: image model에서는 서구가 강하지만, video model leaderboard의 top 10~20에는 중국 모델이 다수다.
- 대응 방식: 중국 모델의 출력에서 distill해 성능에 묶이는 것은 장기 전략으로 낙관적이지 않다. 자체적으로 뛰어난 모델을 학습할 역량이 있다고 보고, 커뮤니티 전체의 투자를 넓혀 경쟁력을 확보해야 한다.
8.3. Benchmark와 인간 평가
- Arena score의 한계
- 창작 현장의 선택: creative·artist·marketer는 leaderboard보다 같은 prompt를 여러 모델에 넣고 결과를 눈으로 비교하는 경향이 강하다.
- 시각적 즉시성: 미적 완성도, artifact, 물리 오류는 사람이 즉시 볼 수 있다.
- 언어와의 차이: LLM의 수학·코딩 benchmark는 인간이 직접 차이를 판별하기 어렵지만, 이미지·영상은 출력 자체를 바로 평가할 수 있다.
9. AI와 창작자, 그리고 속도의 다음 단계
생성 AI를 둘러싼 반감은 “한 줄의 텍스트가 완성된 영화를 마법처럼 뽑는다”는 이미지와 연결돼 있었다. 참조와 제어가 늘어나면 도구의 성격이 달라지고, 창작자와 AI의 관계도 달라진다.
9.1. 브러시와 카메라라는 관점
-
기술과 예술의 연속성
- 도구의 계보: 생성 모델은 붓이나 카메라와 마찬가지로 예술과 기술이 함께 발전해 온 긴 계보의 최신 도구다.
- 태도 변화: Ron Howard를 비롯해 AI를 긍정적으로 말하거나 실제로 채택하는 유명 감독이 늘면서 공개적 반응이 바뀌고 있다.
-
Text-to-video에 대한 오해
- 초기 인상: 단 한 줄의 텍스트가 장편 영화를 자동으로 만든다는 인상이 반발을 키웠다.
- 현재 도구: 최신 모델은 많은 reference와 높은 controllability를 받으며, 최대 50개의 reference를 이용해 사용자가 원하는 방향으로 조종할 수 있다.
- 본질적 변화: 결과를 마법처럼 결정하는 존재가 아니라, 창작자가 steering하는 story tool로 보일수록 생성 모델이라는 사실의 중요성이 줄어든다.
9.2. Quality → Controllability → Latency
-
요구사항의 순서
- Quality: 초창기에는 더 선명하고 사실적인 출력이 절대적인 목표였다.
- Controllability: 이제는 reference, storyboard, camera와 다양한 입력으로 원하는 결과를 재현하는 능력이 품질만큼 중요하다.
- Latency: 다음 병목은 속도다. 한 prompt로 거의 즉시 10개의 결과를 만들면 탐색 공간을 훨씬 빠르게 훑을 수 있다.
-
창작 도구의 즉시성 회복
- 과거의 감각: Photoshop 같은 도구는 조작 즉시 반응했다.
- 현재의 손실: 생성 영상은 결과를 받기까지 2분을 기다려야 하므로 창작의 흐름이 끊긴다.
- 실시간 모델의 의미: quality와 control을 유지하면서 latency를 줄여 과거의 즉각적인 창작 경험을 되돌리는 것이 real-time video model의 핵심 가치다.
10. Physical AI Summit과 다중 양식의 종착점
Runway는 9월 30일 San Francisco에서 physical AI와 real-time video generation을 주제로 summit을 열고 NVIDIA, Physical Intelligence, The Bot Company, DeepMind의 연구자들과 기술적인 토론을 예고했다.
10.1. 남아 있는 연구 논쟁
-
Robotics architecture
- VLA와 World Action Model: 시각·언어·행동을 결합한 접근과 video model에 action head를 붙이는 접근 중 어느 쪽이 장기적으로 나을지 논쟁이 있다.
- 데이터의 원천: third-party video를 더 크게 확장할지, first-party·teleoperation 데이터를 더 많이 모을지 의견이 갈린다.
- 표현 방식: 픽셀을 직접 예측할지, JEPA 같은 잠재 표현을 사용할지, 더 3D 기반으로 갈지 아직 결정되지 않았다.
-
하드웨어의 현실
- 해결되지 않은 층: 센서·액추에이터·전압·전력·열·모터는 소프트웨어 대화만으로 추상화할 수 없다.
- 실제 로봇의 어려움: 로봇을 사거나 직접 조립하면 모터조차 제대로 동작시키기 어려울 수 있다. 물리 장비는 software model만큼 쉽게 확장되지 않는다.
10.2. Omni World Model
-
RGB를 넘어서는 관측
- 기본 확장: RGB 영상과 audio를 동시에 생성한다.
- 추가 양식: depth, heat, text, IMU, ultraviolet 같은 센서 양식도 같은 모델에 넣을 수 있다.
- ImageBind의 사례: Meta의 ImageBind는 image, audio, depth, heat, text, IMU 등 여러 양식을 하나의 표현 공간으로 묶는 가능성을 보여줬다.
-
양식 간 Transfer
- Refusion: Stable Diffusion을 spectrogram에 fine-tune해 꽤 능력 있는 music generator로 만들었다. 이미지 모델의 공간·시간 패턴이 오디오로 이전될 수 있다는 사례다.
- 과학 시뮬레이션: 물리·생물학의 numerical simulation을 여러 공간·시간 규모로 모은 The Well 같은 데이터셋을 RGB frame처럼 취급해 video model을 fine-tune하면, 처음부터 학습하는 것보다 빠르게 합리적인 성능을 얻는다.
- OCR의 방향: 텍스트를 반드시 token으로 쪼개지 않고 이미지로 넣어도 기반 사전학습에서 얻는 표현이 활용될 수 있다는 DeepSeek-OCR 같은 흐름도 같은 가능성을 보여준다.
-
과학을 위한 통합 모델
- AlphaFold의 대비: AlphaFold는 제한된 데이터에서 단백질 구조 예측을 해결하기 위해 매우 특화된 architecture를 사용했다.
- 새로운 접근: 서로 다른 과학 데이터 소스를 단일 모델에 모으면 한 양식에서 학습한 지식을 다른 양식으로 옮겨 새로운 과학 문제를 해결할 수 있다.
- 최종 방향: RGB는 시작점일 뿐이며, 우주의 더 많은 관측 양식을 함께 학습하고 transfer를 이용하는 것이 세계 시뮬레이션의 궁극적 형태다. 다만 여러 양식을 한 모델에서 안정적으로 예측하려면 아직 해결할 open-ended research가 많다.
주요 발언 모음
“Effectively, the endgame of something like interface world models is you have a fully neural operating system.”
“You’re not just delivering the language model; you’re also delivering the render and the pixels, and that’s also a learnable component.”
“The most plentiful source of video data is third-person video data.”
“The biggest gap between video models and world models is the idea of counterfactual generation.”
“I would be very surprised if two years from now we don’t primarily use real-time models.”
“My cat videos are the same thing as understanding physics.”
핵심 데이터 & 수치
- 2015년: 갤러리 관람객의 정체성과 대화를 생성하는 인터랙티브 아트 프로젝트를 제작했다.
- 2016~2017년: NVIDIA Pix2PixHD 계열의 semantic map-to-image 모델과 초기 창작 AI 실험이 진행됐다.
- 1,000개 A100: Runway가 대규모 video model 학습을 위해 구축한 클러스터 규모다.
- 256×256: Runway의 대규모 영상 생성 베팅 당시 CogVideo의 대표적인 해상도였다.
- 2023년 1월: depth-conditioned video-to-video 모델 Gen 1을 공개했다.
- 2023년 말: Camera Control을 World Model 연구의 씨앗으로 보고 전담 research group을 확장했다.
- 약 3개월: Sora 공개 뒤 model parallelism과 10배 규모 확장을 거쳐 Gen 3를 추격한 기간이다.
- 24fps: Characters real-time talking avatar 모델의 생성 속도다.
- 약 30분: Characters가 autoregressive 방식으로 생성할 수 있는 영상 길이다.
- 수분: GWM Worlds의 개방형 탐색에서 현재 유지되는 대략적인 autoregressive 생성 길이다.
- 수백 시간: 대규모 video pre-training 뒤 GWM Robotics에 추가하는 특정 로봇 데이터의 규모다.
- 약 3자릿수: third-person video에 비해 egocentric video가 훨씬 적은 정도다.
- 최대 50개: 최신 Runway 모델이 인터페이스·영상 생성에 활용할 수 있다고 언급한 reference 수다.
- 9월 30일: Physical AI와 real-time video generation을 다루는 Runway Summit 일정이다.
결론 및 시사점
- AI 비디오를 단순한 영상 제작 자동화로 보면 Gen 2의 출력 품질과 현재의 논쟁을 놓치게 된다. 핵심은 픽셀 예측이 세계의 동역학을 얼마나 잘 압축하고 재생하느냐에 있다.
- 영상 모델의 다음 경쟁력은 화질만이 아니라 controllability, latency, long-context, counterfactual realism이다. 좋은 장면을 한 번 만드는 것보다 어떤 행동에도 일관된 결과를 내는 능력이 중요하다.
- Interface World Model은 소프트웨어의 기본 단위를 codebase에서 생성되는 경험으로 바꿀 수 있다. LLM이 언어와 계획을 담당하고, video model이 개인화된 화면과 반응을 실시간으로 생성하는 Neural OS가 그 방향이다.
- 로보틱스에서는 대규모 third-person video pre-training과 소량의 first-person·robot data post-training을 결합하는 curriculum이 유력하다. 부족한 teleoperation 데이터를 world model의 합성 rollout으로 보완할 수 있다.
- 최종 World Model은 RGB만 보는 모델이 아니다. 오디오·깊이·열·텍스트·IMU·과학 시뮬레이션을 함께 학습해 한 영역의 구조를 다른 영역으로 전이하는 Omni Model에 가까워진다.
- 기술적으로는 픽셀 직접 예측, JEPA·잠재 표현, 3D 기반 모델, VLA와 World Action Model 사이의 경쟁이 남아 있다. 센서·모터·열·전력 같은 하드웨어 문제도 모델 성능과 별도로 해결해야 한다.
- 창작자의 입장에서는 AI를 완성품을 대신 만드는 마법보다 조종 가능한 붓·카메라·편집 도구로 보는 관점이 중요하다. reference와 storyboard가 늘어날수록 창작자의 의도와 모델의 생성 능력이 더 밀접하게 결합된다.
- 결국 Runway의 장기 베팅은 “AI가 인간을 얼마나 잘 모방하는가”보다 “AI가 세계를 얼마나 정확하고 오래, 실시간으로 시뮬레이션하는가”를 묻는다.
핵심 요약 (20줄)
-
Runway는 생성 모델을 예술가에게 전달하는 도구에서 세계를 시뮬레이션하는 연구 조직으로 확장됐다.
-
Anastasis Germanidis는 인터랙티브 아트와 ML 엔지니어링을 함께 경험하며 생성과 시뮬레이션을 연결했다.
-
2015년 갤러리 프로젝트는 관람객의 정체성과 대화를 템플릿과 Markov chain으로 생성했다.
-
Pix2PixHD는 도로 데이터로 학습했지만 예술가들은 보행자와 교통 표지판을 과장해 초현실적 장면을 만들었다.
-
Runway의 Green Screen은 VFX의 고된 rotoscoping과 segmentation을 자동화해 실제 영화 제작에 사용됐다.
-
2022년 1,000개 A100 클러스터에 대한 베팅은 영상에도 언어 모델과 같은 Scaling law가 있다는 믿음에서 출발했다.
-
Gen 1은 text-to-video보다 쉬운 depth-conditioned video-to-video로 시작해 실제 영상의 스타일과 장면을 바꿨다.
-
Gen 2는 텍스트를 depth로 바꾼 뒤 Gen 1에 연결한 2단계 pipeline에서 탄생했고 이후 planner 구조의 가능성을 보여줬다.
-
영상 생성의 실용성을 결정한 요소는 화질보다 camera control과 motion brush 같은 controllability였다.
-
영상 모델을 크게 만들면 픽셀 생성기가 물리와 인간 행동을 예측하는 World Model로 확장될 수 있다.
-
텍스트는 신발끈 묶기 같은 암묵적 지식을 충분히 표현하지 못하므로 직접 관측한 영상이 새로운 학습 신호가 된다.
-
Runway는 현재까지 Physics IQ 점수가 compute scale과 함께 예측 가능하게 향상된다고 설명한다.
-
Sora의 등장 뒤 Runway는 diffusion transformer와 model parallelism을 도입하고 약 3개월 만에 Gen 3를 공개했다.
-
Characters는 24fps real-time autoregressive video model이며 최대 약 30분의 아바타 영상을 생성한다.
-
Interface World Model은 HTML과 CSS 대신 클릭·드래그·스크롤을 받아 픽셀과 오디오를 직접 생성한다.
-
Neural OS는 언어 모델, 렌더러, 인터페이스를 하나의 학습 루프에 넣어 애플리케이션의 경계를 재정의한다.
-
GWM-1은 video model을 로봇의 합성 데이터 생성기와 closed-loop 시뮬레이터로 바꾸며 real-to-sim correlation을 측정한다.
-
풍부한 third-person video로 사전학습하고 수백 시간의 로봇 데이터로 post-training하는 방식이 데이터 부족을 완화한다.
-
좋은 World Model은 성공 장면뿐 아니라 action별 실패와 counterfactual 결과까지 현실적으로 생성해야 한다.
-
AI 비디오의 최종 목표는 RGB 생성에 머물지 않고 모든 감각 양식을 전이 학습하는 실시간 Omni World Model이다.
