메타데이터
- 원문 제목: How Real-Time AI Video Is Changing How Creators Work
- 채널: a16z
- 영상 URL: https://www.youtube.com/watch?v=SDbRJXQrYGY
- 영상 ID: SDbRJXQrYGY
- 발행일/처리일: 2026-09-19
- 주요 인물: Jennifer Li(a16z General Partner), Gorkem Yurtseven(fal 공동창업자), Batuhan Taskaya(fal Head of Engineering)
- 핵심 제품: fal H3 Max, H3 Max Turbo, H3 Max Director, MiniMax H3
- 주제 분류: AI·LLM·생성형 미디어
📌 핵심 질문 / 실시간 생성형 비디오는 창작 매체를 어떻게 바꾸는가?
==비디오 생성이 5초짜리 클립을 기다리는 작업에서 장면을 보면서 즉시 지시하고 수정하는 실시간 매체로 넘어가면, 속도 자체보다 장면의 기억·정밀한 제어·전문 제작 파이프라인과의 결합이 창작자의 핵심 요구가 된다.==
- fal은 MiniMax의 오픈웨이트 H3를 포스트 트레이닝하고 시스템·커널·하드웨어를 함께 최적화해 5초 영상을 약 1.5초에 생성하는 H3 Max Turbo를 공개했다.
- H3 Max Director는 최근 2분의 압축된 원시 비디오를 기억하고, 2분부터 60분까지는 진화하는 시스템 프롬프트로 장면의 구조와 세계관을 유지하면서 실시간 지시를 반영한다.
- Blender 장면 참조, 캐릭터·음성 참조, 립싱크·모션·조명·카메라 제어를 결합하면 전문가가 원하는 결과를 반복적으로 얻는 제작 도구에 가까워진다.
생성형 미디어는 한 사람이 매달 수천 달러, 많게는 1만 달러 수준의 토큰을 업무에 소비할 수 있는 ‘토큰 시장 적합성(token market fit)’을 보인다. 따라서 전체 산업의 병목은 더 이상 단순한 생성 가능 여부가 아니라, 컴퓨트 제약을 풀면서도 창작자의 의도를 거의 빠짐없이 보존하는 데 있다. H3 Max의 사례는 오픈 모델, 포스트 트레이닝, 추론 시스템, 인터랙티브 제품 실험이 한꺼번에 맞물릴 때 비디오 생성이 영상 편집 도구를 넘어 라이브 공연·소셜 경험·할리우드 제작 인프라로 확장될 수 있음을 보여준다.
1. H3 Max가 등장한 배경과 ‘토큰 시장 적합성’
H3 Max의 출발점은 최신 세대 비디오 모델을 마음대로 수정할 수 있는 오픈웨이트 기반과, 생성형 미디어 사용량을 감당해야 하는 컴퓨트 경제성의 결합이다.
1.1. MiniMax H3를 선택한 이유
-
최신 세대 오픈 모델의 희소성
- 진정한 오픈웨이트 기반: MiniMax H3는 최신 세대에 속하면서도 충분히 강력하고, 참조 이미지를 받을 수 있는 첫 번째 진정한 오픈소스급 비디오 모델로 소개된다.
- 수정 권한의 확보: fal은 그동안 여러 모델 연구소의 추론을 운영했지만 모델 위에 자체 기능을 추가할 권한까지 가진 경우는 드물었다. H3의 공개 가중치가 포스트 트레이닝과 특화 시스템 작업을 가능하게 했다.
- 익숙한 구조와 확장성: H3는 다른 비디오 모델과 구조적으로 친숙해 기존 비디오 추론 전문성을 적용하기 쉬웠고, 참조 기반 생성으로 확장하기에도 적합했다.
-
제품 전략의 전환
- 추론 서비스에서 모델 공동 설계로: fal은 단순히 모델을 실행하는 플랫폼에서 벗어나, 모델의 학습 단계와 추론 시스템을 함께 설계하는 방향으로 이동했다.
- 오픈 모델 생태계의 이점: 기본 모델에 립싱크 버전, 카메라 각도 LoRA, 스타일 LoRA 같은 파생 모델을 붙이면 하나의 모델이 다양한 창작 도구 생태계로 확장된다.
1.2. 생성형 미디어의 수요 구조
-
토큰 시장 적합성의 정의
- 고사용량 개인: 생성형 미디어와 코딩 에이전트는 한 사람이 업무 중 많은 토큰을 생산적으로 소비하는 시장이다.
- 월 1만 달러 규모의 소비: 매일 컴퓨터 앞에서 생성 작업을 수행하는 전문 사용자는 월 수천 달러를 지출할 수 있고, fal은 생산적인 개인 한 명이 월 1만 달러 수준의 토큰을 쓸 가능성을 수요의 기준으로 제시한다.
-
컴퓨트 제약과 효율성 압력
- 수요만큼 늘지 않는 컴퓨트: 4월 무렵부터 업계와 fal 모두 컴퓨트 제약을 겪었고, 서버를 추가해도 사용량이 그만큼 증가하는 상황이 이어졌다.
- 효율성의 목적: H3 Max의 효율 개선은 단일 모델을 싸게 만드는 데 그치지 않고, 같은 자원으로 다른 모델과 더 많은 토큰을 처리하게 하는 데 목적이 있다.
2. H3 Max의 속도·품질을 만든 포스트 트레이닝과 시스템 최적화
H3 Max의 성능은 특정한 한 가지 비법이 아니라 확산 단계, 하드웨어 활용률, 모델 파이프라인의 각 구성 요소를 동시에 개선한 복합 효과다.
2.1. 확산 단계와 품질의 교환 관계
-
50단계에서 20단계로의 축소
- 기본적인 속도 레버: 확산 모델을 약 50단계에서 약 20단계로 줄이면 생성 시간은 크게 감소하지만, 단순히 단계를 줄이는 것만으로는 품질이 떨어진다.
- 품질을 먼저 회복: fal은 포스트 트레이닝과 강화학습(RL) 파이프라인으로 적은 단계에서도 높은 품질을 내도록 체크포인트를 만든 뒤, 그 위에 최적화 스택을 적용했다.
- 결과의 목표: 최종 모델은 원래 모델과 같거나 더 높은 품질을 유지하면서 한 자릿수 이상의 속도 향상을 내는 것을 목표로 했다.
-
포스트 트레이닝과 추론 시스템의 결합
- 모델·시스템 공동 설계: 포스트 트레이닝은 모델을 적은 확산 단계에 맞게 바꾸고, 커널과 시스템 엔지니어링은 그 모델이 칩에서 빠르게 실행되도록 바꾼다.
- 기존 실험의 축적: fal은 이미지 모델과 비디오 모델에서 여러 차례 포스트 트레이닝 인프라를 실험했으며, Ideogram과 FLUX 기반 버전에서 얻은 경험을 H3에 적용했다.
- 35배 속도 향상: Jennifer Li는 원래 MiniMax H3와 비교해 약 35배 빠른 결과를 언급했고, 이는 한 가지 최적화가 아니라 여러 개선이 합쳐진 결과로 설명된다.
2.2. 하드웨어 활용률과 다단계 파이프라인
-
GPU 활용률을 끌어올린 작업
- MFU 30~40%에서 70~80%로: 일반적인 추론 작업의 하드웨어 활용률이 이론상 MFU 기준 약 30~40%인 데 비해, 커널과 시스템 최적화로 70~80%까지 끌어올리는 것을 목표로 했다.
- 지붕선(roofline)의 돌파: 같은 아키텍처를 최적화하는 시스템 작업은 보통 2~3배 속도를 높이지만, 포스트 트레이닝과 코드·시스템 공동 설계는 기존 하드웨어 지붕선을 넘어 한 자릿수 이상의 개선을 가능하게 했다.
- 세대 교체의 효과: Hopper에서 Blackwell 계열로 옮기면 그 자체로 약 2~3배 개선이 가능하지만, 하드웨어 가격도 비슷한 수준이어서 주로 벽시계 시간 단축에 기여한다.
-
영상 생성 파이프라인 전체 최적화
- 프롬프트 확장: 사용자의 입력은 대형 언어 모델(LLM)이 비디오 모델이 학습한 형식으로 확장한다.
- 잠재 공간 생성: 확산 모델은 잠재 공간(latent space)에서 비디오를 생성한다.
- VAE 디코딩: 잠재 표현은 VAE를 통해 픽셀로 디코딩되며, 작업에 따라 업스케일링 단계가 추가된다.
- 구성 요소별 최적화: 프롬프트 확장 LLM, 확산 모델, 잠재 공간에서 픽셀로 변환하는 VAE, 업스케일러는 기본 상태에서 모두 최적화되지 않았기 때문에 각각 다른 최적화가 필요하다.
- 단일 샷 작업의 특성: 에이전트 디코딩과 달리 한 번의 프롬프트를 처리하는 작업은 캐시율과 세션이 낮고 배치 크기도 작다. 따라서 프롬프트 확장, 확산, VAE에 서로 다른 최적화 전략을 적용해야 한다.
-
노드 구성의 한계
- 8 GPU 단일 노드: 현재 대부분의 비디오 모델은 한 노드의 8개 GPU에서 병렬 실행된다.
- 8개 이상 확장의 비효율: GPU를 8개 이상으로 늘리면 통신 오버헤드가 커져 효율이 감소하기 때문에, MiniMax H3와 H3 Max 모두 단일 노드 구성이 일반적이다.
2.3. H3 Max Turbo의 실용적 절충
-
속도와 품질의 선택지
- 2배 빠른 터보 버전: 출시 일주일 뒤 팀은 품질의 97번째 백분위 수준을 유지하면서 H3 Max를 2배 빠르게 실행할 수 있음을 확인했다.
- 작지만 인지 가능한 품질 손실: H3 Max Turbo는 원본과 거의 비슷하지만 작은 품질 저하는 눈에 보일 수 있다.
- 5초 영상을 1.5초에 생성: 공개된 Turbo 버전은 5초 비디오를 약 1.5초에 만들고 비용도 약 2배 낮춘다.
-
다음 병목은 속도가 아니다
- 이미 충분히 낮은 비용과 지연: 최첨단 모델과 비교하면 비용은 한 자릿수 이상 저렴하고 속도는 한 자릿수 이상 빠르다.
- 품질·제어 우선순위: 이 정도 속도와 비용에서는 더 빠른 생성보다 품질과 제어 가능성을 높이는 일이 더 중요하다는 판단이 제시된다.
- 참조 중심 사용 방식: 텍스트-비디오에서 이미지-비디오로, 다시 참조 기반 생성으로 발전하면서 사용자가 원하는 캐릭터·장면을 유지하는 제어력이 핵심 기능이 됐다.
3. 생성 속도가 열어젖힌 연속형 실시간 비디오
H3 Max가 만든 가장 큰 변화는 짧은 클립을 빠르게 만드는 것이 아니라, 장면이 계속 진행되고 사용자가 실행 중에 개입하는 비디오 경험이다.
3.1. 출시 직후의 자발적 실험
-
fal 내부의 동시 폭발
- 전사적 집중: 모델이 공개된 뒤 fal 전체가 새 모델에 집중했고, 프론트엔드·월드 모델 액셀러레이터·ML·추론 팀이 각자 애플리케이션과 최적화를 동시에 시작했다.
- WebRTC 라이브 경험: 새로 생긴 월드 모델 액셀러레이터 팀은 저지연 WebRTC 기반 라이브 경험을 만들었다.
- 분산 팀의 24시간 개발: 샌프란시스코를 중심으로 전 세계에 흩어진 팀이 16~17시간씩 작업하고 다음 지역의 팀원이 이어받는 방식으로 3~4일 동안 제품을 완성했다.
-
세 가지 독립적인 바이럴 실험
- Rohan의 Twitch 스트림: 엔지니어 Rohan은 노트북에서 H3 Max를 반복 호출하고 프롬프트를 조정해 이야기의 연속성을 유지하는 라이브 스트림을 Twitch에 올렸다.
- LevelZio의 무한 스트리밍 사이트: 인플루언서 LevelZio는 자체 웹사이트에서 무한 스트리밍을 호스팅하겠다고 제안했다.
- fal의 연속형 모델: 내부 ML 팀은 마지막 프레임만 이어 붙이는 방식보다 과거 장면을 기억하는 연속형 모델을 별도로 개발했다.
- 계획되지 않은 제품화: 세 프로젝트는 사전에 계획된 마케팅 캠페인이 아니라 독립적으로 시작됐고, 며칠 안에 각각 제품과 경험으로 발전했다.
3.2. H3 Max Director의 장면 기억 구조
-
기존 클립 연결의 한계
- 마지막 프레임만 전달: Rohan과 LevelZio의 초기 방식은 클립이 끝날 때 마지막 프레임을 다음 생성의 입력으로 넣는 방식이었다.
- 세계의 기억 부재: 다음 클립은 이전 클립의 마지막 이미지 외에는 거의 기억하지 못해 등장인물·공간·사건의 연속성이 약해졌다.
-
2분의 세밀한 기억
- 10초 단위 확장: 모델은 5초 단위 대신 약 10초 이상의 비디오를 생성하고 이전 5초를 계속 참조하는 방식으로 연속성을 늘렸다.
- 최대 2분의 원시 비디오 기억: 자체 생성한 최근 2분의 비디오를 매우 압축된 형태로 보존해 최근 장면의 세부사항을 유지한다.
- 계산량의 급증: 2분 분량 전체에 주의를 기울이는 작업은 계산량이 급격히 증가하므로, 이를 가능하게 하는 별도의 최적화가 필요했다.
- 장면 연속성: 누군가 방에 들어오면 기존 인물들이 그 사람을 바라보고, 카메라가 원래 인물에게 돌아왔을 때 같은 상태가 유지되는 식으로 장면을 이어 간다.
-
2분에서 60분까지의 구조 기억
- 진화하는 시스템 프롬프트: 2분을 넘어서는 세부 프레임 대신, 2분부터 최대 60분까지 세계의 구조와 전반적인 일관성을 담은 시스템 프롬프트가 계속 업데이트된다.
- 최근 4~8개 장면: 한 장면을 15~30초로 보면 모델은 최근 4~8개 장면을 직접 기억하고 더 오래된 사건은 요약된 구조로 유지한다.
- 사실상 무한 스트리밍: 세부 기억과 구조 기억을 결합하면 모델이 한 시간까지 연속 영상을 만들고, 그 이상도 프롬프트 추적을 통해 이어 갈 수 있다.
- H3 Max Director 공개: H3 Max Director는 행동 지시를 받으면서 최대 60분의 연속 비디오를 생성하는 공개 모델로 소개된다.
3.3. 관객이 장면을 공동 연출하는 방식
-
즉시 반영되는 지시
- 상황 예시: 사무실에서 누군가 일하는 장면을 시작한 뒤 30초 후 “여성이 문으로 들어온다”고 지시하면 새 인물이 즉시 장면에 들어온다.
- 공간과 상태 유지: 사무실의 동일성이 보존되고, 카메라가 원래 인물에게 돌아와도 그 인물이 이전 상태를 유지한다.
-
소셜 인터랙션의 포맷
- 투표 기반 행동 선택: 시청자는 다음 행동을 투표로 고를 수 있고, 채팅이 무엇이 일어날지를 공동 결정한다.
- 제한된 선택과 재미: 무제한 지시 대신 “달이 들어올지 바나나가 사무실에 들어올지” 같은 선택지를 제공해 안정성과 재미를 함께 확보했다.
- 채널별 콘셉트: 완전한 혼돈을 추구하는 채널, 1980년대 만화풍 채널처럼 각 스트림이 고유한 콘셉트를 갖는다.
- 스타일과 개념의 장기 기억: H3 Max Director는 다양한 스타일과 개념을 기억해 단순한 화면 전환이 아니라 하나의 세계처럼 작동한다.
-
음성 지시와 ‘AI 감독’
- 창작자의 익숙한 입력 방식: 크리에이티브 테크놀로지스트는 이미 WhisperFlow나 ChatGPT 음성 모드로 음성 프롬프트를 사용하는 데 익숙하다.
- 촬영 현장 같은 상호작용: 실시간 비디오에 음성을 계속 입력하면 카메라를 움직이고 인물의 이동을 지시하는 실제 영화 현장의 감독처럼 사용할 수 있다.
- 재생 중 편집: 비디오가 재생되는 동안 말로 지시하면 화면에 나타나는 내용이 그 즉시 달라지는 경험이 가능하다.
4. 플랫폼·비용·개인화된 생성 경험
실시간 비디오가 서비스 수준으로 구현되려면 모델 속도뿐 아니라 파이프라인별 하드웨어, 클라우드와 로컬의 역할 분담, 모델 생태계가 함께 설계되어야 한다.
4.1. 서비스 규모와 하드웨어 설계
-
H3 Max의 채택 속도
- 플랫폼 내 1위 모델: 공개 약 3주 만에 H3 Max는 fal 플랫폼에서 사용량 기준 가장 인기 있는 비디오 모델이 됐고, 다음 모델보다 거의 2배 이상의 사용량을 기록했다고 설명된다.
- 기본 선택지로의 이동: 빠르고 저렴하기 때문에 다른 플랫폼에서도 사용자가 처음 접하는 기본 모델로 자리 잡고 있다.
- 라이브 스트림의 확장: H3 Max Director 기반 라이브 스트림은 수십 가지 버전이 만들어졌고 일부는 계속 성장하고 있다.
-
이기종 하드웨어 파이프라인
- 구성 요소별 하드웨어 요구: 프롬프트 확장, 확산, 디코딩, 업스케일링은 서로 다른 하드웨어 구성에서 효율이 다르다.
- 단계별 하드웨어 분리: 비용을 더 낮추려면 파이프라인의 각 부분을 가장 적합한 하드웨어에 배치해야 한다.
- 소비자 하드웨어 가능성: 서버에서 얻은 최적화가 가정용 컴퓨터로 100% 그대로 옮겨지지는 않지만 상당 부분 이전할 수 있고, 추가 작업으로 그 비율을 높일 수 있다.
-
클라우드와 로컬의 결합
- 부분적인 로컬 스트리밍: Rohan처럼 일부 경험을 자신의 컴퓨터에서 스트리밍하는 방식이 가능하다.
- 클라우드 제어 평면: 무거운 생성은 로컬에서 일부 처리하더라도 Director와 제어 평면은 클라우드에 두는 하이브리드 구조가 현실적이다.
- 다음 단계: 서로 다른 하드웨어에서 파이프라인을 더 효율적으로 조합하는 작업이 향후 몇 주의 주요 과제로 제시된다.
4.2. IP 보유자와 AI 쇼의 결합
-
기존 AI IP의 실시간화
- 소셜 플랫폼의 AI 쇼: fal은 Instagram과 TikTok에서 AI 쇼를 운영하는 IP 보유자와 협력해 그들의 스타일을 LoRA로 학습하고 실시간 버전을 만들려 한다.
- 새로운 라이브 포맷: 기존 캐릭터와 스타일을 관객의 실시간 지시와 결합하면 고정된 에피소드가 아니라 계속 변하는 쇼가 된다.
-
소셜 AI의 소비자 순간
- 충분한 품질과 낮은 비용: 생성형 비디오가 충분히 빠르고 저렴해지면서 진정으로 새로운 소셜 AI 경험을 만들 조건이 갖춰졌다.
- 관객이 화면을 조작: 시청자는 단순히 완성된 영상을 소비하는 대신 음성·채팅·투표로 화면의 사건을 바꾼다.
5. 할리우드급 창작 제어로의 확장
전문 제작자의 기준은 “그럴듯한 영상 한 편”이 아니라 카메라·조명·인물·음성·움직임을 계획한 대로 반복 재현하는 신뢰성이다.
5.1. Blender 참조 워크플로
-
비AI 장면을 제어 기준으로 사용
- 저해상도 장면 렌더링: 창작자는 먼저 기존 Blender 기술로 원하는 장면을 저해상도로 렌더링한다.
- 참조 영상 입력: 그 렌더링을 비디오 모델의 참조로 넣으면 모델이 장면의 공간·카메라·움직임을 따라가도록 만들 수 있다.
- 거의 100%에 가까운 제어력: 직접 장면을 설계한 뒤 생성 모델에 넘기기 때문에, 프롬프트만 사용하는 방식보다 전문 제작자가 요구하는 제어력에 가까워진다.
-
LLM이 만드는 Blender 장면
- GPT Astra의 역할: GPT Astra 같은 LLM으로 Blender 장면을 생성한 뒤 H3 Max에 넘기는 파이프라인이 등장했다.
- 반복 실험의 가속: H3 Max가 빠르기 때문에 장면 변형을 여러 개 병렬로 시도할 수 있고, Blender와 비디오 생성 사이의 반복 주기가 짧아진다.
- BFX 아티스트의 실무 적합성: 전문 BFX 아티스트는 정확한 입력을 원하는 만큼, Blender 참조 방식이 영화·광고·시각효과 파이프라인에 특히 잘 맞는다.
5.2. 99.9% 신뢰성을 향한 제어 기능
-
립싱크와 모션 제어
- 오디오 기반 립싱크: 오디오와 비디오 또는 이미지 참조를 제공하면 캐릭터의 입 모양을 음성에 맞춰 동기화하는 모델이 개발되고 있다.
- 동작 전이: 춤추는 사람의 움직임을 가져와 AI 생성 캐릭터에 적용하는 모션 제어가 가능하다.
- 현재와 목표의 차이: 기본 프롬프트만으로도 80~90%의 신뢰성을 얻을 수 있지만, 실제 제작에 쓰려면 99.9%의 신뢰성이 필요하다.
-
구조화된 카메라 제어
- 시간별 카메라 경로: JSON으로 t0에서 카메라 좌표를 0,0,0으로 두고 t1에서 90도 회전하도록 지정하는 식의 구조화된 설명을 입력한다.
- 카메라를 단일 진실 공급원으로 사용: 모델은 자유롭게 카메라 위치를 상상하지 않고 지정된 경로를 우선 조건으로 사용한다.
- 단일 입력에서 3D 장면 재구성: 강력한 비디오 이해와 카메라 조건화를 결합하면 하나의 입력으로 3D 장면에 가까운 구조를 복원할 수 있다.
-
조명·캐릭터·음성 참조의 누적
- 참조 이미지와 시작 프레임: 특정 캐릭터와 공간을 지속시키는 기준을 제공한다.
- 캐릭터별 목소리: 등장인물마다 사용할 음성을 지정해 얼굴·대사·캐릭터 정체성을 함께 유지한다.
- 시간별 카메라와 조명: 장면 안에서 특정 시점에 카메라가 어느 각도를 보고, 빛이 어느 방향에서 들어오는지 지정한다.
- 제어 기능의 합성: 카메라·조명·캐릭터·음성 기능은 따로 존재하는 것이 아니라 하나의 포스트 트레이닝 인프라 위에서 누적된다.
5.3. 모델보다 중요한 포스트 트레이닝 인프라
-
기본 모델의 이해만으로는 부족한 이유
- 텍스트-비디오의 한계: 텍스트 프롬프트로 비디오를 만들 수 있지만 완벽한 캐릭터를 지정하거나 특정 초에 새 인물을 등장시키는 일은 불안정하다.
- 이미지-비디오의 개선과 한계: 첫 장면을 이미지로 제공하면 결과가 더 잘 맞지만, 시간축의 특정 시점에 캐릭터나 행동을 정확히 넣기는 어렵다.
- 참조-비디오의 확장: 시작 프레임, 캐릭터, 음성, 카메라, 조명을 단계적으로 제공하면서 제작자의 의도를 시간축 전체로 확장한다.
-
재사용 가능한 툴킷
- 모델별 일회성 학습의 탈피: fal은 한 번의 H3 Max 학습보다 어떤 새 비디오 모델에도 기능을 붙일 수 있는 포스트 트레이닝 인프라 자체를 만드는 데 시간을 쓴다.
- 오픈·폐쇄 모델 모두 적용: 가중치를 확보할 수 있는 오픈 모델뿐 아니라 프런티어 폐쇄 모델에도 서비스를 제공할 수 있는 구조를 목표로 한다.
- 창작자별 표현 방식: 소비자는 프롬프트로 원하는 결과를 설명하지만 전문가는 렌즈·카메라 각도·조명·동선으로 설명한다. 재사용 가능한 툴킷은 이 서로 다른 표현을 모델 제어로 변환한다.
5.4. 할리우드의 실제 수요와 데이터 거버넌스
-
‘영화 한 편 생성’보다 작은 포인트 솔루션
- 가장 빠르게 성장하는 시장: 할리우드는 1년 전에는 거의 존재하지 않았지만 현재 fal에서 가장 빠르게 성장하는 세그먼트가 됐다.
- 기존 영상의 연장: 스튜디오는 처음부터 전체 영화를 생성하기보다 촬영분을 조금 더 늘리는 기능을 원한다.
- 카메라와 조명 수정: 특정 장면의 카메라 각도나 조명을 바꾸고, 자신의 IP를 기존 워크플로에 맞게 보존하는 기능이 실무 수요다.
- 연구와 제작 현장의 간극: 연구소가 전체 영화를 한 번에 만드는 모델을 연구하는 동안, 스튜디오는 좁고 정확한 기능을 요구한다. 포스트 트레이닝 프로젝트가 이 간극을 메운다.
-
IP와 데이터 주권
- 자체 IP 적용: 스튜디오가 자기 IP를 제공하면 그 IP를 모델에 적용해 전용 기능을 사용할 수 있는 시스템이 마련되고 있다.
- 미국 내 호스팅: 할리우드 스튜디오가 요구하던 미국 내 호스팅이 제공되면서 데이터 레지던시(data residency)가 주요 장애물에서 제외됐다.
- 사용량 확대 전망: 필요한 기능과 운영 조건이 갖춰지면 스튜디오의 AI 사용량이 수개월 안에 10배에서 100배까지 늘어날 수 있다는 전망이 제시된다.
6. 창작자와 제품 설계자가 얻는 시사점
-
실시간성은 기능이 아니라 매체의 문법이다
- 클립에서 상태 있는 세계로: 장면이 멈추고 새 클립이 시작되는 구조에서, 과거를 기억하며 계속 진행되는 상태 있는 세계로 비디오의 단위가 바뀐다.
- 관객의 역할 변화: 시청자는 완성물을 보는 사람에서 음성·투표·채팅으로 다음 사건을 결정하는 공동 연출자가 된다.
-
속도·품질·제어의 순서가 바뀐다
- 초기 병목은 속도: 5초 영상을 5초 안에 만들지 못하면 실시간 경험을 구현할 수 없었다.
- 현재 병목은 제어: 1.5초 생성이 가능해진 뒤에는 카메라, 인물, 조명, 음성, 움직임을 원하는 대로 재현하는 신뢰성이 제품 경쟁력이 된다.
- 전문가의 성공 기준: 멋진 데모 한 번이 아니라 반복 제작에서 99.9%에 가까운 예측 가능성이 중요하다.
-
범용 모델보다 워크플로별 기능이 먼저 확산된다
- 좁은 기능의 높은 가치: 영상 연장, 카메라 경로, 조명 변경, 립싱크, 모션 전이처럼 한 가지 문제를 정확하게 해결하는 기능이 실제 제작에 빠르게 들어간다.
- 참조 기반 파이프라인: Blender나 기존 촬영물을 참조로 활용하면 생성 AI가 기존 제작 도구를 대체하기보다 확장하는 방식으로 도입된다.
- 창작자별 인터페이스: 소비자에게는 음성·자연어가 적합하고, 전문 감독에게는 JSON 카메라 경로·조명 파라미터·캐릭터 참조 같은 구조화된 제어가 적합하다.
-
오픈 모델은 속도뿐 아니라 생태계를 만든다
- 파생 모델의 연쇄: 기본 H3 Max에서 립싱크·카메라·스타일·모션 전용 LoRA가 파생되며 새로운 창작 도구가 축적된다.
- 제품 실험의 민주화: 빠르고 저렴한 추론은 작은 팀과 개인이 라이브 비디오 경험을 직접 만들고 공개하게 한다.
- 플랫폼의 역할: 모델 제공자는 단일 API만 제공하는 것이 아니라 포스트 트레이닝, 하드웨어 최적화, 참조 입력, 배포·호스팅을 묶은 제작 인프라가 되어야 한다.
주요 발언 모음
“이제 이 모델들은 충분히 빠르고 저렴해졌기 때문에, 다음 개선은 속도보다 품질과 제어 가능성에 집중해야 한다.”
“5초 영상을 약 1.5초에 생성할 수 있고, 비용도 약 2배 낮춘 H3 Max Turbo를 공개했다.”
“최근 2분의 비디오는 세부적으로 기억하고, 2분에서 60분 사이는 진화하는 시스템 프롬프트로 세계의 구조를 기억한다.”
“Blender로 장면을 저해상도 렌더링해 참조로 넣으면 전문 작업에서 거의 100%에 가까운 제어력을 얻을 수 있다.”
“할리우드가 원하는 것은 처음부터 모든 것을 생성하는 모델보다 영상을 조금 연장하고, 카메라와 조명을 바꾸는 작은 포인트 솔루션이다.”
핵심 데이터 & 수치
- 5초 / 1.5초: H3 Max Turbo는 약 5초짜리 영상을 약 1.5초에 생성한다.
- 약 2배: H3 Max Turbo는 원본과 거의 같은 품질의 97번째 백분위 수준에서 약 2배 빠르고 비용도 약 2배 낮다.
- 약 35배: 원래 MiniMax H3 대비 전체 속도 향상은 약 35배로 언급된다.
- 50단계 → 20단계: 포스트 트레이닝으로 확산 단계 수를 줄이면서 품질을 보존한다.
- 30~40% → 70~80%: 시스템·커널 최적화로 이론상 MFU 하드웨어 활용률을 높인다.
- 2~3배: Hopper에서 Blackwell 세대로 바꾸면 하드웨어 세대만으로도 약 2~3배 개선이 가능하다.
- 8 GPU: 통신 오버헤드 때문에 대부분의 비디오 모델은 단일 노드 8 GPU에서 실행된다.
- 2분: H3 Max Director가 압축된 원시 비디오를 세밀하게 기억하는 시간이다.
- 4~8개 장면: 15~30초 장면 기준으로 최근 2분에 해당하는 세부 장면 수다.
- 60분: 구조화된 시스템 프롬프트를 활용해 연속적으로 유지할 수 있는 공개 Director 경험의 상한으로 제시된다.
- 80~90% → 99.9%: 기본 프롬프트 수준의 현재 신뢰성과 전문 제작을 위한 목표 신뢰성이다.
- 거의 2배: fal 플랫폼에서 H3 Max가 공개 약 3주 만에 다음 모델보다 기록한 사용량 우위다.
- 10배~100배: 미국 호스팅과 IP 적용 같은 조건이 갖춰지면 할리우드 스튜디오의 AI 사용량이 늘어날 수 있다는 전망이다.
결론 및 시사점
- 실시간 비디오는 생성 속도 이상의 변화다: 장면이 멈추지 않고 과거 상태를 기억하며 관객이나 감독의 지시를 즉시 반영하면 비디오는 일회성 결과물이 아니라 상호작용 가능한 세계가 된다.
- 품질과 제어가 다음 경쟁장이다: H3 Max Turbo가 속도와 비용의 장벽을 낮춘 뒤, 카메라·조명·캐릭터·음성·모션을 계획대로 재현하는 능력이 창작 도구의 가치를 결정한다.
- 기존 도구와 결합할수록 전문성이 높아진다: Blender 장면, 촬영 영상, 캐릭터 음성, 구조화된 카메라 JSON을 참조로 사용하는 방식은 생성 AI를 기존 제작 파이프라인 안에 넣는다.
- 좁은 문제를 해결하는 제품이 먼저 확산된다: 할리우드는 전체 영화를 한 번에 만드는 모델보다 영상 연장, 카메라 이동, 조명 수정, 립싱크 같은 포인트 솔루션을 먼저 채택한다.
- 오픈웨이트 모델은 생태계를 촉진한다: 누구나 기본 모델 위에 LoRA와 특화 기능을 만들 수 있으면 모델 한 개가 스타일·카메라·립싱크·모션 도구의 플랫폼으로 변한다.
- 창작자 인터페이스는 이중화된다: 대중에게는 음성·채팅·투표가, 전문가에게는 장면 참조·구조화된 파라미터·IP 전용 모델이 핵심 입력 방식이 된다.
핵심 요약 (20줄)
- fal의 H3 Max는 MiniMax의 차세대 오픈웨이트 비디오 모델 H3를 포스트 트레이닝한 시스템이다.
- 생성형 미디어와 코딩 에이전트는 한 사람이 월 1만 달러 수준의 토큰을 생산적으로 소비할 수 있는 ‘토큰 시장 적합성’을 보인다.
- fal은 4월 무렵부터 이어진 업계의 컴퓨트 제약을 완화하기 위해 모델과 추론 시스템을 함께 최적화했다.
- 포스트 트레이닝은 확산 단계를 약 50단계에서 약 20단계로 줄이면서 원래 품질을 유지하도록 모델을 조정했다.
- 커널과 시스템 엔지니어링은 일반적인 하드웨어 활용률 30~40%를 이론상 MFU 기준 70~80%까지 끌어올렸다.
- 프롬프트 확장 LLM, 확산 모델, VAE 디코더, 업스케일러를 각각 최적화한 효과가 누적되어 전체 속도가 약 35배 향상됐다.
- H3 Max Turbo는 품질 97번째 백분위 수준에서 5초 영상을 약 1.5초에 만들고 비용도 약 2배 낮춘다.
- H3 Max가 충분히 빠르고 저렴해진 뒤에는 추가 속도보다 품질과 제어 가능성이 더 중요한 개선 과제가 됐다.
- Rohan은 노트북에서 H3 Max 생성을 이어 붙인 연속 스트림을 Twitch에 올려 실시간 사용 가능성을 보여줬다.
- LevelZio는 무한 스트리밍 웹사이트를 만들었고 fal 내부 팀은 장면 기억을 갖춘 연속형 모델을 별도로 개발했다.
- H3 Max Director는 최근 2분의 압축된 원시 비디오를 기억해 인물과 공간의 세부 연속성을 유지한다.
- 2분을 넘어선 구간은 진화하는 시스템 프롬프트로 요약해 최대 60분 동안 세계의 구조와 일관성을 보존한다.
- 시청자는 채팅 투표나 음성 지시로 다음 행동을 선택하며 실시간 비디오의 공동 연출자가 될 수 있다.
- 음성 명령은 카메라 이동과 등장인물의 행동을 지시하는 영화 현장의 감독 인터페이스처럼 작동한다.
- H3 Max는 공개 약 3주 만에 fal 플랫폼에서 다음 모델보다 거의 2배 많은 사용량을 기록했다.
- Blender 저해상도 렌더링을 참조로 넣으면 전문 제작자가 원하는 장면과 카메라를 거의 100%에 가깝게 제어할 수 있다.
- GPT Astra 같은 LLM으로 Blender 장면을 만든 뒤 H3 Max에 넘기는 파이프라인은 영화 제작의 반복 실험을 가속한다.
- 립싱크와 모션 제어의 현재 신뢰성은 80~90%지만 fal은 전문 제작을 위해 99.9%를 목표로 한다.
- 구조화된 JSON 카메라 경로와 시간별 조명·캐릭터·음성 참조는 프롬프트만으로 불가능했던 정밀 제어를 제공한다.
- 할리우드는 전체 영화를 한 번에 생성하기보다 영상 연장·카메라·조명·IP 보존 같은 작은 포인트 솔루션을 먼저 원한다.
자막 원문은 YouTube 자동 캡션과 공개 검색 가능한 캡션을 대조해 정리했으며, 고유명사와 수치는 문맥에 맞게 보정했다.
