URL: https://www.youtube.com/watch?v=ZZcE0HeO-Hc 날짜: 2026-09-24 채널: aiDotEngineer 원문 제목: From VLM/VLA's to Embodied Agents — Armen Aghajanyan, Perceptron AI 발표자: Armen Aghajanyan (Perceptron 공동창업자·CEO, 전 FAIR 연구자)
📌 핵심 질문 / 이 발표가 다루는 핵심 논점
==시각언어모델(VLM), 시각언어행동모델(VLA), 월드 모델(World Model)을 별개의 모델 계보로 나누기보다 지각(Perception)·이해(Reasoning)·행동(Control)을 하나의 체화형 기반 모델(Embodied Foundation Model) 안에서 통합해야 한다.==
- 물리적 AI는 기기·계측기·로봇·카메라·센서가 현실 세계를 실시간으로 지각하고 이해하고 상호작용하도록 만들어야 한다.
- 장시간 비디오에는 입력 토큰 대부분을 직접 감독할 정답이 없으므로, 모델이 미래 행동에 중요한 지각(percept)을 스스로 찾아 예측하게 해야 한다.
- 서로 다른 모달리티를 같은 토큰으로 취급하지 않고, 데이터 희소성(sparsity)과 컨텍스트 팽창(context bloat)을 아키텍처 차원에서 해결해야 한다.
- 통합 모델은 일반 비디오 사전학습 데이터와 값비싼 원격조작(teleoperation) 데이터를 교환할 수 있는 새로운 스케일링 법칙을 만든다.
Perceptron의 북극성은 물리적 세계와 디지털 세계를 잇는 AI 기반을 만들고, 어디에 장치·계측기·로봇·카메라·센서가 있든 실시간 지능을 제공하는 것이다. Armen Aghajanyan은 이 목표를 위해 전통적인 멀티모달 모델의 조각들을 하나의 모델로 합치고, 로봇 제어까지 연결하는 연구 방향을 설명한다.
1. VLM/VLA 구분을 넘어선 체화형 기반 모델
Perceptron은 텍스트·이미지·비디오·궤적을 따로 다루는 모델 계보를 하나의 지각-추론-제어 시스템으로 재구성한다.
1.1. Perceptron의 목표와 연구 배경
-
물리적 AI 기반의 북극성
- 실시간 지각·이해·상호작용: 물리적 AI 기반은 현실 세계를 실시간으로 보고, 상황을 이해하고, 실제 세계에 행동을 가해야 한다.
- 물리 세계와 디지털 세계의 연결: 디바이스, 계측기, 로봇, 카메라, 센서가 존재하는 모든 곳에 지능을 제공하는 것이 장기 목표다.
- 지각-추론-행동의 통합: 여러 감각 모달리티를 입력으로 받아 지각과 체화형 추론을 수행하고, 텍스트·공간 정보·행동·제어 등 다양한 출력을 하나의 모델에서 처리한다.
-
Armen Aghajanyan의 멀티모달 연구 경로
- FAIR에서의 6년: FAIR에서 멀티모달 모델을 확장하는 학습 레시피(scaling recipe)를 찾는 일을 수행했다.
- 초기 융합(Early Fusion): 가능한 한 이른 단계에서 여러 모달리티를 함께 넣고, 입력과 출력 모두에서 각 모달리티를 전체적으로 표현하는 방법을 연구했다.
1.2. 기존 모델 계보와 통합 프레임
-
시각언어모델(VLM)
- 기본 입출력: 이미지·비디오·텍스트를 입력받아 주로 텍스트를 출력한다.
- 확장 가능성: 멀티모달 모델이라는 말이 일반적으로 VLM을 가리키게 되었지만, 출력 공간을 확장하면 공간 이해와 실제 행동으로 넘어갈 수 있다.
-
체화형 추론 모델(ER)과 VLA
- ER 모델: 텍스트 대신 또는 텍스트와 함께 그라운딩 포인트(grounding point)를 출력해 공간 이해와 추론을 강화한다.
- VLA(Vison-Language-Action): VLM의 출력 도메인을 행동(action)까지 넓힌다. 전통적으로 VLM 백본 위에 구축된다.
-
월드 모델과 시맨틱 월드 모델
- 월드 모델(World Model): 이미지·비디오·행동을 입력받아 미래 비디오를 출력한다.
- 월드 액션 모델(World Action Model): VLM에서 벗어나 월드와 행동을 직접 연결하려는 시도지만, 아직 결정적으로 유효한 결과는 많지 않다.
- 시맨틱 월드 모델(Semantic World Model): 명시적인 출력을 내기보다 미래에 유용하다고 판단되는 내부 표현(representation)을 학습한다.
-
체화형 기반 모델의 정의
- 한 모델 안의 전체 스펙트럼: 표준 지각, 체화형 추론, 궁극적인 제어(control)를 하나의 통합 모델에서 수행한다.
- 모달리티 간 추론: 서로 다른 감각을 가로질러 추론하고, 지각·공간 추론·행동·제어에 필요한 출력을 모두 같은 모델에서 만든다.
2. 연구 난제 1: 희소한 감독 신호와 자연스러운 지각 목표
장시간 비디오를 학습하려면 입력 토큰 수와 실제로 감독할 수 있는 정보량 사이의 불균형을 해결해야 한다.
2.1. 비디오 토큰 대부분에는 정답이 없다
-
감독 밀도의 근본적 불일치
- 한 시간의 비디오: 표현 방식에 따라 약 100만 개의 시각 토큰(visual token)이 들어올 수 있다.
- 실제 정답 부족: 모든 토큰에 사용할 수 있는 ground truth가 없다. 트랜스크립트를 뽑아 예측하게 하거나 일부 프레임에 질문을 만들고 합성 라벨을 붙이는 방식이 흔히 사용된다.
- 약 2%만 손실 계산: 100만 토큰을 넣고 그중 약 2%에 대해서만 손실(loss)을 계산하면, 입력의 대부분은 학습 신호를 받지 못한다.
-
기존 보완책의 문제
- 희소한 신호: 소수의 프레임·트랜스크립트만 라벨링하면 신호가 너무 드물다.
- 합성 신호: 인위적으로 라벨을 늘리면 실제 세계와 다른 학습 신호를 주게 된다.
- 무차별 신호: 모든 픽셀을 예측하게 하면 밀도는 높아지지만 무엇이 중요한지 구분하지 못한다.
2.2. 픽셀 예측에서 자연스러운 지각 목표로
-
픽셀 단위 학습의 주의 배분 실패
- 동일한 가중치의 오류: 배경 픽셀과 그리퍼 끝(gripper tip), 접촉 지점(contact point), 실패 순간, 물리(physics)에 관한 픽셀을 같은 중요도로 취급한다.
- 밀도와 유용성의 차이: 신호가 촘촘하다는 사실만으로 로봇의 미래 행동에 유용한 감독이 되지는 않는다.
-
자연스러운 지각 목표(Natural Perceptive Objective)
- 미래에 중요한 percept 예측: 모델이 앞으로 중요해질 지각을 자동으로 예측하도록 만드는 것이 Perceptron의 핵심 IP다.
- 예시와 한계: 로봇 팔에서는 그리퍼 끝을 미래에 예측하는 것이 유용하다고 사람이 미리 지정할 수 있다. AI2의 Momo 팀과 일부 VLA가 이런 방식을 사용하지만, 이는 여전히 사람이 정한 하드코딩 percept다.
- 자동 의미 학습: 모델이 어떤 고유한 지각 목표가 유용한지 의미적으로 스스로 학습하도록 만드는 방법을 확보했지만, 구체적인 구현은 공개하지 않았다.
3. 연구 난제 2: 모달리티별 컨텍스트 팽창
항상 켜진 카메라와 멈추지 않는 로봇은 긴 시간의 비디오를 계속 입력하므로, 텍스트와 비디오의 밀도 차이를 아키텍처가 직접 다뤄야 한다.
3.1. 모달리티마다 토큰의 의미가 다르다
-
항상 켜진 입력의 부담
- 긴 추론 구간: 로봇이 중단되지 않고 카메라가 계속 작동하면 매우 긴 토큰 시퀀스를 처리해야 한다.
- 텍스트와 비디오의 차이: 텍스트는 상대적으로 정보가 조밀하고 비디오는 상대적으로 희소하다.
-
모달리티를 분리해 생각하기
- 동일 취급 금지: 텍스트 토큰, 이미지 토큰, 오디오 토큰, 비디오 토큰은 서로 완전히 다른 것으로 다뤄야 한다.
- 공간·토큰 압축: 초기 실험처럼 비디오나 이미지의 패치별 표현을 평균내면 최대 약 10배의 압축을 얻을 수 있지만, 이는 임시방편에 가깝다.
3.2. Data-Sparse Mixture of Experts
-
라우터 기반 선택적 계산
- 토큰 선택: Perceptron이 공개한 Data-Sparse Mixture of Experts는 모델 내부 라우터(router)가 어떤 토큰을 입력하고 어떤 토큰을 건너뛸지 예측하게 한다.
- 전 계층에서의 효율: 특정 층에만 적용하는 별도 처리라기보다 여러 계층을 통과하는 동안 선택적 계산을 수행해 비용을 크게 늘리지 않는다.
-
모델이 학습하는 관심 배분
- 고밀도·작업 관련 정보: 강한 아키텍처 선험(prior)을 하드코딩하지 않아도 모델은 고밀도 정보와 현재 작업에 중요한 정보에 계산을 집중한다.
- 그래프 예시: 그림의 오른쪽 위 영역에서는 모델이 그래프에 토큰을 집중한다. 사람도 그 부분이 흥미로운 정보일 가능성이 높다고 보고 확대할 만한 장면이다.
- 질문별 변화: 매우 일반적인 질문에는 이미지 전체로 계산이 퍼진다. 반대로 과일을 모두 분할하라는 요청에는 과일로 판단한 토큰에 더 많은 계산을 배정한다.
-
선험과 학습의 균형
- 유용하지만 과도하지 않은 구조: 모달리티의 희소성 불균형을 해결할 아키텍처 선험은 넣되, 모델이 스스로 학습할 가능성을 막을 만큼 강하게 만들면 안 된다.
- 핵심 효과: 모델이 무엇을 봐야 하는지를 직접 배우므로, 단순 평균 압축보다 작업 적응적이고 자연스러운 계산 배분이 가능하다.
4. Perceptron의 첫 체화형 기반 모델과 창발 능력
Perceptron은 위의 지각 목표와 선택적 계산을 결합한 첫 체화형 기반 모델을 공개했고, 대규모 이종 데이터에서 전통적 컴퓨터 비전 작업을 에이전트 작업으로 재해석했다.
4.1. Mark1 모델과 데이터 구성
-
성능·비용 포지셔닝
- 최전선 성능: 발표 시점에 Mark1 계열 모델은 Gemini 3.1 Pro와 비교해 최전선(frontier)에 있으며, Gemini의 체화형 추론 모델보다 나은 결과를 보였다고 제시됐다.
- 비용 효율: Gemini 체화형 추론 대비 약 15배 저렴하다고 설명됐다.
- 단일 통합 모델: 텍스트, 이미지, 비디오, 궤적을 한 모델에서 함께 처리한다.
-
약 1PB 데이터셋
- 데이터 출처: 인터넷 크롤링, Perceptron의 맞춤형 학습 레시피, 합성 데이터 파이프라인을 결합했다.
- 데이터 형태: 텍스트·이미지·비디오·trajectory를 모두 포함한다.
- 궤적의 폭: 로봇 조작만이 아니라 데스크톱 사용 trajectory와 비디오게임 플레이 trajectory처럼 일반적인 행동 궤적도 포함한다.
4.2. 고전적 컴퓨터 비전을 에이전트 작업으로 재정의
-
검출을 고정된 박스 예측으로 보지 않기
- 도구 사용: 모델은 코드를 작성하고, 이미지의 특정 부분을 확대하고, 타일로 나누고, 대비(contrast)를 바꿀 수 있다.
- 순차적 지각: 한 번에 박스 하나를 출력하지 않고 무엇을 더 봐야 하는지 스스로 결정한다.
-
숨은 새 찾기 사례
- 어려운 지각 문제: 이미지 속 매우 작은 대상을 찾는 문제로, 사람이 만든 온라인 커뮤니티에서도 어려운 퍼즐로 다뤄질 정도다.
- 에이전트 과정: 모델은 이미지를 타일링하고, 특정 영역에 박스를 제안하고, 대비를 높인 뒤, 최종적으로 숨은 새를 찾아낸다.
- 핵심 의미: 결과는 고전적인 “이 박스를 검출하라”가 아니라, 여러 모달리티를 본질적으로 이해하는 체화형 모델이 능동적으로 관찰 전략을 세운 결과다.
5. 로보틱스에서의 체화형 추론과 제어
로봇 시스템은 하나의 거대한 VLA에 모든 시간을 맡기는 방식부터 상위 오케스트레이터와 하위 촉각·제어 정책을 결합하는 방식까지 넓은 스펙트럼을 가진다.
5.1. 오케스트레이터와 촉각 정책의 분리
-
두 종류의 모델
- 체화형 추론 모델·오케스트레이터: 긴 작업을 의미 있는 하위 작업으로 나누고 순서를 계획한다.
- 촉각 제어 정책(Tactile Control Policy): 오케스트레이터가 정한 하위 작업 위에서 실제 로봇의 세밀한 제어를 실행한다.
-
커피 만들기 비유
- 전체 작업: 커피를 만드는 데 약 3분이 걸린다면, 하나의 VLA가 3분짜리 작업 전체를 직접 풀게 할 수 있다.
- 분해 방식: 오케스트레이터가 컵 가져오기, 재료 다루기 등 하위 작업으로 분해하고, 촉각 정책이 각 조작을 실행하게 할 수 있다.
- 미해결 문제: 완전한 VLA부터 에이전트형 분해 시스템까지 선택지는 넓지만, 체화형 추론 자체는 아직 해결되지 않은 복잡한 연구 문제다.
5.2. 로봇 데이터 주석과 비용 효율
-
복잡한 로봇 데이터 주석
- 능동적 탐색: 모델은 비디오의 서로 다른 구간을 뛰어다니며 확인하고, 필요한 부분을 잘라내고, 캡션이 정확한지 점검한다.
- 자기 검증(Self-verification): 생성한 주석을 다시 확인해 오류를 줄인다.
-
속도와 비용
- 빠른 AR 모델: 발표자는 이런 작업이 AR 모델의 빠른 추론 속도 덕분에 가능하다고 설명했다.
- 비용 비교: Gemini로 같은 비디오를 처리하면 몇 달러가 들 수 있지만 Perceptron 모델은 센트 단위 수준이라고 설명했다. 정확한 단가는 제시되지 않았다.
- 능력의 원천: 지금까지 다른 모델에서 충분히 관찰되지 않았던 최전선 체화형 추론 능력이 복잡한 주석 작업을 가능하게 한다.
6. 체화형 기반 모델의 새로운 스케일링 법칙
지각·추론·trajectory·제어를 함께 학습하면, 값비싼 로봇 데이터만 늘리는 것과 다른 데이터 교환 레버가 나타난다.
6.1. 통합 학습이 만드는 새로운 레버
-
공동 학습 목표
- 제어 기반 학습(Control-based training): 실제 행동 제어를 학습한다.
- 궤적 학습(Trajectory training): 데스크톱·게임·로봇 등 행동의 시간적 흐름을 학습한다.
- 지각 학습과 체화형 추론 학습: 무엇을 보고 어떻게 추론할지까지 함께 학습한다.
-
혼합 비율의 중요성
- 올바른 조합: 네 학습 형태를 어떤 비율로 섞고 어떤 objective를 선택하는지가 핵심이다.
- 새로운 관측 가능성: 올바른 조합을 찾으면 순수 정책 학습만으로는 보이지 않던 데이터·성능 교환 관계가 드러난다.
6.2. 비디오 사전학습과 teleop 데이터의 교환
-
원격조작 데이터의 가격
- 높은 수집 비용: teleoperation 데이터는 시간당 약 100달러 수준으로 비싸다.
- 비디오의 상대적 풍부함: 같은 100달러로 훨씬 많은 일반 비디오 사전학습 데이터를 수집할 수 있다.
-
순수 정책 모델과 통합 모델의 차이
- 순수 VLA·정책: teleop 데이터를 계속 늘리면 성능이 좋아지는 스케일링 효과는 있지만 이득 폭이 제한적이다.
- 통합 체화형 기반 모델: 비디오 사전학습과 teleop를 함께 사용하면 더 강한 효과가 나타난다.
-
10배 교환 법칙
- 핵심 관계: 비디오 사전학습 데이터를 10배 늘리면 teleop 데이터를 10배 적게 사용해도 되는 관계가 관찰됐다.
- 관찰 범위: 이 관계는 발표 시점까지 Perceptron이 사용한 컴퓨트 규모에서 유지됐으며, 더 큰 규모로 얼마나 확장되는지 계속 검증 중이다.
7. 통합 모델의 로봇 시연
하나의 모델이 체화형 추론으로 작업을 파악하고 제어 토큰(control token)을 직접 출력하는 방식이 여러 시연에 사용됐다.
7.1. 단일 모델의 행동 출력
-
추론과 제어의 결합
- 내부 처리: 모델은 task가 무엇인지 추론한 뒤 행동에 필요한 제어 토큰을 출력한다.
- 현재 한계: 시연 정책은 다소 떨리는(jittery) 움직임이 있었지만, 규모를 키우면 개선될 문제로 설명됐다.
-
제로샷 실행
- 기본 성능: 별도 맞춤 학습 없이도 비교적 괜찮게 zero-shot으로 작동한다.
- 공개 계획: 더 작은 모델 중 하나를 몇 주 안에 오픈소스로 공개할 계획이었으며, 발표자는 시점을 7월 중으로 언급했다.
7.2. 책 분류·배치 작업
-
다단계 지각
- 제목 읽기: 로봇은 책 표지의 제목을 읽어야 한다.
- 의미 이해: 제목을 바탕으로 어떤 종류의 책인지에 관한 지식을 적용해야 한다.
- 배치 결정: 이해한 책의 종류에 맞는 상자(bin)에 책을 넣어야 한다.
-
순수 end-to-end 제어와의 차이
- 여러 perceptive task: 제목 읽기, 지식 적용, 위치 선택이 순차적으로 필요하다.
- 통합 모델의 이점: 필요한 지각 작업을 인식하지 못하는 순수 end-to-end 제어 모델보다 지각과 제어 사이의 다단계 문제를 더 자연스럽게 처리한다.
8. 질의응답: 시간 이해·강건성·지식 추출
8.1. 시간적 이해와 컨텍스트 관리
-
아직 완전히 해결되지 않은 시간 이해
- 과장하지 않기: 모델이 시간적 이해를 완전히 해결한 것은 아니며, 안정적으로 배포하려면 여전히 많은 연구가 필요하다.
- 컨텍스트 한계: 발표 모델의 컨텍스트는 약 100만 토큰이지만, 높은 FPS의 비디오를 넣으면 그 정도도 빠르게 소진된다.
-
컨텍스트 압축 전략
- 키 프레임과 델타 프레임: 중요한 key frame과 그 사이의 변화(delta frame)를 구별해 컨텍스트를 관리하는 방법을 고려할 수 있다.
- 로보틱스에 유용한 정보의 선제적 학습: 사전학습 단계에서 로봇 작업에 유용하다고 판단되는 신호를 자연스럽게 입력 분포에 포함해야 한다.
-
공간 관계와 데이터 분포
- 좌우·상하(cardinality) 이해: 왼쪽과 오른쪽, 위와 아래를 구분하는 것은 기본처럼 보이지만 어렵다.
- 인터넷 크롤링의 공백: 인터넷 자료에는 “A가 B의 왼쪽에 있다”처럼 공간 관계가 명시적으로 라벨링된 경우가 드물다.
- 초기 분포 설계: 학습 초기에 이런 데이터 분포를 의도적으로 넣으면 공간 추론 능력을 비교적 빠르게 만들 수 있다.
- Gemini ER 대비: 체화형 추론을 구체적인 연구 목표로 삼았기 때문에 상대적으로 적은 컴퓨트로 Gemini ER을 넘어섰다고 설명했다.
8.2. 배경 변화에 대한 강건성
-
기존 VLA의 취약성
- 배경 변경 실패: 중국산 VLA를 특정 정책에 파인튜닝한 뒤 테이블 배경만 바꿔도 정책이 실패할 수 있다.
- 조명 변화: 물체에 빛이 조금 다른 방향으로 들어오는 경우도 전통적인 정책에는 문제가 될 수 있다.
-
지각과 제어의 공동 모델링
- 배경 강건성: 지각과 제어를 함께 모델링하면 배경과 조명 변화에 훨씬 강해진다.
- 과장하지 않는 한계: 팔에 손전등을 직접 비추는 극단적인 변화까지 견딜 것이라고 주장할 수는 없다.
-
온라인 증강(Online Augmentation)
- 카메라 고장 시뮬레이션: 학습 중 팔에 달린 카메라 하나가 꺼진 상황을 인위적으로 만든다.
- 빛 변화 시뮬레이션: 특정 방향에서 햇빛이 들어오는 상황을 합성한다.
- 가장 큰 이득: 증강도 도움이 되지만, 가장 큰 개선은 초기 융합(early fusion)을 로보틱스 영역으로 옮겨 지각과 제어를 함께 학습한 데서 나온다.
8.3. 지식 베이스와 구조화 추출
-
K1 모델 활용 질문
- 기본 활용: K1 모델은 이미지와 비디오 캡션 작성에 유용하다.
- 로봇 파트너 사례: Perceptron은 복잡한 로봇 egocentric 데이터의 주석 작업을 파트너들과 수행한다.
-
온톨로지보다 깊은 구조화 추출
- 온톨로지 구축과 구별: 단순히 지식 온톨로지를 만드는 것이 핵심은 아니다.
- 구조화된 정보 추출: 이미지·비디오에서 깊이 있는 구조화 추출을 수행하는 능력이 강점이다.
-
접근성
- 공개 API: 발표에서 보여준 기능은 공개 API로 제공돼 직접 실험할 수 있다.
- 공개 벤치마크: 성능을 확인할 수 있는 벤치마크도 공개돼 있다.
주요 발언 모음
“VLM, VLA, 월드 모델이라는 구분에서 벗어나 우리가 체화형 기반 모델이라고 부르는 것으로 가고 싶다.”
“어디에 디바이스, 계측기, 로봇, 카메라, 센서가 있든 우리는 본질적으로 그곳에 지능을 제공한다.”
“배경 픽셀을 그리퍼 끝이나 접촉 지점, 구체적인 실패나 물리와 같은 중요도로 다루고 싶지는 않다.”
“비디오 사전학습 데이터가 10배 많다면 teleop 데이터는 10배 적게 사용할 수 있다.”
“시간적 이해가 해결됐다고 말할 수는 없다. 안정적으로 배포할 수 있는 수준까지 가려면 아직 할 일이 많다.”
핵심 데이터 & 수치
- 약 100만 시각 토큰: 표현에 따라 한 시간 비디오가 만들어내는 입력 규모다.
- 약 2%: 기존 방식에서 손실 계산에 실제로 활용되는 입력 토큰의 예시 비율이다.
- 최대 약 10배: 패치 표현 평균화로 얻을 수 있는 초기 토큰 압축률이다.
- 약 15배 저렴: Perceptron 모델이 Gemini 체화형 추론 대비 제시한 비용 우위다.
- 약 1PB: 텍스트·이미지·비디오·trajectory를 포함한 학습 데이터 규모다.
- 약 100달러/시간: teleoperation 데이터 수집 비용의 예시다.
- 10배 대 10배: 비디오 사전학습 데이터를 10배 늘리면 teleop 데이터를 10배 줄일 수 있다는 관찰이다.
- 약 100만 토큰 컨텍스트: 발표 모델이 보유한 컨텍스트 규모지만 고FPS 비디오에는 빠르게 소진된다.
- 약 3분: 커피 만들기 작업을 전체 VLA가 직접 처리할지 오케스트레이터가 분해할지 설명하는 예시 작업 시간이다.
핵심 요약 (20줄)
- Perceptron은 VLM·VLA·월드 모델의 구분을 넘어 지각·추론·제어를 한 모델에 통합하는 체화형 기반 모델을 지향한다.
- Armen Aghajanyan은 FAIR에서 6년간 멀티모달 모델의 확장 레시피와 초기 융합을 연구했다.
- VLM은 이미지·비디오·텍스트를 받아 텍스트를 출력하고 VLA는 출력 공간을 행동으로 확장한다.
- 월드 모델은 입력으로부터 비디오를 생성하고 시맨틱 월드 모델은 미래에 유용한 내부 표현을 학습한다.
- 한 시간 비디오는 약 100만 시각 토큰을 만들지만 직접 감독 가능한 정보는 극히 일부에 불과하다.
- 트랜스크립트 예측과 합성 라벨은 신호가 희소하거나 합성적이거나 무차별적이라는 한계를 가진다.
- 모든 픽셀을 예측하는 방식은 배경과 그리퍼 끝·접촉 지점을 같은 중요도로 취급해 주의 배분에 실패한다.
- Perceptron은 미래 행동에 중요한 percept를 모델이 자동으로 찾아 예측하는 자연스러운 지각 목표를 연구한다.
- 항상 켜진 카메라와 로봇은 컨텍스트를 팽창시키므로 텍스트·이미지·오디오·비디오 토큰을 다르게 다뤄야 한다.
- Data-Sparse Mixture of Experts의 라우터는 작업에 중요한 토큰만 선택해 계층 전반의 계산을 줄인다.
- 모델은 그래프나 과일처럼 질문과 관련된 영역에 계산을 집중하는 작업 적응적 관심 배분을 학습한다.
- Mark1은 약 1PB의 텍스트·이미지·비디오·궤적 데이터로 학습했고 Gemini 체화형 추론보다 약 15배 저렴하다고 제시됐다.
- 데스크톱 사용과 비디오게임 플레이 궤적도 포함되면서 전통적 컴퓨터 비전 작업을 에이전트 작업으로 재정의할 수 있다.
- 숨은 새 찾기에서 모델은 타일링·확대·대비 조절·박스 제안을 순차적으로 수행한다.
- 로봇 시스템은 장기 계획을 세우는 오케스트레이터와 세밀한 촉각 제어 정책을 분리할 수 있다.
- 통합 체화형 모델은 제어·궤적·지각·추론 학습을 섞어 새로운 데이터 스케일링 레버를 만든다.
- 비디오 사전학습 데이터를 10배 늘리면 teleop 데이터를 10배 줄일 수 있다는 교환 관계가 관찰됐다.
- 책 분류 시연은 제목 읽기·책 종류 이해·상자 선택을 하나의 지각-제어 작업으로 연결한다.
- 시간 이해는 아직 완전히 해결되지 않았고 키 프레임·델타 프레임과 로봇 관련 데이터 분포가 컨텍스트 관리에 중요하다.
- 공동 지각·제어 모델링과 카메라·조명 온라인 증강은 배경 변화에 대한 강건성을 높이며 공개 API와 벤치마크로 실험할 수 있다.
결론 및 시사점
- 모델 설계: 멀티모달 모델을 단순한 입력-텍스트 변환기로 묶지 말고, 지각·추론·행동·제어가 같은 표현 공간에서 상호작용하도록 설계해야 한다.
- 감독 설계: 모든 픽셀에 동일한 손실을 부여하기보다 실제 작업과 미래 행동에 중요한 percept를 모델이 발견하도록 학습 목표를 설계해야 한다.
- 계산 설계: 모달리티별 토큰 밀도 차이를 인정하고, 선택적 라우팅과 작업 적응적 계산으로 항상 켜진 센서 입력을 감당해야 한다.
- 데이터 전략: 고가의 로봇 teleop 데이터만 확장하기보다 일반 비디오·행동 궤적·로봇 데이터를 통합해 데이터 간 교환 레버를 확보해야 한다.
- 로봇 시스템 구조: 장기 작업 계획과 저수준 촉각 제어를 하나의 정책으로 무리하게 처리할지, 오케스트레이터와 정책을 분리할지 작업 시간과 안정성에 따라 결정해야 한다.
- 현실 배포: 배경·조명·카메라 결손에 대한 증강은 필요하지만, 성능을 과장하지 않고 시간적 이해와 고FPS 컨텍스트 관리의 잔여 문제를 별도로 검증해야 한다.
- 생태계 접근: 제한된 파트너에게 Mark1 가중치를 제공하고 공개 API·벤치마크·소형 모델 공개를 추진하는 접근은 연구 결과를 실제 로봇 개발 흐름으로 연결한다.
