- 원문 제목: Robot-Use Agents: Why General-Purpose Models May Win in Robotics
- URL: https://www.youtube.com/watch?v=Jv5B5CEaPJI
- 영상 ID: Jv5B5CEaPJI
- 날짜: 2026-09-27
- 원본 게시일: 2026-09-26
- 채널: Y Combinator
- 참여자: Y Combinator 진행자들, Waddle Labs의 Jaime·Vincent, RoboCurve 공동창업자 Jay
- 핵심 모델·개념: Astra, RT-2, VLA(Vision-Language-Action), LLM, Code as Policies, Voyager, In-Context Learning(ICL), Bitter Lesson, Platonic Representation Hypothesis
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==로봇 제어를 위해 별도의 소형 로보틱스 모델을 계속 학습시키기보다, 코드·컴퓨터 사용·시각·언어를 폭넓게 학습한 범용 LLM을 로봇 사용 에이전트(robot-use agent)로 확장하는 편이 결국 더 강력할 수 있다.==
- RT-2 같은 초기 VLA는 웹 텍스트·이미지 사전학습의 폭넓은 표현을 로봇 행동으로 옮겨 성능을 높였다.
- 최신 LLM은 코드를 작성하고, 도구를 탐색하고, 실패에 대응하며, 여러 단계 정책을 스스로 구성할 수 있다.
- 컴퓨터 사용(computer use), CAD, egocentric video, 코딩 데이터는 로봇 데이터가 아니어도 공간·행동·물리 세계에 대한 유용한 표현을 제공한다.
- 다만 매 순간 거대 모델을 호출하는 방식은 느리고 비싸므로, 컨텍스트에서 얻은 경험을 스킬·프로그램·소형 정책으로 압축하는 하네스가 필요하다.
로봇의 범용성은 로봇 전용 데이터의 양만으로 결정되지 않는다. 모델이 이미 이해하는 풍부한 세계 표현과 코드 실행 능력을 로봇의 센서·도구 인터페이스에 연결하면, 적은 로봇 데이터로도 보지 못한 작업과 환경에 일반화할 가능성이 열린다. Waddle Labs는 LLM이 로봇을 제어하도록 만드는 하네스와 데이터·모델 학습을, RoboCurve는 물리적 AI의 모델·로봇·환경을 평가하는 체계를 구축하고 있다.
1. 로봇 사용 에이전트가 등장한 배경
코딩 에이전트의 급속한 발전은 언어 모델이 로봇 행동을 구성하는 단계로 넘어가는 기반이 됐다.
1.1. Waddle Labs와 RoboCurve의 역할
-
Waddle Labs의 접근법
- LLM 기반 로봇 제어: Jaime와 Vincent가 이끄는 Waddle Labs는 LLM이 로봇을 제어하도록 만드는 일을 한다.
- 하네스 구축: 모델이 로봇과 효과적으로 상호작용하도록 센서 입력과 도구 호출을 연결하는 하네스를 만든다.
- 데이터 루프: 하네스에서 수집한 데이터를 사용해 더 나은 LLM을 학습시킨다.
-
RoboCurve의 평가 범위
- 모델 평가: LLM뿐 아니라 VLA, World Action Model 등 고전적·최신 접근법을 모두 측정한다.
- 로봇 평가: 어떤 로봇이든 평가 대상으로 삼는다.
- 환경 평가: 손(hand), 그리퍼(gripper), 로봇 팔, 휴머노이드, 사족보행 로봇 등 다양한 하드웨어를 다룬다.
1.2. 바이럴 데모가 보여준 가능성
-
단순 조작의 범위 확장
- 뚜껑 돌려 열기: LLM이 병이나 용기의 캡을 돌려 여는 작업을 수행한다.
- 펜 뚜껑 열기: 펜의 캡을 벗기는 것처럼 미세한 조작이 필요한 작업도 수행한다.
- 블록 옮기기: 테이블 위 블록을 집어 그릇에 넣는 작업을 시연한다.
-
다중 로봇 상호작용
- 로봇 간 통신: 여러 로봇이 정보를 주고받으며 하나의 작업을 수행하는 시나리오를 보여준다.
- 로봇 사용 에이전트 논의: 이러한 시연은 MIT 교수 Philip Isola가 확산시킨 ‘robot-use agents’ 논지와 연결됐다.
2. RT-2에서 범용 LLM 제어로
초기 VLA는 사전학습의 이점을 로봇 행동으로 옮겼지만, 행동을 직접 출력하는 구조에는 유연성의 한계가 있었다.
2.1. RT-2가 확립한 VLA의 기본 구조
-
언어·이미지 사전학습의 전이
- 웹 데이터 활용: RT-2는 웹 텍스트와 이미지로 사전학습된 언어 모델을 사용했다.
- 로봇 행동 출력: 모델이 영어 문장 대신 엔드 이펙터 포즈(end-effector pose)를 출력한다.
- 좌표에서 관절 명령으로: 엔드 이펙터의 좌표를 로봇 관절 명령으로 변환해 물리적 움직임을 만든다.
-
RT-2의 핵심 장점
- 웹 규모의 표현: 특정 로봇 데이터만으로 학습한 기반 모델보다 웹 이미지·텍스트가 제공하는 폭넓은 개념 표현을 활용한다.
- 출력 형식만 행동으로 변경: 모델의 핵심 지식은 유지하면서 출력 인터페이스를 로봇 행동에 맞춘다.
- 현재 방식과의 연속성: 지금의 LLM이 별도 미세조정 없이 도구를 호출하는 모습과 닮았지만, RT-2는 당시 행동 토큰을 직접 출력하도록 미세조정했다.
2.2. 직접 행동 출력의 병목
-
추론 예산이 고정된다
- 한 번의 행동 출력: VLA는 포즈나 행동을 출력해야 하므로 복잡한 작업에 더 많은 계산을 배정하기 어렵다.
- 연쇄적 사고의 제약: GSM8K 수학 문제에서 과거 모델이 정답과 해시 표시만 내고 중간 사고를 표현하지 못했던 것처럼, VLA도 행동 전에 충분히 계획하기 어렵다.
- 코드 기반 사고와의 대비: 최신 에이전트는 코드를 오래 작성·수정·실행한 뒤 행동을 내릴 수 있다.
-
‘Bitter Lesson’의 재해석
- 확장 가능한 계산과 데이터: 모델의 자율성과 자원을 늘리면 사람이 특정 행동을 미세조정해 넣지 않아도 더 많은 일을 수행할 수 있다.
- 데이터의 모달리티: 핵심은 아키텍처 이름보다 어떤 데이터가 모델의 표현과 행동 능력을 키우는지에 있다.
- 범용 모델 선호: 컴퓨터 사용·코딩 데이터를 로봇 모델에 계속 더하면 결국 일반 목적 LLM 에이전트와 가까워지므로, 처음부터 강한 범용 LLM을 로봇 제어에 쓰는 선택이 가능해진다.
3. Code as Policies와 코딩 에이전트의 전이
로봇의 행동을 고정된 액션 토큰이 아니라 실행 가능한 프로그램으로 표현하면, 모델은 적은 예시만으로도 복합 작업을 구성할 수 있다.
3.1. Voyager가 보여준 도구 생성 구조
-
코딩 에이전트의 정의
- 도구 사용: 에이전트는 Python 내장 기능, 조건문, 반복문 같은 기본 도구를 조합한다.
- 새 도구 생성: 기본 기능으로
francois.py같은 새로운 함수를 만들고 이후 호출한다. - 경험 압축: 문제를 해결한 절차와 사고를 재사용 가능한 도구에 압축한다.
-
Voyager의 사례
- Minecraft 탐색: Voyager는 Minecraft에서 도구를 즉석 생성하고 호출하는 코딩 에이전트의 대표적 사례가 됐다.
- 누적 능력: 매번 처음부터 추론하지 않고 이전에 만든 스킬을 재사용해 게임 수행 능력을 높였다.
- 로봇으로의 전이: 같은 원리가 로봇의 이동·파지·검사·복구 스킬을 프로그램으로 저장하는 방식으로 이어진다.
3.2. 초기 Code as Policies 연구
-
함수 목록을 통한 행동 합성
- 기본 로봇 함수: Google DeepMind 연구진은 물체 집기, 들어 올리기, 특정 포즈로 이동하기 같은 함수를 Python 함수 형태로 제공했다.
- 정책 코드 작성: 코딩 에이전트는 주어진 함수를 조합해 로봇이 블록을 집어 그릇으로 옮기는 복합 정책을 작성했다.
- 프로그램의 행동화: 작성된 코드는 함수 호출 순서와 조건을 포함해 로봇의 실제 동작으로 실행됐다.
-
로봇 데이터가 적어도 작동한 이유
- 코딩 사전학습: 모델은 이미 대규모 코드 데이터에서 무엇을 먼저 하고 무엇을 다음에 할지에 대한 절차적 감각을 학습했다.
- 일회성 일반화: 별도의 로봇 시연 데이터를 많이 추가하지 않아도 복합 과제를 한 번에 구성할 수 있었다.
- 후속 연구의 자극: 일회성(in-context) 탐색과 코드 작성 능력이 LLM을 로보틱스에 적용하는 후속 연구를 촉진했다.
3.3. 트랜스덕션에서 프로그램 유도로
-
트랜스덕션(transduction)의 한계
- 입력-출력 함수 학습: 전통적 방식은 많은 입력
x와 출력y쌍을 보고x→y함수를 가중치에 학습한다. - 샘플 비효율: 데이터가 적으면 충분한 입력-출력 쌍을 모으거나 강한 귀납적 편향(inductive bias)을 넣어야 한다.
- 로봇의 어려움: 현실 세계의 상태·행동 조합은 방대해 모든 대응 쌍을 모으기 어렵다.
- 입력-출력 함수 학습: 전통적 방식은 많은 입력
-
프로그램 유도(program induction)의 장점
- 함수 자체 생성: 몇 개의 예시와 문제 설명을 보고 입력을 출력으로 매핑하는 프로그램
f를 생성한다. - 화이트보드 코딩 비유: 코딩 면접에서 예시와 문제를 받은 뒤 함수를 작성하는 과정이 프로그램 유도다.
- Astra의 역할: 기존 프로그램 합성은 좋은 귀납적 편향을 찾기 어려웠지만, Astra 같은 강한 모델은 코드로 매핑을 만들 수 있는 표현과 추론 능력을 제공한다.
- 신경기호(neurosymbolic) 구조: 뉴런 기반 모델이 코드라는 기호(symbol)를 생성하고, 그 기호가 물리 행동을 결정한다.
- 함수 자체 생성: 몇 개의 예시와 문제 설명을 보고 입력을 출력으로 매핑하는 프로그램
4. 인컨텍스트 학습과 로봇 하네스
LLM의 즉석 학습은 저데이터 환경에서 강력하지만, 반복·대규모 배포를 위해서는 경험을 압축하고 실행 속도를 높여야 한다.
4.1. ICL의 효율과 한계
-
샘플당 지능(intelligence per sample)
- 상태-행동-결과-보상 입력: 학습 사례를 컨텍스트에 붙여 정책이 다음 행동을 개선하는 정도를 측정할 수 있다.
- 값싼 적응: ICL은 SGD나 별도의 학습 플롭 없이 예시를 추가해 빠르게 검증 집합 성능을 높인다.
- 자기개선 학습 필요: 모델이 멀티턴 상호작용과 자기반성을 학습하지 않았다면, 사례를 컨텍스트에 넣어도 진정한 개선이 일어나지 않는다.
-
ICL의 포화와 불안정성
- 비단조 개선: 예시를 추가할수록 항상 좋아지지 않고 성능이 좋아졌다가 나빠지는 현상이 나타난다.
- 빠른 포화: 약 20~40개 예시를 넣으면 성능이 사실상 포화되고, 더 많은 예시는 추가 개선을 만들지 못한다.
- 컨텍스트 길이의 벽: 모델이 10만 토큰으로 학습됐더라도 실제로는 약 5만 토큰을 안정적인 유효 컨텍스트로 봐야 하며, 이를 넘으면 전체를 주의 깊게 참조하지 못해 성능이 다시 떨어진다.
- 검색·메모리의 보완: 필요한 유사 사례를 RAG나 활성 메모리에서 그때그때 불러오면 시험 때 교과서를 참고하는 것처럼 확장성이 좋아진다.
-
학습 압축의 계층
- ICL: 경험을 컨텍스트에 임시로 저장한다.
- 도구·스킬: 반복되는 경험을 호출 가능한 프로그램으로 압축한다.
- LoRA와 미세조정: 더 많은 경험을 저랭크 업데이트나 전체 SFT·RL로 가중치에 반영한다.
- 데이터 규모에 따른 선택: Tesla처럼 무한에 가까운 자율주행 데이터를 가진 조직은 ICL만 쓰지 않으며, 저데이터 환경에서는 ICL의 효율이 특히 크다.
4.2. 하네스가 수행하는 도메인 특화
-
컨텍스트의 프로그램화
- 새 환경 적응: 습식 실험실에서 시험관을 집는 등 특정 환경에 배치되면 모델은 컨텍스트에서 많은 스킬을 배운다.
- 스킬 패키징: 한 번 배운 행동을 프로그램·메모리·도구로 작성해 다음 에이전트가 재사용하게 한다.
- 경험 증류: 과거 경험을 미래 에이전트가 쓸 수 있는 작은 표현으로 압축하는 과정이다.
-
큰 모델과 작은 모델의 분업
- 큰 모델: 범용 모델이 환경을 탐색하고 하네스를 도메인에 맞게 프로그래밍한다.
- 작은 모델: 하네스 안에서 학습하는 더 작은 모델이 빠르고 저렴하게 반복 작업을 실행할 수 있다.
- 메타러닝 연결: 큰 모델이 작은 모델의 학습 프로그램을 구성한다는 점에서 전통적인 메타러닝과 닮았다.
-
가중치 공간과 기호 공간의 경계
- ICL과 경사하강의 유사성: 일부 연구는 모델이 ICL 중 경사하강을 근사할 수 있음을 보인다.
- 모호한 경계: 학습이 가중치에 들어가는지, 컨텍스트·프로그램이라는 기호 공간에 남는지 명확히 분리하기 어렵다.
- 하네스의 핵심 과제: 이 두 공간 사이에서 언제 컨텍스트를 유지하고 언제 스킬·가중치로 증류할지 결정해야 한다.
5. Astra로 본 실제 로봇 제어
블록을 집어 그릇에 넣는 데모는 범용 모델이 카메라 입력과 로봇 도구를 결합해 행동하는 과정을 보여준다.
5.1. 직접 제어와 하네스 제어
-
Astra의 입력과 출력
- 다중 카메라 입력: Astra는 로봇 주변의 카메라 피드를 모두 본다.
- 로봇 인식: 어떤 로봇을 제어하는지와 사용 가능한 도구를 파악한다.
- 엔드 이펙터 명령: 데모에서는 긴 코드를 출력하기보다 로봇에 포즈를 보내는 도구 호출(tool call)을 반복한다.
-
직접 호출의 용도
- 새로운 작업: 모델이 매 단계 상황을 보고 처음 수행하는 작업에 적합하다.
- 유연한 판단: 물체 위치나 주변 상태가 달라질 때 매번 새 명령을 만들 수 있다.
- 느린 지연시간: Astra가 매 단계 사고하면 로봇이 다음 명령을 기다리므로 전체 움직임이 느려진다.
-
Waddle 하네스의 용도
- 반복 작업 자동화: 병에 접근하고 집는 것처럼 이미 여러 번 수행한 부분은 코드로 묶어 고속 실행한다.
- 컴파일된 스킬 호출: 비슷한 과제를 해본 경험이 있으면 기존 스킬을 호출해 처음부터 다시 추론하지 않는다.
- 엣지 케이스 처리: 단순 반복 코드에 실패 점검·대체 행동을 추가해 실제 환경의 변동에 대응한다.
5.2. 정책 그래프의 결정성과 유연성
-
결정적 구간
- 접근·파지 동작: 물체에 다가가고 집는 과정은 몇 차례 수행하면 비교적 결정적인 코드로 표현할 수 있다.
- 고속 반복: 코드 정책은 매번 거대 모델을 호출하지 않고 짧은 지연시간으로 실행된다.
- 재사용성: 동일하거나 유사한 작업에서 이미 검증된 경로를 다시 쓴다.
-
변이가 필요한 구간
- 물체 검출: VLM을 도구 호출 내부에 넣어 장면에서 물체를 찾는다.
- 실패 판정: 집기가 실패했는지, 물체가 미끄러졌는지 같은 상태를 시각 모델이 확인한다.
- 분기 행동: 실패 원인에 따라 재시도·다른 포즈·다른 도구를 선택한다.
- 하이브리드 구조: 정책 그래프는 결정적으로 유지하되, 변동 지점에 VLM을 삽입해 유연성을 확보한다.
5.3. 지연시간의 빠른 개선
-
현재 병목
- Astra 호출 지연: 데모에서 로봇이 멈칫하는 이유는 모델이 다음 포즈를 계산하는 시간이 길기 때문이다.
- 경제성 문제: 모든 미세 동작을 고가의 대형 모델이 담당하면 로봇 서비스가 비용 면에서 유용하지 않다.
-
개선 추세와 목표
- 월 2배 개선: 안정적인 계열의 LLM은 지연시간이 한 달에 약 2배씩 줄어드는 추세로 관찰됐다.
- 실시간 제어 전망: 이 추세가 유지되면 연말까지 실시간 로봇 제어가 가능할 수 있다고 전망했다.
- 하네스의 필요성: 모델 자체가 빨라져도 반복 스킬을 로컬·고속 실행하는 계층은 여전히 필요하다.
6. Platonic Representation Hypothesis와 데이터의 통합
서로 다른 모달리티로 학습한 강한 모델이 세계의 유사한 관계를 비슷하게 표현한다면, 강한 언어 모델은 곧 강한 로봇 모델의 기반이 될 수 있다.
6.1. 표현 수렴과 ‘Bitter Lesson’의 귀결
-
Platonic Representation Hypothesis
- 공통 거리 구조: 서로 다른 데이터와 학습 정책으로 훈련된 모델도 유사한 대상 사이의 거리·관계를 비슷하게 학습할 수 있다.
- 플라톤의 동굴 비유: 각 데이터 모달리티가 현실의 그림자를 보지만, 대규모 학습을 거치면 현실의 일관된 구조로 수렴한다는 발상이다.
- 새 과제로의 전이: 모델이 언어·이미지·코드에서 세계 구조를 충분히 익히면, 직접 로봇 데이터로 학습하지 않은 새 과제에도 강해질 수 있다.
-
로봇 전용 모델과 범용 모델의 대결
- 표현이 같다는 가정: 강한 언어 모델과 강한 로보틱스 모델의 세계 표현이 유사하다면 둘의 격차는 줄어든다.
- 하나의 강한 모델: 여러 전용 모델을 따로 만드는 것보다 한 개의 강한 기반 모델이 다양한 로봇과 도메인을 커버할 수 있다.
- 아키텍처보다 데이터: ‘어떤 구조인가’보다 ‘어떤 폭넓은 데이터를 얼마나 잘 학습했는가’가 결정적일 수 있다.
6.2. 컴퓨터 사용·CAD 데이터가 물리 세계를 가르치는 방식
-
컴퓨터 사용 데이터의 공간 지식
- 커서 조작: CAD나 Blender에서 물체를 회전시키고 확대·축소하며 화면을 드래그하는 행동은 공간 관계를 다룬다.
- 좌표 개념: 위·아래, 왼쪽·오른쪽, 앞·뒤를 화면상에서 추적하는 경험이 로봇의 공간 제어와 연결된다.
- 단순 클릭 이상의 의미: 컴퓨터 사용 데이터는 클릭 기록이 아니라 시각 입력을 행동으로 바꾸는 물리적 관계의 축약본이다.
-
GUI에서 로봇으로의 역전된 전이
- 물리 세계를 닮은 GUI: 1980년대 Xerox PARC 이후 GUI는 파일·폴더·창과 그래픽 조작으로 물리 세계의 직관을 컴퓨터에 옮기려 했다.
- 3D 설계 도구: SolidWorks와 Autodesk 같은 도구는 물체를 회전·배치하며 현실과 비슷한 조작 환경을 제공한다.
- 뜻밖의 학습 환경: 로봇이 현실 세계에서 충분히 작동하지 못하는 동안, 물리 세계를 흉내 낸 컴퓨터 환경이 로봇 학습에 유용한 데이터를 축적했다.
- 도구 인터페이스의 설계: 로봇 도구를 커서 드래그처럼 보이게 만드는 하네스만으로도 LLM의 물리 작업 성능이 향상될 수 있다.
-
통합해야 할 데이터 모달리티
- 코딩 데이터: 절차를 구성하고 재사용 가능한 함수를 만드는 능력을 준다.
- 컴퓨터 사용 데이터: 화면 공간과 도구 조작의 관계를 가르친다.
- Egocentric video: 사람의 시점에서 실제 환경을 보고 행동하는 연속적 맥락을 제공한다.
- 로봇 데이터: 실제 센서·관절·접촉의 제약을 모델 행동에 연결한다.
- 극단적 결론: 가장 유능한 로봇 사용 에이전트는 로봇 영상만이 아니라 가능한 모든 유용한 모달리티를 한 모델에서 학습할 수 있다.
7. 향후 2년의 로봇 범용화와 지속 학습
프런티어 연구소와 로보틱스 기업의 공통 전망은 자연어로 지시하면 보지 못한 작업도 수행하는 범용 로봇이 2년 안에 등장할 수 있다는 것이다.
7.1. ‘로봇의 ChatGPT 순간’
-
범용 로봇의 정의
- 자연어 지시: 사용자가 임의의 자연어로 작업을 설명한다.
- 청소년 수준의 손 기술: 유능한 청소년이 손으로 할 수 있는 일을 로봇이 수행한다.
- 미지 환경 일반화: 본 적 없는 작업과 환경에서도 지시의 의도를 일반화한다.
-
사회적 준비 부족
- 대중의 인식 격차: 업계 내부의 2년 내 가능성에 비해 사회는 변화의 속도를 충분히 인지하지 못하고 있다.
- 경제·제도적 대비: 범용 로봇이 현실화하면 단순 작업 자동화뿐 아니라 안전·책임·노동 구조에 대한 준비가 필요하다.
7.2. Astra의 첫 패스와 수면 단계
-
Waddle Labs의 우선 과제
- 지연시간 해결: Astra가 매 단계 사고하는 구조는 느리고 경제성이 낮다.
- 컨텍스트 증류: Astra의 첫 시도와 학습을 더 빠른 스킬·정책으로 압축한다.
- 고처리량 실행: 압축된 정책을 반복 실행해 로봇이 매번 대형 모델을 기다리지 않게 한다.
-
생물학적 수면의 비유
- 빠른 온라인 적응: 새로운 상태·행동·보상 사례는 우선 컨텍스트에 넣어 즉시 반응한다.
- 오프라인 압축: 지능적 시스템이 잠을 자듯, 에이전트도 일정 시간 후 경험을 정리하고 압축해야 한다.
- 가중치 업데이트: 하루 동안의 경험을 반영해 Astra 자체 또는 더 작은 전용 모델의 가중치를 갱신할 수 있다.
-
DAGGER·DreamCoder와의 연결
- DAGGER식 데이터 루프: 행동 데이터를 모으고, 반성하고, 업데이트된 정책으로 다시 배포하는 고전 RL 구조와 닮았다.
- DreamCoder의 스킬 라이브러리: 스킬을 모으고 수면 단계에서 더 압축된 표현으로 리팩터링한다.
- 로봇의 스킬 관리 문제: Code as Policies 연구는 스킬이 계속 늘어나는 사다리를 만들므로, 어떤 스킬을 남기고 합치고 폐기할지 결정해야 한다.
- 미래 하네스의 핵심: 증가하는 컨텍스트, 스킬, 배포 데이터를 조직하고 검색하는 운영 체계가 모델 능력만큼 중요해진다.
주요 발언 모음
“The Bitter Lesson”의 핵심은 자율성과 자원을 더 주었을 때 모델이 우리가 미세조정해 넣은 것보다 더 많은 일을 할 수 있다는 데 있다.
RT-2의 강점은 특정 로봇 데이터가 아니라 언어 모델이 학습한 웹 이미지와 텍스트의 모달리티를 활용한다는 점이다.
코드는 입력에서 출력으로 가는 함수를 직접 방출하는 방식이며, 이것이 트랜스덕션보다 샘플 효율적인 프로그램 유도의 직관이다.
가장 유능한 로봇 사용 에이전트는 코딩·컴퓨터 사용·egocentric data를 모두 같은 모델에 넣는 데서 나올 수 있다.
범용 로봇은 유능한 청소년이 손으로 할 수 있는 일을 자연어 지시만으로 수행하는 로봇이다.
핵심 데이터 & 수치
- 17분 50초: 자동 자막 기준 영상 길이.
- 약 20~40개 예시: ICL 성능이 빠르게 포화된다고 설명한 사례 범위.
- 10만 토큰 / 약 5만 토큰: 학습상 컨텍스트가 10만 토큰이어도 안정적 실사용 범위는 절반 수준일 수 있다는 설명.
- 월 약 2배: 안정적인 LLM 계열의 지연시간이 개선되는 관찰 추세.
- 연말: 지연시간 개선 추세가 유지되면 실시간 제어가 가능할 수 있다는 전망.
- 2년 이내: 자연어 지시와 미지 작업 일반화를 갖춘 범용 로봇이 등장할 수 있다는 업계 전망.
- 2022년 전후: Code as Policies 계열 연구가 ChatGPT 초기 시기와 겹치며 코딩 에이전트 발전 직전에 나왔다는 맥락.
- 2026-09-26: YouTube 원본 게시일.
결론 및 시사점
- 로봇의 다음 도약은 로봇 전용 모델의 규모 경쟁보다 범용 모델이 가진 세계 표현·코드·도구 사용 능력을 로봇 인터페이스에 연결하는 데서 나올 가능성이 크다.
- RT-2는 웹 텍스트·이미지 사전학습이 로봇 행동에 직접적인 이점을 줄 수 있음을 보여준 출발점이다.
- Code as Policies와 Voyager는 행동을 고정 출력이 아닌 생성·재사용 가능한 프로그램으로 표현하는 길을 열었다.
- ICL은 로봇 데이터가 부족한 초기에 매우 효율적이지만, 20~40개 사례의 포화와 컨텍스트 길이 문제 때문에 영구적인 해결책이 아니다.
- 하네스는 센서·도구·메모리·스킬·VLM 분기를 묶어 범용 모델을 특정 로봇과 환경에 맞추는 핵심 제품 계층이다.
- 반복 작업은 빠른 코드·스킬로 컴파일하고, 물체 검출·실패 판정·복구 같은 변이 지점만 VLM에 맡기는 하이브리드 구조가 현실적이다.
- 컴퓨터 사용·CAD·egocentric video는 로봇 데이터와 별개로 공간·절차·행동에 대한 표현을 제공하므로 데이터 모달리티의 경계를 넓혀야 한다.
- 앞으로의 경쟁력은 모델 성능만이 아니라 경험을 검색하고, 스킬로 압축하고, 작은 정책이나 가중치로 증류하는 지속 학습 시스템에 달려 있다.
- 범용 로봇이 2년 안에 등장한다는 전망은 기술적으로는 가능성의 문제이지만, 사회적 안전·책임·노동 전환 대비가 병행되지 않으면 충격이 커질 수 있다.
핵심 요약 (20줄)
범용 LLM이 로봇 전용 모델보다 강해질 수 있다는 주장이 로봇 사용 에이전트의 핵심 가설이다. RT-2는 웹 텍스트와 이미지로 사전학습한 언어 모델을 엔드 이펙터 포즈 출력에 연결했다. 웹 규모의 표현은 로봇 데이터만 학습한 모델보다 폭넓은 세계 지식을 제공한다. VLA의 직접 행동 출력은 복잡한 작업에 추가 추론 예산을 배정하기 어렵다는 한계가 있다. 코드 기반 에이전트는 행동 전에 계획하고 실행하며 실패를 수정할 수 있어 더 유연하다. Voyager는 도구를 조합해 새 스킬을 만들고 이후 재사용하는 코딩 에이전트의 대표 사례다. Code as Policies는 집기와 이동 같은 로봇 함수를 조합해 복합 행동 프로그램을 생성한다. 코딩 사전학습 덕분에 로봇 데이터가 적어도 작업 순서를 한 번에 구성할 수 있다. 인컨텍스트 학습은 저데이터 환경에서 빠르고 저렴하게 정책을 적응시키는 방법이다. ICL은 대략 20~40개 예시 뒤 포화되고 예시가 늘수록 성능이 오르내릴 수 있다. 긴 컨텍스트는 전체 사례를 주의 깊게 참조하지 못해 일정 길이 이후 오히려 성능을 낮춘다. 반복 경험은 검색 메모리와 호출 가능한 스킬로 압축해야 지속적인 개선이 가능하다. Astra는 카메라 입력을 보고 엔드 이펙터 포즈를 도구 호출로 보내 블록을 그릇에 넣는다. 반복적인 접근과 파지는 코드로 실행하고 검출과 실패 대응은 VLM에 맡기는 구성이 효율적이다. 안정적인 LLM 지연시간이 월 2배씩 개선되면 실시간 로봇 제어가 가까워질 수 있다. 컴퓨터 사용과 CAD 데이터는 커서·회전·좌표 조작을 통해 공간 추론을 학습시킨다. 코딩·컴퓨터 사용·egocentric video·로봇 데이터를 통합하면 더 강한 로봇 사용 에이전트가 된다. 범용 로봇은 자연어 지시로 보지 못한 작업을 유능한 청소년 수준으로 수행하는 시스템이다. 업계는 이런 로봇이 2년 이내 등장할 수 있다고 보지만 사회는 아직 충분히 대비하지 못했다. 미래의 핵심은 경험을 수집하고 수면처럼 압축해 빠른 스킬과 정책으로 증류하는 하네스다.
