URL: https://www.youtube.com/watch?v=Sjfz1TqxzEs 날짜: 2026-09-24 (원본 업로드일) 처리일: 2026-09-25 채널: aiDotEngineer 발표자: Jason Ma, Dyna Robotics 공동 창업자·CTO 영상 ID: Sjfz1TqxzEs 재생 시간: 약 26분 21초
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==다양한 작업을 수행하는 범용 로봇이 실제 상업 현장에서 멈추지 않고 일하려면, 데모 수준의 80~90% 성공률을 어떻게 상용 등급의 견고성으로 끌어올릴 것인가?==
- 범용 로봇의 80~90% 단일 시도 성공률은 같은 작업 10회 연속 성공 확률이 0.1% 미만이라 제품이 되기 어렵다.
- Dyna Robotics는 20만 시간 이상의 다층 데이터, 고수준 추론 모델(Reasoning Model), 저수준 행동 모델(World Action Model)을 결합한다.
- 보상 모델(Reward Model)이 작업 진척도를 0~1로 측정하고, 점수가 꺾이는 실패를 찾아 능동 학습(Active Learning)용 회복 데이터를 집중 수집한다.
- 이 순환으로 Dyna-1은 식당 냅킨 접기에서 24시간 99.4% 성공률을 기록하고, CoRL 2025에서는 새 현장 데이터 없이 3일간 티셔츠를 접었다.
로봇 상용화의 핵심은 한 번 성공한 장면을 재현하는 능력이 아니라, 변형 가능한 물체·조명·사람의 방해·초기화되지 않은 환경에서 실패를 감지하고 회복하는 능력이다. Dyna의 접근은 범용 사전 학습으로 물리 세계의 폭넓은 지식을 확보한 뒤, 상업적 작업의 명확한 품질 기준에 맞춘 사후 학습과 보상 기반 능동 학습을 반복하는 방식이다. 연구실의 문제를 고객 현장의 데이터로 다시 정의하는 연구-배포 선순환이 이 전략의 운영 기반이다.
1. 데모와 제품 사이의 신뢰성 격차
범용성만 높인 로봇은 보기 좋은 데모를 만들 수 있지만, 반복 작업의 비용과 실패를 감당해야 하는 상업 제품이 되려면 거의 100%에 가까운 작업 신뢰성이 필요하다.
1.1. 80~90% 성공률이 제품으로 부족한 이유
-
연속 성공 확률의 급락
- 범용 로봇 모델은 여러 작업을 수행할 수 있어도 실제 배포 시 단일 시도 성공률이 대략 80~90%에 머문다.
- 성공률이 80%라면 같은 작업 10회를 모두 성공할 확률은 0.8^10으로 약 10.7%이며, 90%를 낙관적으로 잡아도 약 34.9%다. 발표자는 현장 조건과 실패 정의를 감안한 실질적 연속 성공 가능성이 0.1% 미만까지 떨어질 수 있다고 지적한다.
- 물리적 작업은 사람과 로봇이 수천 번 반복해야 하므로, 한 번의 멋진 성공 영상보다 실패 빈도와 회복 능력이 훨씬 중요하다.
-
전문화와 범용성의 딜레마
- 전통적인 로봇 공학은 pick-and-place처럼 한 가지 작업에 특화된 로봇과 머신러닝 파이프라인으로 높은 성능을 얻었다.
- 특화 파이프라인은 새로운 작업이나 임의의 작업으로 빠르게 확장하기 어렵다.
- 범용 모델은 확장성이 좋지만 초기 성공률이 낮다. Dyna의 목표는 여러 작업을 처리하면서도 상업 배포에 충분한 신뢰성을 갖는 모델로 이 이분법을 해소하는 것이다.
1.2. 연구-배포 선순환(Research and Deployment Flywheel)
-
Dyna Robotics의 출발점
- Dyna Robotics는 2024년 9월 설립된 Series A 단계 기업이며 약 1억 2천만 달러를 유치했다.
- 미션은 실제 환경에서 견고한 파운데이션 모델 자율성(Foundation Model Autonomy)을 구축하고, 모델과 하드웨어를 함께 학습시켜 경제적으로 유용한 물리 작업을 처리하는 단일 플랫폼을 만드는 것이다.
-
배포가 연구를 되돌려주는 방식
- 사내 R&D와 하드웨어 연구는 실제 현장에서 상용화할 수 있는 작업과 워크플로를 결정한다.
- 제품을 만들고 여러 현장에 배포하면 고품질의 실제 데이터가 쌓이고, 모델과 하드웨어가 아직 못하는 일이 드러난다.
- 로봇 공학에는 풀어야 할 문제가 너무 많기 때문에, 현장 실패는 연구팀이 올바른 문제를 선택하도록 연구 초점을 좁혀 준다.
- 5곳 이상의 배포 현장에서 얻은 데이터는 로봇이 YouTube 데모에 머무르지 않고 수백만 명의 삶에 영향을 주는 기술이 되기 위한 입력이다.
2. 범용 로봇 파운데이션 모델의 설계
실제 조작(Manipulation) 모델은 시각적 세계 표현을 받아 관절 위치나 토크 같은 제어 출력을 내보내며, 의미 이해와 미세한 물리 상호작용을 동시에 처리해야 한다.
2.1. 데이터에서 행동으로 이어지는 기본 흐름
-
행동 데이터 수집
- 사람이 로봇 하드웨어를 조작해 티셔츠를 접는 것처럼 실제 작업 시연을 수집한다.
- 충분한 시연을 거대 신경망에 넣어 카메라에 보이는 테이블과 물체 상태를 세계 표현(World Representation)으로 학습시킨다.
-
제어 출력
- 신경망은 카메라 입력을 바탕으로 로봇 관절 위치(Joint Positions) 또는 토크(Torque)를 출력한다.
- 출력은 학습 데이터에 포함된 작업을 실제 로봇이 수행하도록 제어한다.
- 실세계에서 일반화하려면 단순한 장면 인식이 아니라, 접촉·마찰·변형·실패 후 상태까지 이해해야 한다.
2.2. 실세계를 위한 사전 학습 데이터 피라미드
-
로봇 외부 데이터(Off-Robot Data)
- 사람이 카메라를 착용하고 작업하는 영상과 공개 데이터셋을 활용한다.
- 로봇 데이터가 희소하므로 시뮬레이션 데이터도 고려해 폭넓은 의미·행동 사전 지식을 만든다.
-
로봇 자체에서 수집한 데이터(On-Robot Data)
- 산업 현장, 가정, 세탁소, 호텔 등 다양한 시나리오와 작업 유형을 로봇으로 직접 수집한다.
- 오프-로봇 데이터만으로는 정밀한 물리 동작을 만들기 어렵기 때문에 실제 로봇의 관절·접촉·실패 데이터가 필요하다.
-
배포 데이터(Deployment Data)
- 연구실의 학습 분포와 고객 현장의 테스트 분포 사이에는 큰 차이가 있다.
- 실제 배포 데이터는 이 train-test distribution gap을 줄이고, 현장에서만 드러나는 오류를 학습에 되돌린다.
- 세 층의 데이터를 합쳐 20만 시간 이상의 학습 파이프라인을 구축했다.
2.3. 추론 모델과 행동 모델의 분업
-
고수준 의미 이해
- 고수준 추론 모델(Reasoning Model)은 무엇을 해야 하는지, 물체와 작업의 의미적 관계가 무엇인지 판단한다.
- 새로운 작업에 빠르게 적응하려면 다양한 물리적 상황에 대한 범용 표현이 필요하다.
-
저수준 정밀 제어
- 저수준 월드 액션 모델(World Action Model)은 높은 빈도로 세밀하고 손재주 있는 동작(Dexterous Action)을 출력한다.
- 물체를 잡고 펴고 분리하는 미세 동작, 그리고 실수에서 회복하는 동작은 저수준 물리 이해에 의존한다.
- 두 모델과 대규모 데이터를 결합하면 사전 학습에 없던 작업도 1시간 미만의 작업별 데이터로 사후 학습할 수 있다.
-
벤치마크 작업
- 쓰레기 치우기, 상자 열기, 수건 접기, 티셔츠 접기와 연구진이 고안한 도구 사용 작업을 사무실에서 검증한다.
- 일부 작업은 사전 학습 데이터에 없었지만, 잘 구축된 백본 덕분에 1시간 미만의 작업별 데이터로 반복 수행이 가능했다.
3. Dyna-1의 냅킨 접기 사례
상업적 가치가 있고 반복성이 높으며 품질 기준이 명확한 식당 냅킨 접기는 범용 모델의 신뢰성을 높이기 위한 적절한 난이도의 사용 사례가 됐다.
3.1. 왜 식당 냅킨 접기인가
-
실제 고객 수요
- 미국의 고급 레스토랑과 딤섬 식당은 테이블 위에 일정한 모양으로 접힌 냅킨을 둔다.
- Cheesecake Factory 같은 식당의 뒤편에서는 직원이 냅킨을 하나씩 손으로 접는다.
- 반복성이 높은 작업이라 Dyna가 대화한 고객 다수가 대신 수행할 로봇을 찾고 있었다.
-
Dyna-1 성과
- Dyna-1은 냅킨 접기를 위해 파인 튜닝한 범용 로봇 파운데이션 모델이다.
- 24시간 동안 99.4%의 성공률을 달성했다.
- 공개된 타임랩스는 약 1,000배 속도로 재생되며, 약 오전 7시 무렵 바깥 빛이 들어오기 시작해 조명이 바뀌는 상황에서도 작업이 지속된다.
- 결과는 단일 우연이 아니다. 24시간 동안 별도의 4회 테스트를 진행해 반복 가능성을 확인했다.
3.2. 냅킨 접기의 숨은 난제
-
한 장 집기와 평행 그리퍼(Parallel Gripper)
- 로봇은 쌓인 냅킨 더미에서 정확히 한 장을 집어 접은 뒤 바구니에 넣어야 한다.
- 평행 그리퍼가 한 장을 정확히 분리하지 못해 여러 장을 동시에 집는 사례가 주요 실패 원인이다.
- 모델은 여러 장을 집은 상태를 감지하고 냅킨을 분리하는 회복 행동을 학습해야 한다.
-
상업적 품질 기준
- 연구실에서는 연구자가 성공 여부를 대략 판단할 수 있지만, 식당에서는 허용 가능한 접힘을 명확히 정의해야 한다.
- 식당이 허용하는 5등급 접기와 기준 미달인 3등급 접기의 차이는 두 번째 접힌 선 위치가 약 1인치 낮은 정도의 미세한 차이다.
- 작은 외형 차이가 고객에게 제공할 수 있는 제품과 폐기해야 하는 제품을 가른다.
-
변형 가능한 물체
- 냅킨은 변형 가능 물체(Deformable Object)라 놓이는 상태와 형태의 조합이 거의 무한대다.
- 모든 오류 상태를 사람이 미리 수집해 학습시키는 방식은 불가능하다.
- 따라서 모델이 새로운 상태에서 회복 전략을 조합하고 일반화하는 능력이 핵심이다.
4. 보상 모델과 능동 학습으로 회복 능력 만들기
표준 사전 학습과 사후 학습만으로는 한 번의 실수가 모델을 학습 분포 밖으로 밀어내고 정지시키므로, 진척도 변화를 측정하는 자동 감독 루프가 필요하다.
4.1. 표준 파인 튜닝이 80%에서 멈추는 이유
-
오류 뒤의 분포 이탈
- 대규모 사전 학습 후 작업별 사후 학습을 적용하면 냅킨 접기 성공률은 약 80%까지 오른다.
- 모델은 처음에는 잘 수행하지만, 실수하는 순간 학습 데이터에 없던 상태로 들어가 멈춘다.
- 복구 시연이 충분하지 않으면 모델은 스스로 작업을 재개하지 못한다.
-
보상 모델(Reward Model)의 역할
- 보상 모델은 로봇 영상을 보고 장기 작업(Long-Horizon Task)의 수행 진척도를 0에서 1 사이 점수로 산출한다.
- 작업을 잘 수행하면 점수가 대체로 단조 증가한다.
- 로봇이 실수하면 점수가 내려가거나 비단조적인 신호를 보낸다.
- 냅킨 아홉 번째 작업에서 모델이 실수를 시작하는 순간 진척도 추정치가 꺾여 문제를 조기에 알린다.
4.2. 확장 가능한 감독(Scalable Supervision)
-
실패 감지 자동화
- 로봇이 냅킨을 접는 동안 백그라운드에서 보상 모델을 계속 실행한다.
- 모델이 실패할 때마다 연구원이나 운영자는 점수가 꺾인 영상을 즉시 확인한다.
- 사람이 모든 시간대를 지켜보는 대신, 보상 모델이 사람이 봐야 할 어려운 사례를 선별한다.
-
인간 개입 능동 학습 루프
- 선별된 실패 상태에서 정밀한 데이터 수집과 오류 회복 학습을 수행한다.
- 새 회복 데이터를 포함해 모델을 다시 미세 조정한다.
- 보상 모델이 취약점을 찾고, 인간이 해당 사례의 데이터를 수집하고, 모델이 재학습하는 순환을 반복한다.
- 몇 차례 반복하면 로봇은 사람이 일일이 정의하지 않은 오류에서도 스스로 회복해 상용 등급에 가까워진다.
-
실제 회복 장면
- 로봇이 실수로 냅킨을 여러 장 집으면 모델이 냅킨을 분리하고 작업을 이어간다.
- 가장 큰 실수는 냅킨 더미 전체를 넘어뜨린 사건이었다.
- 로봇은 당기고 펴는 동작을 조합해 흩어진 냅킨을 다시 다루고 멈추지 않은 채 접기를 재개했다.
- 성공률 99.4%는 실패가 완전히 사라졌다는 뜻이 아니라, 실패 이후의 회복이 시스템의 일부가 됐다는 뜻이다.
5. 실제 배포와 미지 환경 일반화
배포 현장은 모델의 정확도를 시험하는 장소인 동시에, 어떤 데이터와 회복 전략이 상업적 신뢰성을 만드는지 알려주는 실험실이다.
5.1. 식당과 세탁소 배포
-
미국 식당
- 냅킨 접기 모델은 미국 여러 식당의 뒷공간에 배치돼 고객용 냅킨을 실제로 접는다.
- 범용 레시피를 확보한 뒤에는 냅킨 접기에서 다른 상업적 작업으로 확장할 수 있게 됐다.
-
새크라멘토 세탁소
- Dyna는 모델을 미세 조정해 고객용 수건 접기 작업을 수행하게 했다.
- 세탁소 직원이 바구니에 수건을 계속 채워 주면 로봇은 멈추지 않고 수건을 접어 고객 서비스 흐름을 유지한다.
5.2. 추가 현장 데이터 없이 새 환경에서 작동하기
-
일반화 데이터 레시피
- 기존 배포 영상은 로봇이 실제 투입된 현장에서 수집됐지만, 모든 고객과 작업에 새 데이터를 모으는 방식은 확장에 한계가 있다.
- Dyna는 2025년 말 새로운 현장에 배치될 때 추가 데이터 없이도 작업 성능을 유지하도록 다양한 작업을 수집하는 레시피를 연구했다.
-
CoRL 2025 시연
- CoRL(Conference on Robot Learning)은 로봇 학습 분야의 주요 학술 대회이며 2025년 행사는 한국에서 열렸다.
- 미국에서 가져온 로봇을 전시 부스에 놓자 별도 현장 데이터 없이 다양한 티셔츠 접기를 시작했다.
- 참가자들이 티셔츠로 카메라를 가리거나 의도적으로 방해했지만, 로봇은 3일 동안 티셔츠 접기를 계속했다.
- 이는 로봇을 새 현장에 가져다 놓으면 바로 작동하는 이상적인 go-to-market에 가까워졌다는 증거다.
-
Red Bull 파트너십
- Dyna는 Red Bull 행사에서 음료 캔을 여는 작업으로 적용 범위를 넓혔다.
- 음악 축제의 조명과 배경이 계속 바뀌는 환경에서도 참가자에게 Red Bull 캔을 반복해서 열어 줬다.
- 발표 중 해당 영상이 제대로 재생되지 않았지만, 조명 변화가 있는 실전 환경에서의 연속 동작이라는 핵심 사례는 분명했다.
6. Q&A: 플랫폼 공개, 소비자 제품, 음성 제어
질문은 개발자 생태계·교육·가정용 로봇·음성 인터페이스·범용 모델과 현장 학습의 역할 분담으로 이어졌고, 답변은 현재의 병목이 로봇 파운데이션 모델과 하드웨어의 결합임을 재확인했다.
6.1. 개발자 키트와 SDK
- 상업 파트너를 위한 로봇·SDK·프레임워크가 포함된 개발자 키트 계획이 질문으로 나왔다.
- 현재 개발자 키트는 준비하지 않았으며, Dyna 자체 하드웨어 스택 구축에 집중하고 있다.
- 개발자 키트는 장기 로드맵에 포함될 수 있지만 당장 제공할 계획은 없다.
6.2. 교육 분야
- 초등학생에게 수학을 가르치는 등 교육용 로봇 사례를 시도했는지 질문이 나왔다.
- 현재 교육 분야는 검토하지 않았다.
- 풀스택 로봇 파이프라인, 자체 하드웨어, 데이터 수집 툴킷이 성숙하면 교육 분야 진출은 가능하고 흥미로운 방향이 될 수 있다.
- 어린이가 모델을 학습시켜 작업을 수행하는 법을 배우는 것은 로봇 산업 확대와 함께 의미 있는 교육 경험이 될 수 있다.
6.3. 소비자용 제품과 기업용 시장
-
장기 비전
- 장기적으로 누구나 어디서나 배치할 수 있는 로봇 모델과 하드웨어 플랫폼을 만들고, 소비자 직접 판매도 포함한다.
- 현재 모델은 여러 종류의 의류를 접을 수 있어 가정용 빨래 접기 가능성을 보여준다.
-
현재 기업용 집중
- 시장 진입은 기업용 사례에 우선 집중한다. 기업 고객은 현장에 바로 배치하고 반복적으로 개선하기 쉬운 유통·운영 경로를 제공한다.
- 소비자 제품은 더 높은 완성도와 훨씬 낮은 오류 허용도를 요구한다.
- 가정 환경은 개인정보와 안전 이슈가 크므로 현재는 이런 위험을 피하면서 배포를 가속하는 전략을 택했다.
- 현 단계 AI 로봇의 병목은 AI와 하드웨어가 얼마나 잘 함께 작동하는지에 있으며, 상업 환경은 이를 검증하기 좋은 시험대다.
6.4. 음성 스택과 VLA 모델의 통합
-
가능한 스택
- 온보드 음성-텍스트(Speech-to-Text) 모델이 사람의 말을 빠르게 텍스트로 바꾼다.
- 추론 모델과 월드 모델이 텍스트 명령을 해석하고, 로봇 파운데이션 모델이 지시를 물리적 행동으로 변환한다.
-
남은 병목
- 음성을 텍스트로 바꾸는 기술은 충분히 성숙했지만, 현재 로봇 모델은 임의의 명령을 바로 실행할 정도로 준비되지 않았다.
- 저수준 로봇 제어에서 명령을 안정적 행동으로 바꾸는 격차가 남아 있다.
- 궁극적인 목표는 사람이 말로 가르칠 수 있고 제어할 수 있는(teachable and controllable) 로봇 모델이다.
6.5. 범용 백본과 작업·현장별 학습의 역할
-
세 단계 학습
- 사전 학습(Pre-training)은 물리 세계의 의미적·물리적 일반 지식을 만든다.
- 사후 학습(Post-training)은 특정 작업의 품질 기준과 행동을 맞춘다.
- 능동 학습(Active Learning)은 실제 현장에서 점수가 꺾이는 실패와 회복 사례를 추가한다.
-
범용성이 회복을 돕는 방식
- 인간이 다양한 물리 작업에 빠르게 적응하는 것처럼, 범용 모델은 여러 작업에서 얻은 물리 지식을 새 작업에 전이한다.
- Dyna가 확인한 추가 통찰은 모델이 수천 가지 작업과 다양한 실패를 경험했기 때문에 다른 작업의 회복 행동을 보간해 처음 보는 작업에서도 즉시 활용한다는 점이다.
- 처음부터 빨래 접기 하나만 학습한 모델은 그 작업 데이터에는 맞을 수 있지만, 다른 작업에서 얻을 수 있는 물리 지식을 잃어 더 견고해지기 어렵다.
- 범용 사전 학습 백본 위에 사후 학습과 능동 학습을 반복하는 동일한 방식을 여러 상업 작업에 적용하는 것이 Dyna의 recipe다.
주요 발언 모음
“로봇 데모는 쉽지만, 신뢰성은 어렵습니다.”
“실패를 모두 미리 수집할 수는 없으므로, 모델이 실수에서 회복하는 법을 학습해야 합니다.”
“범용 사전 학습 백본 위에 사후 학습과 능동 학습을 적용하는 방식은 여러 작업에 반복할 수 있습니다.”
핵심 데이터 & 수치
- 설립·투자: Dyna Robotics는 2024년 9월 설립됐고 Series A 단계에서 약 1억 2천만 달러를 유치했다.
- 배포 현장: 발표 시점에 5곳 이상의 현장에서 다양한 작업을 수행하고 있었다.
- 학습 규모: 오프-로봇, 온-로봇, 배포 데이터로 20만 시간 이상의 학습 파이프라인을 구축했다.
- 작업별 데이터: 사전 학습에 없던 일부 작업도 1시간 미만의 작업별 데이터로 사후 학습했다.
- 기존 범용 모델: 실제 배포 성공률은 대략 80~90% 수준이며, 반복 작업에는 부족하다.
- Dyna-1: 식당 냅킨 접기에서 24시간 99.4% 성공률을 기록했고, 별도 4회 테스트로 반복성을 확인했다.
- 환경 변화: 냅킨 타임랩스는 약 1,000배 속도로 재생됐고, 오전 7시 무렵 자연광 변화에도 작업을 지속했다.
- 품질 기준: 식당 허용 5등급과 기준 미달 3등급의 차이는 두 번째 접힌 선 위치 약 1인치였다.
- 새 환경 일반화: CoRL 2025 한국 전시 부스에서 추가 현장 데이터 없이 티셔츠를 3일간 접었다.
결론 및 시사점
- 로봇의 상용 가치는 데모 성공 장면의 화려함이 아니라 장시간 반복 작업에서의 실패율과 회복률로 평가해야 한다.
- 범용성은 특화 파이프라인의 확장성 한계를 보완하지만, 범용 사전 학습만으로는 상업적 품질을 보장하지 못한다.
- 오프-로봇·온-로봇·배포 데이터의 피라미드는 희소한 로봇 데이터와 연구실-현장 분포 차이를 동시에 다룬다.
- 고수준 추론 모델과 저수준 월드 액션 모델을 분리하면 의미 이해와 고주파 정밀 제어를 함께 확보할 수 있다.
- 냅킨처럼 변형 가능하고 품질 기준이 미세한 작업은 모델의 진짜 견고성을 검증하기에 적합하다.
- 보상 모델은 모든 시간을 사람이 감시하지 않고도 실패 직전의 비단조적 진척도 신호를 찾아낸다.
- 능동 학습은 실패 영상을 선별하고 회복 데이터를 집중 수집해, 실패를 단순 중단이 아닌 재학습 신호로 바꾼다.
- 기업용 배포는 고객 현장에서 즉시 개선할 수 있고 개인정보·안전 부담이 낮아 소비자 제품보다 먼저 확장하기 좋다.
- 장기적으로는 음성 명령과 가정용 배포까지 가능하지만, 현재 가장 큰 병목은 임의 명령을 안정적 저수준 행동으로 바꾸는 능력이다.
- 범용 모델이 수천 가지 작업의 회복 행동을 공유할수록 처음 보는 작업에서도 더 강한 일반화와 복구가 가능해진다.
핵심 요약 (20줄)
범용 로봇의 80~90% 성공률은 데모에는 충분해도 반복 작업 제품에는 부족하다. 같은 작업을 연속 수행해야 하는 상업 현장에서는 실패율보다 회복 능력이 중요하다. Dyna Robotics는 2024년 9월 설립됐고 Series A에서 약 1억 2천만 달러를 유치했다. 연구와 실제 배포를 결합하면 현장 데이터가 연구 우선순위와 제품 개선을 동시에 만든다. 로봇 외부 영상과 공개 데이터는 희소한 로봇 데이터를 보완하는 사전 학습 재료다. 산업 현장과 가정과 세탁소와 호텔의 로봇 데이터는 정밀한 물리 제어를 학습시킨다. 배포 데이터는 연구실 학습 분포와 고객 현장 테스트 분포 사이의 차이를 줄인다. Dyna의 학습 파이프라인은 세 데이터 층을 합쳐 20만 시간 이상으로 확장됐다. 고수준 추론 모델은 의미를 이해하고 저수준 월드 액션 모델은 정밀한 동작을 출력한다. 사전 학습이 잘 되면 사전 데이터에 없던 작업도 1시간 미만의 데이터로 배울 수 있다. 식당 냅킨 접기는 반복성이 높고 품질 기준이 명확해 상용 신뢰성 연구에 적합했다. Dyna-1은 냅킨을 24시간 접으며 99.4% 성공률을 기록하고 네 번의 별도 시험을 통과했다. 평행 그리퍼의 다중 집기와 약 1인치의 접힘 차이가 실제 품질 판정을 어렵게 만든다. 보상 모델은 로봇의 작업 진척도를 0에서 1까지 점수화하고 실수 때 점수를 낮춘다. 아홉 번째 냅킨의 점수 하락은 실패를 사람이 감시하기 전에 포착하는 신호가 된다. 실패 영상을 선별해 회복 데이터를 수집하고 재학습하는 과정이 확장 가능한 감독이다. 냅킨 더미 전체를 넘어뜨린 뒤에도 당기고 펴는 동작으로 복구해 작업을 이어갔다. 새크라멘토 세탁소에서 직원이 채운 수건 바구니를 로봇이 계속 접으며 서비스를 제공했다. CoRL 2025 한국 부스에서 방해와 카메라 가리기에도 티셔츠 접기를 3일간 지속했다. 현재 기업용 배포가 우선이며 장기적으로 음성 명령과 소비자용 로봇까지 확장할 계획이다.
