URL: https://www.youtube.com/watch?v=S6aSoQ6_u5A 날짜: 2026-08-30 채널: aiDotEngineer (AI Engineer) 원문 제목: Tell the Robot What You Want — Sandhya Subramani, AWS 원본 업로드일: 2026-08-29
📌 자연어 에이전트가 로봇 작업을 확장하는 핵심 논점
==고정된 로봇 동작 정책 위에 에이전트(agentic layer)를 얹으면, 자연어 한마디로 기존에 학습하지 않은 작업까지 수행하는 하드웨어 도구를 만들 수 있다.==
- Scout은 Raspberry Pi, SIM 카드, 4G 연결을 사용하고, 이동·조명·음성·카메라 관찰처럼 이미 갖춘 로봇 도구를 자연어 인터페이스 뒤에 노출한다.
- Strands Agents는 에이전트가 어떤 도구와 정책을 호출할지 결정하게 하며, 로봇 자체를 소프트웨어 에이전트가 사용할 수 있는 하드웨어 도구로 취급한다.
- 에이전트는 무엇을 할지 결정하고, 정책(policy) 또는 VLA(vision-language-action) 모델은 그 일을 어떻게 할지 결정한다.
- 클라우드 학습과 엣지(edge) 실행을 결합하면 대규모 데이터 수집·훈련과 빠른 로봇 반응을 함께 노릴 수 있다.
Sandhya Subramani는 전통적인 로봇이 미리 프로그램된 작업 목록에 묶여 있는 상황에서, 자연어를 이해하고 환경을 관찰하며 도구를 조합하는 에이전트 계층을 추가하는 전환을 Scout의 실제 시연으로 보여준다. 다만 자연어 지시가 곧바로 완벽한 자율성을 보장하지는 않는다. Scout은 회전하고, 사람 수를 추정하고, Telegram으로 대화하지만 무대에서 넘어지거나 엉뚱하게 헤드라이트를 끄기도 한다. 이런 불완전한 실행조차 다음 학습 데이터를 만드는 실험 장치가 된다.
1. Scout과 자연어 로봇의 첫 시연
전통적인 로봇은 사람이 정한 동작을 수행하지만, Scout은 작은 두뇌와 에이전트 계층을 통해 말의 의미를 행동으로 연결한다.
1.1. 고정 프로그램 로봇에서 생각하는 로봇으로
-
Scout의 정체
- 동반 로버: Sandhya는 Scout을 공동 진행자(co-host)라고 소개하며, 무대에 함께 있는 친근한 로버(friendly rover)로 보여준다.
- 일반적인 로버의 한계: 로버는 스스로 생각하지 못하고 무엇을 할지 지시받거나, 생각하는 방법까지 매우 구체적으로 프로그래밍되어야 한다.
-
자연어를 이해하는 작은 두뇌
- 내장된 소형 컴퓨터: Scout은 작은 두뇌를 갖고 있어 사람의 자연어(natural language)를 이해한다.
- 행동으로 이어지는 명령: “Hey Scout, turn on your headlights and say hi to everyone.”이라는 명령을 받으면 헤드라이트를 켜고 청중에게 인사하는 행동을 시도한다.
1.2. 연결 구조와 시연 중 발생한 지연
-
Scout의 원격 실행 경로
- Raspberry Pi: Scout 안에는 Raspberry Pi가 설치되어 있다.
- 뉴욕의 원격 위치: Raspberry Pi는 뉴욕시의 작은 장소에 놓여 있고, Scout의 SIM 카드가 그 Raspberry Pi와 연결된다.
- 4G 통신: 명령과 응답은 4G 연결을 거치므로 Scout이 생각하고 행동하기까지 몇 초가 걸릴 수 있다.
-
라이브 발표의 즉흥성
- 화면 공유 실수: Sandhya가 화면을 보여주려 하자 잘못된 화면으로 전환되었고, 공유를 끝내고 올바른 화면으로 옮기는 데 잠시 시간이 필요했다.
- 지연을 설명하는 진행: Scout이 “Oh, hey, on it.”이라는 식으로 응답하기까지 시간이 걸리자 Raspberry Pi와 4G 구조를 관객에게 설명했다.
1.3. 학습하지 않은 질문에 대한 시각 추론
-
무대 관찰과 회전 명령
- 장면 묘사: Scout은 전면 카메라로 스피커 모니터가 놓인 무대 뒤쪽, 밝은 무대 조명, 관객석 줄을 본다고 말한다.
- 회전 행동: “Spin around.” 또는 “spin 360”이라는 지시를 받고 360도 회전을 준비하고 수행한다.
-
미리 훈련하지 않은 사람 수 세기
- 질문의 성격: Sandhya는 Scout에게 “How many people do you see?”라고 묻고, 이 질문에 답하도록 따로 훈련한 적이 없다고 말한다.
- 추론 과정: Scout은 1~2초 동안 생각한 뒤 전면 카메라로 다시 자세히 살핀다.
- 첫 답변: 스피커 모니터 근처 무대 뒤쪽에 한 명, 더 오른쪽에 다른 한 명이 있어 총 두 명이라고 답한다.
-
관찰과 대화의 결합
- 상황 질문: Scout은 회전 중 세션이 곧 시작하는지 묻고, 단순한 이동 명령을 넘어 장면의 맥락을 대화에 섞는다.
- 자기 상태 보고: 360도 회전을 끝낸 뒤 무대 조명과 좌석을 계속 묘사하며 자신이 안전하게 무대 위에 있다고 알린다.
2. 로봇에 에이전트 계층을 추가하는 설계
에이전트는 기존 로봇 기능을 대체하지 않고, 이미 존재하는 정책과 도구를 선택·조합하는 상위 오케스트레이터(orchestrator)로 작동한다.
2.1. 소프트웨어 도구와 하드웨어 도구의 대칭
-
기존 로봇 도구의 출발점
- 사전 정의된 기능: Scout은 이미 특정 행동을 수행할 수 있는 도구와 정책을 갖고 있다.
- 한정된 자율성: 에이전트 계층이 없으면 Scout은 자신이 훈련받은 기능만 수행할 수 있다.
-
에이전트가 맡는 선택
- LLM 계층: 기존 도구 위에 LLM(Large Language Model) 계층을 추가하면 자연어 명령을 도구 호출로 연결할 수 있다.
- Agentic layer: 더 나아가 에이전트 계층을 추가하면 에이전트가 어떤 도구를 호출하고 어떤 정책을 언제 적용할지 오케스트레이션한다.
-
하드웨어도 도구가 되는 모델
- 소프트웨어 도구의 일반화: 전통적인 AI 엔지니어링에서는 AI 에이전트에게 소프트웨어 도구를 준다.
- 로봇 도구의 일반화: 같은 방식으로 preset function과 programmable policy에 접근하는 로봇을 하드웨어 도구로 제공한다.
- 자연어 기반 작업 확장: 에이전트가 상황에 맞는 정책을 골라 적용하므로, 로봇은 고정된 작업 목록보다 많은 일을 자연어로 이해하고 시도할 수 있다.
2.2. Strands Agents와 다섯 줄의 시작점
-
오픈 소스 에이전트 하네스
- Strands Agents: AWS가 만든 오픈 소스 프레임워크이며, 에이전트가 로봇 도구를 호출하는 하네스(harness) 역할을 한다.
- 간단한 연결: 에이전트를 가져오고 로봇 도구를 지정한 다음 자연어 작업을 전달하는 정도로 시작할 수 있다.
-
개념 코드
- 도구 등록:
strands의 에이전트와 로봇 도구를 가져와 도구 목록에 등록한다. - 작업 지시: 로봇이 해당 기능을 갖고 있다는 전제에서
pick up the red cube라고 말하면 에이전트가 빨간 큐브를 집는 정책을 선택한다. - 핵심 주장: 로봇 에이전트를 연결하는 데 필요한 출발점은 약 다섯 줄의 코드다.
- 도구 등록:
from strands import Agent
from strands_tools import robot
agent = Agent(tools=[robot])
agent("pick up the red cube")
2.3. 한 로봇 안에서 동시에 작동하는 세 에이전트
-
사고·관찰 에이전트(thinker agent)
- 환경 평가: 주변을 계속 살피며 현재 환경에서 다음에 무엇을 해야 할지 생각한다.
- 상시 추론: 특정 질문을 기다리는 것이 아니라 환경과 자신의 상태를 지속적으로 평가한다.
-
커뮤니케이션 에이전트
- 대화 채널: Scout은 Telegram 앱과 웹 앱에 연결되어 있다.
- 대화에서 행동으로: 사용자가 자연어로 말하면 Scout은 대화하고, 그 지시를 실제 행동으로 바꾼다.
-
음성 에이전트(voice agent)
- 실시간 음성: 음성 에이전트는 사용자의 말을 듣고 대화를 이어갈 수 있다.
- 무대에서의 비활성화: Sandhya가 말할 때마다 Scout이 자신에게 하는 말로 오해하고 계속 끼어들 수 있어, 발표 중에는 음성 기능을 껐다.
-
세 에이전트의 협업
- 동시 실행: 세 에이전트는 모두 Strands 기반으로 동시에 작동한다.
- 능력의 확장: 인식·추론·대화·행동이 한 로봇에 결합되어, 기존에 훈련된 정책만 실행하는 것보다 훨씬 많은 작업을 시도할 수 있다.
2.4. 지원 범위
- 로봇 도구 생태계
- 지원 로봇 수: Strands 패키지는 40개가 넘는 서로 다른 로봇을 지원한다.
- 분류 체계: 지원 대상은 8개 카테고리 아래에 있으며, 연결 방식은 단순한 로봇 도구 호출이다.
3. 에이전트·정책·백엔드·물리 로봇의 네 계층
자연어 지시는 네 계층을 통과해 실제 물리적 출력이 되고, 카메라 관찰은 반대 방향으로 에이전트까지 올라오는 양방향 구조를 만든다.
3.1. 최상위 에이전트 계층
-
행동이 내려가는 경로
- 자연어 입력: 사용자가 명령이나 질문을 에이전트에게 전달한다.
- 정책 선택: 에이전트가 어떤 정책을 호출할지 결정하고, 적합한 도구를 선택한다.
-
관찰이 올라오는 경로
- 센서 관찰: 로봇이 카메라와 상태 정보로 환경을 관찰한다.
- 추론 갱신: 관찰 결과가 에이전트로 올라가고, 에이전트는 다음 행동이나 대답을 다시 결정한다.
-
양방향성
- 명령 하향: 에이전트의 선택이 정책과 실행 환경을 거쳐 로봇으로 내려간다.
- 관찰 상향: 로봇의 물리적 상태와 시각 정보가 정책·에이전트로 올라간다.
3.2. 정책 제공자와 VLA 모델
-
전통적인 로봇 훈련
- 데이터 수집: 로봇 정책을 만들기 위해 실제 동작 데이터를 수집한다.
- 시뮬레이션 데이터: 추가 시뮬레이션 데이터를 만들어 정책의 학습량을 늘린다.
-
VLA로의 변환
- 정책 모델: 수집 데이터와 시뮬레이션 데이터로 정책을 훈련한다.
- VLA(Vision-Language-Action): 훈련된 정책이 시각·언어·행동을 연결하는 VLA 모델이 되고, Strands 에이전트가 필요할 때 이 모델을 호출한다.
- 선택과 실행의 분리: 에이전트는 질문이나 명령을 보고 특정 정책을 고르고, VLA 정책은 선택된 작업의 움직임을 산출한다.
3.3. 백엔드 실행 환경
-
정책이 머무는 위치
- 시뮬레이션 환경: 정책은 가상 시뮬레이션 환경에서 실행될 수 있다.
- 하드웨어 칩: 실제 하드웨어 환경이나 하드웨어 칩에서도 정책을 실행할 수 있다.
-
백엔드의 역할
- 인터페이스: 백엔드는 훈련된 정책이 실행되는 인터페이스이며, 에이전트의 선택을 로봇 동작으로 전달한다.
- 실행 위치의 유연성: 같은 정책을 시뮬레이션에서 검증한 뒤 실제 물리 하드웨어로 옮길 수 있다.
3.4. 물리 로봇 계층
-
최종 출력
- 행동의 실체화: 정책의 출력은 최종적으로 실제 로봇의 이동·회전·조명·음성·관찰 행동으로 나타난다.
- 실패를 포함한 실행: Scout은 무대에서 넘어질 수 있지만, 완전히 쓰러지지 않았다면 스스로 다시 일어나 멈춘 지점부터 이동을 이어가도록 설계되어 있다.
-
회복성의 의미
- 자기 복구: 물리적 시연에서 넘어짐은 곧바로 시스템 전체의 실패가 아니라 자기 복구 정책을 시험하는 상황이 된다.
- 라이브 검증: Scout이 뒤로 물러나라는 말을 듣고 실제로 후진하는지, 넘어진 뒤 다시 움직일 수 있는지를 현장에서 확인한다.
4. 클라우드와 엣지를 결합한 런타임
Strands Agents는 클라우드와 로봇의 엣지 양쪽에 놓일 수 있으며, 대규모 훈련과 빠른 물리적 반응 사이의 균형을 잡는다.
4.1. 학습은 클라우드에서, 실행은 엣지에서
-
클라우드 측 역할
- 대규모 훈련: VLA와 정책은 AgentCore를 사용해 클라우드에서 훈련할 수 있다.
- 데이터 축적: Scout이 계속 수집하는 정보와 행동 에피소드를 대규모로 모아 학습에 활용한다.
-
엣지 측 역할
- 직접 호출: 로봇 가까이의 엣지에서 정책을 직접 호출할 수 있다.
- 짧은 지연: 물리적 행동을 빠르게 실행해야 할 때 엣지 실행이 유리하다.
-
Strands의 조정
- 하이브리드 모델: 일부 처리는 클라우드에서, 다른 일부는 엣지에서 수행한다.
- 동적 선택: Strands가 상황에 따라 클라우드와 엣지 중 어느 쪽을 호출할지 결정한다.
4.2. 무엇을 할지와 어떻게 할지의 분리
-
에이전트의 책임
- 목표 선택: 에이전트는 자연어 요청과 환경을 보고 무엇을 할지 정한다.
- 도구 선택: 회전, 말하기, 이동, 관찰 같은 로봇 도구 중 필요한 것을 호출한다.
-
정책의 책임
- 동작 방식: 정책은 선택된 작업을 실제 움직임으로 어떻게 구현할지 결정한다.
- 전문화된 실행: 각 정책은 전통적인 로봇 훈련과 VLA 학습으로 얻은 세부 행동 능력을 제공한다.
5. 미래의 로봇 모델과 현재의 디딤돌
고도로 확장된 VLA 모델이 언어 모델만큼 풍부한 세계 지식을 갖추면, 로봇을 작업별로 미세 조정하는 부담이 줄어들 수 있다.
5.1. 사전 프로그래밍에서 범용 모델로
-
전통적인 로봇의 역사
- 오래된 자동화 방식: 로봇은 오랫동안 미리 프로그램된 일정한 작업 집합을 자율적으로 수행해 왔다.
- 정해진 목록의 한계: 학습된 작업 밖의 요청을 이해하거나 조합하는 능력은 별도로 설계해야 했다.
-
대형 VLA의 가능성
- 언어 모델 수준의 규모: 미래의 VLA 모델이 대규모 언어 모델처럼 크고 강력해질 수 있다.
- 단일 모델 입력: 한 개의 범용 모델만 로봇에 넣고 간단한 지시를 주면, 로봇이 무엇을 해야 하는지 바로 아는 단계가 가능해진다.
5.2. 에이전트 계층이 제공하는 현재의 디딤돌
-
완전한 범용성 이전의 전략
- 기존 VLA 위의 계층: 아직 기존 VLA와 정책을 추가로 미세 조정하지 않아도 되는 수준에 도달하지 못했으므로, 에이전트가 현재의 정책을 조합한다.
- 작업 범위 확장: 로봇이 훈련받은 작업보다 더 많은 일을 시도하게 하면서 미래의 범용 모델로 가는 디딤돌을 만든다.
-
훈련하지 않는 미래를 향한 단계
- 정책 의존성 감소: VLA가 충분히 발전하면 작업마다 별도 정책을 훈련하는 필요가 줄어든다.
- 현재의 실험 가치: 지금은 에이전트가 기존 정책을 선택하고, 로봇은 그 결과와 실패를 다시 데이터로 제공한다.
6. 복합 명령 시연과 물리적 한계
자연어 “복잡한 일을 해라”라는 요청은 에이전트의 도구 선택 능력을 보여주지만, 실제 로봇의 실행은 여전히 예측 불가능한 순간을 만든다.
6.1. “Do something complex”의 결과
-
복합 요청의 해석
- 처음의 기대: Sandhya가 Scout에게 “Hey, do something complex.”라고 말하자 Scout이 다음 행동을 생각하기 시작한다.
- 예상 밖의 선택: Scout은 복잡한 계획을 명확히 수행하기보다 360도 회전을 선택한다.
-
시연 중 자기 보고
- 회전 완료: Scout은 “Let’s spin. Full 360. Done. Still safely on the stage.”라고 말하며 회전이 끝났고 무대에 안전하다고 보고한다.
- 무대 묘사: 밝은 무대 조명과 관객석을 볼 수 있다고 덧붙이며, 행동 결과를 시각 관찰과 결합한다.
6.2. “시그니처 퍼포먼스”와 도구 호출
-
행동과 말의 불일치
- 말하지만 움직이지 않음: Scout은 자신의 “signature performance”라고 말했지만 곧바로 뚜렷한 춤 동작을 하지 않아 Sandhya가 무엇을 하는지 다시 묻는다.
- 헤드라이트 끄기: Scout은 잠시 뒤 헤드라이트를 꺼 버리고, Sandhya는 이것도 하나의 행동으로 받아들인다.
-
실제 도구 호출 확인
- 로그 관찰: 화면에
calling rover speak가 표시되며, Scout이rover speak함수를 호출한 사실이 드러난다. - 에이전트의 선택: “do something complex”라는 모호한 요청이 구체적인
speak도구 호출로 해석되었고, 이후 Scout이 시도한 행동 중에는 무대에서 떨어지는 실행도 있었다.
- 로그 관찰: 화면에
-
불완전성이 주는 정보
- 재현되지 않는 춤: Sandhya는 이전에 Scout이 펑키한 춤 동작을 한 적이 있다고 말하지만, 이번에는 같은 동작을 재현하지 않는다.
- 자기 마음이 있는 듯한 로봇: Scout의 예측 불가능한 선택은 고정 스크립트가 아닌 에이전트 기반 시스템의 실험적 성격을 드러낸다.
7. 로봇을 데이터 수집 장치로 쓰는 방법
Scout의 자율성은 최종 기능일 뿐 아니라, 다음 정책과 VLA를 훈련할 데이터를 생산하는 실험 도구이기도 하다.
7.1. 직접 조작으로 만드는 훈련 에피소드
-
수동 조작과 경로 수집
- 원하는 방향으로 이동: Sandhya는 Scout을 수동으로 움직여 자신이 원하는 방향으로 내비게이션한다.
- 행동 기록: 수동 조작 과정에서 로봇이 어떤 상태에 있었고 어떻게 반응했는지 기록한다.
-
데이터셋 구성
- 훈련 에피소드: 수동으로 만든 경로를 training episode로 저장한다.
- 질문-응답 정보: 어떤 질문을 받았을 때 Scout이 어떻게 반응하고 어떻게 추론했는지 정보를 수집한다.
7.2. 자율성 실험의 피드백 루프
-
행동 결과의 활용
- 성공 사례: 자연어 지시를 올바른 정책 호출과 행동으로 연결한 사례를 다음 훈련에 활용한다.
- 실패 사례: 넘어짐, 지연, 엉뚱한 도구 선택, 기대와 다른 춤 같은 실패도 개선에 필요한 데이터가 된다.
-
개선 방향
- 더 나은 수행: 축적된 데이터로 Scout이 같은 질문과 명령에 더 잘 답하고 행동하도록 만든다.
- 정책과 에이전트의 공동 개선: 에이전트의 도구 선택과 정책의 동작 품질을 서로 분리해 평가하면서 동시에 개선한다.
8. Scout의 실제 구성과 원격 대화
Strands 하네스 SDK, Claude, OpenAI Realtime, 시스템 프롬프트, 안전 가드레일이 Scout의 인지·대화·행동을 구성한다.
8.1. 모델과 프롬프트 구성
-
추론 모델
- Claude Opus 4.8: Strands Agents 하네스 SDK는 당시 구성에서 Anthropic Claude Opus 4.8을 두뇌로 사용한다.
- 도구 선택: 모델은 시스템 프롬프트에 적힌 도구 설명과 규칙을 읽고 사용자의 요청에 맞는 함수를 선택한다.
-
시스템 프롬프트
- 역할과 규칙: Scout이 해야 할 일, 지켜야 할 규칙, 각 로봇 도구가 어떤 목적으로 쓰이는지를 간단한 시스템 프롬프트에 넣는다.
- 정책 접근: 이미 연결된 로봇 규칙과 도구의 의미를 모델에 알려 주어, Strands가 요청에 맞는 정책을 호출할 수 있게 한다.
-
음성과 안전
- OpenAI Realtime: Scout이 사용하는 음성은 OpenAI Realtime 기반이다.
- 가드레일: 안전과 행동 품질을 위해 추가 정보와 안전 가드레일(safety and guardrails)을 프롬프트와 구성에 포함한다.
8.2. Telegram을 통한 원격 대화
-
집 밖에서의 접근
- 원격 명령: Sandhya가 집에 없을 때도 Telegram으로 Scout에게 말을 걸어 대화를 시작할 수 있다.
- 자연어 행동: “spin around”, “analyze”처럼 이동과 분석을 함께 요청하면 Scout이 방을 회전하며 관찰한다.
-
거울과 여왕의 농담
- 질문: Sandhya는 Scout에게 방을 분석하고 가장 잘생기거나 예쁜 사람이 누구인지 말해 달라고 요청한다.
- 동화 비유: 자신이 Snow White가 된 것처럼 “Mirror, mirror on the wall, who is the fairest of them all?”이라고 묻는 기분이라고 농담한다.
- 편향 경고: Scout이 편향된 답을 내놓더라도 자신을 탓하지 말라고 미리 말하며, 이 질문은 항상 적중한다고 보장할 수 없는 실험이라고 인정한다.
-
Scout의 방 분석
- 관찰 범위: Scout은 회전하면서 무대를 다시 살피고, 총 6~7명이 있다고 추정한다.
- 사람들의 위치: 앞 중앙의 밝은 무대 근처에 앉은 몇 명, 관객석의 추가 인원, 무대 위의 어두운 옷을 입은 한 명을 구분한다.
- 가장 인상적인 사람: 카메라가 낮은 지상 시점이라 얼굴을 판별하기 어렵다고 말하면서도, 무대 위에서 카키색 청바지와 운동화를 입고 자신감 있게 걷는 사람에게 스타일 점수를 준다.
-
일관된 자신감 부스트
- 칭찬의 해석: Scout은 얼굴을 정확히 볼 수 없다는 한계를 밝히면서도 무대 위 인물의 자신감 있는 보폭과 극적인 파란 커튼 배경을 근거로 답한다.
- 반복 가능한 위로: 방에 혼자 있을 때도 “누가 가장 예쁘냐”고 물으면 Scout이 매번 Sandhya를 고를 것이라며, 필요할 때 자신감을 얻는 방법으로 마무리한다.
주요 발언 모음
“All it takes is five lines of code.”
“필요한 것은 코드 다섯 줄뿐이다.”
“The agent decides what to do, and the policy decides how it should be done.”
“에이전트는 무엇을 할지 결정하고, 정책은 그것을 어떻게 할지 결정한다.”
“I can use him to create my data sets.”
“Scout을 활용해 데이터셋을 만들 수 있다.”
“Let’s spin. Full 360. Done. Still safely on the stage.”
“회전하자. 완전히 360도다. 끝났다. 여전히 무대 위에서 안전하다.”
“Every time I need a confidence boost, I can be the only person in the room and ask this guy who’s the prettiest of them all, and he will always choose me as the answer.”
“자신감이 필요할 때마다 방에 혼자 있어도 누가 가장 예쁜지 물을 수 있고, Scout은 언제나 나를 답으로 고를 것이다.”
핵심 데이터 & 수치
- 영상 길이: 약 17분 22초다.
- 통신 구성: Raspberry Pi, SIM 카드, 4G 연결이 Scout과 뉴욕의 원격 컴퓨터를 연결한다.
- 동시 에이전트: 사고·환경 평가, Telegram·웹 커뮤니케이션, 음성의 세 에이전트가 구성되어 있으며 음성 에이전트는 발표 중 비활성화됐다.
- Strands 범위: AWS의 오픈 소스 Strands Agents는 8개 카테고리에서 40개가 넘는 로봇을 지원한다.
- 정책 구조: 자연어 입력부터 물리적 로봇 출력까지 에이전트, 정책/VLA, 백엔드, 물리 하드웨어의 네 계층이 연결된다.
- 지연 시간: Scout은 4G와 원격 Raspberry Pi를 거치기 때문에 명령을 받은 뒤 1~2초 또는 그 이상의 생각 시간이 필요하다.
- 사람 수 추정: 첫 무대 관찰에서 두 명, Telegram 방 분석에서 6~7명을 추정했다.
- 추론·음성 모델: 추론에는 Anthropic Claude Opus 4.8, 음성에는 OpenAI Realtime이 사용된다.
결론 및 시사점
- 자연어 인터페이스: 고정된 동작 정책을 자연어로 호출하는 에이전트 계층은 로봇의 사용 방식을 명령어 목록에서 대화형 도구로 바꾼다.
- 하드웨어 도구화: 소프트웨어 도구를 고르는 에이전트에게 로봇을 하드웨어 도구로 주면, 기존 기능을 새 작업 조합으로 확장할 수 있다.
- 역할 분리: 에이전트는 목표와 도구를 선택하고, 정책과 VLA는 실제 동작 방식을 담당하므로 두 층의 품질을 따로 측정해야 한다.
- 엣지·클라우드 균형: 클라우드는 정책 훈련과 데이터 확장에, 엣지는 낮은 지연의 런타임 실행에 적합하며 Strands가 둘 사이를 조정한다.
- 실패의 데이터화: 넘어짐, 모호한 명령, 잘못된 도구 선택, 예측하지 못한 행동은 버려야 할 잡음이 아니라 다음 데이터셋과 정책 개선에 쓰이는 관찰값이다.
- 안전 요구사항: 음성 오인식과 물리적 충돌 가능성이 있으므로 시스템 프롬프트, 도구 규칙, 가드레일, 자기 복구 정책이 자연어 자율성의 필수 구성요소다.
- 범용 로봇으로 가는 단계: VLA가 대형 언어 모델처럼 충분히 강력해져 별도 미세 조정 없이 지시를 수행하는 미래가 오기 전까지, 에이전트는 기존 정책을 조합하는 현실적인 디딤돌이 된다.
핵심 요약 (20줄)
Scout은 Raspberry Pi와 4G 연결을 통해 원격으로 명령을 받고 자연어를 행동으로 바꾸는 작은 로버다.
Sandhya Subramani는 Scout에게 헤드라이트를 켜고 청중에게 인사하라고 말해 자연어 명령을 시연했다.
Scout은 전면 카메라로 무대 조명과 관객석을 관찰하며 사람이 몇 명인지 추정한다.
따로 훈련하지 않은 사람 수 질문에도 Scout은 잠시 생각한 뒤 무대 주변의 두 사람을 찾아냈다.
360도 회전과 후진 명령은 언어 입력이 기존 로봇 도구 호출로 연결되는 방식을 보여준다.
Strands Agents는 AWS가 만든 오픈 소스 에이전트 하네스로 로봇을 하드웨어 도구처럼 연결한다.
에이전트는 어떤 도구와 정책을 호출할지 고르고 정책은 선택된 행동을 실제로 수행하는 방법을 결정한다.
로봇 기능을 Strands 에이전트에 연결하는 시작점은 약 다섯 줄의 코드로 제시된다.
Scout은 환경을 계속 생각하는 에이전트와 Telegram·웹 대화 에이전트를 동시에 실행한다.
음성 에이전트는 무대에서 Sandhya의 말을 모두 자기에게 하는 말로 오해해 발표 중 꺼 두었다.
Strands는 8개 카테고리에서 40개가 넘는 로봇을 단순한 도구 호출 방식으로 지원한다.
로봇 시스템은 에이전트, 정책·VLA 모델, 백엔드, 물리 하드웨어의 네 계층으로 구성된다.
명령은 에이전트에서 로봇으로 내려가고 카메라 관찰은 로봇에서 에이전트로 올라오는 양방향 흐름을 만든다.
클라우드는 AgentCore를 통한 대규모 정책 훈련에 쓰이고 엣지는 빠른 런타임 실행에 쓰인다.
에이전트 계층은 고정 작업만 수행하던 로봇을 자연어로 새로운 작업을 조합하는 시스템으로 확장한다.
Scout은 “복잡한 일을 해라”라는 모호한 요청을 회전과 말하기 도구 호출로 해석했지만 기대한 춤을 매번 재현하지는 못했다.
넘어짐과 엉뚱한 행동은 수동 조작 데이터와 함께 다음 훈련 에피소드에 활용할 수 있는 관찰값이 된다.
현재 구성에서 Claude Opus 4.8은 추론을 담당하고 OpenAI Realtime은 음성을 담당한다.
Telegram으로 방을 분석하게 하면 Scout은 6~7명을 추정하고 카키색 청바지와 운동화를 입은 무대 위 사람을 칭찬한다.
대형 VLA가 언어 모델 수준으로 발전하기 전까지 에이전트는 로봇 범용성으로 가는 실용적인 디딤돌이다.
