URL: https://www.youtube.com/watch?v=ULhklk4PCO4
날짜: 2026-09-17
채널: Tech Bridge
길이: 12분 45초
발표자: Caitlyn(Anthropic 플랫폼 엔지니어링 리드), Angela(Anthropic 플랫폼 제품 리드)
행사: AI Engineer
자막 기준: 영어 자동 자막 전체 검토 후 한국어 번역
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==에이전트 성능을 높이는 방법은 실행 토큰의 양이나 가격만 늘리는 것이 아니라, 토큰마다 실행·조언·평가·회고 같은 역할을 부여하고 이들을 전략적으로 조합하는 것이다.==
- 일반적인 에이전트는 주어진 토큰 예산을 거의 모두 실행(execution)에 사용하며, 모든 토큰이 사실상 같은 일을 한다고 가정한다.
- 일부 토큰을 조언자(adviser), 채점자(grader), 꿈꾸는 에이전트(dreamer)로 분리하면 실행 결과를 점검하고 다음 시도를 개선할 수 있다.
- 금융 분석 벤치마크에서 예산을 고정해도 역할 분업 전략은 단순 실행보다 높은 정확도를 보여 주며, 동일한 예산에서 활용할 수 있는 추가 성능(alpha)이 발생한다.
- 실제 비즈니스에서는 평균 정확도보다 100% 정답을 얻는 데 필요한 총 토큰 비용과 완벽한 실행의 성공 확률을 함께 봐야 한다.
Anthropic의 두 발표자는 토큰을 무차별적으로 소비되는 자원(fungible resource)으로 보는 가정을 검증한다. 실행 에이전트 하나에 모든 일을 맡기는 대신 서로 다른 역할을 수행하는 토큰을 조합하면, 고정된 예산 안에서도 더 안정적이고 유용한 결과를 만들 수 있다는 것이 실험과 플랫폼 설계의 핵심 결론이다.
1. 토큰 예산을 늘리는 것만으로는 충분하지 않다
에이전트 시스템에서 예산을 키우는 관행은 토큰이 모두 서로 대체 가능하다는 가정 위에 놓여 있지만, 작업의 결과를 개선하는 토큰 사용 방식은 하나가 아니다.
1.1. 실행 토큰 중심의 기본 구조
-
일반적인 에이전트 구성
- 사용자는 에이전트에 달성해야 할 과업을 전달한다.
- 에이전트에는 사용할 수 있는 토큰 예산이 주어진다.
- 예산에 포함된 토큰은 거의 모두 과업을 직접 수행하는 실행(execution)에 투입된다.
- 이 구조에서는 각각의 토큰이 어떤 기능을 담당하는지 구분하지 않으며, 모든 토큰이 실행이라는 한 가지 일을 한다.
-
성능을 높이는 통상적인 레버
- 더 많은 토큰을 쓰면 더 오래 생각하고 더 많은 시도를 할 수 있다.
- 더 비싼 토큰을 사용하면 더 강한 모델이나 더 많은 추론 자원을 투입할 수 있다.
- 그래서 에이전트 시스템을 개선할 때 예산을 늘리는 것이 가장 먼저 선택되는 방법이 된다.
- 그러나 예산 자체를 늘리는 일과 같은 예산을 더 효과적으로 배분하는 일은 서로 다른 문제다.
1.2. 토큰의 대체 가능성에 대한 의문
-
Fungibility 가정의 검증
- 토큰을 모두 대체 가능한(fungible) 단위로 취급하면 어떤 토큰을 실행에 쓰든 결과 차이가 없어야 한다.
- Caitlyn과 Angela는 실제로 모든 토큰이 같은 역할을 해야 하는지 의문을 제기한다.
- 일부 토큰이 실행 외의 일을 맡을 때 결과가 달라지는지 확인하기 위해 토큰에 직무(job)를 부여한다.
-
전략(strategy)의 정의
- 실행하는 토큰 일부와 다른 일을 수행하는 토큰 일부를 조합한 구성을 전략이라고 부른다.
- 다른 역할은 실행 에이전트에게 방향을 제시하거나, 결과를 채점하거나, 지난 시도의 학습 내용을 메모리에 기록하는 일이 될 수 있다.
- 전략의 차이는 같은 양의 토큰을 어디에 배치하느냐에서 생긴다.
2. 토큰에 부여하는 세 가지 역할
실행자 하나를 중심에 두되, 조언·평가·회고를 담당하는 토큰을 별도로 두면 에이전트가 다음 행동을 선택하고 실패를 수정하는 루프를 만들 수 있다.
2.1. Advising: 실행자를 돕는 조언자
-
실행자와 조언자의 분리
- 실행자(executor)는 원래 맡은 과업을 실제로 수행한다.
- 조언자(adviser)는 실행자가 다음 단계를 진행할 때 참고할 조언을 제공한다.
- 실행자는 조언자를 호출해 현재 접근법이나 다음 행동이 올바른지 확인할 수 있다.
- 조언자가 모든 결정을 대신하는 것이 아니라, 실행자가 더 나은 결정을 내리도록 중간 점검을 제공한다.
-
영업 에이전트 사례
- 영업 에이전트가 영업사원의 업무를 보조한다고 가정한다.
- 조언자는 후속 연락이 기한을 넘겼는지 파악할 수 있다.
- 조언자는 거래가 정체되고 있는지 확인하고, 여러 영업 활동이 제대로 이어지고 있는지 점검할 수 있다.
- 실행 에이전트가 각 작업을 처리하는 동안 조언자가 관계의 상태와 누락된 조치를 알려 주면 영업 흐름을 놓칠 가능성이 줄어든다.
2.2. Grading: 명시적 기준으로 결과를 채점하는 평가자
-
루브릭 기반 평가
- 작업의 좋은 결과가 무엇인지 알고 있다면 그 기준을 루브릭(rubric)으로 명시할 수 있다.
- 실행자가 결과를 만들 때마다 채점자(grader)가 루브릭을 읽고 결과의 품질을 평가한다.
- 실행 결과가 기준을 충족하면 작업을 끝낸다.
- 결과가 충분히 좋지 않으면 실행자가 다시 시도하도록 하여 목표에 가까워지는 반복 루프를 만든다.
-
고객 서비스 환불 사례
- 온라인 상점의 고객이 특정 상품에 대해 환불을 요청한다고 가정한다.
- 고객 서비스 에이전트는 어떤 상황에서 환불을 승인할지에 관한 구체적인 기준을 가져야 한다.
- 환불 조건, 고객의 상황, 처리 결과를 루브릭에 담을 수 있다.
- 채점자는 고객 서비스 에이전트의 응답을 기준과 대조해 올바른 결론에 도달했는지 판단한다.
- 응답이 기준을 만족하지 못하면 에이전트가 다시 생성하고, 만족하면 고객에게 답변을 완료한다.
2.3. Dreaming: 지난 작업을 회고해 다음 실행에 반영하는 토큰
-
실행 기록을 읽는 꿈꾸는 에이전트
- 실행자(executor)는 현재 과업을 수행한다.
- 꿈꾸는 에이전트(dreamer)는 실행자의 작업 결과와 트랜스크립트를 검사한다.
- 꿈꾸는 에이전트는 실행 과정에서 발견한 유용한 패턴, 실수, 개선점을 추출한다.
- 추출한 학습 내용을 메모리에 기록하고, 다음 실행 라운드에서 실행자가 다시 읽게 한다.
- 같은 종류의 작업을 반복할수록 실행자가 이전 시도의 교훈을 활용해 더 유용해지는 것이 목표다.
-
채용 에이전트 사례
- 채용 업무는 후보자가 적합한지에 대해 여러 상호작용과 피드백을 필요로 한다.
- 어떤 후보자와 역할이 잘 맞는지 판단하는 과정에는 반복적인 평가와 수정이 들어간다.
- 꿈꾸는 에이전트가 이전 후보자 검토와 피드백의 트랜스크립트를 살펴보면 다음 라운드의 판단을 더 정교하게 만들 수 있다.
- 양쪽이 좋은 적합성을 보였던 조건과 그렇지 않았던 조건을 메모리에 남기면 채용 에이전트가 상호작용을 거듭할수록 유용해진다.
3. 금융 분석 벤치마크로 역할 분업을 검증하다
역할이 다른 토큰이 실제로 추가 가치를 만드는지 확인하기 위해, 전문가 수준의 금융 분석 업무를 모사한 과업 묶음을 만들고 전략별 성능을 비교했다.
3.1. 실험 설계와 실행 기준선
-
전문가 업무를 모사한 과업 벤치마크
- 연구팀은 금융 분석과 관련된 여러 과업으로 벤치마크를 구성했다.
- 목표는 실제 세계의 전문 금융 분석가가 수행할 법한 일을 에이전트가 얼마나 잘 처리하는지 측정하는 것이었다.
- 먼저 실행만 하는 전략을 통제군(control)으로 두고, 같은 과업에 조언·평가·회고 전략을 차례로 적용했다.
-
원샷(oneshot) 비교의 한계
- 첫 실험에서는 각 전략이 한 번만 과업을 수행하게 했다.
- 실행 전략은 정확도 15%에 그쳤다.
- 원샷 실험에서는 전략이 스스로 실제 사용 토큰 수를 선택할 수 있었다.
- 실행 전략은 약 39,000토큰만 사용했기 때문에, 더 복잡한 전략이 더 많은 토큰을 쓴 결과와 단순 비교하기 어려웠다.
- 회고(dreaming) 전략은 매우 좋은 결과를 냈지만 약 600,000토큰을 사용했으므로, 성능 증가가 역할 분업 때문인지 단순한 예산 증가 때문인지 구분할 수 없었다.
3.2. 고정 예산에서 확인한 추가 성능
-
600,000토큰 예산 고정
- 연구팀은 원샷 실험에서 가장 많은 예산을 사용한 회고 전략의 약 600,000토큰을 최대 예산으로 정했다.
- 실행·조언·평가·회고 전략 모두에 동일한 예산을 제공했다.
- 예산을 늘리면 대체로 모든 전략의 성능이 올라가므로, 전체적인 상승 자체는 예상 가능한 결과였다.
-
전략별 정확도 변화
- 실행 전략은 0.15에서 0.76으로 상승했다.
- 조언 전략과 평가 전략은 60%대에서 90%에 가까운 수준으로 상승했다.
- 모든 전략이 같은 토큰 예산을 받았다면 결과도 같아야 한다는 것이 토큰 대체 가능성 가정의 예측이다.
- 실제로는 같은 예산에서도 실행 전략이 76%인 반면 조언 전략은 89%를 기록했다.
- 차이는 작아 보일 수 있지만, 동일한 비용에서 발생한 추가 성능(alpha)이므로 역할 설계를 통해 활용할 수 있는 개선 여지다.
3.3. 금융 분석에서 80% 정답은 실무적으로 실패다
-
벤치마크 점수와 실제 전문가의 업무 차이
- 금융 분석가가 에이전트에게 손익계산서(P&L)를 작성하라고 요청한다고 가정한다.
- 벤치마크에서 80% 정확도를 얻으면 겉으로는 높은 점수처럼 보일 수 있다.
- 하지만 실제 분석가는 틀린 손익 숫자나 비용 숫자를 그대로 사용할 수 없다.
- 80% 결과는 분석가가 손익계산서를 직접 다시 계산하거나, 에이전트에게 한 번 더 실행하게 해야 한다는 뜻이다.
- 이 도메인에서는 일부만 맞는 답보다 모든 항목이 맞는 100% 정확한 답이 실사용의 기준이다.
-
완벽한 실행(pass) 기준으로 재평가
- 연구팀은 결과가 완벽하게 채점되면 통과(pass)시키고, 100%보다 조금이라도 낮으면 실패(failure)로 처리하도록 평가 방식을 바꿨다.
- 변동 예산에서 실행 전략의 완벽한 통과 비율은 약 42%였다.
- 더 복잡한 전략들은 최대 약 75%까지 완벽한 통과 비율을 올렸다.
- 다만 전략마다 한 번의 실행에 사용하는 예산이 달라질 수 있으므로, 이 수치만으로는 실제 비용을 비교할 수 없었다.
4. 완벽한 답에 도달하는 실제 비용을 계산하다
실제 사업에서 중요한 지표는 한 번의 실행에서 얻은 점수만이 아니라, 사용 가능한 완벽한 답 하나를 얻기까지 평균적으로 얼마를 써야 하는지다.
4.1. 성공 확률을 총 토큰 비용으로 환산하기
-
실행 전략의 기대 비용
- 실행 전략은 약 40%의 확률로 완벽한 답을 준다.
- 따라서 평균적으로 약 세 번 실행해야 그중 한 번 완벽한 답을 얻을 수 있다.
- 고정된 개별 실행 예산은 약 600,000토큰이다.
- 세 번 실행하면 완벽한 답을 얻는 데 필요한 평균 총비용은 약 1,800,000토큰(1.8M)이 된다.
-
전략 간 진짜 비용 비교
- 연구팀은 각 전략의 완벽한 통과 확률과 고정 예산을 결합해 유용한 결과 하나의 실제 비용을 계산했다.
- 실행 전략을 기준으로 하면 완벽한 답 하나를 얻는 총 토큰 비용은 약 1.8M이다.
- 조언·평가·회고 전략은 단순 정확도뿐 아니라 완벽한 결과에 도달하는 반복 횟수와 비용 구조에서 서로 다른 특성을 보였다.
- 이 계산은 “더 많은 토큰을 한 번에 쓰는가”보다 “완벽한 답 하나를 얻기 위해 전체적으로 몇 토큰을 쓰는가”가 실무적인 지표임을 보여 준다.
4.2. 사업 목표에 따른 전략 선택
-
토큰 효율을 최우선으로 하는 사업
- 모델 호출 비용이나 처리량이 가장 중요한 사업은 완벽한 답에 도달하는 평균 토큰 수를 줄여야 한다.
- 이런 경우에는 해당 도메인에서 토큰 효율이 가장 좋은 조언 전략을 선택하는 것이 합리적이다.
- 조언자는 실행자가 잘못된 경로로 멀리 돌아가지 않도록 중간 방향을 잡아, 최종적으로 낭비되는 실행을 줄일 수 있다.
-
정답 신뢰성을 최우선으로 하는 사업
- 금융, 고객 응대, 운영 자동화처럼 틀린 결과를 허용하기 어려운 영역은 완벽한 답을 내는 실행 비율을 최대화해야 한다.
- 이런 경우에는 한 번의 실행이 통과할 확률이 높은 전략을 선택해야 한다.
- 실험 결과에 따르면 평가 또는 회고 전략 쪽으로 기울이는 선택이 적합할 수 있다.
- 따라서 모든 기업에 하나의 최적 전략이 있는 것이 아니라, 비용·처리량·신뢰성 중 무엇을 최적화하느냐에 따라 구성이 달라진다.
5. 전략을 실제 에이전트 플랫폼으로 구성하는 방법
역할 분업 전략은 개별 에이전트의 성능만 개선하는 기법이 아니라, 에이전트들을 조정하는 메타 하네스(meta-harness) 수준의 아키텍처로 확장된다.
5.1. 개별 에이전트 하네스에서 메타 하네스로
-
개별 에이전트 하네스
- Anthropic은 Cloud Managed Agents에 제공하는 에이전트형 솔루션을 위해 개별 에이전트를 실행하는 하네스를 구축했다.
- 이 하네스는 에이전트가 과업을 수행하고 도구를 호출하며 결과를 반환하는 기본 실행 환경이다.
- 실행만 담당하는 단일 에이전트는 이 수준의 기능으로도 동작할 수 있다.
-
다중 에이전트 오케스트레이션 계층
- 그 위에 메타 하네스 수준의 다중 에이전트 오케스트레이션과 실행 계층을 추가한다.
- 이 계층은 실행자와 조언자, 채점자, 회고 에이전트 사이의 작업 분배와 결과 전달을 조정한다.
- Anthropic의 Cloud Managed Agents에는 회고와 결과 처리 같은 일부 기능이 기본 프리미티브로 제공된다.
- 충분한 프리미티브와 조정 계층이 있으면 새로운 전략을 비교적 쉽게 조립할 수 있다.
5.2. 역할을 직렬·반복 루프로 조합하기
-
조언과 실행의 결합
- 하나의 과업을 실행자에게 맡기면서 동시에 조언자가 다음 행동을 제시하게 할 수 있다.
- 데모에서는 Fable이라는 에이전트가 실행자를 조언하는 역할을 맡는다.
- 실행자는 Fable의 조언을 참고해 과업을 계속 진행한다.
-
조언·평가·회고의 연쇄
- 실행 결과를 채점자에게 보내 기준을 만족하는지 검증할 수 있다.
- 통과하지 못하면 평가 결과를 다시 실행 루프로 보내 수정하게 한다.
- 통과한 결과와 관련 맥락은 Dreaming에 보내 다음 실행을 개선할 학습으로 남길 수 있다.
- 이렇게 하면 조언이 방향을 잡고, 평가가 결과를 검증하며, 회고가 다음 실행을 개선하는 구조가 된다.
-
새로운 역할과 대규모 아키텍처
- 조정에 필요한 프리미티브가 갖춰지면 이 세 가지 전략에만 머물 필요가 없다.
- 동적인 문제의 유형에 맞춰 여러 에이전트와 역할을 조합한 대규모 아키텍처를 만들 수 있다.
- 실행 전 계획 수립, 실행 중 감시, 실행 후 검증과 기록처럼 새로운 직무를 토큰에 부여할 수도 있다.
- 핵심은 고정된 패턴을 복사하는 것이 아니라 문제의 비용·신뢰성·학습 요구에 맞는 역할 조합을 설계하는 일이다.
5.3. 장기적인 플랫폼 목표
-
동적 전략 구성
- Anthropic은 모델과 플랫폼이 점점 더 좋아지면서 사용자가 일을 수행할 때 필요한 전략을 동적으로 구성하는 수준을 목표로 한다.
- 시스템이 과업의 성격과 사업 목표를 보고 실행·조언·평가·회고의 조합을 선택하는 방향이다.
- 현재는 개발자가 프리미티브를 조립하지만, 장기적으로는 플랫폼이 적합한 전략을 자동으로 만들 수 있다.
-
현재 사용자가 할 수 있는 일
- 그 수준에 도달하기 전까지는 토큰에 직무를 부여한다는 관점으로 에이전트 설계를 다시 볼 수 있다.
- 단순히 예산을 늘리는 대신 조언자·채점자·회고자의 비용이 실행 결과에 어떤 가치를 더하는지 측정해야 한다.
- 토큰 효율을 최적화할지, 완벽한 답의 성공 확률을 최적화할지 먼저 정한 뒤 전략을 선택해야 한다.
- 같은 프리미티브를 여러 방식으로 결합하고 실제 과업의 성공 기준과 총비용으로 평가해야 한다.
주요 발언 모음
“We think that token should have jobs.”
“Tokens are not fungible.”
“If you’re not 100% accurate, it’s actually not useful.”
“You should give your tokens jobs.”
위 발언들은 토큰을 단순히 소모하는 계산량으로 보지 않고, 실행 결과를 개선하는 조직의 구성원처럼 역할별로 배치해야 한다는 발표의 핵심을 압축한다. 정확도 평균이 높아도 완벽한 결과가 필요한 도메인에서는 실용성이 없을 수 있으므로, 역할 설계와 성공 기준을 함께 정의해야 한다.
핵심 데이터 & 수치
- 15% 정확도: 원샷 실행 전략이 약 39,000토큰을 사용했을 때의 기준선 성능이다.
- 약 600,000토큰: 원샷 비교에서 회고 전략이 사용한 최대 수준의 예산이며, 이후 고정 예산 실험의 기준이 됐다.
- 76% 대 89%: 동일한 고정 예산에서 실행 전략과 조언 전략이 기록한 정확도다.
- 약 42%: 변동 예산 조건에서 실행 전략이 100% 정확한 결과를 내고 통과한 비율이다.
- 최대 약 75%: 같은 완벽 통과 기준에서 더 복잡한 전략들이 기록한 수준이다.
- 약 1.8M 토큰: 실행 전략으로 완벽한 답을 얻기 위해 평균 세 번의 600,000토큰 실행이 필요하다고 계산한 총비용이다.
- 100% 기준: 금융 분석처럼 숫자 하나의 오류도 허용하기 어려운 업무에서 실사용 가능한 결과로 인정하는 기준이다.
결론 및 시사점
- 토큰을 모두 실행에 투입하는 구조는 예산을 늘리는 만큼만 성능을 얻는 단순한 방식이다.
- 조언자는 실행자의 방향을 잡고, 채점자는 명시적 기준으로 결과를 검증하며, 회고자는 다음 라운드에 학습을 전달한다.
- 같은 토큰 예산을 받더라도 역할을 나눈 전략은 단일 실행 전략과 다른 정확도와 성공 확률을 만들 수 있다.
- 금융 분석처럼 100% 정답이 필요한 업무에서는 평균 점수보다 완벽한 답 하나의 기대 비용을 계산해야 한다.
- 토큰 효율이 중요하면 조언 전략을, 결과 신뢰성이 중요하면 평가나 회고 전략을 우선 검토할 수 있다.
- 실행·조언·평가·회고 프리미티브를 메타 하네스에서 조합하면 업무별 대규모 오케스트레이션 아키텍처를 만들 수 있다.
- 장기적으로는 플랫폼이 과업과 최적화 목표에 맞는 토큰 역할 조합을 동적으로 구성하는 방향으로 발전할 가능성이 크다.
- 에이전트 시스템을 설계할 때 “예산을 얼마나 늘릴까?”와 함께 “각 토큰이 어떤 직무를 맡아야 할까?”를 물어야 한다.
핵심 요약 (20줄)
- 에이전트 성능은 실행 토큰의 양만 늘리는 방식으로만 개선되지 않는다.
- 모든 토큰이 같은 일을 한다는 fungibility 가정을 검증하려면 역할별 배치가 필요하다.
- 실행자는 주어진 과업을 직접 처리하는 기본 역할을 맡는다.
- 조언자는 실행자에게 다음 행동과 접근법에 대한 방향을 제공한다.
- 영업 조언자는 후속 연락 지연과 거래 정체를 감지할 수 있다.
- 채점자는 루브릭으로 실행 결과의 품질과 기준 충족 여부를 판단한다.
- 고객 서비스 채점자는 환불 조건에 맞는 응답인지 검증할 수 있다.
- 꿈꾸는 에이전트는 실행 결과와 트랜스크립트를 읽고 학습을 메모리에 쓴다.
- 채용 에이전트는 후보자 피드백을 회고해 다음 판단을 정교하게 만들 수 있다.
- 금융 분석 벤치마크는 전문 분석가의 실제 과업을 모사하도록 구성됐다.
- 원샷 실행 전략은 약 39,000토큰으로 15% 정확도를 기록했다.
- 약 600,000토큰을 고정 예산으로 주자 모든 전략의 성능이 상승했다.
- 동일 예산에서도 실행 전략은 76%, 조언 전략은 89% 정확도를 기록했다.
- 금융 업무에서는 80% 정확도가 아니라 100% 정확도가 실사용의 기준이다.
- 실행 전략의 완벽 통과율은 약 42%, 복잡한 전략은 최대 약 75%였다.
- 실행 전략으로 완벽한 답을 얻는 평균 총비용은 약 1.8M 토큰으로 계산됐다.
- 토큰 효율이 중요하면 조언 전략, 신뢰성이 중요하면 평가·회고 전략이 유리할 수 있다.
- Anthropic은 개별 에이전트 하네스 위에 메타 하네스 오케스트레이션 계층을 둔다.
- 조언·실행·평가·회고를 연결하면 통과할 때까지 검증하고 다음 실행을 개선할 수 있다.
- 에이전트 설계의 핵심 질문은 예산 규모뿐 아니라 토큰별 직무 배치다.
