URL: https://www.youtube.com/watch?v=x4e5O9zN0TE
날짜: 2026-09-27
채널: aiDotEngineer
발표자: Erina Karati (Microsoft와 Supercell 출신 엔지니어)
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==오랜 시간 동안 상태(state)를 유지하는 에이전트는 프롬프트를 손으로 다듬거나 한 번의 멋진 데모로 개선할 수 없으며, 통제된 시나리오·실행 추적·행동 점수표를 이용한 반복 실험으로 개선해야 한다.==
- 게임 속 여러 에이전트는 서로 다른 기억·감정·믿음·목표를 유지하므로 단일 응답보다 사회적 행동의 시간적 일관성이 중요하다.
- RAG 메모리만 추가하면 정보의 출처·확실성·현재 믿음과 원시 사건 기억을 구분하지 못하는 문제가 해결되지 않는다.
- 자동 연구(auto research)는 마을 안의 또 다른 에이전트가 아니라 전체 실행 기록을 읽고, 작은 정책 표면(policy surface)만 수정한 뒤, 점수와 가드레일을 통과한 변경만 보존하는 외부 실험 루프다.
발표자는 Supercell AI Innovation Lab의 Project Paradox를 장기 상태 에이전트의 실험대(lab bench)로 설명한다. 멀티 에이전트가 무엇을 알고, 누가 누구에게 무엇을 전했으며, 무엇이 사실·소문·오래된 정보인지 계속 보존해야 하므로 핵심 문제는 애니메이션이나 대화 생성 자체가 아니다. 문제는 과거 상태가 미래 행동을 어떻게 바꾸는지를 통제하고 검증하는 것이다.
1. Project Paradox: 게임 안에서 살아 움직이는 멀티 에이전트
Project Paradox는 게임 개발자가 지능형 자율 에이전트를 비디오 게임에 꽂아 넣을 수 있도록 만든 모듈형 AI 프레임워크다. 에이전트는 플레이어뿐 아니라 다른 플레이어·에이전트와 상호작용하고, 경쟁하거나 협력하며, 동적인 게임 동료(game companion)가 된다.
1.1. 에이전트가 수행하는 행동
-
의도를 가진 이동
- 에이전트는 아무 위치로든 이동할 수 있고 특정 사람을 찾아갈 수 있다.
- 이동은 단순한 경로 추적이 아니라 각자의 기억, 감정, 호기심에 의해 유도된다.
-
환경과의 상호작용
- 에이전트는 물체를 집어 들고 원하는 곳에 내려놓을 수 있다.
- 주변에 어떤 물체·캐릭터·다른 에이전트가 있는지 환경의 맥락을 인식한다.
- 프레임워크에 새 행동을 추가할 수 있으므로, 기본적인 물체 배치 외에도 게임 개발자가 에이전트가 수행할 동작을 확장할 수 있다.
-
사건에 따른 내적 상태 변화
- 주변에서 발생하는 사건에 반응하며, 사건은 에이전트의 믿음과 감정을 즉시 바꾼다.
- 에이전트가 다른 에이전트나 플레이어에게 먼저 다가가 대화를 시작할 수 있어 게임 세계가 더 살아 있는 것처럼 보인다.
- 대화 내용은 에이전트의 기억에 저장되고, 이후 감정·믿음·목표에 영향을 준다.
1.2. 의도적으로 상태를 보존한 아키텍처
-
에이전트별 메모리 네임스페이스
- 각 에이전트는 RAG(Retrieval-Augmented Generation)로 뒷받침되는 독립 메모리 공간을 가진다.
- 한 에이전트의 기억이 다른 에이전트의 기억으로 새어 들어가지 않도록 메모리를 분리했다.
-
감정 벡터
- 감정은 기쁨(joy), 슬픔(sadness), 두려움(fear), 분노(anger), 혐오(disgust) 같은 값을 담는 작은 벡터로 관리한다.
- 사건이나 대화가 끝나면 이 값들이 갱신되어 이후 행동에 영향을 준다.
-
상대방에 대한 믿음과 신뢰 행렬
- 에이전트는 다른 에이전트와 플레이어 각각에 대해 믿음 점수를 가진다.
- 상호작용 뒤 언어 모델(LM)은 상대에 대한 신뢰 점수를 올릴지, 내릴지, 그대로 둘지를 결정한다.
-
기억의 중요도 점수와 별도 캐시
- 모든 기억에는 중요도 점수가 부여된다.
- 며칠 전 먹은 저녁 메뉴는 잘 잊지만, 며칠 전 살인 사건 같은 강한 사건은 기억한다는 비유처럼, 모델이 사건의 중요도를 평가한다.
- 중요도 점수가 임계값을 넘으면 해당 기억을 별도 캐시에 저장해 나중에 중요한 맥락으로 더 잘 검색할 수 있게 한다.
1.3. 짧은 상호작용에서의 작동 예시
-
Blossom의 피크닉 계획
- 플레이어가 캐릭터 Blossom에게 함께 피크닉을 가자고 요청한다.
- Blossom은 페이스트리 하나를 집어 들고 피크닉 장소로 이동한다.
- 대화가 진행되는 동안 표면에 드러나지 않게 목표 달성에 필요한 행동 순서를 계획한다.
- 이후 플레이어가 Blossom에게 다시 말을 걸면 앞서 있었던 요청과 행동의 맥락에 맞춰 답한다.
-
짧은 시간 범위에서의 성공
- 캐릭터는 계획을 세우고 이동하며 대화할 수 있다.
- 최근 상호작용을 기억해 플레이어나 다른 캐릭터에게 상황에 맞는 반응을 보인다.
- 그러나 이 성공은 짧은 게임플레이 범위에서의 성공이며, 시간이 길어지면 사회적 일관성이 약해진다.
2. 장기 시야에서 드러나는 상태와 사회적 일관성의 붕괴
2.1. 망고 세일 소문 사례
-
정보가 여러 에이전트를 거치는 과정
- 에이전트 A가 망고 세일에 관한 소문을 에이전트 B에게 퍼뜨린다.
- B는 그 정보를 받아 다른 에이전트에게 다시 전달한다.
- 그 사이에 여러 사건과 대화가 발생하고 시간이 흐른다.
-
나중의 질문에서 나타난 실패
- 플레이어가 한 에이전트에게 망고 세일을 물으면, 시스템은 기대했던 맥락을 정확히 보존하지 못할 수 있다.
- 시스템은 소문의 대략적인 주제는 기억해도 누가 처음 말했는지라는 출처를 잃는다.
- 단순한 소문이 사실로 굳어져 에이전트가 불확실한 정보를 확정된 사실처럼 말할 수 있다.
- 반대로 에이전트가 사실을 알고 있어도 행동 계획을 만드는 순간 그 사실을 기억하거나 실행하지 못할 수 있다.
-
문제의 본질
- 정보 전달의 성공 여부가 단일 답변의 품질로 끝나지 않고, 여러 사건을 거친 뒤에도 사회적 상태가 유지되는지에 달려 있다.
- 따라서 질문은 “이번 응답이 괜찮았는가?”가 아니라 “긴 시간 동안 멀티 에이전트 시스템의 사회적 행동을 어떻게 개선할 것인가?”가 된다.
2.2. 공통 메모리 없이 형성되는 각자의 관점
-
마을 에이전트의 제한된 지식
- 마을의 에이전트들은 공유 데이터베이스나 공통 메모리를 사용하지 않는다.
- 각자는 직접 보거나, 듣거나, 기억하거나, 추론한 것만 알고 있다.
- 정보는 다른 에이전트가 올바르게 전달할 때에만 이동한다.
-
출처와 확실성의 손실
- 전달을 거듭하면 원래 발화자와 전달 경로가 사라질 수 있다.
- “누군가 떠날지도 모른다”는 가능성은 전달 과정에서 “그가 떠난다”는 확정 문장으로 변질될 수 있다.
- 알고 있는 사실이 계획 단계에서 사용되지 않는 단절도 생길 수 있다.
3. 자동 연구를 에이전트 마을 바깥의 실험 루프로 배치하기
3.1. 프롬프트 튜닝과 한 번의 데모를 넘어
-
자동 연구에 관심을 갖게 된 계기
- 발표자는 Andrej Karpathy가 몇 달 전 소개한 auto research에서 영감을 받았다.
- 시스템 스스로 실험을 실행하게 만들 수 있다면 Project Paradox의 장기 사회 행동도 개선할 수 있는지 질문했다.
-
실험 중심의 접근
- 손으로 프롬프트를 조정하거나 한 번의 멋진 데모를 관찰하는 대신, 통제된 시나리오 묶음(scenario suite)을 정의한다.
- 에이전트를 실행하고 전체 trace를 수집한다.
- 행동을 점수화한 뒤, 작은 정책 표면을 변경한다.
- 실제 점수가 개선된 변경만 남기고 나머지는 버린다.
-
두 시스템의 역할 분리
- Project Paradox는 에이전트와 사회적 상호작용을 실행하는 실험대(lab bench)다.
- 자동 연구는 실험대 바깥에서 반복 실행·평가·정책 변경을 담당하는 실험 루프다.
- 목표는 단순히 RAG 검색률을 높이는 것이 아니라, 에이전트 프로토콜 전체를 최적화하는 것이다.
3.2. 최적화 대상: 에이전트 프로토콜
-
기억과 검색
- 에이전트가 기억을 어떻게 쓰는지 결정한다.
- 어떤 기억을 언제 검색하고, 원시 사건 기억과 현재의 믿음을 어떻게 연결할지 정한다.
-
불확실성과 출처
- 에이전트가 정보의 불확실성을 전달하는 방식을 다룬다.
- 누가 말했는지, 직접 본 것인지 전해 들은 것인지, 검증됐는지를 보존한다.
-
사회적 상태와 재계획
- 다른 에이전트에 대한 신뢰를 어떻게 갱신할지 정한다.
- 새 사실이 들어왔을 때 기존 계획을 언제 폐기하고 다시 계획할지 정의한다.
3.3. 자동 연구 루프의 단계
-
통제 시나리오 정의
- 한 에이전트가 공공 사실을 배우거나 다른 에이전트가 소문을 듣는 식으로, 기대 결과를 명시한 상황을 만든다.
- 장기 사회 행동은 그냥 세계를 돌아다니게 해서는 평가하기 어려우므로, 측정 가능한 사건 순서를 먼저 고정한다.
-
시뮬레이션과 구조화된 추적 수집
- 에이전트들이 시나리오를 수행하게 한다.
- 관찰 내용, 대화, 메모리 쓰기, 검색, 믿음 갱신 등 관련 정보를 구조화된 trace로 기록한다.
-
행동 평가
- 정보가 예상한 방식으로 퍼졌는지 확인한다.
- 누가 소문을 시작했는지라는 출처가 살아 있는지 확인한다.
- 불확실한 정보가 끝까지 불확실하게 유지되는지 확인한다.
- 에이전트가 실제로 알고 있던 것에 근거해 행동했는지 확인한다.
-
작은 정책 변경과 재실행
- 자동 연구 계층은 애플리케이션 전체를 다시 쓰지 않고, 통제된 정책 표면의 일부만 바꾼다.
- 변경 뒤 같은 시나리오를 다시 실행한다.
- 점수가 좋아지고 가드레일을 지키면 변경을 유지한다.
- 그렇지 않으면 이전 버전으로 되돌린다.
4. 시나리오 스위트: 사회적 행동을 측정 가능한 문제로 바꾸기
4.1. 자유롭게 돌아다니는 데모가 부족한 이유
-
그럴듯함과 개선 가능성의 차이
- 에이전트를 환경에 풀어 놓으면 멋진 움직임과 재미있는 상호작용이 나올 수 있다.
- 하지만 그 결과만으로 시스템이 실제로 개선됐는지는 판단하기 어렵다.
- 사회적 행동은 본래 모호하므로, 전후 비교가 가능한 통제 조건이 필요하다.
-
시나리오 스위트의 원칙
- 발표자가 든 사례가 모든 에이전트에 보편적으로 적용된다는 뜻은 아니다.
- 중요한 것은 장기 시야 에이전트가 하나의 데모가 아니라 여러 종류의 시나리오 묶음에서 시험되어야 한다는 점이다.
4.2. 대표 통제 시나리오
-
공공 사실의 확산(public fact diffusion)
- 에이전트 A가 “빵집이 내일 문을 닫는다”는 사실을 학습한다.
- 올바른 에이전트들이 이 사실을 알게 되는지 확인한다.
- 각 에이전트가 누가 무엇을 말했는지 기억하는지 확인한다.
- 이 사실에 따라 기존 계획을 변경하는지 확인한다.
-
소문의 불확실성(rumor uncertainty)
- 에이전트 A가 “에이전트 C가 마을을 떠날지도 모른다”는 말을 듣는다.
- 소문이 여러 사람에게 전해진 뒤에도 “떠날지도 모른다”가 유지되는지 확인한다.
- 불확실한 가능성이 “떠난다”는 사실로 굳어지지 않는지 측정한다.
-
재계획(replanning)
- 그룹이 이동 계획을 세운다.
- 한 에이전트가 예정 경로가 막혔다는 사실을 새로 알아낸다.
- 에이전트들이 이 정보를 서로 전달해 잘못된 계획이나 불가능한 행동을 피하는지 확인한다.
- 새 정보에 맞춰 계획을 바꾸는 속도와 행동의 일관성을 측정한다.
4.3. 망고 사례에서 관찰된 개선
- 자동 연구 루프를 한 번 실행하고 긴 시간이 지난 뒤 플레이어가 다시 망고 세일을 물었다.
- 초기 실행과 달리, 에이전트가 이번에는 질문에 맥락에 맞게 답했다.
- 이 사례는 접근법의 가능성을 보여 주지만, 반복된 현재 루프 결과가 충분하지 않은 상태에서 시스템이 일반적으로 개선됐다고 주장해서는 안 된다는 발표자의 신중한 태도도 함께 보여 준다.
5. 단일 점수가 아닌 균형 잡힌 행동 점수표
5.1. 측정 항목의 구성
-
확산(diffusion)
- 시뮬레이션 종료 시점에 몇 명의 에이전트가 사실을 알고 있는지로 도달 범위를 측정한다.
-
출처 보존(provenance)
- 해당 사실을 아는 에이전트 중 몇 명이 정보의 출처를 기억하는지 측정한다.
- 정보가 어디에서 왔는지와 누가 전달했는지를 함께 본다.
-
소문 처리
- 불확실성이 끝까지 보존되는지 측정한다.
- 소문이 사실로 잘못 바뀌는 비율(false certainty rate)을 측정한다.
-
계획과 재계획
- 에이전트들이 업데이트된 정보에 따라 일관된 행동을 하는지 본다.
- 변화된 세계를 인지한 뒤 재계획에 걸리는 시간을 측정한다.
-
프라이버시
- 공개되어야 할 정보와 비공개 정보가 구분되는지 본다.
- 사적인 정보가 의도하지 않은 에이전트에게 퍼지지 않고 containment를 유지하는지 측정한다.
5.2. 단일 목표 최적화의 부작용
-
확산만 높일 때
- 에이전트가 모든 정보를 무차별적으로 공유하는 전략을 학습할 수 있다.
- 공공 사실의 도달률은 올라가도 사적인 정보까지 유출될 수 있다.
-
기억 회상만 높일 때
- 오래되어 더 이상 유효하지 않은 기억을 현재의 사실처럼 사용하는 문제가 생길 수 있다.
- 잡음이 많은 기억이나 잘못된 기억까지 과도하게 보존할 수 있다.
-
균형 점수표의 역할
- 여러 목표를 동시에 평가해야 자동 연구 에이전트가 하나의 숫자만 올리는 방식으로 평가를 속이는(gamify) 일을 막을 수 있다.
- 발표자가 강조한 것은 정확한 공식보다 확산·출처·불확실성·계획·프라이버시를 함께 보는 점수표의 형태다.
6. 자동 연구가 검색할 수 있는 작은 정책 표면
6.1. 변경 권한을 제한해야 하는 이유
- 자동 연구 계층이 코드베이스 전체를 무작위로 다시 쓰도록 허용해서는 안 된다.
- 하네스, 시나리오, 측정 지표는 고정해야 한다.
- 최적화하려는 부분만 노출하면 탐색에 충분한 공간을 주면서 평가 자체를 조작하는 것을 막을 수 있다.
- 이 차이가 언어 모델이 무작위 패치를 작성하는 것과 통제된 정책 공간 안을 실제로 검색하는 것의 차이다.
6.2. Project Paradox에서 노출할 수 있는 정책
- 메모리 작성 정책
- 메모리 검색 정책
- 에이전트 간 커뮤니케이션 프롬프트
- 믿음과 신뢰 갱신 규칙
- 정보 출처(attribution) 보존 규칙
- 재계획 트리거
6.3. 실패 유형별로 탐색할 수 있는 변경
-
출처가 사라지는 경우
- 메모리에 원 출처를 보존하도록 정책을 바꾼다.
- 메모리 작성과 요약 단계에 출처 필드를 함께 기록하게 한다.
-
소문장이 사실로 굳는 경우
- 정보가 직접 관찰된 것인지, 다른 사람에게 들은 것인지 신뢰도 표시를 저장한다.
- 불확실한 주장을 다시 전달할 때 완곡한 표현(hedging)을 요구한다.
-
공공 사실이 한 지역에 머무는 경우
- 유용한 공공 사실을 다른 종류의 정보로 분류한다.
- 에이전트가 출처 근거와 함께 중요한 공공 정보를 능동적으로 공유하게 한다.
-
작은 변경의 시스템적 영향
- 수정 자체는 에이전트 프로토콜의 작은 부분에 머문다.
- 그러나 멀티 에이전트 사회 전체의 정보 전달과 행동에는 더 큰 변화가 나타날 수 있다.
- 따라서 통제 가능할 만큼 작고, 사회적 행동을 바꿀 만큼 풍부한 표면을 고르는 것이 핵심이다.
7. 메모리만으로는 장기 행동이 만들어지지 않는다
7.1. RAG를 추가해도 남는 문제
- 에이전트에 RAG 메모리를 붙이는 것만으로는 원하는 장기 시야 행동을 얻을 수 없다.
- 에이전트는 정보 자체뿐 아니라 그 정보가 어디에서 왔는지도 알아야 한다.
- 정보가 직접 관찰된 것인지, 간접적으로 들은 것인지, 검증됐는지, 불확실한지를 보존해야 한다.
7.2. 기억과 현재 믿음의 분리
- 원시적인 사건 기억(episodic memory)과 에이전트가 현재 믿는 내용을 구분해야 한다.
- 과거에 “누군가 C가 떠날지도 모른다고 말했다”는 기억과, 현재 C가 실제로 떠난다는 믿음은 같은 데이터가 아니다.
- 이 구분이 없으면 추측이 사실로 굳거나, 오래된 정보가 현재 행동을 잘못 유도한다.
7.3. 분위기가 아니라 시나리오로 검증하기
- 그럴듯한 대화나 활기찬 움직임을 보고 시스템이 좋아졌다고 판단해서는 안 된다.
- 출처, 불확실성, 프라이버시, 재계획 같은 행동을 시나리오로 재현하고 측정해야 한다.
- 장기 상태 시스템에서는 기억 구조, 정책, 측정이 함께 설계되어야 한다.
8. 롤백과 가드레일을 포함한 래칫(ratchet)형 개선
8.1. 한 가지 개선이 다른 실패를 만들 수 있다
- 공공 사실을 더 빠르게 퍼뜨리는 정책은 사적 정보를 유출할 수 있다.
- 기억 회상을 높이는 정책은 오래된 기억의 사용을 늘릴 수 있다.
- 사회적 행동을 최적화할 때 한 지표의 개선을 전체 개선으로 오해하면 위험하다.
8.2. 보존 조건이 있는 반복 루프
- 작은 정책 변경을 시도한다.
- 균형 잡힌 점수표로 결과를 측정한다.
- 주요 점수와 가드레일이 모두 좋아졌을 때만 변경을 보존한다.
- 한 항목을 올리는 대신 다른 항목을 훼손하면 즉시 이전 버전으로 롤백한다.
- 이 과정을 발표자는 “변경을 시도하고, 점수를 매기고, 점수표와 가드레일이 개선된 경우에만 전진하는 래칫”으로 설명한다.
9. 게임 밖의 장기 상태 에이전트에 적용하기
9.1. 도메인별로 필요한 상태 관리
-
고객지원 에이전트
- 어떤 정책 업데이트가 어느 출처에서 왔는지 알아야 한다.
- 새 답변이 이전 답변을 대체하는지 판단해야 한다.
-
개인 비서
- 사용자와 과거에 한 약속을 기억해야 한다.
- 사용자가 약속을 바꾸면 이전 커밋먼트를 수정해야 한다.
-
연구 에이전트
- 출처와 인용(provenance/citation)을 보존해야 한다.
- 서로 모순되는 자료를 처리하고, 새로운 증거에 따라 가설을 갱신해야 한다.
-
코딩 에이전트
- 여러 이슈, 파일, 팀원, 변경되는 요구사항을 가로질러 맥락을 유지해야 한다.
- 한 번의 코드 생성 결과보다 장기 작업의 상태와 누적된 결정이 중요하다.
-
워크플로 에이전트
- 접근 권한과 인계(handoff)를 관리해야 한다.
- 외부 세계가 바뀌면 기존 작업을 재계획해야 한다.
9.2. 공통된 추상화
- 이들 시스템은 모두 시간에 걸쳐 상태를 유지한다.
- 유지된 상태가 이후 행동에 영향을 준다.
- 따라서 게임 에이전트와 마찬가지로 통제된 시나리오와 행동 점수표가 필요하다.
10. 장기 시야 에이전트를 위한 실전 레시피
10.1. 구현 순서
- 하네스를 고정한다.
- 평가할 시나리오를 정의한다.
- 실행 trace를 기록한다.
- 행동을 여러 지표로 점수화한다.
- 변경 권한을 작은 정책 표면에만 노출한다.
- 정책 변경 후보를 그 제한된 공간에서 탐색한다.
- 측정과 가드레일을 모두 통과한 변경만 남긴다.
10.2. 최종 성공 기준
- 한 번의 데모가 자연스러워 보이는가가 기준이 아니다.
- 통제된 여러 실행에서 시스템이 실제로 더 나은 행동을 하는지가 기준이다.
- 핵심 질문은 “통제된 실행을 반복했을 때 시스템이 더 잘 행동하는가?”이다.
주요 발언 모음
“장기 시야 에이전트는 프롬프트만이 아니라 실험이 필요합니다.”
“메모리는 여기서 충분하지 않습니다.”
“하네스를 고정하고, 시나리오를 정의하고, trace를 기록하고, 행동을 점수화하고, 작은 정책 표면만 노출하세요.”
“한 번의 데모를 믿거나 프롬프트를 끝없이 손으로 조정하는 대신, 통제 실험을 실행하고 측정에서 살아남은 변경만 유지해야 합니다.”
“Project Paradox의 더 깊은 엔지니어링 문제는 애니메이션이나 대화가 아니라, 어떤 에이전트가 무엇을 알고, 누가 누구에게 무엇을 말했으며, 무엇이 사실·불확실·오래된 정보인지, 그리고 에이전트가 기억한 내용대로 행동하는지였습니다.”
핵심 데이터 & 수치
- 영상 길이: 약 21분 19초 분량의 발표다.
- 핵심 상태 요소: 에이전트별 RAG 메모리, 감정 벡터, 상대방별 믿음·신뢰 점수, 기억 중요도 점수와 별도 캐시가 소개됐다.
- 점수표 축: 정보 확산, 출처 보존, 소문 불확실성·오보율, 행동 일관성·재계획 시간, 프라이버시 containment를 함께 측정한다.
- 변경 표면 예시: 메모리 쓰기·검색, 커뮤니케이션 프롬프트, 믿음·신뢰 규칙, 출처 보존, 재계획 트리거로 제한한다.
- 성공 사례: 망고 세일 소문을 장기간 전달한 뒤 질문했을 때, 자동 연구 루프 이후 에이전트가 이전보다 맥락에 맞게 답했다.
결론 및 시사점
- 장기 시야 에이전트의 품질은 한 응답의 유창함보다 시간이 흐른 뒤에도 지식·출처·불확실성·계획이 일관되게 유지되는지로 평가해야 한다.
- RAG 메모리는 필요한 기반이지만, 출처·확실성·현재 믿음과 원시 사건을 구분하는 프로토콜이 없으면 장기 행동을 보장하지 못한다.
- 자유로운 데모 대신 공공 사실 확산, 소문 보존, 경로 변경에 따른 재계획 같은 통제 시나리오를 만든다.
- 전체 실행의 trace를 남기고, 확산률 하나가 아니라 출처·불확실성·프라이버시·계획을 함께 보는 균형 점수표를 사용한다.
- 자동 연구 에이전트에는 코드베이스 전체가 아니라 작고 명시적인 정책 표면만 열어 준다.
- 변경은 점수와 가드레일을 모두 개선한 경우에만 보존하고, 부작용이 생기면 즉시 롤백한다.
- 이 실험 패턴은 게임뿐 아니라 고객지원·개인 비서·연구·코딩·워크플로 에이전트처럼 상태가 미래 행동을 바꾸는 모든 시스템에 적용된다.
- 장기 에이전트를 만드는 실용적인 순서는 하네스 고정 → 시나리오 정의 → trace 기록 → 행동 점수화 → 작은 정책 공간 탐색 → 검증된 변경만 보존이다.
