URL: https://www.youtube.com/watch?v=XPj3mIKEtI4
날짜: 2026-10-09
채널: AI Engineer (aiDotEngineer)
발표자: William(Will) Lyon, Neo4j Senior Product Manager
원문 제목: Turning Agent Memory Into Skills That Work — Will Lyon, Neo4j
메타데이터
- 영상 ID:
XPj3mIKEtI4 - 재생 시간: 18분 40초
- 촬영/행사: AI Engineer World's Fair 2026, San Francisco
- 주제 태그:
#KnowledgeGraph#AgentMemory#AIEngineer - 관련 링크: Neo4j Agent Memory Service (NAMS), Will Lyon, Agent Skills 표준
- 핵심 제품: Neo4j Agent Memory Service(NAMS), Neo4j Labs 오픈소스 도구
- 주의: 발표의 자동 자막에서 Neo4j가 “NearJ”, “Near Forj” 등으로 잘못 인식된 부분은 문맥상 Neo4j로 교정했다.
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==에이전트가 과거 실행에서 얻은 기억을 어떻게 연결되고 추적 가능하며 실제로 실행할 수 있는 스킬로 바꿀 것인가?==
- 임베딩과 검색은 관련 텍스트를 찾아 컨텍스트에 넣을 뿐이며, 그 자체로 실행 가능한 지식이 되지 못한다.
- 에이전트 메모리는 단기 기억(short-term), 장기 기억(long-term), 추론 기억(reasoning memory)을 하나의 컨텍스트 그래프(context graph)로 연결해야 한다.
- 기억에서 스킬을 추출할 때는 실제 관찰 데이터에 대한 근거성(grounding), 범위 전반의 커버리지(coverage), 주제 일관성(coherence), 변경 감지와 거버넌스(governance)가 필요하다.
- 스킬을 산문이나 Markdown 파일로만 저장하지 않고 타입이 있는 실행 그래프(typed execution graph)로 표현하면 단계와 출력의 디버깅, 재사용, 최신성 검증이 가능해진다.
Will Lyon은 AI Engineer World's Fair 2026에서 에이전트가 작업을 성공적으로 끝낸 뒤 학습한 내용을 잊어버리는 “기억상실 루프(amnesic loop)”를 지적한다. Neo4j의 접근은 메시지와 엔티티만 저장하는 데 그치지 않고, 에이전트의 결정·정책·도구 호출·결과·토큰·소요 시간까지 결정 추적(decision trace)으로 보존하는 것이다. 이 공유 컨텍스트 그래프에서 관찰된 절차를 근거 있는 실행 스킬로 증류하고, 원천 데이터가 바뀌면 오래된 스킬이나 드리프트를 표시한다. 마지막에는 의료 대화에서 환자 접수(patient intake) 스킬을 추출해 차트 작성까지 이어지는 과정을 NAMS로 시연한다.
1. 검색된 기억이 실행 가능한 지식이 되지 못하는 이유
1.1. 에이전트의 “기억상실 루프”
-
반복되는 루프와 기억의 단절
- AI Engineer World's Fair에서 React loop와 Ralph loops에 관한 논의가 이어졌지만, Will Lyon은 에이전트 시스템이 또 다른 “amnesic loop”에 빠진다고 농담한다.
- 에이전트는 추론하고 행동하는 단계를 거쳐 작업을 성공적으로 끝내지만, 그 과정에서 무엇을 배웠는지는 다음 실행에 남기지 못한다.
- 발표 초반의 가벼운 “사람들이 들어오고 있으니 편하게 들어오라”는 안내 뒤에, 세션의 중심 주제를 actionable knowledge와 context graph라고 명확히 제시한다.
-
현재 메모리 시스템의 전형적인 흐름
- 텍스트를 임베딩(embedding)하고, 검색 시 코퍼스에서 가장 관련성이 높은 데이터 조각을 찾는다.
- 유사한 청크를 컨텍스트 윈도우에 주입한 뒤, 에이전트가 그 자료로 유용한 일을 할 것이라고 신뢰한다.
- 이 방식은 “무엇이 관련 있는가”를 찾는 회상(recall)에는 도움이 되지만, 그 지식의 동일성·관계·근거·실행 절차를 보장하지 않는다.
1.2. 회상(recall)과 실행 가능 지식(actionable knowledge)의 차이
-
정식 표현(canonical representation)의 부재
- 같은 대상을 대화 맥락에 따라 “Dr. Nwin”, “Robert N”, “the cardiologist”처럼 세 가지 방식으로 부를 수 있다.
- 검색 결과가 세 표현을 따로 반환하면 에이전트는 같은 사람을 하나의 대상으로 결합하지 못하고, 어느 정보가 같은 의사에게 속하는지 판단해야 한다.
- 따라서 “그 대상이 무엇인가”를 하나의 정식 엔티티로 해석하고, 이름과 역할을 안정적으로 연결해야 한다.
-
지식에 필요한 세 가지 성질
- 연결됨(connected): 엔티티와 엔티티 사이의 관계를 그래프에서 보존해야 한다.
- 타입이 있음(typed): 관계가 단순한 문자열이 아니라 “의사”, “제공자(provider)”, “환자 접수”, “도구 호출” 같은 도메인 타입과 의미를 가져야 한다.
- 추적 가능함(traceable): 어떤 사실이나 행동이 어떤 근거·정책·실행에서 나온 것인지 되짚을 수 있어야 한다.
- 검색(retrieval)은 이 문제의 한 부분일 뿐이며, 연결성·타입·추적성을 갖춘 지식으로 이어져야 실제 행동을 지원한다.
2. 컨텍스트 그래프로 설계하는 에이전트 메모리
2.1. 세 종류의 기억을 하나로 연결하기
-
Neo4j의 메모리 모델
- 에이전트 메모리를 연결된 그래프(connected graph)로 보고, 단기 기억·장기 기억·추론 기억을 함께 구성한다.
- 이 구조를 컨텍스트 그래프(context graph)라고 부르며, 에이전트가 현재 대화뿐 아니라 축적된 사실과 과거의 판단에 접근하게 한다.
-
단기 기억과 장기 기억의 역할
- 사용자 메시지와 어시스턴트 메시지는 에이전트가 관찰한 원자료이자 단기적 상호작용의 기록이다.
- 메시지에서 엔티티를 추출하고 관계를 연결하면, 특정 대화가 끝난 뒤에도 재사용할 수 있는 장기 지식이 된다.
- 하지만 메시지와 추출 엔티티만 저장하면 에이전트가 어떤 이유로 특정 행동을 택했는지는 빠진다.
2.2. 비정형 메시지에서 지식 그래프로
-
엔티티 추출(entity extraction)
- 사용자와 어시스턴트의 모든 메시지를 처리해 사람·역할·환자·만남·도구 등 무엇이 언급됐는지 식별한다.
- 엔티티뿐 아니라 엔티티들이 서로 어떻게 연결되는지도 찾아 그래프에 기록한다.
-
강한 타입의 관계(strongly typed relationship)
- 그래프의 관계는 “함께 등장했다”는 단순 링크가 아니라, 엔티티 간 관계를 설명하는 강한 타입을 가진다.
- 강한 타입이 있으면 지식 검색 결과를 절차·정책·도메인 객체에 맞게 해석하고, 이후 스킬 단계의 근거로 연결할 수 있다.
2.3. 엔티티 해소와 공유 온톨로지
-
엔티티 해소(entity resolution)
- 지식 그래프를 구축하는 과정에서 가장 중요한 단계 중 하나는 여러 표현을 하나의 정식 엔티티로 해소하는 것이다.
- “Dr. Nwin”을 의료 제공자(provider)로 식별하고, 이름과 그가 맡은 역할을 함께 저장해야 한다.
- 해소가 실패하면 동일 인물의 사실이 여러 노드로 쪼개져 검색과 실행 모두의 기반이 흔들린다.
-
공유 온톨로지(shared ontology)
- 온톨로지는 해당 도메인의 데이터 모델과 개념·관계·타입을 설명하는 공유된 틀이다.
- 도메인을 먼저 설명해 두면 비정형 텍스트를 지식 그래프로 바꾸는 과정에서 어떤 엔티티와 관계를 만들어야 하는지 일관되게 결정할 수 있다.
- 의료 도메인이라면 provider, encounter 같은 개념을 온톨로지에 정의하고, 이후 대화·메모리·스킬이 같은 의미 체계를 사용하게 한다.
3. 추론 기억과 에이전트 간 공유 메모리
3.1. 추론 그래프(reasoning graph)는 일급 시민이다
-
데이터뿐 아니라 생각과 행동을 저장하기
- 단기·장기 기억이 메시지와 추출된 엔티티를 나타낸다면, 추론 기억은 에이전트가 실제로 취한 행동과 그 행동에 이르는 판단을 나타낸다.
- 에이전트가 무엇을 했는지뿐 아니라 왜 그렇게 결정했는지, 즉 “thinking the facts”를 기록해야 한다.
- 이 추론 그래프는 에이전트 메모리의 부가 정보가 아니라 핵심 구성요소이며, 실제 지식을 행동으로 전환하는 연결부다.
-
결정 추적(decision traces)
- 에이전트가 내린 각각의 결정은 근거가 있는 추론(reasoning grounded in evidence)에 연결한다.
- 적용한 정책을 명시적으로 모델링하고, 실행 계획(execution plan)에 포함된 도구와 각 도구 호출 결과를 저장한다.
- 호출에 소비한 토큰 수와 실행에 걸린 시간도 기록해 결과뿐 아니라 실행 비용과 성능을 관찰한다.
- 이 정보가 있으면 동일 작업을 다시 수행할 때 한 에이전트가 더 나아질 뿐 아니라, 조직 차원의 실행을 검증하고 개선할 수 있다.
3.2. 수백·수천 에이전트가 배우는 공유 컨텍스트
-
공유 도구 집합을 가진 다중 에이전트
- 조직 안에서 수백 또는 수천 개의 에이전트가 같은 도구 그룹에 접근하는 시스템을 생각할 수 있다.
- 각 에이전트 실행과 결정 추적을 그래프에 영속화하면, 한 에이전트가 남긴 근거와 절차를 다른 에이전트가 사용할 수 있다.
-
서로에게서 학습하는 메모리
- 하나의 공유 컨텍스트 그래프가 조직 전체의 공통 기억이 된다.
- 에이전트는 다른 에이전트의 실행에서 축적된 사실·정책·도구 결과를 활용하므로, 동일한 시행착오를 반복하지 않고 서로에게서 학습한다.
- 발표자는 이 부분까지를 “메모리(memory) 조각”으로 정리한 뒤, “그렇다면 actionable knowledge는 어떻게 만들 것인가?”라는 다음 질문으로 전환한다.
4. 메모리에서 실행 가능한 스킬로
4.1. 기억은 일어난 일을 표현하고, 스킬은 다음 행동을 표현한다
-
메모리의 역할
- 메모리 그래프는 어떤 사람과 이야기했는지, 사람들이 어떻게 연결됐는지, 어떤 결정 추적이 남았는지를 잘 표현한다.
- 그러나 “무슨 일이 있었는가”를 표현하는 것만으로는 에이전트가 “무엇을 해야 하는가”를 바로 실행할 수 없다.
-
스킬로의 전환
- 다음 단계는 메모리 그래프 또는 컨텍스트 그래프에서 근거 있는 실행 스킬(grounded executable skill)을 만드는 것이다.
- 현장 청중에게 에이전트에 스킬을 쓰는지, 직접 스킬을 작성했는지, 에이전트에게 스킬 작성을 맡겨 본 적이 있는지 차례로 묻자 대부분이 손을 들었다.
- 이 반응을 바탕으로 발표자는 오늘의 주제를 “메모리 그래프를 grounded executable skills로 바꾸는 방법”이라고 좁힌다.
4.2. Agent Skills 표준과 점진적 공개(progressive disclosure)
-
스킬의 기본 단위
- 발표자는 Anthropic이 제시한 오픈 표준을 소개하고, 관련 표준이
agentskills.io에 호스팅된다고 설명한다. - 스킬에는 무엇을 위한 것인지 설명하는 메타데이터가 있다.
- 상세한 정보는 Markdown 파일이나 references에 담아 두고, 에이전트가 특정 경로를 선택했을 때 필요한 부분만 점진적으로 검색·로드한다.
- 발표자는 Anthropic이 제시한 오픈 표준을 소개하고, 관련 표준이
-
재사용 가능한 공유 단위
- 점진적 공개는 처음부터 모든 세부사항을 컨텍스트에 넣지 않고, 필요한 정보만 가져오게 한다.
- 완성된 스킬은 패키지로 묶어 여러 에이전트 사이에서 공유하고 재사용할 수 있다.
- 다만 Markdown 중심의 산문 스킬은 메모리와 마찬가지로 정식 엔티티, 디버깅 가능한 단계, 검증 가능한 출력이라는 문제를 그대로 안고 있다.
4.3. 산문 스킬의 한계
-
정식 대상과 절차가 불명확함
- 산문으로 작성한 스킬은 어떤 대상을 말하는지 canonical한지 판단하기 어렵다.
- 실행 단계와 출력이 엄격한 구조로 정의되지 않으면, 에이전트가 같은 스킬을 매번 다르게 해석할 수 있다.
- 문제가 발생해도 어느 단계에서 어떤 입력·도구·출력이 어긋났는지 디버깅하기 어렵다.
-
그래프 표현 연구로의 연결
- Neo4j 연구팀은 스킬을 학습하고 거버넌스하기 위한 APE graph representation 연구를 발표했다.
- Will Lyon은 Zach이 행사장 어딘가 또는 그날 Neo4j 부스에 있을 것이라며 관심 있는 참석자는 직접 이야기해 보라고 가볍게 권한다.
5. APE: 타입이 있는 실행 그래프
5.1. 스킬을 실행 가능한 노드와 엄격한 스키마로 표현하기
-
Agent Skills 프로토콜의 확장
- APE는 Agent Skills 프로토콜에 추가 메타데이터를 더해 스킬을 타입이 있는 실행 그래프(typed execution graph)로 다룬다.
- 스킬의 각 단계(step)를 그래프의 노드로 모델링한다.
- 단계가 어떻게 실행 가능한지를 매우 엄격한 스키마로 정의하고, 스키마가 단계의 설명과 행동 가능성을 거버넌스한다.
-
실행 단계의 구조화
- 하나의 긴 산문 지침을 그래프 안의 여러 실행 단계로 쪼갠다.
- 각 단계는 타입이 있고 스키마로 통제되는 설명을 가지므로, 입력·행동·결과·근거를 구조적으로 연결한다.
- 결과적으로 스킬은 읽는 문서가 아니라 실행·검증·관리할 수 있는 절차 그래프가 된다.
5.2. SkillsBench 벤치마크 결과
-
사람이 큐레이션한 스킬에 적용
- APE 연구 논문에서 사용한 벤치마크는 SkillsBench였으며, 사람의 큐레이션을 거친 스킬에 APE 프로토콜을 적용했다.
- 벤치마크에서는 성공적으로 완료된 작업의 비율이 유의미하게 증가했다.
-
시사점
- 타입과 스키마를 추가하는 일이 형식적인 문서화 작업에 그치지 않고 작업 성공률에 영향을 준다.
- 이 연구 아이디어가 메모리 그래프에서 스킬을 증류하는 방법으로 이어진다.
6. 메모리 그래프에서 스킬 증류하기
6.1. 관찰 데이터에 근거한 결정론적 절차
-
증류의 입력과 범위
- 조직의 워크스페이스나 프로젝트에 범위를 둔 컨텍스트 그래프를 입력으로 삼는다.
- 그래프 전체를 단순히 Markdown 파일로 요약하는 것이 아니라, 실제 관찰된 데이터에 근거한 스킬을 만든다.
-
증류된 스킬의 품질 목표
- 스킬의 절차는 결정론적(deterministic)이어야 한다.
- 그래프 안에서 절차 단계가 잘 이해되고, 각 단계가 어떤 실제 데이터에 근거하는지 설명할 수 있어야 한다.
- 시간이 지나 underlying memory data가 바뀌면 스킬도 영향을 받으므로, 변화와 최신성을 계속 거버넌스해야 한다.
6.2. Grounding, coverage, coherence
-
근거성(grounding)
- 스킬을 구성하는 데이터가 메모리 시스템에 실제로 존재하는지 확인한다.
- 그래프의 사실·엔티티·도구 호출·결정 추적이 스킬의 단계와 설명을 뒷받침해야 한다.
- 근거성은 필수지만 그것만으로 스킬이 유용해지는 것은 아니다.
-
커버리지(coverage)
- 스킬 전체의 각 단계와 설명이 고르게 근거를 갖는지 확인한다.
- 일부 단계만 실제 데이터에 연결되고 나머지가 추측에 의존하면, 전체 절차의 신뢰성이 떨어진다.
-
일관성(coherence)
- 증류 대상인 하위 그래프가 여러 주제로 갈라져 있는지 감지한다.
- 서로 다른 커뮤니티의 정보가 한 스킬에 섞였다면, 하나의 거대한 스킬보다 여러 개의 스킬로 만드는 편이 낫다고 제안할 수 있다.
- 이 판단은 스킬 생성 전 품질 점검이자, 이후 스킬 조합·분해를 위한 거버넌스 신호가 된다.
6.3. 최신성, 드리프트, 스킬 거버넌스
-
변경된 스킬의 관리
- 기반 데이터가 바뀌었을 때 스킬을 업데이트할 수 있는지 이해해야 한다.
- 동적 로딩(dynamic loading)을 활용하면 거버넌스된 스킬 레지스트리에서 각 에이전트가 가장 최신 스킬을 조회할 수 있다.
-
오래된 스킬 탐지
- 스킬을 뒷받침하던 데이터가 제거되거나, 변경되거나, 서로 모순되면 스킬이 stale 또는 drift 상태가 될 수 있다.
- 레지스트리는 스킬을 단순히 배포하는 데 그치지 않고, 최신 버전인지 오래됐는지 또는 원천 데이터와 어긋났는지를 알려야 한다.
7. Neo4j Agent Memory Service(NAMS) 구현
7.1. 서비스 구조
-
NAMS의 목적과 공개 도구
- Neo4j는 위 패턴을 Neo4j Agent Memory Service, 줄여서 NAMS로 구현했다.
- NAMS는 Neo4j Labs의 Agent Memory as a Service 작업이며, 같은 패턴을 구현하는 오픈소스 도구도 제공한다.
- 발표 시점에 NAMS는 무료로 제공되어 누구나 가입해 시험할 수 있다고 설명한다.
-
워크스페이스 범위의 컨텍스트 그래프
- 각 워크스페이스에 범위가 지정된 컨텍스트 그래프를 둔다.
- 그래프에는 단기·장기·추론이라는 세 종류의 에이전트 메모리가 들어간다.
- 백그라운드 워커가 메모리 그래프를 스킬 증류 프로세스로 처리한다.
- 별도의 백그라운드 큐레이션이 메모리 데이터에 기반해 스킬이 stale해지는 시점을 찾아 거버넌스 신호를 표면화한다.
7.2. 증류 파이프라인의 설계
-
대부분 결정론적인 단계
- NAMS는 스킬을 생성하는 파이프라인을 거치며, 발표자는 화면의 모든 단계를 자세히 설명하지는 않는다.
- 핵심은 파이프라인의 대부분이 결정론적이라는 점이다.
- LLM은 일부 주장(claim)을 합성하고 스킬 설명에 필요한 텍스트를 생성하는 데 주로 사용한다.
-
시작 범위와 근거 연결
- 첫 단계는 무엇을 기준으로 스킬을 증류할지 시작 범위를 정하는 것이다.
- 특정 엔티티와 그 주변 하위 그래프, 특정 대화, 온톨로지의 특정 클래스 등을 범위로 선택할 수 있다.
- 스킬 표현을 구성요소로 분해하고, 각 구성요소를 다시 underlying data에 연결해 근거성을 유지한다.
- 해당 원천 데이터가 변경·삭제·모순될 때 어떤 스킬이 stale해지는지 추적할 수 있다.
7.3. 스킬 조합과 분해
-
커뮤니티 탐지(community detection)
- 여러 스킬을 조합할 수도 있지만, 서로 다른 주제가 뒤섞이면 coherence 점검이 필요하다.
- 그래프 알고리즘인 커뮤니티 탐지를 적용해 하위 그래프들이 여러 커뮤니티에 걸쳐 있는지 확인한다.
-
거버넌스에 의한 분해 제안
- 여러 커뮤니티의 토픽이 한 스킬에 섞여 있다는 신호는 스킬을 분해해야 한다는 뜻일 수 있다.
- NAMS는 이런 신호를 스킬 거버넌스 과정에서 포착하고, 하나의 불명확한 스킬을 더 작고 일관된 스킬들로 나누게 한다.
8. NAMS 대시보드와 환자 접수 스킬 시연
8.1. 메모리 수집·검색 API와 그래프 탐색
-
에이전트에 노출되는 인터페이스
- NAMS는 REST API와 MCP 도구를 제공한다.
- 이 인터페이스는 에이전트가 단기·장기·추론 메모리를 수집하고 검색하며 다루는 동작에 매핑된다.
-
대시보드의 메모리 확인
- 메모리는 엔티티 추출과 엔티티 해소 과정을 거친다.
- 대시보드에서 에이전트 메모리를 그래프로 보고, 그래프를 직접 순회하며 연결을 확인할 수 있다.
- 플래그가 지정된 엔티티도 따로 확인할 수 있어, 해소가 필요하거나 주의해야 할 데이터를 찾는다.
8.2. 의료 온톨로지와 대화 데이터
-
도메인 온톨로지 선택
- 시연은 의료(healthcare) 온톨로지를 사용한다.
- 의료 온톨로지에는 encounter, provider 같은 데이터가 포함되며, 의료 에이전트의 메모리를 같은 의미 체계로 처리한다.
-
대화 수집
- 의료 에이전트와 관련된 여러 대화를 NAMS에 미리 수집해 두었다.
- 대시보드에서 수집된 대화를 확인한 뒤, 이제 그 기록에서 스킬을 증류할 준비가 됐다고 설명한다.
8.3. 최근 대화에서 스킬을 증류하는 과정
-
증류 범위 선택
- 전체 워크스페이스를 범위로 잡을 수도 있지만, 보통 원하는 결과는 너무 넓은 전체 범위에서 나오지 않는다.
- 특정 엔티티, 특정 대화, 온톨로지의 특정 클래스 중 하나를 선택할 수 있다.
- 시연에서는 가장 최근 대화를 범위로 선택한다.
-
7단계 파이프라인 실행
- 선택하면 작업이 증류 큐(distillation queue)에 들어간다.
- NAMS가 필요한 데이터를 가져오고, 7단계 파이프라인을 거쳐 스킬을 그래프로 구성한다.
- 처리 결과는 재사용할 수 있는 스킬 패키지로 포장된다.
8.4. 환자 접수(patient intake)에서 차트 작성까지
-
기존 증류 결과 열기
- 새 작업이 실행되는 동안, 이전에 실행해 둔 환자 접수 대화 기반 스킬을 화면에서 확인한다.
- 그래프에는 환자 접수에서 시작해 환자 차트(charting) 작성까지 수행하는 스킬의 단계가 추출돼 있다.
-
각 단계의 근거와 패키징
- 각 단계는 실제 도구 호출과 그 스킬의 기반을 구성한 엔티티에 연결돼 있다.
- 따라서 단계가 단순한 생성 텍스트가 아니라, 원래 대화·엔티티·도구 실행에 근거한다.
- 결과를
SKILL.md파일로 패키징하며, 다운로드하면 점진적 공개 표준에 맞는 references와 기타 자료도 함께 담긴다.
주요 발언 모음
“Sometimes I feel like we're in maybe like an amnesic loop.”
“Recall isn't really actionable knowledge.”
“Agents need knowledge that is both connected, typed and traceable, not just retrievable.”
“Reasoning memory is a first class citizen.”
“We want this to be grounded in actual data that we've observed.”
“We want this to be deterministic.”
“Grounding is an important piece here, but that's not enough for it to be useful.”
“Most of these steps are deterministic. We're really only leveraging an LLM here for synthesizing some of the claims [and] generating some of the text that we use for some of the skill description.”
핵심 데이터 & 수치
- 18분 40초: 전체 발표 길이다.
- 3종 메모리: NAMS의 컨텍스트 그래프는 단기 기억, 장기 기억, 추론 기억을 함께 관리한다.
- 수백~수천 에이전트: 공유 도구 집합을 쓰는 조직에서 하나의 공유 그래프가 에이전트 간 학습 기반이 될 수 있다.
- 3가지 핵심 지식 속성: 연결성(connected), 타입(typed), 추적성(traceable)이 검색만으로는 얻을 수 없는 실행 기반이다.
- 3가지 스킬 품질 휴리스틱: grounding, coverage, coherence를 사용한다.
- 7단계 파이프라인: 선택된 범위의 데이터를 가져와 스킬 그래프로 구성하고 패키징하는 NAMS 증류 과정이다.
- APE와 SkillsBench: 타입이 있는 실행 그래프를 사람 큐레이션 스킬에 적용했을 때 성공적으로 완료된 작업이 유의미하게 증가했다.
- LLM의 제한된 역할: 파이프라인의 대부분은 결정론적이고, LLM은 주장 합성과 스킬 설명 텍스트 생성에 주로 쓰인다.
- 18:02~18:18: 발표자는 NAMS와 오픈소스 도구 문서를 리소스로 남기고, Neo4j 부스에서 팀원들과 더 이야기할 수 있다고 안내한다.
결론 및 시사점
- 임베딩 검색은 메모리 시스템의 출발점이지 완성품이 아니다. 검색된 텍스트를 실행에 쓰려면 대상의 정식 표현, 타입이 있는 관계, 근거 추적이 필요하다.
- 단기·장기·추론 기억을 하나의 컨텍스트 그래프로 연결하면 사실뿐 아니라 에이전트의 결정 이유, 정책, 도구 결과, 비용과 시간까지 재사용할 수 있다.
- 결정 추적을 공유하면 한 에이전트의 학습이 조직의 수백·수천 에이전트에게 전파되고, 에이전트가 서로의 실행에서 배울 수 있다.
- 스킬은 산문 지침이 아니라 타입이 있는 실행 그래프로 모델링해야 단계별 입력·행동·출력·근거를 디버깅하고 관리할 수 있다.
- 메모리에서 스킬을 만들 때는 실제 관찰 데이터에 grounding하고, 모든 단계의 coverage를 점검하며, 여러 주제가 섞였는지 coherence를 확인해야 한다.
- 원천 데이터가 변경·삭제·모순되면 스킬은 stale하거나 drift할 수 있으므로, 동적 로딩과 거버넌스된 스킬 레지스트리로 최신성과 변경 상태를 관리해야 한다.
- NAMS의 핵심 설계는 대부분 결정론적인 7단계 증류 파이프라인과 제한적인 LLM 사용이다. LLM이 전체 절차를 임의로 발명하게 두기보다 그래프와 관찰 데이터가 스킬의 경계를 정하게 한다.
- 의료 환자 접수 사례는 그래프에 저장된 엔티티와 도구 호출이 실제 업무 절차를 어떻게 환자 차트 작성 스킬로 바꾸는지 보여준다.
- 실무에서 도입할 때는 먼저 도메인 온톨로지를 정의하고, 메시지·엔티티·관계를 그래프로 정규화한 뒤, 결정 추적을 반드시 함께 저장해야 한다.
- 그 위에서 하나의 대화나 특정 엔티티처럼 좁은 범위로 시작해 근거성·커버리지·일관성을 검증하고, 안정적인 스킬만 조직의 공용 레지스트리로 확장하는 순서가 적절하다.
핵심 요약 (20줄)
- Will Lyon은 에이전트가 작업을 끝내고 배운 것을 잊는 “기억상실 루프”를 지적한다.
- 임베딩 검색은 관련 텍스트를 찾지만 그 자체로 실행 가능한 지식을 만들지는 못한다.
- “Dr. Nwin”, “Robert N”, “심장 전문의” 같은 표현은 하나의 정식 엔티티로 해소해야 한다.
- 에이전트 지식은 연결되고 타입이 있으며 근거를 추적할 수 있어야 한다.
- Neo4j는 단기·장기·추론 기억을 하나의 컨텍스트 그래프로 연결한다.
- 사용자와 어시스턴트의 메시지는 엔티티 추출과 관계 모델링을 거쳐 지식 그래프가 된다.
- 공유 온톨로지는 도메인의 데이터 모델과 관계 타입을 정해 비정형 텍스트의 해석을 일관되게 만든다.
- 추론 기억은 에이전트가 무엇을 했는지뿐 아니라 왜 그렇게 결정했는지도 보존한다.
- 결정 추적은 근거·정책·실행 계획·도구 호출·결과·토큰·시간을 함께 기록한다.
- 공유 그래프는 수백 또는 수천 에이전트가 서로의 실행에서 배우게 한다.
- 메모리가 일어난 일을 표현한다면 스킬은 다음에 수행할 절차를 표현한다.
- Anthropic의 Agent Skills 표준은 메타데이터와 점진적 공개 방식으로 재사용 가능한 스킬을 만든다.
- 산문 스킬은 정식 대상과 디버깅 가능한 단계 및 출력을 명확히 표현하기 어렵다.
- Neo4j 연구의 APE 접근은 스킬을 타입이 있는 실행 그래프로 표현한다.
- SkillsBench 결과는 사람 큐레이션 스킬에 APE를 적용했을 때 작업 성공률이 유의미하게 높아졌다고 보고한다.
- 메모리 증류는 실제 관찰 데이터에 근거하고 결정론적인 절차를 만들어야 한다.
- Grounding은 원천 데이터 연결을, coverage는 모든 단계의 근거성을, coherence는 주제 혼합 여부를 점검한다.
- NAMS는 원천 데이터 변경·삭제·모순으로 발생하는 stale skill과 drift를 거버넌스한다.
- NAMS 대시보드는 의료 온톨로지와 환자 접수 대화에서 7단계 파이프라인으로 스킬을 추출한다.
- 환자 접수 스킬의 각 단계는 실제 도구 호출과 엔티티에 근거하며
SKILL.md와 references로 패키징된다.
