URL: https://www.youtube.com/watch?v=ACPEpji5NV4
날짜: 2026-09-26
채널: aiDotEngineer
발표자: Raghav Saboo, Staff Machine Learning Engineer, DoorDash
📌 핵심 질문 / 전체 논점
==대규모 마켓플레이스의 검색·추천에서 LLM을 온라인 요청마다 직접 호출하지 않고, LLM의 의미 추론을 오프라인 프리미티브로 증류해 기존 검색·순위 시스템에 결합하려면 어떻게 해야 하는가?==
- DoorDash의 발견(discovery) 병목은 참여도(engagement) 최적화 자체가 아니라 상품의 의미와 쇼핑객 의도를 이해하는 능력이다.
- LLM은 사람이 만든 정답과 행동 신호를 보완하는 확장 가능한 추론 신호를 만들 수 있다.
- 비용이 큰 LLM 추론을 관련성 라벨, 시맨틱 ID(semantic ID), 고객 메모리(memory)로 저장하면 소형·고속 모델과 기존 랭킹 스택이 온라인 서빙을 담당할 수 있다.
- 공유 표현(shared representations)은 검색(retrieval), 순위(ranking), 개인화(personalization), 맞춤형 콘텐츠 생성(content generation)을 하나의 흐름으로 연결한다.
DoorDash의 목표는 레스토랑을 넘어 식료품, 소매, 반려동물, 선물 등 모든 영역에서 사용자의 쇼핑 순간을 포착하는 것이다. 사용자의 목적은 단일 검색어로 끝나지 않고 여러 세션과 여러 날에 걸쳐 검색어 재구성, 보완 상품 탐색, 장바구니, 결제로 이어진다. 따라서 각 모델을 따로 최적화하는 것보다 상품·사용자·의도를 공통 의미 표현으로 연결하는 것이 핵심이다.
1. 발견의 병목은 참여도가 아니라 의미 이해다
1.1. DoorDash의 확장된 쇼핑 여정
-
마켓플레이스 범위의 확대
- DoorDash는 레스토랑 중심 서비스에서 grocery, retail, pets, gifting 등으로 확장했다.
- 카테고리가 늘어날수록 같은 검색·추천 시스템이 서로 다른 상품 의미와 구매 목적을 이해해야 한다.
- 목표는 특정 식사 주문만 늘리는 것이 아니라 사용자가 무엇인가를 사려는 모든 순간을 포착하는 것이다.
-
넓은 쇼핑 미션
- 사용자는 앱에 들어와 상품 하나의 이름보다 더 넓은 문제를 해결하려 한다.
- 강아지를 막 입양한 소비자는 “이번 주에 시작하려면 무엇이 필요하지?”라고 생각하며 강아지 사료를 검색할 수 있다.
- 첫 검색은 강아지 사료에서 끝나지 않고 케이지(crate), 목줄(leash), 배변·훈련 패드(training pads) 같은 보완 상품으로 이어질 수 있다.
- 검색어 재구성, 컬렉션 탐색, 상품 선택, 장바구니, 결제가 여러 세션과 여러 날에 걸쳐 일어날 수 있다.
-
모델을 가로지르는 여정
- 한 번의 검색 결과만 최적화해서는 전체 쇼핑 미션을 포착하기 어렵다.
- 검색, 추천, 순위, 컬렉션, 에이전트가 서로 다른 모델을 사용하므로 고객 여정의 신호가 모델 사이에서 단절되기 쉽다.
- 상품 의미와 고객 맥락을 여러 모델이 재사용할 수 있는 공유 표현으로 만들어야 전체 여정을 연결할 수 있다.
1.2. 네 가지 기본 프리미티브
-
지도 학습과 감독(supervision)
- 검색·검색 결과 순위 시스템에 작업별로 무엇이 좋은 결과인지 가르치는 역할을 맡는다.
- LLM을 사용해 사람의 정답과 행동 데이터 사이의 빈틈을 메우는 확장 가능한 추론 라벨을 만든다.
-
카탈로그 의미론(catalog semantics)
- SKU ID나 경직된 수동 taxonomy만으로 표현하기 어려운 상품 간 의미 관계를 학습한다.
- 계층형 시맨틱 ID를 통해 광범위한 이웃부터 세부 특성까지 공통 코드로 표현한다.
-
의미적 개인화(semantic personalization)
- 사용자의 장기 선호, 현재 세션, 명시적 제약을 사람이 읽을 수 있고 모델이 재사용할 수 있는 메모리로 저장한다.
- 텍스트, 임베딩, 그래프·트리라는 여러 형태로 같은 고객 맥락을 물질화한다.
-
제어 가능한 콘텐츠 생성(steerable content generation)
- 시맨틱 ID, 고객 메모리, 관련성 감독을 LLM·소형 언어 모델·기존 모델에 입력한다.
- 순위가 매겨진 상품 목록, 캐러셀 제목, 부제목, 상품 컬렉션 등 화면에 필요한 출력을 생성한다.
2. 지도 학습으로 ‘좋은 결과’의 의미를 만든다
2.1. 참여도만으로는 검색 의도를 가르칠 수 없다
-
글루텐 프리 파스타 사례
- 사용자가 “gluten-free pasta”를 검색했는데 참여도만 기준으로 순위를 매기면 인기 있는 일반 스파게티가 높은 위치에 나타날 수 있다.
- 일반 스파게티는 많이 팔리기 때문에 클릭·구매 신호를 계속 얻지만, 사용자의 글루텐 제한 조건을 충족하지 않는다.
- “gluten-free”라는 단어가 겹친다는 이유로 글루텐 프리 흰 빵이 검색 결과에 들어올 수도 있다.
- 진짜 글루텐 프리 파스타는 높은 관련성(high relevance)이고, 병아리콩 파스타는 합리적인 대체품(reasonable substitute)이며, 일반 스파게티는 인기와 무관하게 제약을 위반하는 결과다.
-
두 가지 기존 진실의 원천
- 사람의 주석(human annotation)은 의미를 직접 판단할 수 있지만 비싸고 느리며 빠르게 변하는 카탈로그를 따라가기 어렵다.
- 행동 신호(behavioral signals)는 풍부하지만 상품의 실제 의미보다 노출(exposure), 위치(position), 가격(price), 프로모션(promotions), 이전 모델의 선택에 좌우될 수 있다.
- 참여도 데이터와 사람의 주석만으로는 규모에 맞는 의미 추론 신호를 만들기 어렵다.
-
LLM의 역할
- LLM은 쿼리와 상품의 관계를 추론해 사람이 일일이 라벨링하지 않은 대규모 카탈로그에 적용할 수 있는 감독 신호를 제공한다.
- LLM을 최종 검색기나 순위기로 직접 서빙하는 대신, LLM이 판단한 의미를 더 저렴하고 빠른 모델이 사용할 수 있는 학습 목표로 바꾼다.
2.2. PIP 파이프라인과 골든 데이터 세트
-
사람의 정답으로 시드 세트 구축
- PIP 파이프라인은 사람이 만든 ground truth에서 출발한다.
- 쿼리-상품(query-item) 쌍을 모아 0·1·2의 3단계 관련성 등급(relevance scale)을 부여한다.
- 0은 관련 없음, 1은 중간 또는 대체 가능성, 2는 높은 관련성에 해당하는 graded relevance 구조로 사용한다.
-
의심스러운 사례 감사
- 사람이 관련 없음으로 라벨링한 상품이 장바구니 추가(add-to-cart)나 전환(conversion)에서 매우 좋은 성과를 내면 해당 사례를 의심 사례로 분류한다.
- 의심 사례는 더 강한 LLM에 보내 더 세밀한 프롬프트로 재평가한다.
- 이 과정은 행동 신호가 사람의 판단을 반박할 때도 단순히 어느 한쪽을 맹신하지 않고 사례 단위로 검증하게 한다.
-
다른 모델과의 조정
- 쿼리 taxonomy 모델이나 category 모델과 결과를 대조한다.
- 쿼리가 유효한 카테고리 집합에 매핑되고 상품이 그 카테고리에 속한다면 관련성 라벨을 그 근거에 맞춰 조정할 수 있다.
- 사람의 정답, 행동 성과, LLM의 추론, taxonomy·category 모델의 구조를 합쳐 높은 정밀도의 golden data set을 만든다.
-
라벨러의 경량화
- 골든 데이터 세트로 GPT-4o mini 같은 lightweight LLM을 미세 조정한다.
- 미세 조정된 라벨러를 오프라인 전체 카탈로그에 적용해 대규모 graded query-item pair를 생성한다.
- 생성된 관련성 라벨은 retrieval과 ranking 모두가 공유하는 하나의 학습 목표가 된다.
- 비싼 추론은 한 번 오프라인에서 수행하고, 그 결과를 저렴하고 빠르게 서빙할 수 있는 모델로 증류한다.
3. LLM의 추론을 검색·순위 아키텍처로 증류한다
3.1. 검색에서 표준 임베딩이 무너지는 지점
-
관련성과 일치의 혼동
- 전자상거래 규모에서 표준 임베딩은 단순히 관련된 상품과 정확히 일치하는 상품의 거리를 충분히 벌리지 못한다.
- 모델은 두 상품이 서로 관계가 있다는 사실은 알지만 exact match, substitute, complement를 구분하지 못할 수 있다.
- 검색 결과의 의미적 질을 높이려면 관련성 등급을 임베딩 공간의 구조에 직접 반영해야 한다.
-
2단계 대조 학습(two-stage contrastive method)
- 두 타워 인코더(two-tower encoder)를 사용해 쿼리와 상품을 각각 표현한다.
- 1단계인 mining에서는 다단계 지도 대조 손실(multi-level supervised contrastive loss)로 전역 기하(global geometry)를 만든다.
- 기본 모델이 쿼리와 상품의 전체 공간을 정리하면 모델이 혼동하는 어려운 네거티브(hard negatives)를 찾아낸다.
- hard negative에는 너무 높은 순위에 올라가는 혼동 상품과, 실제로 강한 포지티브인데 너무 낮게 평가되는 상품이 포함된다.
- 2단계에서는 hard negative를 사용해 curriculum training을 수행하고 관련성 라벨을 다시 지정한다.
-
검색 성능 개선
- 1단계 뒤에는 높은 관련성과 중간 관련성 영역이 겹치지만, 2단계 뒤에는 두 영역 사이에 상당한 차이가 생긴다.
- 이 분리가 검색 계층의 전반적인 관련성 개선을 이끈 가장 큰 레버 중 하나가 됐다.
- 관련성 NDCG(Normalized Discounted Cumulative Gain)가 2.3% 향상됐다.
- 검색 관련성 상승은 하위 비즈니스 지표에도 개선으로 이어졌다.
3.2. 순위 모델에서 관련성과 참여도를 함께 최적화한다
-
새로운 ordinal relevance tower
- LLM이 생성한 등급 라벨 위에 순서형 관련성 타워(ordinal relevance tower)를 추가한다.
- 이 타워의 예측은 기존 참여도 타워와 나란히 작동한다.
- 기존 타워가 모델의 클릭(click), 장바구니 추가(add-to-cart), 전환(conversion)을 예측한다면 새 타워는 쿼리-상품 의미 적합성과 관련성 등급을 예측한다.
-
공유 하위 계층과 역전파
- 관련성 타워와 참여도 타워는 같은 bottom layers를 공유한다.
- 의미적 적합성과 행동적 적합성이 같은 역전파(backward pass) 안에서 증류된다.
- 모델은 여러 관련성 등급에 걸친 확률을 예측할 수 있다.
-
표면별 가치 함수
- value function을 통해 화면(surface)별로 참여도와 관련성의 균형을 조정한다.
- 모든 화면이 같은 목적함수를 가져야 하는 것은 아니므로, 어떤 화면에서 의미적 정확성을 더 중시하고 어떤 화면에서 참여도를 더 중시할지 미세 조정할 수 있다.
- 핵심은 LLM이 기존 목표를 대체하는 것이 아니라, 기존 비즈니스·시스템 목표 안에 의미 추론을 추가하는 것이다.
3.3. ‘LLM을 서빙하지 말라’는 아키텍처 원칙
-
직접 대체 대신 추론 증류
- 검색·순위 시스템을 LLM으로 통째로 교체하지 않는다.
- LLM의 reasoning과 understanding을 production ranking architecture 안으로 추출한다.
- LLM으로 빠르게 실험하면서도 기존 검색 지연시간, 비용, 안정성, 비즈니스 목적을 유지한다.
-
온라인 호출이 항상 정답은 아니다
- 온라인 LLM 호출은 검색과 추천의 필수 제품 아키텍처가 아닐 수 있다.
- 상품·쿼리 관계처럼 반복적으로 계산할 수 있는 지식은 오프라인에서 라벨로 만들고, 소형 모델이 대규모 트래픽을 처리하게 한다.
- 비용이 큰 추론을 매 요청 반복하지 않고, 한 번의 추론을 많은 서빙 경로에서 재사용하는 구조가 확장성의 핵심이다.
4. 카탈로그를 시맨틱 ID로 표현한다
4.1. SKU와 수동 taxonomy의 한계
-
카탈로그 규모
- DoorDash는 여러 국가의 여러 매장에서 매장-상품 수준으로 수십억 개의 상품을 다룬다.
- 각 상품에는 고유 SKU ID가 있지만 임의의 식별자는 상품이 무엇인지 알려주지 않는다.
-
너무 거칠고 경직된 taxonomy
- 사람이 만든 taxonomy는 상품을 의미 있는 공간에 배치하는 출발점이지만, 분류가 coarse하고 rigid할 수 있다.
- 핫소스는 단순히 “sauces/hot sauces”로 분류될 수 있지만 Huy Fong, Frank’s, Tabasco 사이의 관계나 스타일 차이까지 표현하지 못한다.
4.2. 계층형 시맨틱 ID의 구조
-
학습된 짧은 계층 코드
- 시맨틱 ID는 기존 taxonomy와 비슷한 짧은 hierarchical code를 각 상품에 부여한다.
- 사람이 미리 고정한 분류보다 fine-grained한 정도를 조절할 수 있다.
- 앞쪽 prefix는 넓은 상품 이웃과 카테고리를 나타내고, 뒤쪽 token은 세부 특성과 전문성을 표현한다.
-
핫소스의 의미 공간
- 핫소스 상품들은 첫 번째와 두 번째 prefix를 공유해 큰 범주에 함께 놓인다.
- 뒤쪽 토큰이 갈라지면서 Mexican, Caribbean, Korean hot sauce 같은 전문 영역이 구분된다.
- 별도의 사람이 붙인 세부 레이블이 없어도 데이터에서 의미적 구조가 나타날 수 있다.
-
모델 간 공통 인터페이스
- prefix 기반 비교가 가능하므로 두 상품이 얼마나 가까운 의미 이웃인지 계산할 수 있다.
- 시맨틱 ID는 검색, 순위, 추천 등 모든 downstream model이 사용할 수 있는 공통 표현이 된다.
4.3. 시맨틱 ID가 여는 네 가지 활용
-
카테고리 간 관계와 쇼핑 미션
- 칩, 살사, 과카몰리는 수동 taxonomy에서 서로 다른 가지에 놓일 수 있다.
- 하지만 시맨틱 ID의 공유된 의미 이웃은 세 상품이 하나의 쇼핑 미션에 함께 속할 가능성을 보여준다.
- 서로 다른 카테고리를 넘나드는 보완 상품 추천과 컬렉션 구성이 가능해진다.
-
콜드 스타트(cold start)
- 매장이 새 카탈로그 상품을 추가해도 해당 상품은 초기 클릭·판매 데이터가 부족하다.
- n-gram이나 byte-pair encoding과 유사한 방법으로 새 토큰을 sparse ID feature로 모델에 확장 가능하게 추가한다.
- 새 상품을 처음부터 독립 상품으로 학습시키지 않고 기존 의미 공간에 배치할 수 있다.
-
롱테일 커버리지(tail coverage)
- 노출과 판매량이 적은 상품은 의미적으로 가까운 상품에서 신호를 상속받는다.
- 충분한 소비자 노출이나 판매량이 쌓일 때까지 기다리지 않고 롱테일 상품을 표현하고 검색할 수 있다.
-
역방향 감사(reverse audit)
- 학습된 의미 라벨과 사람이 지정한 라벨을 비교해 카탈로그를 감사한다.
- 두 라벨이 일치하지 않는 지점을 찾아 수동 taxonomy의 오류나 새로운 의미 관계를 발견할 수 있다.
4.4. 검색·쿼리 재구성의 실제 효과
-
순위 모델의 MRR 개선
- 시맨틱 ID는 DoorDash ranker의 큰 개선 요인 중 하나가 됐다.
- MRR(Mean Reciprocal Rank)이 4~5% 향상됐고, 전환율에서도 큰 개선이 나타났다.
-
카탈로그에 근거한 쿼리 재구성
- 사용자가 Sriracha를 검색하면 garlic chili garlic sauce나 sambal oelek처럼 의미적으로 가까운 대체·관련 쿼리를 제안할 수 있다.
- 제안 쿼리는 카탈로그에 실제 재고가 있는 의미적 이웃에 매핑된다.
- DoorDash에 재고가 없는 검색어는 사용자에게 실질적으로 의미가 없으므로, 검색어 제안도 카탈로그 근거를 가져야 한다.
- 쿼리 그래프에 시맨틱 ID를 추가한 결과 이 작업에서 시장 반응(MR, 발표에서 사용한 지표)이 크게 향상됐다.
5. 고객 맥락을 의미적·검사 가능·재사용 가능한 메모리로 만든다
5.1. 임베딩만으로는 ‘왜’를 표현하기 어렵다
-
사용자 임베딩의 장점과 한계
- DoorDash는 소비자를 여러 형태로 표현하며 사용자 임베딩은 추천에 유용하다.
- 하지만 벡터만으로는 소비자가 특정 의도를 가진 이유나 특정 선호를 가진 이유를 설명하기 어렵다.
- LLM은 일반적인 임베딩을 곧바로 읽지 못하므로 토큰화와 별도 학습이 필요하다.
-
LLM 네이티브 표현
- 텍스트처럼 명시적인 LLM-native counterpart를 함께 두면 LLM과 전통적 ML 모델이 같은 고객 지식을 사용할 수 있다.
- 메모리는 소비자를 semantic, inspectable, reusable한 여러 표현으로 저장하는 개념이다.
- 사람이 읽고 검토할 수 있는 표현을 남기면 개인화가 왜 일어났는지 감사할 수 있다.
5.2. 세 가지 시간 척도의 메모리
-
장기 메모리(long-term memory)
- 주문, 검색, 브라우징, 고객 지원 상호작용에서 반복적으로 드러난 지속적 선호를 보존한다.
- 식단 선호, 자주 찾는 식사 스타일, 특정 대체품 선호처럼 여러 쇼핑 미션에서 재사용되는 정보를 담는다.
-
실시간 컨텍스트(real-time context)
- 현재 세션의 장바구니 상태, 활성 검색, 진행 중인 탐색을 기록한다.
- 장기 선호와 달리 지금 이 순간의 목적을 표현하므로 즉시 순위와 컬렉션에 반영할 수 있다.
-
명시적 선호(stated preferences)
- Ask DoorDash 같은 에이전트 상호작용에서 사용자가 직접 제약과 선호를 말한 내용을 보존한다.
- 식단 제한, 알레르기, 가정 구성, 대체 가능 여부처럼 행동 데이터만으로 확신하기 어려운 조건을 명시적으로 표현한다.
5.3. 메모리 블록과 다중 물질화
-
확장 가능한 메모리 블록
- 장기 메모리는 memory blocks로 구성한다.
- 소비자를 더 많이 알게 될수록 dietary preferences, dining preferences, substitute preferences 같은 새로운 차원을 블록으로 추가한다.
- 하위 시스템은 고객 메모리를 각자의 사용 사례에 맞게 매번 재해석하지 않고 공통 블록을 그대로 활용한다.
-
텍스트 표현
- 사람과 LLM이 읽을 수 있는 압축 텍스트로 고객을 요약한다.
- 개인화 결과를 검토하고 새 선호를 추가하는 기준점으로 사용할 수 있다.
-
잠재 벡터와 임베딩
- 메모리 블록을 latent vector와 embedding으로 변환한다.
- 검색·순위 모델의 입력 feature로 넣어 고객 맥락을 수치적으로 반영한다.
-
그래프·트리·계층 구조
- 고객과 브랜드, taxonomy, 메모리에서 드러난 선호 사이의 유형 관계를 그래프 또는 계층으로 표현한다.
- 텍스트·벡터·관계 구조를 composite memory object로 묶어 ML 모델과 LLM이 함께 사용하게 한다.
5.4. 컨텍스트 그래프와 다중 홉 쇼핑 여정
-
희소하고 다중 홉인 상호작용
- 한 고객과 한 상품의 상호작용은 드물고, 여러 단계로 나뉘는 경우가 많다.
- 고객이 특정 브랜드를 직접 구매하지 않았더라도 관련 선호와 상품 개념을 통해 간접 관계를 추론할 수 있다.
-
메모리 개념의 연결
- 컨텍스트 그래프는 고객과 추출된 메모리 개념을 연결한다.
- 기존에 관계가 없던 고객·상품·브랜드·선호 사이를 연결해 여러 단계의 쇼핑 여정을 추적한다.
- 특히 세분화된 taxonomy 수준에서 그래프가 유용하다.
-
검색 성능
- 그래프 기반 임베딩은 기존 taxonomy 기반 임베딩보다 검색 성능이 높게 나타났다.
- 공통 그래프 표현은 단순한 사용자 벡터보다 고객의 이유와 관계를 더 풍부하게 보존한다.
5.5. 메모리의 세 가지 소비처
- 개인화된 컬렉션: 고객 메모리와 상품 의미를 결합해 사용자별 컬렉션을 만든다.
- 에이전트 기반 개인화: Ask DoorDash가 세션을 고객에게 맞게 구성할 때 메모리를 사용한다.
- 검색·순위 모델: 메모리 블록을 인코딩해 하위 모델의 feature로 주입한다.
6. 제어 가능한 콘텐츠 생성으로 개인화된 컬렉션을 만든다
6.1. 공유 입력과 다양한 출력
-
여러 모델이 공유하는 입력
- 시맨틱 ID, 메모리 블록, graded relevance, LLM supervision이 공통 입력으로 작동한다.
- 입력은 LLM, small language model, traditional model에 맞게 전달할 수 있다.
-
화면에 맞는 출력 형태
- 모델은 순위가 매겨진 시맨틱 ID 목록을 출력할 수 있다.
- 상품 캐러셀 제목과 부제목(subcopy)을 생성할 수 있다.
- 같은 공유 표현이 검색 결과, 추천 목록, 매장 페이지 컬렉션 등 서로 다른 DoorDash 화면에서 재사용된다.
6.2. 매장 페이지 컬렉션의 진화
-
고정 컬렉션에서 고객 수준 컬렉션으로
- 과거 DoorDash 매장 페이지 컬렉션은 고정된 라이브러리이거나 상품 속성 기반이었다.
- 이제 소비자 수준에서 컬렉션을 생성해 고객의 선호와 현재 순간을 반영할 수 있다.
-
오프라인 LLM 생성
- 오프라인 LLM 프로세스가 고객 메모리와 시맨틱 ID를 입력으로 받는다.
- 제목, 부제목, 실제 상품까지 컬렉션 전체를 합성(synthesize)한다.
- 컬렉션을 어떤 고객에게 어떤 시점에 보여줄지 제어하고 조정할 수 있다.
-
기존 검색·순위 스택의 재사용
- 콘텐츠 생성은 LLM을 통해 오프라인 배치로 처리한다.
- 온라인에서는 기존 retrieval·ranking stack을 사용해 실제 상품을 hydration하고 컬렉션 내부 순위를 정한다.
- LLM이 만든 설명과 구조가 오래된 상품을 부정확하게 고정하지 않도록 재고와 순위는 운영 시스템이 담당한다.
6.3. 상황별 컬렉션 사례와 초기 실험
-
식물성 식품 선호
- 식물성 식품 affinity가 있는 고객에게 plant-based pantry 상품군을 생성한다.
-
고양이 가정
- 고양이만 키우는 가정에는 cat dry food 중심의 상품 행(row)을 보여준다.
-
식료품 재보충 세션
- 현재 세션이 pantry restocking을 나타내면 기본 식료품(pantry staples)에 가중치를 둔다.
-
반려동물 카테고리의 결과
- 초기 테스트에서 맞춤형 경험의 이점이 실제 행동으로 나타났다.
- pets vertical에서 주문율(order rate)이 약 1% 상승했다.
- 활성 사용자(active users)는 6% 상승했다.
7. 전체 아키텍처와 실행 원칙
7.1. 네 프리미티브가 연결되는 흐름
-
상품 의미 구축
- LLM 감독으로 쿼리-상품 관련성 라벨을 만든다.
- 카탈로그 상품에 계층형 시맨틱 ID를 부여해 상품 간 의미적 이웃을 만든다.
-
고객 의미 구축
- 주문·검색·브라우징·지원 기록과 명시적 대화에서 고객 메모리를 만든다.
- 텍스트, 임베딩, 그래프·트리로 다중 물질화해 여러 downstream model이 사용하게 한다.
-
운영 시스템으로 증류
- LLM은 오프라인에서 비싼 의미 추론과 콘텐츠 합성을 수행한다.
- 경량 라벨러, 임베딩, 시맨틱 ID, 메모리 feature가 추론 결과를 저장한다.
- 온라인 검색·순위·추천은 소형 모델과 기존 인프라가 낮은 지연시간으로 처리한다.
-
다양한 제품 출력
- 검색 retrieval은 관련성 중심의 후보를 찾는다.
- ranking은 관련성과 클릭·장바구니·전환 목표를 value function으로 조정한다.
- personalization은 고객 메모리를 사용해 상품·쿼리·컬렉션을 맞춘다.
- content generation은 제목·부제목·캐러셀·컬렉션을 생성한다.
7.2. 세 가지 결론
-
발견은 의미 이해 문제다
- 검색·추천 품질은 참여도만 높이는 문제가 아니다.
- 상품의 의미와 쇼핑객의 의도를 추론해야 사용자의 제약과 쇼핑 미션에 맞는 결과를 제공할 수 있다.
-
LLM 추론을 프리미티브로 증류해야 한다
- 추론을 라벨, 시맨틱 ID, 메모리 같은 오프라인 표현으로 저장한다.
- 더 작고 빠른 모델이 이 표현을 서빙하게 한다.
- 온라인 LLM 호출은 가능한 선택지 중 하나일 뿐, 검색·추천 제품의 기본 아키텍처일 필요는 없다.
-
공유 표현은 여러 사용 사례를 만든다
- 한 번 만든 관련성 라벨은 retrieval과 ranking의 공통 목표가 된다.
- 한 번 만든 시맨틱 ID는 검색, 쿼리 재구성, 추천, 컬렉션 생성에 재사용된다.
- 한 번 만든 고객 메모리는 개인화 컬렉션, Ask DoorDash, 검색·순위 모델을 함께 강화한다.
주요 발언 모음
“효과적인 discovery를 구축할 때 진짜 병목은 semantic understanding이다.”
“우리는 retrieval과 ranking 시스템을 LLM으로 대체하는 것이 아니라, reasoning과 understanding을 production ranking architecture로 증류한다.”
“비싼 reasoning을 오프라인에서 한 번 수행한 다음, 저렴하고 빠르게 서빙할 수 있는 모델로 증류한다.”
“온라인 LLM 호출은 종종 필요한 제품 아키텍처가 아니다.”
“발견은 engagement만의 문제가 아니라 semantic understanding의 문제다.”
“공유 표현을 갖추면 retrieval, ranking, content generation 같은 여러 사용 사례를 만들 수 있다.”
핵심 데이터 & 수치
- 수십억 개: 여러 국가의 매장-상품 수준에서 DoorDash가 다루는 카탈로그 규모다.
- 0·1·2: 쿼리-상품 관련성을 표현하는 3단계 graded relevance 척도다.
- 2단계: 전역 기하를 만드는 mining과 hard negative curriculum training으로 구성한 대조 학습 구조다.
- 2.3%: 2단계 관련성 학습으로 향상된 NDCG다.
- 4~5%: 시맨틱 ID를 적용한 ranker의 MRR 개선 폭이다.
- 약 1%: 개인화 컬렉션 초기 실험에서 반려동물 카테고리 주문율이 상승한 폭이다.
- 6%: 같은 실험에서 활성 사용자가 증가한 폭이다.
- 3가지 시간 척도: 장기 메모리, 실시간 세션 컨텍스트, 명시적 선호로 고객 메모리를 구성한다.
- 3가지 표현 형태: 사람이 읽는 텍스트, 검색·순위용 잠재 벡터, 관계 추론용 그래프·트리로 고객 메모리를 물질화한다.
- 4가지 프리미티브: supervision, catalog semantics, semantic personalization, steerable content generation으로 전체 흐름을 구성한다.
결론 및 시사점
- 검색 품질의 핵심 지표를 클릭·구매 같은 참여도에만 두면 인기 있지만 제약을 위반하는 상품이 상위에 노출될 수 있으므로, 의미적 관련성을 별도 학습 목표로 둬야 한다.
- 사람의 주석은 정확한 출발점이고 행동 신호는 풍부한 검증 재료이며, LLM은 두 신호가 놓치는 대규모 추론 라벨을 생성하는 증폭기 역할을 한다.
- 고비용 모델을 매 요청 호출하는 방식보다 LLM의 판단을 오프라인 라벨과 표현으로 저장하고 고속 모델에 증류하는 방식이 전자상거래 규모에 맞다.
- 검색 후보 생성과 최종 순위는 같은 관련성 라벨을 공유하되, 화면별 value function으로 의미 정확성과 사업 목표의 균형을 조절해야 한다.
- 시맨틱 ID는 상품의 정확한 일치·대체·보완 관계를 분리하고, 신규 상품의 콜드 스타트와 롱테일 커버리지를 동시에 개선한다.
- 카탈로그에 실제 재고가 없는 검색어를 제안하지 않으려면 쿼리 재구성도 재고와 연결된 의미 그래프를 기반으로 해야 한다.
- 고객 임베딩만 제공하는 것보다 텍스트·벡터·그래프를 함께 제공하면 개인화의 이유를 검사하고 여러 모델에 재사용하기 쉬워진다.
- 장기 선호·현재 세션·사용자가 직접 말한 제약은 시간 척도가 다르므로 하나의 벡터로 뭉개지 않고 별도 메모리 층으로 관리해야 한다.
- 오프라인 LLM이 만든 컬렉션의 제목과 구조에 기존 검색·순위·재고 시스템을 연결하면 생성 품질과 운영 안정성을 함께 확보할 수 있다.
- LLM 도입의 가장 큰 자산은 특정 모델 호출이 아니라 검색·추천·콘텐츠 생성이 공유하는 의미 표현을 축적하는 데서 나온다.
핵심 요약 (20줄)
DoorDash의 검색·추천 병목은 참여도 최적화보다 상품 의미와 쇼핑객 의도를 이해하는 능력에 있다.
강아지를 막 입양한 고객의 쇼핑은 사료 검색에서 케이지·목줄·훈련 패드·결제로 이어지는 여러 날의 여정이 될 수 있다.
DoorDash는 지도 학습, 카탈로그 의미론, 의미적 개인화, 제어 가능한 콘텐츠 생성이라는 네 가지 프리미티브를 사용한다.
글루텐 프리 파스타 검색에서 인기 있는 일반 스파게티는 참여도는 높아도 사용자의 제약을 충족하지 못한다.
사람의 주석은 비싸고 느리며 행동 신호는 노출·위치·가격·프로모션·이전 모델에 편향될 수 있다.
LLM은 쿼리와 상품의 의미적 관련성을 추론해 대규모로 활용할 수 있는 감독 신호를 만든다.
DoorDash는 0·1·2 관련성 라벨과 의심 사례 감사로 높은 정밀도의 골든 데이터 세트를 구축한다.
GPT-4o mini 같은 경량 모델을 미세 조정해 전체 카탈로그의 쿼리·상품 쌍에 등급을 부여한다.
표준 임베딩은 정확한 일치·대체·보완 상품의 차이를 충분히 벌리지 못할 수 있다.
2단계 대조 학습은 전역 기하를 만든 뒤 hard negative를 이용해 관련성 경계를 선명하게 만든다.
2단계 검색 학습은 관련성 NDCG를 2.3% 향상시켰고 하위 비즈니스 지표도 개선했다.
순위 모델은 LLM 관련성 타워와 클릭·장바구니·전환 타워를 공유 하위 계층에서 함께 학습한다.
시맨틱 ID는 앞쪽 prefix로 넓은 상품 이웃을, 뒤쪽 토큰으로 세부 특성을 표현하는 계층형 코드다.
시맨틱 ID는 카테고리 간 쇼핑 미션, 신규 상품 콜드 스타트, 롱테일 커버리지, 카탈로그 감사를 지원한다.
시맨틱 ID를 적용한 ranker의 MRR은 4~5% 향상됐고 Sriracha 기반 쿼리 재구성의 시장 반응도 크게 개선됐다.
고객 메모리는 장기 선호, 실시간 세션 컨텍스트, 에이전트에서 밝힌 명시적 선호를 세 시간 척도로 보존한다.
메모리 블록은 사람이 읽는 텍스트, 모델 입력용 임베딩, 관계 추론용 그래프·트리로 다중 물질화된다.
오프라인 LLM은 고객 메모리와 시맨틱 ID로 개인화 컬렉션의 제목·부제목·상품을 만들고 기존 검색 스택이 상품을 채운다.
반려동물 분야의 초기 개인화 컬렉션 실험에서 주문율은 약 1%, 활성 사용자는 6% 상승했다.
LLM의 추론을 라벨·시맨틱 ID·메모리로 증류하면 온라인 LLM 호출 없이 빠르고 저렴한 검색·순위·개인화를 구현할 수 있다.
메타데이터
- type: youtube-digest
- source: aiDotEngineer
- source_platform: YouTube
- video_id: ACPEpji5NV4
- video_url: https://www.youtube.com/watch?v=ACPEpji5NV4
- title_original: Distill the LLM, Don't Serve It: Search & Personalization at DoorDash
- presenter: Raghav Saboo, DoorDash
- processed_date: 2026-09-26
- language: 한국어 심층 정리
- category: ai-llm
