URL: https://www.youtube.com/watch?v=2LRIAfng7eA 날짜: 2026-09-26 채널: AI Engineer 발표: Yves Raimond, Jacqueline (Jackie) Wood, Spotify
📌 핵심 질문 / Spotify 추천 시스템을 어떻게 LLM 중심으로 바꾸는가
==대규모 카탈로그와 사용자의 맥락을 이해하는 오픈 LLM을 결합해, 추천 목록을 예측하는 시스템에서 사용자가 자연어로 조종하고 설명을 받는 생성형 개인화 시스템으로 전환한다.==
- 7억 6천만 명의 월간 활성 사용자와 1억 개가 넘는 트랙을 처리하려면 단순한 순위 예측만으로는 부족하다.
- Semantic Identifier(Semantic ID)를 오픈 LLM의 어휘에 추가하면 자연어, 사용자의 청취 이력, Spotify 카탈로그 항목을 하나의 생성 과정에서 연결할 수 있다.
- NEO 학습 절차는 기존 언어 능력을 보존하면서 Spotify 전용 추천·검색·설명 능력을 학습하고, LLM judge를 사용자 데이터로 보강해 품질을 평가한다.
개인화의 중심이 큐레이션과 과거 행동에서 유추한 취향에 머물지 않고, 사용자가 원하는 목표·상황·제외 규칙을 자연어로 지정하면 즉시 경험을 재구성하는 방향으로 이동한다. Spotify는 이를 실제 제품과 프로덕션 시스템에 적용해 추천, 검색, 설명, 생성 콘텐츠를 하나의 모델 계층으로 통합했다.
1. Spotify 개인화가 풀어야 하는 규모와 역사
1.1. 거대한 사용자·콘텐츠 공간
-
사용자 규모
- 월간 활성 사용자: Spotify는 184개 시장에 걸쳐 약 7억 6천만 명의 월간 활성 사용자(MAU)를 보유한다. Yves Raimond는 이 숫자가 행사장의 파이 차트에 표시되지 않은 점을 아쉽게 언급할 정도로 중요한 규모 지표로 제시했다.
- 개인화 난이도: 국가·시장·사용자별 상황이 다르고, 같은 콘텐츠라도 사용자의 목적과 시간대에 따라 적합성이 달라지므로 하나의 고정 순위표로 모든 맥락을 표현하기 어렵다.
-
카탈로그 규모
- 음악: Spotify에는 지금까지 발표된 음악의 거의 전부에 가까운 1억 개 이상의 트랙이 있다.
- 비음악 콘텐츠: 비디오, 팟캐스트, 오디오북도 함께 다뤄야 하므로 콘텐츠 유형별 의미와 추천 신호가 달라진다.
- 선택 문제: 사용자가 고를 수 있는 후보가 단순히 많기만 한 것이 아니라 장르·형식·길이·신규성·상황 적합성이 얽혀 있어 추천 자체가 놀라울 만큼 복잡해진다.
1.2. 큐레이션에서 확장 가능한 추천으로
-
사람이 만든 플레이리스트에서 출발
- 수동 큐레이션: 특정 취향을 위해 사람이 직접 플레이리스트를 만들었고, 이 방식은 지금도 Spotify의 매우 흔한 사용 시나리오다.
- 플레이리스트의 신호: Spotify에는 약 100억 개의 플레이리스트가 있으며 매시간 새로운 플레이리스트가 계속 만들어진다.
-
큐레이션 신호의 확장
- 신호의 학습: 사람이 만든 플레이리스트와 기타 행동 데이터를 모델이 학습해 큐레이션 의도를 확장 가능한 추천으로 변환했다.
- Discover Weekly: 2014년에 출시된 Discover Weekly는 초기 추천 시스템을 대표하는 제품으로, 큐레이션 신호를 대규모 개인화 경험으로 확장한 사례다.
2. 추천에서 생성형 개인화로의 전환
2.1. 추측하는 개인화에서 추론하는 개인화로
-
Personalization as guessing에서 reasoning으로
- 기존 접근: 랭킹 알고리즘(Ranking Algorithm)이 카탈로그에서 항목 목록을 생성하고, 사용자가 그중 무엇을 선택할지 과거 데이터로 추정한다.
- 새 접근: 모델이 후보 결과를 분석하고 특정 사용자의 현재 맥락에 실제로 관련성이 있는지 판단한다. 예측(Prediction)만이 아니라 논리적 추론(Reasoning)을 포함한다.
-
블랙박스에서 관리 가능한 개인화로
- 투명성 문제: 여러 단계의 랭킹 시스템을 사람이 완전히 분석하기는 어렵고, 사용자는 왜 특정 항목이 노출됐는지 알기 어렵다.
- 사용자 통제: 자연어를 이해하고 말할 수 있는 모델을 사용해 사용자가 개인화 결과의 방향과 규칙을 직접 관리한다.
- 경험 생성: 추천 목록만 반환하지 않고, 추천 경험을 만들며 그 이유를 자연어로 설명한다.
2.2. 사용자가 조종하는 생성형 경험
-
Spotify DJ의 조종 가능성
- 기본 경험: 몇 년 전 출시된 Spotify DJ를 실행하면 개인화된 음악이 재생된다.
- 실시간 개입: 지난해부터 화면 오른쪽 아래 버튼을 눌러 세션을 원하는 방향으로 돌릴 수 있다. 사용자는 재생 도중 알고리즘에 요구를 전달하고 즉시 다음 흐름을 조정한다.
-
자연어 온디맨드 플레이리스트
- 구체적 장소·시간 질의: “오늘 밤 샌프란시스코에서 공연하는 밴드들의 플레이리스트를 만들어줘(Create a playlist of bands playing in San Francisco tonight)”라고 요청하면 실제 공연 후보를 반영한 플레이리스트를 생성한다.
- 활동 동반 요청: “달리기를 함께할 플레이리스트를 만들어줘(Create a playlist to accompany me on my run)”처럼 활동을 직접 지정할 수 있다.
- 단계별 적응: 달리기 플레이리스트는 사용자의 입력에 따라 달리기의 서로 다른 단계에 맞춰 경험 자체가 동적으로 변한다. 단순히 미리 정한 곡 목록을 주는 것이 아니라 활동의 진행 맥락을 반영한다.
-
자연어 Taste Profile
- 취향의 가시화: 뉴질랜드에서 몇 달 전 출시됐고 다른 시장으로 확대 예정인 기능이다. Spotify 알고리즘이 사용자를 어떻게 이해했는지 자연어로 보여준다.
- 편집 가능성: 사용자는 빠진 취향이나 잘못 해석된 내용을 직접 고쳐 모델의 이해를 개선할 수 있다.
- 공유 기기 예외: “모든 Disney 음악은 아이들을 위한 것이다. 집에서 기기를 공유하지만 그것을 내 취향으로 추천하지 말라(All Disney music is for my kids ... but please don't recommend it to me)”라는 규칙을 추가할 수 있다. 가족이 함께 쓰는 기기에서 발생한 행동을 개인의 취향으로 잘못 해석하는 문제를 막는다.
- 능동적 목표: 새 장르나 새 주제에 익숙해지기, 새로운 언어 배우기처럼 사용자가 이루고 싶은 목표를 Taste Profile에 반영할 수 있다.
-
Personal Podcast
- 추천을 넘어 콘텐츠 생성: 생성형 개인화 시스템은 추천과 사용자 인상 수집에서 멈추지 않고 개인용 콘텐츠를 직접 만든다.
- 일일 커뮤니티 요약: 특정 사례에서는 매일 생성되는 요약을 통해 사용자의 커뮤니티에서 무슨 일이 일어나는지 알려준다.
3. 모든 제품을 연결하는 Large Taste Model
3.1. 하나의 공통 모델 계층
-
모델의 역할
- 내부 명칭: Spotify는 이 여러 애플리케이션을 실행하는 큰 시스템을 내부적으로 “Large Taste Model”이라고 부른다. 내부 시스템 이름을 잘 짓지 못한다는 농담도 곁들여졌다.
- 전체 상호작용 이해: Spotify에서 사용자가 과거에 어떤 콘텐츠와 상호작용했는지 모두 이해한다.
- 예측과 논리 결합: 다음 행동을 예측하는 동시에 높은 수준의 논리적 추론으로 요청과 맥락을 해석한다.
- 실시간 경험 구성: 사용자의 요청에 따라 경험을 실시간으로 만들고 조정한다. 따라서 완전히 관리 가능하고(steerable), 사용자의 요구에 적응한다.
-
사용량과 제품 효과
- 일일 사용: 미국 Spotify Premium 가입자 중 대략 네 명 중 한 명(1 in 4)이 매일 이 시스템과 상호작용한다.
- 기존 제품의 개선: 동일한 시스템을 기존 추천 플랫폼에 적용한 결과 자동 재생(Autoplay), 팟캐스트 오프닝/시작(Podcast Openings), DJ 메시지와의 사용자 참여에서 모두 개선을 관찰했다.
- 시스템적 의미: 새 모델은 별도의 실험 기능 하나를 추가한 것이 아니라 기존 추천 인프라의 여러 지점을 함께 개선하는 공통 기반으로 작동한다.
4. Spotify 카탈로그를 LLM의 언어로 변환하는 Semantic ID
4.1. 자연어와 카탈로그 항목을 한 시퀀스에 넣기
-
Semantic Identifier의 생성
- 출발점: 팟캐스트 에피소드 임베딩(Podcast Episode Embedding)처럼 이미 존재하는 콘텐츠 임베딩(Content Embedding)을 준비한다.
- 양자화: Quantization 알고리즘을 적용해 연속적인 임베딩을 이산 토큰(Discrete Token) 집합으로 바꾼다.
- 의미 보존: 생성된 Semantic ID는 Spotify 카탈로그의 객체를 표현하면서도 LLM이 처리할 수 있는 토큰 형태가 된다.
-
오픈 LLM 어휘 확장
- 모델 선택: Qwen 같은 오픈 대규모 언어 모델(Open LLM)을 기반으로 삼는다.
- 사전 수정: 모델의 토큰 사전(Dictionary)에 Semantic ID 전용 특수 토큰을 추가한다.
- 공동 학습: 자연어와 카탈로그 객체를 나타내는 새 토큰을 모두 이해하도록 모델을 재학습한다.
4.2. 자연어 요청에서 추천·설명까지
- 팟캐스트 도덕성 질의 예시
- 요청: 사용자가 자연어로 도덕성(Morality)에 관한 팟캐스트를 요청한다.
- 입력 결합: 자연어 요청과 사용자의 청취 이력이 Semantic ID 목록 형태로 프롬프트에 함께 들어간다.
- 출력: 모델은 조건에 맞는 팟캐스트 에피소드의 Semantic ID를 생성하고, 왜 해당 에피소드를 추천했는지 자연어로 설명한다.
- 핵심 변화: 추천 객체를 별도 도구 호출로 조회한 뒤 설명을 덧붙이는 구조가 아니라, 자연어와 Spotify 객체를 동일한 생성·추론 체계에서 처리한다.
5. NEO의 네 단계 학습 레시피
5.1. Semantic Foundation — 의미 토큰의 기반 만들기
-
카탈로그 의미의 토큰화
- 콘텐츠 임베딩에서 의미 있는 Semantic ID를 생성한다.
- 새 토큰을 오픈 LLM의 사전에 추가해 Spotify 객체를 언어 모델이 생성할 수 있는 단위로 만든다.
-
학습 목표
- 자연어만 처리하던 모델이 일반 언어와 Spotify 카탈로그의 이산 표현을 함께 읽고 쓰게 한다.
- 이 단계가 Spotify 전용 추천 시스템을 LLM 중심 시스템으로 전환하는 의미적 출발점이 된다.
5.2. Domain Binding/Grounding — 기존 언어 공간에 새 토큰 정렬하기
-
임베딩 공간 정렬
- 새 Semantic ID 임베딩을 기존 자연어 임베딩 공간에 맞춘다.
- Semantic ID에서 텍스트로 가는 매핑, 텍스트에서 Semantic ID로 가는 매핑, 두 표현을 조합하는 양방향 학습을 사용한다.
-
Frozen Backbone 전략
- 고정 대상: 기존 LLM의 프레임워크, 기존 가중치와 기존 임베딩을 동결한다.
- 학습 대상: 새로 추가한 Semantic ID 토큰의 임베딩만 학습한다.
- 보존 효과: 사전 학습된 기본 언어 능력을 잃는 catastrophic forgetting 위험을 줄이면서 Spotify 의미 토큰을 배울 수 있다.
5.3. Capability Induction — Spotify 작업을 다중 작업으로 주입하기
-
Instruction 기반 다중 작업 학습
- 다음 항목 추천(Next-Item Recommendation), 검색(Search) 등 Spotify에 중요한 작업을 지시문 형태로 묶어 학습한다.
- 이 단계에서는 전체 모델을 다시 동결 해제해 모든 가중치와 임베딩을 조정한다.
-
파라미터 조정 방식
- 전체 파라미터 튜닝(Full Parameter Tuning)을 사용하거나 LoRA를 적용해 여러 Spotify 작업을 학습한다.
- 여러 작업이 공유하는 신호를 한 모델 안에서 학습하면 한 콘텐츠 유형의 정보가 다른 유형의 일반화에 기여할 수 있다.
5.4. Optional Post-Training — 선택적 후처리
- 추가 정렬
- 필요하면 강화학습 기반 튜닝(RL Tuning) 등 선택적 Post-Training을 추가한다.
- NEO의 핵심 네 단계는 의미 기반 마련, 도메인 결합, 능력 주입, 선택적 후처리로 이어지며 제품 요구에 따라 마지막 단계를 생략할 수 있다.
6. 학습 설계와 추론 전략을 검증한 절제 연구
6.1. 다중 작업 학습의 효과
-
단일 작업 모델과 비교
- 모든 작업에서 다중 작업 모델은 단일 작업 모델의 성능을 맞추거나 넘어섰다.
- 여러 작업을 한 모델에 넣는 것이 서로의 성능을 해치는 대신 긍정적인 교차 학습(Positive Cross-Learning)을 만들었다.
-
오디오북 콜드 스타트
- Spotify에서 오디오북은 비교적 새로운 콘텐츠 유형이라 자체 행동 데이터가 부족한 콜드 스타트 문제가 크다.
- 다중 작업 모델은 팟캐스트 추천처럼 이미 신호가 풍부한 카탈로그 영역에서 배운 패턴을 활용해 의미 있는 오디오북 추천을 생성했다.
6.2. Frozen Backbone, 랜덤 초기화, Continuous Pre-Training 비교
-
단계 제거 실험
- Domain Binding/Grounding 단계를 완전히 제거하고 백본을 고정한 경우 성능이 떨어졌다.
- Grounding과 Capability Induction을 instruction 기반 다중 작업 설정 안에서 합쳐 처리한 경우에도 성능이 저하됐다.
-
사전 학습 백본의 중요성
- 가장 큰 성능 하락은 오픈 웨이트 사전 학습 LLM 대신 무작위 초기화(Randomly Initialized) 백본을 사용했을 때 발생했다.
- 이미 자연어와 세계 지식을 학습한 백본을 보존하는 것이 Spotify 카탈로그 지식을 주입하는 것보다 먼저 확보해야 할 기반이다.
-
Continuous Pre-Training의 부작용
- 도메인 앵커링에 Continuous Pre-Training을 쓰면 특정 작업의 성능 저하는 작게 나타날 수 있다.
- 그러나 사전 학습 백본의 자연어 능력과 세계 지식은 거의 0에 가까운 수준까지 감소한다.
- Frozen Backbone 기반 Domain Binding은 Semantic ID를 학습하면서도 기존 기본 언어 능력을 유지한다.
- 이 실험은 Qwen에서 수행했지만 Llama에서도 같은 결과가 확인됐다. 따라서 특정 백본의 우연한 특성보다 학습 패러다임 자체의 효과로 해석할 수 있다.
6.3. Semantic ID 디코딩의 정확도와 지연 시간
-
Beam Search와 Constrained Decoding
- Beam Search를 제한된 디코딩(Constrained Decoding) 적용 여부로 나누어 평가했다.
- 제한된 디코딩 없이도 생성된 Semantic ID의 98%가 유효했다.
- Constrained Decoding은 약간의 지연 시간을 추가하지만 “새 콘텐츠만 추천”처럼 특정 유형의 콘텐츠를 강제해야 하는 상황에 유용하다.
-
Top-P Sampling과 Beam Search의 절충
- Top-P Sampling은 Beam Search보다 정확도를 상당히 낮췄다.
- Beam Search는 약간 더 높은 지연 시간 부담을 만들지만, Spotify는 정확도와 지연 시간의 절충으로 Beam Search를 선택했다.
7. 도구 호출 없이 프로덕션에 적용한 통합 시스템
7.1. NEO가 결합한 기능
-
기존 연구 흐름의 통합
- Semantic ID를 사용하는 Generative Search, Tool-Based LLM Recommender, “Plum” 논문 등 관련 발전이 각각 존재했다.
- NEO는 카탈로그 항목을 의미적으로 이해하고, 자연어로 구동되며, 검색·추천·설명을 수행하는 기능을 하나의 시스템에 결합했다.
-
운영 조건
- 제3자 도구(Third-Party Tool) 없이 낮은 지연 시간(Low Latency)으로 작동한다.
- 산업 규모(Industrial Scale)에서 사용되며 이미 Spotify 프로덕션에 배포되어 있다.
7.2. 팟캐스트 검색에서 청취 습관 넓히기
-
기존 패턴 탈피
- NEO 기반 모델을 팟캐스트 검색에 적용하면 사용자가 평소 반복하던 청취 패턴에서 벗어나게 만들 수 있다.
- 사용자가 익숙한 것만 계속 소비하는 대신 새로운 콘텐츠를 듣도록 유도한다.
-
온라인 성과
- 이런 탐색 확장 효과가 실제 온라인 환경에서 상당한 성공을 거뒀다.
- 생성형 검색의 목표는 클릭률만 높이는 것이 아니라 사용자의 의도에 맞는 새로운 발견을 가능하게 하는 것이다.
8. 생성형 추천을 평가하는 LLM Judge
8.1. 전통적 오프라인 지표의 한계
-
행동 신호만으로 부족한 이유
- 전통적인 오프라인 평가 지표는 사용자가 추천 콘텐츠와 상호작용했는지는 알려준다.
- 그러나 추천이 사용자에게 말이 되는지, 설명이 정확한지, 추천이 사용자의 의도와 맞는지는 판단하지 못한다.
-
LLM Judge의 역할
- LLM Judge는 추천·검색 결과와 자연어 설명의 의미적 타당성을 평가할 수 있다.
- 다만 사람의 선호와 맞는 신뢰할 만한 평가자가 되려면 의미 있는 실제 데이터로 보강해야 한다.
8.2. 사용자 데이터로 평가자를 보강한 결과
-
청취 이력 기반 사용자 프로필
- 청취 이력을 요약한 텍스트 사용자 프로필을 만들고 이를 LLM Judge의 입력으로 제공했다.
- 팟캐스트 추천 평가에서 LLM Judge와 사람의 선호가 75% 일치했다.
-
검색 행동 신호
- 검색 평가에서는 유사한 질의와 과거에 사용자가 그 질의에 어떻게 반응했는지 같은 실제 행동 단서를 추가했다.
- 전체 일치도는 5% 높아졌다.
- 특히 모호한 질의에서는 일치도가 91% 향상됐다. LLM Judge가 어려워하는 복잡한 사례일수록 실제 행동 신호의 가치가 커졌다.
8.3. Cranfield 방식의 평가 세트 확장
-
전통적 구성
- 여러 출처에서 후보를 뽑아 하나의 후보 풀(Pool)을 만들고, 사람이 후보를 순위화한다.
- 이 Cranfield 스타일 평가 세트는 품질이 좋지만 후보를 직접 읽고 순위를 매기는 인간 평가 비용이 높다.
-
보강된 Judge로 확장
- Spotify는 LLM Judge를 실제 데이터로 충분히 보강해 인간 순위를 대신 확장할 수 있도록 했다.
- 보강된 LLM Judge와 인간 순위의 일치 계수(Agreement Coefficient)는 0.87에 도달했다.
주요 발언 모음
“We call it internally the ‘Large Taste Model.’”
“Personalization as guessing”에서 “personalization as reasoning”으로 이동한다.
“One in four Spotify Premium subscribers in the US interact with this system daily.”
“The model responds with the corresponding podcast episodes and explains in natural language why it recommended it.”
“We taught open LLMs to speak the language of Spotify.”
핵심 데이터 & 수치
- 7억 6천만 명: 184개 시장의 Spotify 월간 활성 사용자 수다.
- 184개 시장: 사용자 규모가 분산된 글로벌 운영 범위다.
- 1억 개 이상: 추천 후보가 되는 음악 트랙 수다.
- 100억 개: Spotify에 존재하는 플레이리스트의 대략적인 수다.
- 2014년: Discover Weekly가 출시된 시점이다.
- 1/4: 미국 Spotify Premium 가입자 중 Large Taste Model과 매일 상호작용하는 비율이다.
- 4단계: NEO의 Semantic Foundation, Domain Binding, Capability Induction, 선택적 Post-Training 구성이다.
- 98%: Constrained Decoding 없이도 유효한 Semantic ID를 생성한 비율이다.
- 75%: 청취 이력 기반 사용자 프로필을 사용한 LLM Judge와 인간 선호의 일치도다.
- 5%: 실제 검색 행동 단서를 추가했을 때 전체 Judge 일치도가 상승한 폭이다.
- 91%: 모호한 검색어에서 실제 행동 단서가 Judge 일치도를 높인 폭이다.
- 0.87: 보강된 LLM Judge와 인간 순위의 일치 계수다.
결론 및 시사점
- 추천의 단위를 목록에서 대화형 경험으로 확장해야 한다: 대규모 카탈로그에서 다음 항목을 고르는 것만으로는 사용자 목표와 상황을 충분히 반영할 수 없으므로, 자연어 요청을 받아 경험을 생성하고 재조정하는 계층이 필요하다.
- 카탈로그 객체를 LLM의 토큰 공간에 정착시켜야 한다: Semantic ID는 별도 검색 도구를 무작정 붙이는 대신 콘텐츠 의미와 자연어를 한 모델의 생성 과정에 연결하는 방법을 제공한다.
- 새 지식 주입과 기존 언어 능력 보존을 분리해야 한다: Frozen Backbone 기반 Domain Binding은 새 도메인 토큰을 학습하면서 catastrophic forgetting을 줄이고, Continuous Pre-Training의 언어 능력 손실을 피한다.
- 다중 작업 학습은 추천 품질과 신규 콘텐츠 콜드 스타트를 함께 개선한다: 검색·추천·콘텐츠 유형별 작업이 공유하는 표현을 학습하면 오디오북처럼 데이터가 부족한 영역에도 다른 카탈로그의 지식을 전이할 수 있다.
- 정확도와 제어 가능성을 지연 시간과 함께 최적화해야 한다: 일반 생성에서 98%의 유효 Semantic ID를 얻고, 새 콘텐츠 전용 필터가 필요할 때만 Constrained Decoding을 추가하는 방식이 실용적인 절충이 된다.
- 생성형 개인화에는 생성형 평가가 필요하다: 클릭과 청취 같은 전통 지표만으로는 추천 이유의 정확성이나 사용자 의도 부합 여부를 검증할 수 없으므로, 실제 사용자 프로필과 행동으로 보강한 LLM Judge가 필요하다.
- 개인화는 사용자가 수정할 수 있어야 한다: 공유 기기에서 발생한 가족의 행동처럼 모델이 틀릴 수 있는 맥락을 사용자가 자연어 규칙으로 교정할 수 있어야 장기적인 신뢰와 통제권을 확보한다.
- LLM 기반 추천은 이미 산업 시스템의 공통 기반이 될 수 있다: 검색·추천·설명·생성 콘텐츠를 낮은 지연 시간과 제3자 도구 없이 하나로 처리하는 NEO가 프로덕션에서 작동한다는 점은 실험 단계를 넘어선 적용 가능성을 보여준다.
핵심 요약 (20줄)
Spotify는 184개 시장에서 약 7억 6천만 월간 활성 사용자를 보유한다.
카탈로그는 1억 개가 넘는 트랙과 비디오·팟캐스트·오디오북으로 구성되어 추천 공간이 매우 크다.
개인화는 수동 큐레이션에서 큐레이션 신호를 확장하는 추천 시스템으로 발전했다.
2014년 출시된 Discover Weekly는 큐레이션 신호를 확장 가능한 추천으로 바꾼 대표 사례다.
생성형 개인화는 콘텐츠를 맞히는 데서 사용자별 경험을 실시간으로 만드는 단계로 이동한다.
새로운 패러다임은 순위 추정 대신 맥락을 해석하는 reasoning을 사용한다.
사용자는 Spotify DJ를 원하는 방향으로 조종해 재생 세션을 즉시 바꿀 수 있다.
자연어 플레이리스트는 샌프란시스코 공연이나 달리기 단계처럼 구체적 맥락을 반영한다.
Taste Profile은 알고리즘이 이해한 취향을 자연어로 보여주고 사용자가 직접 수정하게 한다.
사용자는 아이와 공유하는 디즈니 음악을 자신의 취향에서 제외하도록 규칙을 추가할 수 있다.
Personal Podcast는 추천을 넘어 매일 커뮤니티 소식을 요약하는 콘텐츠를 생성한다.
Large Taste Model은 Spotify의 모든 과거 상호작용을 이해하며 예측과 논리적 추론을 결합한다.
미국 Spotify Premium 가입자 네 명 중 한 명이 이 시스템을 매일 사용한다.
Semantic ID는 콘텐츠 임베딩을 양자화해 Spotify 카탈로그 항목을 이산 토큰으로 표현한다.
Qwen 같은 오픈 LLM은 자연어와 Semantic ID를 함께 이해하도록 어휘와 학습 과정을 확장한다.
NEO는 Semantic Foundation, Domain Binding, Capability Induction, 선택적 Post-Training의 네 단계로 구성된다.
고정된 백본 위에서 새 토큰만 학습하면 기존 언어 능력의 catastrophic forgetting을 줄일 수 있다.
다중 작업 학습은 단일 작업 모델과 동등하거나 더 높은 성능을 내며 오디오북 콜드 스타트를 돕는다.
제약 없는 디코딩도 Semantic ID를 98% 유효하게 생성하지만 특정 콘텐츠 제어에는 제약 디코딩이 유용하다.
사용자 프로필과 행동으로 보강한 LLM Judge는 사람과 75% 일치하고 모호한 검색어에서는 일치도가 91% 향상된다.
