URL: https://www.youtube.com/watch?v=lIgdnF0s0kQ
날짜: 2026-09-26
채널: aiDotEngineer
발표자: Devansh Tandon, Meta
원문 제목: Why LLM Recommenders Will Be AI's Biggest Consumer App
영상 길이: 17분 45초
📌 핵심 질문 / 전체 논점
==추천 시스템도 대규모 언어 모델(LLM)처럼 규모 확장 법칙(scaling law)을 따르며, LLM 추천 시스템은 매우 큰 소비자용 AI 애플리케이션이 될 수 있는가?==
- 추천 시스템은 모델 크기, 데이터, 연산량을 늘릴수록 오프라인 품질과 실제 사용자 참여가 함께 개선되는 예측 가능한 확장 곡선을 보인다.
- 추천 분야는 전통적 추천 시스템에서 LLM 영감 모델, LLM 네이티브 모델, 에이전트형(agentic) 모델로 이어지는 네 개의 확장 곡선을 동시에 오르고 있다.
- 시맨틱 ID(semantic ID)로 콘텐츠를 압축된 토큰으로 바꾸면 LLM이 사용자의 긴 상호작용 기록을 이해하고, 기존 콘텐츠를 가리키는 추천을 직접 생성할 수 있다.
- 콘텐츠 피드가 LLM 채팅보다 훨씬 적은 추론 토큰으로 긴 참여 시간을 만들어내므로, LLM 추천 시스템은 규모가 크면서도 토큰 효율이 높은 소비자 AI 제품이 될 가능성이 높다.
Devansh Tandon은 Meta에서 Instagram, Facebook, 광고 및 Meta 앱 제품군을 구동하는 추천 모델을 연구·개발한다. 핵심 주장은 추천 시스템을 단순한 검색·랭킹 부품으로 보지 말고, 모델 학습→추론→참여→수익화→다음 학습을 반복하는 소비자 앱의 경제적 플라이휠(flywheel)로 봐야 한다는 것이다. LLM을 추천 영역에 연결하면 사용자가 자연어로 피드를 조종하고, 추천 이유를 묻고, 자신의 목표에 맞게 경험을 설계하는 상호작용형 제품이 가능해진다.
1. 추천 시스템도 LLM처럼 확장된다
추천 시스템은 이미 거대한 규모로 운영되는 생산용 머신러닝 모델이며, 더 많은 데이터·연산·모델 용량을 투입할수록 품질과 사업 성과가 개선된다.
1.1. 발표의 두 가지 주장과 배경
-
추천 시스템의 확장 곡선
- 두 가지 핵심 주장: 추천 시스템은 LLM처럼 확장되고 있으며, 업계는 아직 그 확장 곡선의 초반부에 있다.
- 소비자 앱으로서의 잠재력: LLM 추천 시스템은 AI에서 가장 큰 소비자용 애플리케이션 중 하나가 될 수 있다.
-
Devansh Tandon의 연구 배경
- Meta Recommendations Research: Meta에서 연구와 제품을 함께 담당하며, Instagram·Facebook 광고·Meta 앱 제품군을 구동하는 프런티어 모델, LLM, 추천 시스템을 학습하는 팀을 이끈다.
- Google에서의 경험: Meta 이전에는 Google에서 오랫동안 근무했고, DeepMind와 YouTube를 포함한 주요 머신러닝 팀에서 일했다.
- 작년 발표와 연결: AI Engineer에서
Teaching Gemini to Speak YouTube라는 발표를 하며 시맨틱 ID와 생성형 검색(generative retrieval)을 소개했고, 두 아이디어에 관한 논문도 작성했다. - 산업 확산: 시맨틱 ID와 생성형 검색은 최근 1년 동안 연구 아이디어에서 실제 대규모 생산 시스템으로 이동했다. YouTube, Meta, Spotify, DoorDash에서 관련 제품 출시와 논문이 나왔다.
-
발표의 네 부분
- 추천 확장 곡선: 추천 모델이 데이터·연산·모델 크기와 함께 어떻게 성장하는지 살핀다.
- 네 가지 추천 패러다임: 업계가 오르고 있는 네 개의 추천 시스템 확장 곡선을 구분한다.
- 추천 시스템 레시피: LLM 추천 시스템을 실제로 만드는 단계를 정리한다.
- 소비자 AI 앱 프레임워크: 콘텐츠 피드와 AI 채팅 앱의 토큰·참여 경제성을 비교한다.
1.2. 2020년 LLM 스케일링 법칙과 추천 시스템의 평행선
-
파워 법칙(power law)의 의미
- 역사적 기준점: 2020년의 대표적 스케일링 곡선 논문은 모델 크기, 데이터, 학습에 사용한 연산량(FLOPs)을 늘리면 손실(loss)이 로그-선형(log-linear) 축에서 예측 가능한 방식으로 낮아진다고 보여줬다.
- 시점의 농담: 당시에는 Dario Amodei가 OpenAI에 있었고 Anthropic은 아직 존재하지 않았다는 점을 들어, 그때가 아주 오래전처럼 느껴진다고 말했다.
- 산업적 영향: 모델 품질과 능력의 개선 폭을 미리 예측할 수 있게 되면서 AI 프런티어 경쟁이 촉발됐고, 오늘날의 거대한 자본지출(capex)과 AI 인프라 투자를 뒷받침하는 근거가 됐다.
-
추천 시스템의 동일한 구조
- 대규모 생산 모델: LLM 물결 이전에는 추천 시스템이 빅테크 기업에서 가장 큰 생산용 머신러닝 모델이었고, 지금도 일일 활성 사용자 10억 명 이상 규모로 서비스되는 가장 큰 모델 중 일부다.
- 확장 축: x축에 데이터·연산·모델 크기를 놓으면, y축에는 손실 감소 또는 추천 품질 향상이 나타난다.
- 오프라인 평가: 오프라인에서는 엔트로피(entropy)나 AUC 개선으로 품질을 측정한다.
- 온라인 성과: 실제 제품 출시에서는 사용자 참여도와 매출에 미치는 영향으로 변환된다.
-
Meta의 HSTU 사례
- 논문 근거: 2024년 HSTU 논문과 올해 발표된 후속 논문은 모델 크기·연산·데이터를 확장할 때 오프라인 추천 품질이 분명하게 좋아지는 파워-로스(power-loss) 곡선을 보여준다.
- 학술 연구 이상의 의미: 곡선은 논문 속 숫자에만 머물지 않고, 세계 최대 소비자 비즈니스의 실제 제품 성과를 움직인다.
1.3. Instagram Reels와 토큰·참여 플라이휠
-
추천 품질 개선이 사업 성과로 바뀌는 과정
- 시청 시간 증가: Meta의 최근 실적 보고에서 Instagram Reels는 전년 대비 시청 시간이 30% 증가하는 강한 분기를 기록했다.
- 랭킹 아키텍처 단순화: 효율적인 모델 확장을 가능하게 하도록 랭킹 아키텍처를 단순화했다.
- 긴 상호작용 기록: 사용자의 관심사를 더 잘 파악하기 위해 더 긴 상호작용 이력을 활용했다.
- 두 가지 데이터 확장: Instagram 학습에 쓰는 사용자 상호작용 시퀀스 길이를 두 배로 늘렸고, 각 상호작용의 풍부함도 높였다.
-
토큰(tokens)에서 참여(engagement)로 이어지는 플라이휠
- 학습과 추론: 모델을 학습한 뒤 추론을 실행한다. 추천 모델에서 소비되는 토큰이 더 나은 콘텐츠 추천으로 변환된다.
- 참여와 수익화: 추천 품질은 일일 활성 사용자(DAU)와 체류 시간으로 나타나는 참여를 높이고, 광고나 구독 수익으로 이어진다.
- 재투자: 수익은 다음 모델 학습 비용을 지불한다. 확장 곡선에서 한 단계 올라갈 때마다 이 플라이휠을 한 바퀴 더 돌게 된다.
- 사업의 중심: 많은 소비자 앱이 이 플라이휠을 사업의 핵심에서 반복적으로 회전시킨다.
2. 업계가 오르는 네 개의 추천 패러다임
네 패러다임은 서로를 완전히 대체하는 단계가 아니라, 기업들이 병렬로 확장하는 서로 다른 곡선이다. 현재 가장 앞선 추천 시스템은 주로 LLM 영감 단계에 있고 LLM 네이티브 단계로 넘어가는 중이다.
2.1. 전통적 추천 시스템(traditional recommenders)
-
특징 공학과 임베딩 중심 구조
- 핵심 방식: 사용자와 콘텐츠의 특징(feature engineering)을 설계하고 사용자·콘텐츠 임베딩(user/content embeddings)을 학습한다.
- 생산 환경의 현실: 대부분의 생산 시스템은 아직 이 곡선 위에 있다.
-
대표적인 모델과 다음 변화
- Two-tower 구조: 두 타워(two-tower) 모델, 희소 네트워크(sparse network), 랭커(rankers)를 사용하고 임베딩 모델을 확장한다.
- 자동화된 연구: 이 패러다임이 사라지지는 않지만 모델 개발은 자동 연구(auto research)로 빨라질 수 있다.
- 에이전트형 특징 공학: 특징 공학처럼 반복적인 작업은 실제 머신러닝 엔지니어 대신 에이전트가 처리할 수 있다.
2.2. LLM 영감 추천 모델(LLM-inspired models)
-
엔드투엔드 확장
- 핵심 전환: LLM에서 영감을 받은 구조로 추천 모델을 가능한 한 엔드투엔드(end-to-end)로 확장한다.
- 대표 사례: HSTU와 OneRec 논문이 이 패러다임의 예다.
- 현재 위치: 업계의 선도적인 추천 시스템 상당수가 현재 이 곡선에서 작동한다.
-
기존 시스템과의 공존
- 병렬 진행: 기업들은 전통적 추천 모델을 계속 확장하면서 LLM 영감 모델도 키운다.
- 다음 목표: 많은 시스템이 LLM 영감 단계에서 LLM 네이티브 단계로 졸업하려 한다.
2.3. LLM 네이티브 추천 모델(LLM-native models)
-
기반 모델을 추천에 적응시키기
- 기본 능력 활용: 언어를 이해하고 추론할 수 있는 기반 모델(base model)을 가져와 추천 작업에 맞게 적응시킨다.
- 대표 논문: TIGER와 PLaM 논문이 이 패러다임의 사례로 제시됐다.
-
기대하는 능력
- 언어와 추천의 결합: 사용자의 자연어 목표, 과거 행동, 콘텐츠 표현을 하나의 모델 안에서 연결한다.
- 설명과 제어: 결과만 내놓는 블랙박스 랭커를 넘어 추천 이유와 사용자 지시를 다룰 수 있다.
2.4. 에이전트형 추천 시스템(agentic recommenders)
-
단일 순전파에서 반복 루프로
- 오케스트레이션: LLM이 추천 시스템을 하나의 루프 안에서 조율한다.
- 반복 단계: 에이전트가 계획(plan)하고, 검색(retrieve)하고, 순위를 매기고(rank), 추천을 비평(critique)한다.
- 정제와 재호출: 필요한 경우 모델을 다시 호출해 추천 결과를 다듬고 최종 목록을 전달한다.
-
코딩 에이전트와의 유사성
- 모델 능력과 하네스의 구분: LLM 네이티브 곡선이 핵심 모델 자체의 능력을 높이는 것이라면, 에이전트형 곡선은 Claude Code나 Codex 같은 코딩 에이전트의 하네스(harness)를 개선하는 것과 비슷하다.
- 개선의 비유: 핵심 모델이 한 버전에서 다음 버전으로 좋아지는 것과, 에이전트가 작업을 계획·검증·반복하는 구조가 좋아지는 것은 서로 다른 확장 축이다.
- 연구 기회: 추천 결과를 한 번만 계산하는 대신 계획·검색·랭킹·비평·재계산을 반복하는 구조는 중요한 연구 영역이 된다.
3. LLM 추천 시스템을 만드는 레시피
LLM 추천 시스템은 콘텐츠를 도메인 언어로 토큰화하고, 언어 모델이 일반 언어와 그 도메인 언어를 함께 이해하도록 학습한 뒤, 사용자 정보를 입력해 추천 토큰을 직접 디코딩하는 세 단계로 구성된다.
3.1. 세 단계의 기본 레시피
-
콘텐츠 토큰화
- 도메인 언어 생성: 콘텐츠 코퍼스(content corpus)를 토큰화해 추천 영역에서 사용할 언어를 만든다.
- 압축된 주소: 콘텐츠의 의미와 유사성을 보존하면서 LLM이 이해하고 추론할 수 있는 토큰 표현을 만든다.
-
LLM 적응
- 이중언어 모델: LLM이 영어와 추천 도메인 언어를 모두 이해하도록 적응시킨다.
- 기반 모델 선택: 오픈 웨이트(open-weights) 모델이나 내부에서 만든 퍼스트파티(first-party) 모델을 기반으로 삼을 수 있다.
-
추천 디코딩
- 사용자 정보 입력: 사용자 이력과 현재 관심사를 모델에 프롬프트로 제공한다.
- 콘텐츠 코퍼스에서 직접 생성: 모델이 콘텐츠 코퍼스에 있는 추천을 직접 디코딩한다.
3.2. 다섯 층 케이크(five-layer cake)
-
1층 — 시맨틱 ID(semantic ID)
- 콘텐츠를 의미를 담은 짧은 토큰 시퀀스로 바꾼다.
- 모델이 콘텐츠의 관계와 사용자의 상호작용 시퀀스를 계산할 수 있는 기반 표현을 마련한다.
-
2층 — 기반 LLM(foundation model)
- 오픈 웨이트 모델이나 내부 퍼스트파티 모델을 선택한다.
- 모델이 영어와 추천 토큰 사이를 연결할 수 있는 용량을 제공한다.
-
3층 — 사전 학습(pre-training)
- 영어와 추천 토큰을 연결해 두 언어를 함께 다루는 능력을 만든다.
- 추천 토큰을 자연어 설명 및 콘텐츠 의미와 연결한다.
-
4층 — 사후 학습(post-training)
- 참여도 예측처럼 추천에 특화된 작업으로 모델을 조정한다.
- 추천 결과를 추론하고 추천 품질을 평가하는 능력을 학습시킨다.
-
5층 — 표면별 미세 조정(surface-specific fine-tuning)
- Instagram Reels처럼 특정 제품 표면에 배치하기 위한 가벼운 미세 조정을 수행한다.
- 대부분의 연산을 여러 제품 표면 사이에서 공유하므로 제품마다 처음부터 개별 모델을 학습할 필요가 없다.
3.3. 시맨틱 ID가 해시 ID보다 나은 이유
-
안정적인 학습 표현
- 해시 ID의 한계: 해시 ID는 계속 바뀌는 식별자라 모델이 의미를 학습하기보다 개별 값을 암기하게 만든다.
- 시맨틱 ID의 장점: 시맨틱 ID는 모델이 콘텐츠의 의미와 관계를 학습할 수 있는 안정적인 표현을 제공한다.
- 기존 모델에도 적용: 일부 팀은 전통적인 모델의 해시 ID를 시맨틱 ID로 교체하는 것만으로도 좋은 성과를 보고 있다.
-
긴 콘텐츠의 압축
- 문맥 창의 병목: 사용자의 긴 상호작용 기록을 추론하려면 콘텐츠 표현을 충분히 압축해야 한다.
- 구체적 수치: 3분짜리 Instagram Reel 하나를 원래 콘텐츠로 표현하면 약 10,000토큰이 필요해 문맥 창을 너무 빨리 채운다.
- 압축 목표: 해당 Reel을 약 10토큰으로 줄여 긴 사용자 이력과 많은 후보를 함께 처리한다.
-
테니스 Reel의 토큰 구조
- 공통 접두사: 테니스에 관한 여러 Instagram Reel은 의미가 매우 비슷해 시맨틱 ID의 첫 세 토큰을 공유한다.
- 의미 계층: 첫 토큰은 스포츠, 다음 두 토큰은 테니스를 나타내는 식으로 의미를 계층화할 수 있다.
- 개별 식별: 마지막 토큰은 비슷한 영상들을 서로 구분하는 고유 표현이 된다.
3.4. 영어와 추천 토큰을 연결하는 학습
-
사전 학습 예시
- 콘텐츠 설명 생성:
semantic ID ABC를 가진 비디오를 입력하고 설명을 비워두면, 모델이 “Wimbledon에서 즉시 전설이 된 샷”이라는 자연어 설명을 출력하도록 학습할 수 있다. - 연결되는 의미: 모델은 시맨틱 토큰과 합성된 영어 자연어 텍스트 사이의 대응 관계를 배운다.
- 콘텐츠 설명 생성:
-
상호작용 시퀀스 추론
- 마스킹 과제: 사용자의 시청 기록에서 시맨틱 ID 일부를 가린다.
- 다음 행동 예측: 모델은 가려진 토큰을 예측하며 어떤 비디오가 연속해서 함께 시청되는지 학습한다.
- 행동 패턴 이해: 콘텐츠 자체뿐 아니라 콘텐츠가 사용자 행동 순서 안에서 놓이는 관계를 파악한다.
3.5. 30개 후보를 5개 추천으로 재랭킹하기
-
사후 학습 과제
- 입력: 사용자 정보와 후보 비디오 30개를 모델에 넣는다.
- 출력: LLM 랭커가 후보를 다시 정렬해 상위 5개 추천을 낸다.
-
추론 가능성과 사용자 이해
- 자연어로 검사: 모델이 영어와 추천 언어를 모두 이해하므로 어떤 이유로 결정을 내렸는지 모델의 추론을 직접 검사할 수 있다.
- 관심사 파악: 예시 모델은 사용자가 코미디, 음식, DIY, 웰니스에 관심이 있다는 점을 이해한다.
- 참여 스타일과 창작자 선호: 어떤 방식으로 참여하는지와 어떤 창작자에게 친밀감을 느끼는지도 반영한다.
- 연쇄적 재랭킹: 이런 추론을 바탕으로 콘텐츠 순위를 다시 정렬한다.
4. 블랙박스 피드에서 조종 가능한 추천으로
추천 모델이 자연어를 이해하면 사용자는 좋아요와 댓글만 남기는 대신 자신의 목표를 말로 지정하고, 피드의 기준과 추천 이유를 직접 다룰 수 있다.
4.1. 자연어로 알고리즘과 대화하기
-
Instagram의 ‘Your algorithm’ 사례
- 사용자는 Reels를 스크롤하면서 알고리즘과 대화할 수 있다.
- Instagram 알고리즘이 사용자의 관심사를 어떻게 이해하고 있는지 확인할 수 있다.
- 관심사를 추가하거나 제거하고, 자연어로 알고리즘에 지시할 수 있다.
-
사용자 주도권의 이동
- 기존 상태: 사용자는 추천 알고리즘이 왜 무엇을 보여주는지 알기 어려운 블랙박스 경험을 했다.
- 새 상태: 알고리즘은 더 상호작용적이고 조종 가능하며, 사용자는 자신의 목표를 언어로 명시할 수 있다.
- 목표 기반 참여: 좋아요와 댓글처럼 간접적인 신호만 남기는 대신 “무엇을 보고 싶은가”를 직접 말한다.
-
추천 이유 설명
- 기반 모델이 추천을 만들 뿐 아니라 추천 이유를 자연어로 설명할 수 있다.
- 설명 가능성은 사용자가 피드를 신뢰하고 수정하는 데 필요한 피드백 루프를 제공한다.
4.2. FIFA 월드컵 관심사 예시와 산업 확산
-
새로운 목표를 즉시 반영하기
- 사용자가 “지금 FIFA 월드컵을 따라가고 싶다”는 관심사를 추가한다.
- 모델은 기존 사용자 이력과 새 자연어 입력을 함께 처리한다.
- 사용자의 취향에 맞춘 최근 월드컵 콘텐츠, 예를 들어 Messi가 최근 기록한 프리킥 장면을 추천한다.
-
이미 등장한 제품 형태
- Spotify는 프롬프트로 만드는 플레이리스트(prompted playlists)를 제공한다.
- YouTube는 사용자가 요청하는 맞춤형 피드(custom feeds)를 실험한다.
- DoorDash는
Ask DoorDash처럼 자연어 질의와 추천을 결합한다. - 여러 서비스에서 상호작용형 추천이 새로운 제품 표면으로 확장되고 있다.
5. 소비자 AI 앱을 평가하는 토큰·참여 프레임워크
콘텐츠 피드와 AI 채팅 앱은 모두 학습·추론·소비자 참여·수익화의 플라이휠을 돌리지만, 콘텐츠를 생성하는 방식 때문에 토큰 효율성에 큰 차이가 있다.
5.1. 학습 투자수익률과 추론 투자수익률
-
학습 측면
- 핵심 질문: 앱이 투입된 연산을 얼마나 잘 프런티어 모델로 변환하는가를 본다.
- 학습 ROI: 더 큰 연산 투자가 더 나은 모델과 제품 품질로 이어지는지가 중요하다.
-
추론 측면
- 토큰의 경제성: 추론 토큰이 얼마나 효율적으로 사용자 참여로 바뀌는지 본다.
- 수익화까지의 연결: 참여가 광고·구독 수익으로 바뀌어 다음 학습 비용을 조달하는지 평가한다.
5.2. 콘텐츠 피드와 AI 채팅 앱의 구조적 차이
-
모델 규모와 대표 서비스
- 콘텐츠 피드: Instagram, Facebook, TikTok, YouTube 같은 서비스는 약 10억~100억 개의 활성 파라미터를 가진 모델을 사용한다.
- AI 채팅 앱: Gemini, ChatGPT, Claude 같은 서비스는 약 100억~1,000억 개의 활성 파라미터를 가진 훨씬 큰 모델을 서비스한다.
-
출력의 차이
- 피드의 출력: 콘텐츠 피드는 시맨틱 ID라는 포인터 또는 주소를 출력한다.
- 콘텐츠 공급: 크리에이터가 이미 콘텐츠를 업로드하므로 건강한 크리에이터 경제가 콘텐츠 공급을 사실상 무료로 제공한다.
- 채팅의 출력: AI 채팅 앱은 매 대화 턴마다 콘텐츠의 모든 토큰을 직접 디코딩해 만들어야 한다.
- 토큰 수: LLM 채팅 상호작용 한 턴은 수천 개 토큰을 출력하는 경우가 많다.
-
시간당 참여 비용
- 채팅의 제조 비용: AI 채팅 앱에서는 모든 출력 토큰을 추론 시점에 새로 제조해야 한다.
- 피드의 포인터 비용: 추천 피드는 이미 존재하는 콘텐츠를 가리키는 포인터만 디코딩한다.
- 구조적 격차: 한 시간의 소비자 참여를 만드는 데 필요한 추론 비용과 연산량을 비교하면 콘텐츠 피드가 AI 채팅보다 최대 100배 이상 저렴할 수 있다.
- 경제적 결론: 콘텐츠의 본문 자체가 아니라 콘텐츠 주소를 생성하기 때문에 추천 시스템은 더 낮은 비용으로 더 긴 참여를 만들 수 있다.
6. LLM 추천 시스템이 가장 큰 소비자 AI 앱이 될 이유
추천 시스템은 이미 사용자가 매일 가장 많이 쓰는 앱과 수익화의 핵심에 자리하며, LLM은 이 거대한 유통·참여 구조를 자연어와 에이전트로 재구성한다.
6.1. 일일 활성 사용자 규모와 성장 동력
-
상위 10개 앱의 구성
- 일일 활성 사용자 기준 상위 10개 앱 가운데 4개가 콘텐츠 피드다.
- 콘텐츠 피드는 소비자 시장에서 이미 매우 중요한 앱 유형이다.
-
추천 모델과 광고 모델의 역할
- 콘텐츠 피드의 참여도 성장은 거의 전부 추천 모델과 광고 모델에 의해 움직인다.
- 수익화 성장도 같은 모델들에 크게 의존한다.
- LLM 추천 시스템은 참여와 수익을 동시에 만드는 핵심 계층을 바꿀 수 있다.
6.2. 예상되는 제품·연구 변화
-
새로운 소비자 경험
- 사용자가 피드를 조종할 수 있는 steerable recommendation이 일반화된다.
- 추천 이유를 설명하는 recommendation explanation이 기본 기능이 될 수 있다.
- 사용자가 자신의 경험을 더 많이 통제하게 된다.
-
소비자 에이전트의 등장
- 앞으로 1년 정도 동안 소비자 에이전트와 추천 에이전트에 관한 연구가 활발히 나올 것으로 전망된다.
- 에이전트는 단순히 콘텐츠를 고르는 것을 넘어 사용자의 목표를 해석하고, 여러 검색·랭킹·비평 단계를 조율할 수 있다.
-
연구와 제품의 교차점
- LLM과 추천 시스템의 결합은 기존 제품을 점진적으로 개선하는 수준을 넘어 새로운 소비자 앱 표면을 만든다.
- 대규모 사용자 기반, 낮은 토큰 비용, 자연어 제어라는 세 요소가 함께 작동한다.
주요 발언 모음
“추천 시스템은 LLM처럼 확장되며, 이 분야는 그 확장 곡선의 아주 초반에 있다.”
“LLM 추천 시스템은 AI의 가장 큰 소비자 애플리케이션 중 하나가 될 것이다.”
“모델을 학습하고, 추론을 실행하고, 더 나은 추천으로 참여를 만들고, 광고나 구독으로 수익화한 뒤, 그 수익으로 다음 학습을 지불한다.”
“콘텐츠 피드는 콘텐츠 자체가 아니라 콘텐츠를 가리키는 포인터를 디코딩하기 때문에 AI 채팅 앱보다 최대 100배 이상 저렴할 수 있다.”
“블랙박스 추천 알고리즘에서 사용자가 자신의 알고리즘을 더 많이 통제하고, 알고리즘이 더 상호작용적이고 조종 가능해지는 방향으로 이동할 것이다.”
핵심 데이터 & 수치
- 17분 45초: 발표 전체 길이.
- 2020년: LLM 확장 곡선 논문이 모델 크기·데이터·FLOPs와 손실의 파워 법칙 관계를 널리 알린 시점.
- 10억 명 이상: 전통적 추천 시스템이 서비스되는 대표적인 일일 활성 사용자 규모.
- 30%: Meta 실적 보고에서 언급된 Instagram Reels의 전년 대비 시청 시간 증가율.
- 2배: Instagram 학습에 사용하는 사용자 상호작용 시퀀스 길이를 늘린 폭.
- 10,000토큰 → 약 10토큰: 3분짜리 Instagram Reel을 시맨틱 ID로 압축하는 예시.
- 30개 → 5개: LLM 랭커가 후보 비디오 30개를 상위 추천 5개로 재랭킹하는 예시.
- 1억~100억 활성 파라미터: 콘텐츠 피드 모델의 대략적인 규모.
- 100억~1,000억 활성 파라미터: AI 채팅 앱 모델의 대략적인 규모.
- 수천 개 토큰: AI 채팅 상호작용 한 턴에서 생성되는 대표적인 출력량.
- 최대 100배 이상: 한 시간의 소비자 참여를 만드는 추론 비용에서 콘텐츠 피드가 AI 채팅보다 저렴할 수 있는 격차.
- 상위 10개 중 4개: 일일 활성 사용자 기준 상위 소비자 앱에서 콘텐츠 피드가 차지하는 개수.
결론 및 시사점
- 추천 시스템에 더 많은 데이터·연산·모델 용량을 투입하면 오프라인 품질뿐 아니라 실제 시청 시간, 사용자 참여, 매출까지 예측 가능한 방식으로 개선될 수 있다.
- 추천 업계는 전통적 임베딩 모델, LLM 영감 모델, LLM 네이티브 모델, 에이전트형 모델이라는 네 개의 확장 곡선을 병렬로 오르고 있다.
- 시맨틱 ID는 해시 ID보다 의미를 안정적으로 보존하고, 긴 콘텐츠를 극도로 압축해 LLM이 긴 상호작용 기록을 처리하도록 만든다.
- 영어와 추천 도메인 언어를 함께 이해하는 모델은 추천 후보를 고르는 이유를 설명하고 사용자의 자연어 지시를 반영할 수 있다.
- LLM 추천 시스템의 핵심 제품 변화는 사용자를 수동적인 클릭 신호 제공자에서 피드 목표를 직접 지정하는 조종자로 바꾸는 데 있다.
- 콘텐츠 피드는 이미 존재하는 콘텐츠의 주소를 생성하므로, 매번 새로운 본문을 생성하는 AI 채팅보다 토큰·연산 효율성이 구조적으로 높다.
- 일일 활성 사용자 상위 앱의 상당수가 콘텐츠 피드인 만큼, 추천 모델의 개선은 소비자 AI 시장에서 매우 큰 파급력을 갖는다.
- 제품을 설계할 때 모델 자체의 성능뿐 아니라 학습→추론→참여→수익화 플라이휠의 회전 속도와 비용을 함께 평가해야 한다.
- 다음 단계의 경쟁력은 자연어로 조종할 수 있고 추천 이유를 설명하며 계획·검색·랭킹·비평을 반복하는 추천 에이전트에서 나올 가능성이 높다.
핵심 요약 (20줄)
추천 시스템은 LLM과 마찬가지로 데이터·연산·모델 크기를 키울수록 품질이 좋아지는 확장 곡선을 보인다.
추천 모델의 오프라인 품질 향상은 실제 사용자 참여도와 매출 증가로 이어질 수 있다.
Meta의 Instagram Reels는 추천 아키텍처 단순화와 더 긴 상호작용 기록으로 전년 대비 시청 시간이 30% 늘었다.
추천 시스템은 학습·추론·참여·수익화가 다음 학습에 재투자되는 플라이휠을 돌린다.
전통적 추천 시스템은 특징 공학, 사용자·콘텐츠 임베딩, two-tower 모델과 랭커를 사용한다.
LLM 영감 추천 모델은 추천 모델을 엔드투엔드로 확장하며 HSTU와 OneRec이 사례로 제시된다.
LLM 네이티브 추천 모델은 언어를 이해하고 추론하는 기반 모델을 추천 작업에 적응시킨다.
에이전트형 추천 시스템은 계획·검색·랭킹·비평을 반복하며 결과를 정제한다.
LLM 추천 시스템은 콘텐츠를 도메인 언어인 토큰으로 바꾸는 단계에서 시작한다.
시맨틱 ID는 계속 바뀌는 해시 ID보다 모델이 의미와 관계를 학습하기 좋은 안정적인 표현이다.
3분짜리 Instagram Reel은 약 10,000토큰에서 약 10토큰으로 압축될 수 있다.
비슷한 테니스 Reel은 시맨틱 ID의 공통 접두사를 공유하고 마지막 토큰으로 개별성이 구분된다.
LLM은 영어와 추천 토큰을 함께 학습해 콘텐츠 의미와 사용자 행동을 연결한다.
30개 후보 비디오는 사용자 관심사·참여 스타일·창작자 선호를 반영해 상위 5개로 재랭킹될 수 있다.
자연어 기반 추천은 사용자가 자신의 알고리즘에 관심사를 추가하거나 제거하게 만든다.
Spotify의 프롬프트 플레이리스트와 YouTube의 맞춤 피드는 상호작용형 추천의 사례다.
콘텐츠 피드는 기존 콘텐츠를 가리키는 시맨틱 ID만 생성해 AI 채팅보다 토큰 효율성이 높다.
콘텐츠 피드는 한 시간의 참여를 만드는 추론 비용에서 AI 채팅보다 최대 100배 이상 저렴할 수 있다.
일일 활성 사용자 기준 상위 10개 앱 중 4개가 콘텐츠 피드일 만큼 추천 앱의 시장 규모는 크다.
LLM 추천 시스템은 대규모 사용자 기반과 낮은 비용, 자연어 제어를 결합해 가장 큰 소비자 AI 앱이 될 가능성이 있다.
