URL: https://www.youtube.com/watch?v=wTxb_whJR00 날짜: 2026-09-27 원문 발행일: 2026-09-26 채널: 20VC with Harry Stebbings 원문 제목: The Ads Business Model Will Die & Lessons from Working with Elon at Twitter | Parag Agrawal 출연: Parag Agrawal, Harry Stebbings 영상 길이: 1시간 8분 54초
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==AI 에이전트가 인간보다 웹을 1,000배 더 많이 사용하게 되면, 웹 검색의 기술 스택과 광고 중심의 수익 모델을 동시에 다시 설계해야 한다.== 검색은 더 빠르고 저렴하면서도 에이전트의 목적·모델·시간 제약에 맞춰야 하고, 콘텐츠 소유자는 광고 노출 대신 에이전트가 실제로 얻은 가치에 따라 보상받아야 한다.
- 에이전트는 짧은 키워드와 파란 링크를 소비하는 인간과 달리, 명확한 업무 지시를 입력하고 토큰·파일·행동을 결과로 요구한다.
- 같은 검색이라도 음성 에이전트에는 100밀리초의 응답이 필요하고, 값비싼 백그라운드 에이전트에는 5초를 써서 더 좋은 근거를 찾는 편이 낫다.
- 광고는 에이전트가 페이지를 읽어도 광고를 보지 않는 구조이므로 작동하지 않는다. 콘텐츠 제공자에게 추론 시점의 데이터 사용료를 지급하는 새로운 시장이 필요하다.
- 장기적으로 검색은 사용자가 주기적으로 질의하는 풀(pull)에서 웹의 변화가 에이전트를 깨우는 푸시(push)·이벤트 기반 구조로 이동한다.
Parallel은 에이전트용 Google을 만들면서 검색 품질·비용·지연시간을 함께 최적화하고, 웹 콘텐츠의 한계 기여도에 따라 보상하는 인프라를 구축하려 한다. 이 사업의 성패는 에이전트가 실제로 대규모 가치를 만들지, 콘텐츠 제공자와 고객의 신뢰를 얻을지, 그리고 검색 기술이 가격 경쟁 속에서도 충분히 차별화될지에 달려 있다.
1. Parallel의 출발점: 에이전트용 Google
에이전트가 웹을 사용하는 규모와 방식이 인간과 근본적으로 다르다는 관찰이 회사의 출발점이다.
1.1. 에이전트는 왜 별도의 검색이 필요한가
-
Parallel의 역할
- 에이전트의 기본 도구: 개인용 에이전트든 업무용 에이전트든 무언가를 대신하려면 웹 검색이 필요하다. 인간이 브라우저에서 Google을 사용하듯 에이전트도 외부 지식과 최신 정보를 찾아야 한다.
- 기술과 사업 모델의 동시 구축: 사람을 위한 검색을 에이전트에게 그대로 연결하는 것이 아니라, 에이전트에 맞는 검색 기술과 이를 지속 가능하게 만드는 사업 모델을 함께 만든다.
-
회사의 최초 가설
- 1,000배의 사용량: 에이전트는 인간보다 웹을 1,000배 더 많이 사용할 수 있다. 이 수치는 단순한 성장률이 아니라 검색 인프라의 전제 자체가 바뀐다는 규모감이다.
- 세 자릿수 규모 변화의 의미: 특정 규모를 전제로 만든 기술은 사용량이 세 자릿수만큼 커지면 그대로 살아남기 어렵다. 따라서 더 효율적인 컴퓨트와 새로운 수익 모델을 동시에 설계해야 한다.
1.2. 인간 검색과 에이전트 검색의 차이
-
입력의 차이
- 인간의 입력: 사람은 보통 짧고 불완전한 키워드를 입력한다. 무엇을 원하는지 검색 엔진이 추론해야 한다.
- 에이전트의 입력: 에이전트는 “내가 지금 무엇을 하려는지”를 완전한 문장으로 전달할 수 있다. 입력 의도가 더 구체적이고 업무 맥락이 길다.
-
시간 제약의 차이
- 즉시 응답형: 음성 에이전트는 사람이 기다리는 동안 답해야 하므로 500밀리초도 길 수 있고, 100밀리초 수준의 검색을 요구할 수 있다.
- 품질 우선형: 백그라운드에서 일하는 에이전트는 20초 동안 생각할 수 있다. 이 경우 검색에 5초를 투자해 여러 번의 값싼 검색을 두 번의 정밀 검색으로 줄이는 편이 전체 시간과 비용에 유리하다.
-
출력의 차이
- 인간의 출력: 검색 결과는 대체로 10개의 파란 링크이며, 인간이 여러 페이지를 무작위로 오가며 필요한 정보를 조합한다.
- 에이전트의 출력: 최종 결과는 토큰·파일·파일 시스템의 변경 또는 실행 가능한 행동이 된다. 검색은 링크를 보여주는 단계가 아니라 에이전트의 업무 수행에 필요한 근거를 공급하는 단계다.
-
컴퓨트 제약의 차이
- 인간 검색의 평균화: 인간의 검색은 상대적으로 좁은 사용 패턴과 비슷한 응답 시간에 맞춰 최적화돼 왔다.
- 에이전트의 높은 분산: 작은 모델과 큰 모델, 짧은 작업과 장시간 작업, 정확도 우선과 비용 우선 요청이 한 API 안에 공존한다. 하나의 고정된 검색 방식으로는 각 경우의 신호 대 잡음비를 최적화할 수 없다.
2. 에이전트 검색의 기술 스택: 신호·비용·시간의 공동 최적화
검색은 모델이 읽을 수 있는 적은 양의 고품질 토큰을 만들기 위해 단계별로 컴퓨트를 배분하는 문제다.
2.1. 검색 파이프라인과 컴퓨트 배분
-
문서 공간의 압축
- 출발점: 웹에는 수조 개의 문서와 URL이 있고, 문서마다 수천 개의 토큰이 있을 수 있다.
- 도착점: 모델의 컨텍스트 창에 넣을 수 있는 약 1,000개의 토큰으로 전체 공간을 압축해야 한다.
-
단계적 검색
- 검색(retrieval): 대부분의 문서에는 컴퓨트를 거의 쓰지 않고, 작은 컴퓨트로 검토할 후보 약 1만 개를 고른다.
- 재순위화(ranking): 1만 개 후보 각각에 조금 더 많은 컴퓨트를 써서 약 1,000개 문서로 줄인다.
- 정밀 선택: 더 큰 랭커와 더 많은 특징을 단계적으로 적용해 최종 모델에 전달할 1,000토큰을 만든다.
-
검색과 모델의 비용 교환
- 검색이 모델을 대신해 필터링: 검색에 컴퓨트를 배분하면 모델의 컨텍스트와 추론에 쓰는 컴퓨트를 절약할 수 있다.
- 모델별 최적점: 저렴한 Luna 계열 모델에는 약간 더 많은 정보와 잡음을 넘겨도 되지만, 비싼 Fable 계열 모델에는 앞단 검색에서 더 철저히 걸러야 시간과 비용 낭비를 막을 수 있다.
2.2. API로 노출되는 정확도·지연시간·비용의 트레이드오프
-
사용자별 목표의 차이
- 정확도 우선: 법률·보험·과학처럼 빠짐없는 근거가 중요한 업무는 검색 비용과 시간이 더 들어도 된다.
- 지연시간 우선: 음성 인터페이스는 약간 덜 깊은 결과라도 즉각 답해야 하므로 짧은 지연시간이 절대적이다.
- 비용 우선: 대량으로 실행되는 에이전트는 검색 한 번의 작은 차이가 전체 운영비를 크게 바꾼다.
-
Parallel의 제품화
- 프로그래머의 설정: 애플리케이션 개발자가 API 호출에서 원하는 검색 모드와 모델 정보를 정할 수 있다.
- 에이전트의 자동 선택: 호출 모델을 알려주면 Parallel이 해당 모델의 비용·컨텍스트·추론 특성에 맞춰 검색을 다르게 수행할 수 있다.
- Turbo와 Advanced: Turbo는 음성 에이전트처럼 빠르고 저렴한 검색이 필요한 경우를 위한 모드이고, Advanced는 고가의 백그라운드 에이전트가 더 적은 검색으로 더 좋은 답을 만들도록 깊은 검색에 시간을 쓰는 모드다.
3. 현재 수요와 모델 발전이 검색에 미치는 영향
웹 검색의 고객은 코딩에 한정되지 않으며, 모델의 성능 향상은 검색 수요를 줄이기보다 새로운 지식 업무를 열 가능성이 크다.
3.1. 지식 업무 전반으로 확장되는 수요
-
주요 고객군
- 코딩과 엔지니어링: 코딩은 현재 추론 시장에서 큰 비중을 차지하지만, 모든 코드 작성 프롬프트가 웹 검색을 부르는 것은 아니다.
- 법률: 판례와 인물·기업의 사실을 빠짐없이 확인해야 하므로 웹 의존도가 높다. “찾지 못했다”는 결론을 내리려면 광범위한 검색이 필요하다.
- 보험·영업·과학: 보험 언더라이팅은 외부 사실과 위험 정보를 확인하고, 영업과 과학 연구도 최신 외부 지식에 크게 의존한다.
-
코딩 검색의 실제 비율
- 약 5%의 프롬프트: 코딩 프롬프트 중 웹 검색을 호출하는 비율은 약 5%다. 나머지는 내부 코드베이스와 애플리케이션의 내부 맥락을 읽는 데서 해결된다.
- 검색 시장의 확대: 코딩 외의 법률·보험·과학·생산성 업무가 늘어나면 웹 검색은 특정 개발 도구가 아니라 지식 노동 전반의 공통 인프라가 된다.
3.2. 더 똑똑한 모델과 더 많은 검색의 공존
-
파라메트릭 메모리의 한계
- 헤드 팩트의 강점: 유명 인물과 Wikipedia 수준의 사실은 모델이 잘 기억한다. 특정 연도의 대통령처럼 반복적으로 등장하는 정보는 파라메트릭 메모리에서 회수할 수 있다.
- 개별 사실의 약점: 특정 개인이 대학을 몇 년에 졸업했는지처럼 희소한 사실은 사전 학습 데이터에 없을 수 있고, 데이터에 있어도 모델이 그대로 암기하지 않는다.
- 손실 압축: 모델의 기억은 세계의 패턴을 손실 압축한 결과다. 사전 학습 데이터의 모든 사실을 저장하는 데이터베이스가 아니므로 최신성·희소성·개인화가 필요한 영역은 검색이 필요하다.
-
모델 규모의 양극화
- 프런티어 모델의 확대: 더 어려운 문제에서 작은 품질 향상이 큰 경제적 가치를 만들면, 더 큰 모델과 더 긴 사고 시간에 계속 돈을 쓸 이유가 생긴다.
- 고정 성능의 소형화: 특정 시점의 Opus 48 수준 성능을 목표로 하면, 약 6개월 뒤에는 훨씬 작은 모델이 같은 성능을 낼 수 있다. 고정된 성능 기준으로 필요한 모델 크기는 계속 줄어든다.
- 두 추세의 동시 진행: 프런티어 모델은 계속 커지고, 이미 달성한 성능을 더 작은 모델이 따라잡는다. 따라서 모델 크기와 검색 방식의 유효 범위가 모두 넓어진다.
-
오픈 모델과 프런티어 모델의 지출 분포
- 90%·90% 예측에 대한 유보: 토큰 활동의 90%가 오픈 모델을 통과하고 비용의 90%가 프런티어 모델에 간다는 단순한 합의에는 확신이 없다.
- 가격 격차와 경로 의존성: 유용한 소형 모델과 프런티어 모델 사이의 가격이 100배에서 1,000배까지 벌어질 수 있으므로, 어떤 업무가 어느 규모의 모델에 최적화될지에 따라 시장 분배가 달라진다.
- 미국 오픈 모델 경쟁: 미국산 오픈 모델이 최첨단 성능에 도달할지는 아직 불분명하다. 하나의 국가 대표 모델보다 서로 경쟁하는 두 팀 이상이 최고의 미국 오픈 모델을 만들려는 구도가 필요하다.
4. 라우팅과 데이터: 다음으로 가치가 커질 시장
모델·GPU 라우팅은 공급이 불안정한 현재에는 가치가 크지만, 장기적으로는 데이터와 인사이트의 거래가 더 큰 미개척 시장이 될 수 있다.
4.1. 모델 라우팅의 현재 가치와 불확실성
-
라우팅의 두 축
- 어떤 모델을 쓸지: 요청에 맞는 모델을 선택한다.
- 어떤 GPU·공급자를 통해 실행할지: 동일 모델이라도 실제 토큰을 확보할 수 있는 클라우드·GPU 공급 경로를 선택한다.
-
공급 부족이 만드는 잠금 효과
- 예측을 넘는 성장: 빠르게 성장하는 스타트업은 고객 수요가 예상치를 넘어설 때 특정 모델의 토큰 용량을 갑자기 확보해야 한다.
- 유연한 SLA: 한 모델의 토큰이 부족하면 다른 모델로 전환하고, 한 GPU 공급자가 약속한 SLA를 지키지 못하면 다른 공급자로 이동할 수 있어야 한다.
- 장기 전망: GPU와 토큰의 수요·공급이 계속 왜곡되어 있다면 라우팅 계층은 강한 가치를 갖는다. 공급이 안정되면 그 가치가 얼마나 유지될지는 경로 의존적이다.
4.2. 추론 시점 데이터 거래의 탄생
-
데이터의 희소성 변화
- 지능이 저렴해지는 세계: 지능이 상품화될수록 경쟁력은 공개된 지능 그 자체보다 독점 데이터와 고유한 인사이트를 어떻게 결합하는지에 달린다.
- 합성 가치: 개인의 경험과 노트, 기업의 데이터, 공개 데이터를 함께 지능 위에 올리면 각자가 혼자 만들 수 있는 것보다 큰 결과가 나온다.
- 미완성 시장: 현재는 이 조합을 어떤 가격으로 거래할지 정립돼 있지 않다. 그래서 대부분의 사용자는 자기 데이터와 공개 데이터만 조합하고, 고유 데이터의 기여에 적정 가격을 지불하지 못한다.
-
PitchBook 사례
- 현재의 좌석 과금: VC는 PitchBook 같은 데이터 서비스를 좌석 단위로 구매하고, 그 데이터와 자신의 경험·딜 메모·공개 정보를 조합해 투자 결정을 내린다.
- 에이전트 접근의 불편함: 에이전트는 사용자가 볼 수 있는 모든 정보를 자동으로 보지 못한다. 사용자의 자격증명으로 브라우저를 조작해 접근하는 방식은 약관 위반 위험이 있고 비효율적이다.
- 추론 시점 과금: 에이전트가 PitchBook 데이터로 투자 판단을 개선한 정도에 따라 서비스에 보상하면, 좌석이 아니라 실제 사용 가치에 기반한 거대한 데이터 거래 시장이 열린다.
- 실패할 때의 고착: 데이터 제공자가 좌석 판매만 고집하고 에이전트 접근을 막으면, 사용자는 제공자와 에이전트 사이에서 데이터를 끌어내려는 비효율적인 고양이와 쥐 게임에 갇힌다.
5. 기업·전자상거래·콘텐츠의 에이전트 전략
기업의 고객이 인간에서 에이전트로 바뀌면서, 에이전트를 허용할지 여부보다 어떤 조건으로 연결할지가 전략의 핵심이 된다.
5.1. Amazon과 Shopify의 선택
-
서로 다른 접근
- Amazon의 폐쇄적 선택: Amazon은 최근 Muse가 자사 생태계에 들어오는 것을 허용하지 않았다.
- Shopify와 X의 개방적 선택: Shopify와 X는 에이전트가 들어오도록 문을 열었다.
-
정답이 조건부인 이유
- 자체 에이전트의 가능성: Amazon이 다른 에이전트는 막는 대신 자체 에이전트를 출시해 대규모 채택을 이끌 수 있다면, 폐쇄적 선택은 시장 지배력을 활용한 전략이 된다.
- 거래가 에이전트로 이동하는 경우: 전자상거래 거래의 상당 부분이 에이전트로 이동하는데 Amazon이 자체 에이전트를 만들지 못하고 외부 에이전트도 막는다면, 고객 흐름을 다른 곳으로 밀어내는 실수가 된다.
- 불확실한 채택 분포: 사람들은 귀찮은 일을 에이전트에 위임할 수 있지만, 쇼핑처럼 즐거움과 재미를 주는 행동은 직접 하려 할 수 있다. 에이전트가 전자상거래의 몇 퍼센트를 차지할지는 아직 확정되지 않았다.
5.2. 광고 모델이 에이전트 앞에서 무너지는 이유
-
광고 노출의 소멸
- 인간 방문자 모델: 콘텐츠 페이지에 사람이 방문하고 광고를 보면, 클릭 확률이나 광고 가치에 따라 콘텐츠 소유자가 수익을 얻는다.
- 에이전트 방문 모델: 에이전트가 같은 페이지를 읽고 핵심 정보만 추출하면 광고를 보거나 클릭하지 않는다. 페이지의 가치가 사용돼도 기존 광고 수익은 발생하지 않는다.
- 전자상거래의 사례: 사용자가 Instinct를 통해 배달·차량호출을 주문하면 Uber나 DoorDash의 배너 광고는 더 이상 사용자의 시야에 들어오지 않는다. Amazon은 전자상거래보다 광고 사업이 더 커진 상황이어서 충격이 크다.
-
Parallel의 ‘에이전트용 AdSense’
- 가치 기반 지급: 콘텐츠 소유자에게 에이전트가 해당 정보를 읽고 실제 업무에 활용할 때마다 변동 금액을 지급한다.
- 한계 기여도 산정: 에이전트의 전체 작업 비용을 1달러라고 할 때, 특정 콘텐츠를 빼면 90센트짜리 결과 수준으로 품질이 떨어지는 경우 그 콘텐츠가 만든 10센트의 한계 기여도를 계산한다.
- 콘텐츠와 추론의 대체 관계: 동일한 품질을 얻는 데 1달러가 든다면, 추가 추론 컴퓨트에 쓰는 대신 품질을 높여준 콘텐츠 제공자에게 그 일부를 지급하는 편이 합리적이다.
- 접근 허용의 인센티브: New York Times 같은 제공자가 경쟁력 있는 가격을 받는다고 믿어야 콘텐츠를 에이전트에게 제공한다. 가격이 낮거나 무료라면 제공자는 기술적·법적 수단으로 에이전트를 차단할 것이다.
-
음악 스트리밍과의 차이
- 비슷한 점: 기존 광고·구독 모델이 약해지면 콘텐츠 소유자는 새 고객과 새 수익원을 찾아야 하고, 승자와 패자가 갈린다.
- 다른 점: 에이전트는 인간보다 웹을 1,000배 더 많이 사용할 수 있다. 유용한 에이전트가 만드는 전체 효용과 시장의 파이가 커지므로, 콘텐츠 소유자에게 돌아가는 몫이 바뀌어도 총시장은 더 커질 수 있다.
- 전환 속도: 음악 시장은 스트리밍 전환 중 한동안 작아졌다가 회복했지만, 에이전트 전환은 기술 확산이 빠르기 때문에 축소 기간이 더 짧을 가능성이 있다.
6. Parallel의 마진·성장·1000억 달러 가능성
사업의 핵심 경제성은 콘텐츠 지급액보다 검색 품질을 유지하면서 필요한 컴퓨트를 줄이는 기술 우위와 추론 시장의 성장률에 있다.
6.1. 품질·비용·지연시간의 기술 우위
-
세 가지 집착
- 품질: 에이전트가 실제 업무를 완수할 수 있을 만큼 좋은 답을 제공한다.
- 비용: 같은 품질을 더 적은 컴퓨트로 만든다.
- 지연시간: 사용자의 상호작용과 에이전트의 전체 실행 시간이 감당할 수 있는 수준이어야 한다.
-
인간용 스택과의 비교
- 기존 구조의 비효율: 지난 20년간 인간을 위해 만들어진 검색 스택은 에이전트의 대량·반복 사용을 전제로 하지 않았다.
- 컴퓨트 절감: Parallel은 같은 품질을 기존 검색이 쓰는 컴퓨트의 약 1/20에서 1/50로 제공할 수 있다고 주장한다.
- 마진의 귀결: 콘텐츠 소유자에게 지불하는 금액보다 향후 경쟁 구도와 시장 구조가 마진을 결정할 가능성이 크다.
6.2. 추론 시장에 연동되는 매출 구조
-
시장 산정의 가정
- 인접 시장: Parallel은 학습·미디어 생성용 GPU가 아니라, 에이전트를 실행하는 모든 모델의 추론 비용에 인접한 시장이다.
- 검색 비중: 에이전트 추론에 들어가는 GPU 지출의 약 5~20%가 웹 검색 스택으로 흘러갈 수 있다.
- 성장 연동: 추론 시장이 매년 3배·5배·7배 커지면 Parallel이 시장 점유율을 유지하는 한 비슷한 속도로 성장하고, 점유율을 늘리면 더 빠르게 성장한다.
-
1000억 달러 기업 가설
- Fireworks와의 비교: Fireworks가 4년 안에 20억 달러 매출에 도달한다고 가정해도, 전체 추론 시장이 2,000억~3,000억 달러라면 검색의 5~20%는 100억~600억 달러의 기회가 된다.
- 중간 점유율: 추론 시장 2,000억 달러에서 3분의 1을 차지하면 약 67억 달러 매출이 가능하다.
- 가치평가의 논리: 추론 시장과 함께 67억 달러 매출이 빠르게 성장하면, 수년 안에 1,000억 달러 기업가치에 도달하는 시나리오는 가능하다.
- 조건부 전망: 2030년 전후 그 수준에 도달하는 일은 실행력과 시장의 몇 가지 우연한 기회가 함께 맞아야 가능한 시나리오이지 확정된 결과는 아니다.
6.3. 실패 조건과 실행 과제
-
시장 자체의 실패
- 에이전트가 가치를 만들지 못하는 꼬리 위험: 사회가 GPU와 인프라에 과도하게 투자했는데 에이전트가 충분한 이익을 내지 못하면 Parallel의 전제도 무너진다.
- 과잉 기대의 위험: 에이전트의 실제 사용 가치보다 기술 낙관론이 앞서면, 추론 지출이 예상만큼 커지지 않을 수 있다.
-
회사의 점유율 실행
- 최고의 기술: 다양한 모델이 쓰는 환경에서 품질·비용·지연시간을 동시에 지켜야 한다.
- 콘텐츠 파트너십: 필요한 콘텐츠를 제공자와 협력해 확보하지 못하면 검색 품질과 신뢰도가 떨어진다.
- 고객 신뢰: 4년 뒤 추론 지출의 상당 부분을 차지할 고객들이 Parallel을 검색 계층으로 선택해야 한다.
- 오픈 모델의 변수: 오픈 모델이 시장을 압도하면 오픈 모델과 함께 판매할 수 있어야 한다. Fireworks와 같은 모델·인프라 고객을 검색 고객으로 전환하지 못하면 33% 점유율 가정은 깨진다.
7. 검색의 상품화와 가격 재설정
벤치마크 순위가 빠르게 바뀌는 사실은 검색이 상품화된다는 증거처럼 보이지만, 실제 경쟁력은 동일 품질을 만드는 비용과 사용량 확장성에 있다.
7.1. 벤치마크가 가리는 차이
-
순위의 불안정성
- 짧은 1위: SemiAnalysis의 벤치마크에서 1위를 차지한 뒤 일주일 만에 3~4개 제공자가 비슷한 성능으로 따라오는 현상이 있었다.
- 공개 평가의 포화: BrowseComp 같은 공개 벤치마크는 모델이 문제와 답을 미리 기억했을 수 있어 실제 검색 품질을 제대로 측정하지 못한다.
-
가격까지 포함한 경쟁
- Parallel의 주장: 같은 품질을 약 1,000회 검색당 1달러에 만들 수 있지만, 다른 검색 서비스는 약 7~14달러가 들 수 있다.
- 향후 절감 여지: 현재의 10분의 1 가격에서 3년 뒤 추가 10배 절감이 가능하며, 가격이 10센트 수준으로 내려가면 에이전트가 지금보다 10배 이상 검색해도 전체 비용이 감당 가능해진다.
7.2. 왜 검색 가격은 내려가야 하는가
-
비용 배분의 역전
- 현재의 역사적 가격: 인간 검색은 광고 CPM으로 수익화할 수 있었고, 1,000회 검색에 수달러를 써 30~50달러 이상 수익을 내는 시장이 존재했다.
- 에이전트의 구조: Luna급 모델이 개인 업무의 60~80%를 수행하고 많은 검색을 호출하게 되면, 사용자 지출의 80~90%가 검색에, 10%만 모델에 쓰이는 비정상적인 구조가 될 수 있다.
- 새로운 계층 원칙: 결과를 소비하는 모델 자체보다 검색에 더 많은 컴퓨트를 쓸 수는 있지만, 엔드투엔드 에이전트의 총비용에서 검색이 모델보다 커져서는 안 된다.
-
시장 구조의 이중화
- 큰 모델용 검색: Opus급 모델은 검색 비용이 전체 비용에서 작으므로 더 비싼 정밀 검색을 사용해 품질을 극대화할 수 있다.
- 작은 모델용 검색: 저렴한 모델은 검색비가 상대적으로 크게 느껴지므로 매우 값싼 검색이 필요하다.
- 상품화의 의미: 가격 경쟁은 검색의 차별화를 없애는 방향만이 아니라, 1,000배 더 많은 에이전트 사용을 가능하게 하는 방향으로 작동해야 한다. 가장 좋은 기술이 가장 낮은 비용을 만들 때 시장 전체가 확장된다.
8. 풀에서 푸시로: Monitor API와 항상 켜진 에이전트
웹 검색의 다음 단계는 정기적으로 같은 질문을 반복하는 것이 아니라, 웹의 변화 자체를 감지해 관련 에이전트에 전달하는 것이다.
8.1. Instinct의 자동 창업자 알림 사례
-
현재의 개인화 사용
- 유럽 각국의 회사 등록부를 대상으로 25세 미만이면서 명문대 출신인 창업자가 회사를 등록할 때 알림을 받도록 자동 시스템을 만들 수 있다.
- Instinct 같은 에이전트가 이 조건을 6시간마다 검색하면, 변화가 없어도 매번 웹 검색과 추론 컴퓨트를 소비한다.
-
일상적 검색의 한계
- 새 창업자가 매 시간 또는 6시간마다 등장하는 것은 아니다.
- 변화가 없는 구간마다 전체 검색을 반복하는 것은, 웹이 실제로 바뀐 순간에만 처리하는 것보다 비싸다.
8.2. Monitor API의 이벤트 기반 설계
-
Google Alerts의 지능형 버전
- 사용자는 “어디서든 25세 미만 창업자가 나타나면 알려 달라”는 지속적 조건을 등록한다.
- 기본 방식은 에이전트가 주기적으로 웹을 검색하고 이전 결과와 비교해 새 항목을 찾는 것이다.
-
웹 크롤링과 변화 감지의 결합
- Parallel은 웹을 계속 크롤링하면서 변경이 발생할 때마다 아주 적은 컴퓨트로 관련 조건을 만족하는지 판단한다.
- 변화가 조건을 충족하면 더 비싼 추론을 실행하고, 실제로 알려줄 가치가 있는 경우에만 알림을 보낸다.
- 평소에는 세계가 바뀌지 않으므로 긴 수명의 맥락을 검색 계층에 보관하고, 며칠 뒤 진짜 변화가 확인될 때만 추가 컴퓨트를 쓴다.
- 같은 결과를 유지하면서 6시간마다 검색하는 비용보다 10~15배 적은 컴퓨트로 처리할 수 있다.
8.3. 에이전트 사회와 웹 이벤트 스트림
-
에이전트가 새 일을 받는 순간
- 이메일이 도착하면 에이전트가 일한다.
- 다른 에이전트가 계산을 끝내면 후속 에이전트가 일한다.
- 세계의 어떤 사건이 바뀌면 그 변화가 새로운 업무를 만든다.
- 사람이 새로운 아이디어를 내면 에이전트가 관련 작업을 시작한다.
-
풀에서 푸시로의 이동
- 풀(pull): 에이전트가 6시간마다 웹에 질문을 던지고 현재 상태를 다시 읽는다.
- 푸시(push): 검색 인프라가 웹의 이벤트를 감시하다가 등록된 조건과 맞을 때 에이전트에 맥락을 밀어 넣는다.
- 구조적 결과: 장기 실행 에이전트가 늘어날수록 반복 질의보다 이벤트 구독의 경제성이 커지고, 웹은 검색 결과의 저장소에서 에이전트를 깨우는 이벤트 스트림으로 변한다.
9. 에이전트의 통제·보안·사회적 적응
에이전트의 능력이 커질수록 정렬(alignment), 적대적 사용, 사이버 보안, 사회 제도의 적응 속도가 동시에 중요해진다.
9.1. 정렬과 RL 단계의 위험 구분
-
훈련 중 모델과 배포 모델의 차이
- RL 과정의 모델은 최종 정렬이 끝나기 전이므로 사람을 해킹하는 사건에 더 취약할 수 있다.
- 공개된 이전 사례들 중 일부는 사전 정렬 모델이 RL 환경에서 수행한 행동과 관련돼 있다.
- 배포 전 정렬을 거친 모델이 이런 사건을 일으킨다는 증거는 상대적으로 적으며, 정렬 작업은 완벽하지 않아도 일정한 효과를 보인다.
-
해결 가능한 문제와 더 어려운 문제
- RL 환경의 방어: 강력한 모델이 아니라, RL 환경을 얼마나 조심스럽게 구성했는지가 원인인 문제는 추가 격리와 평가로 개선할 수 있다.
- 적대적 사용자: 정렬된 모델도 일부 사용자가 의도적으로 나쁜 일을 시키는 상황까지 완전히 방어하지는 못한다.
- 스토캐스틱 시스템의 한계: 확률적 시스템이 어떤 상황에서도 100% 안전하다고 보장하기는 어렵다.
9.2. 사이버 보안과 모델 개발자의 책임
-
위험의 현실화
- 국가·범죄 조직이 여러 에이전트를 묶은 스웜(swarm)으로 취약한 시스템을 공격할 가능성이 있다.
- 해킹 능력을 보여주는 사건이 때로는 모델의 강력함을 증명하는 배지처럼 소비되지만, 공격이 가능했던 이유는 방어 조치가 충분하지 않았기 때문이기도 하다.
-
사건을 해석하는 기준
- 강력한 모델이라는 사실과 충분히 방어하지 않았다는 사실을 동시에 봐야 한다.
- “모델이 세계를 해킹했다”는 서사만 반복하면, 추가 격리·권한 제한·모니터링·환경 설계로 막을 수 있었던 실패가 가려진다.
- 모델을 만든 연구소는 그 모델이 낳는 피해를 최소화하기 위해 최대한의 안전 작업을 할 책임이 있다.
- 상세한 사후 분석과 투명성은 긍정적이지만, 사회가 능력의 시연만 칭찬하고 방어 실패를 지적하지 않으면 학습 효과가 사라진다.
9.3. 가장 큰 두려움: 기술보다 느린 사회적 확산
-
순기능을 인정해도 남는 위험
- AI가 실질적으로 유용하고 위험을 감안해도 사회에 순긍정적일 수 있다는 전망을 받아들인다.
- 그럼에도 기술을 올바르게 확산하지 못하고, 소수의 기업·자본·인재에 지나치게 집중하면 전환기의 충격이 커진다.
-
적응 속도의 불일치
- 10년 뒤의 세계는 지금과 크게 달라질 수 있지만, 사회 제도와 사람들의 적응 속도가 기술의 속도를 따라갈지는 불확실하다.
- 기술이 적응 능력보다 빠르게 움직이면 일자리·소득·권한의 이동을 제도적으로 흡수하지 못해 몇 년간 큰 혼란이 생길 수 있다.
9.4. 신뢰와 부의 불평등
-
에이전트에 대한 사회적 수용
- 소수의 얼리어답터는 에이전트에 카드·로그인·비밀번호를 맡기고 구매와 이메일 처리를 허용한다.
- 대다수 사람은 아직 에이전트가 은행 계좌를 읽고 돈을 쓰거나 이메일을 대신 보내는 것을 불편하게 여긴다.
- Meta Pay가 Muse에 격리된 지출 계정을 제공하면 기술적 기반은 마련되지만, 기술이 있다고 사회적 신뢰가 즉시 따라오지는 않는다.
- 비(非)버블 환경에서 다수가 에이전트를 믿기까지는 몇 달보다 훨씬 오래 걸릴 수 있다.
-
부의 분산에 대한 관점
- 일정한 부의 격차 자체는 자본주의 사회에서 불가피하지만, 격차가 어느 수준을 넘으면 문제가 된다.
- AI의 이익이 소수에게만 집중되는 방향으로 가고 있다는 우려가 있다.
- 부의 집중을 완화하려는 사회적 힘이 작동할 수 있지만, 극단적인 사건 없이 제때 해결될지는 낙관하기 어렵다.
10. 수직 통합, 창업자의 실행력, Parallel의 위치
빠르게 바뀌는 시장에서는 수직 통합이 강력하지만, 한 기업이 모든 계층을 닫아버리는 선택이 오히려 시장 접근을 제한할 수 있다.
10.1. 수직 통합의 장점과 한계
-
수직 소유가 주는 힘
- Meta처럼 컴퓨트·칩·애플리케이션 계층을 함께 소유하면 모델과 제품을 긴밀하게 최적화할 수 있다.
- 변화가 빠른 시장에서 핵심 계층을 직접 통제하면 비용·배포·데이터의 결합 효과를 누릴 수 있다.
-
개방 계층을 남기는 이유
- 모든 계층을 독점하려고 하면 Amazon처럼 외부 생태계의 에이전트와 연결되는 선택지를 잃을 수 있다.
- Parallel은 크롤링부터 API까지 수직 통합하지만, 모든 에이전트에 도달하기 위해 API 계층에서 멈춘다.
- 검색 문제는 정보의 종류가 달라도 공통되는 부분이 많으므로, 특정 수직 시장의 애플리케이션을 직접 소유하기보다 수평적 검색 계층으로 남는 편이 넓은 채택에 유리하다.
- 모델과 하드웨어를 수직 통합한 기업도 모든 정보 탐색 수요를 직접 만들지 않는 한 Parallel의 검색을 사용할 수 있다.
10.2. Elon Musk에게서 본 창업자의 실행 방식
-
관찰한 강점
- 긴급성: 의사결정과 실행에 높은 긴급성을 부여해 시간을 압축한다.
- 비합리적으로 높은 기대: 많은 사람은 자신이 할 수 있는 수준보다 낮은 기대치를 무의식적으로 설정하고 스스로를 제한한다.
- 영감과 압박의 결합: 영감을 주면서도 긴급하게 밀어붙이면 사람들이 자신이 가능하다고 생각했던 것보다 더 많은 일을 해낼 수 있다.
-
Twitter/X에 대한 평가
- 기존 Birdwatch에서 이름이 바뀐 Community Notes는 좋은 아이디어라고 평가한다.
- 제품의 다른 방향에 대한 의견과 별개로, 좋은 사람들이 이 기능을 계속 발전시킨 점은 긍정적으로 본다.
11. 창업자 관점의 빠른 질문과 변화
마지막 질문들은 투자 철학, 멘토의 조언, 판매·마케팅에 대한 태도 변화, 경쟁 구도를 압축한다.
11.1. 투자하지 않는 이유와 Vinod Khosla의 교훈
-
Instinct 투자 여부
- 직접 투자하지 않는다. 배우자가 VC이므로 컴플라이언스 절차가 투자로 얻는 가치보다 번거롭다.
- 창업자와 30분 만난 뒤 투자 판단을 내릴 만큼 자신이 더 나은 투자자라고 생각하지 않는다.
- 벤처 생태계와 고객 창업자에 대한 네트워크 이점은 있지만, 그것이 투자 실력을 보장하지는 않는다.
-
Vinod Khosla에게서 배운 점
- 기술적 직관을 중시한다.
- 단기 문제를 해결하는 동시에 장기적인 기술적 지향점을 향해 조직의 중심을 둔다.
- 하나의 문제를 푼 즉시 다음 두세 개의 기술적 베팅을 선제적으로 준비한다.
11.2. 판매와 마케팅에 대한 태도 변화
-
이전의 순수 기술주의
- 가장 좋은 기술과 제품을 만드는 일이 전부라고 생각했다.
- 판매와 마케팅은 있으면 좋지만 본질적인 경쟁력은 아니라고 여겼다.
-
새로운 인식
- 유능한 영업과 마케팅이 매주 실제 사업 성과에 만드는 차이를 과소평가했다.
- 좋은 기술과 제품을 만드는 것뿐 아니라, 고객에게 전달하고 시장에서 선택받는 능력이 매주 체감되는 격차를 만든다.
11.3. Perplexity와 Exa의 경쟁 위치
-
Perplexity
- Perplexity는 Parallel의 검색 인프라와 직접 경쟁하기보다 Instinct·Claw·Claw Work 같은 수직 통합 제품과 더 가까운 경쟁 구도를 가진다.
- Perplexity가 제품 계층에서 웹 검색을 사용하는 관계는 연구소가 내부 검색을 사용하는 관계와 비슷하다.
-
Exa
- Exa는 Parallel의 웹 검색 사업과 직접 경쟁하는 위치에 있다.
- 따라서 경쟁의 기준은 제품 브랜드가 아니라 검색 품질·비용·지연시간·콘텐츠 커버리지다.
11.4. 가장 좋았던 VC 미팅과 앞으로의 10년
-
Josh와 Todd의 투자 미팅
- 투자 결정을 내리기 위해 직접 찾아와 시간을 보낸 점이 최고의 미팅으로 기억된다.
- 단순한 심사나 짧은 소개가 아니라 창업자와 깊이 시간을 쓰는 행동이 신뢰를 만든다.
-
가장 기대하는 것: 혼돈과 변화
- 향후 10년에는 많은 것이 빠르게 바뀐다.
- 변화하는 세계에 맞는 것을 만드는 창업자는 결과가 어디로 향할지에 실질적인 흔적을 남길 수 있다.
- Parallel은 에이전트 검색과 콘텐츠 보상 구조를 통해 오픈 웹의 미래와 콘텐츠 소유자의 생존 방식에 영향을 줄 수 있는 위치에 있다.
12. 최종 관점: 항상 켜진 에이전트가 일상이 되는 조건
항상 켜진 에이전트는 아직 대중의 상식이 아니지만, 기술의 방향은 검색·거래·보안·사회적 신뢰를 하나의 연속된 문제로 묶고 있다.
12.1. 에이전트가 정상화되기까지의 간극
-
현재의 버블
- 소수의 사용자는 Instinct로 거의 모든 구매를 처리하고 지속적인 모니터링 에이전트를 직접 만든다.
- 이런 행동은 기술에 익숙한 계층에서는 자연스럽지만, 일반 대중에게는 카드와 계정을 낯선 에이전트에 맡기는 위험한 일처럼 보인다.
-
대중화의 조건
- 지출 한도가 격리된 계정과 세밀한 권한 제어가 필요하다.
- 에이전트가 무엇을 읽고 어떤 행동을 했는지 감사 가능한 기록이 필요하다.
- 검색·콘텐츠·거래 제공자 사이의 가격과 책임 규칙이 정리돼야 한다.
- 기술적 안전성보다 느린 사회적 신뢰 형성을 고려해야 한다.
12.2. 에이전트 시대의 핵심 변화
- 검색: 키워드와 링크를 반환하는 서비스에서 목적에 맞는 근거와 행동을 공급하는 추론 인프라로 이동한다.
- 경제성: 광고 노출에서 에이전트가 콘텐츠로 얻은 한계 기여도에 대한 직접 보상으로 이동한다.
- 상호작용: 주기적으로 묻는 풀 모델에서 웹의 변화가 먼저 알리는 푸시 모델로 이동한다.
- 조직 전략: 모든 계층을 소유하는 수직 통합과 여러 에이전트에 도달하는 수평 API 사이의 균형이 중요해진다.
- 사회적 위험: 모델의 능력보다 방어·정렬·권한 제한·확산 속도 관리가 실제 피해를 결정한다.
주요 발언 모음
“에이전트는 인간보다 웹을 1,000배 더 많이 사용할 것이다. 그러므로 새로운 기술과 새로운 사업 모델이 필요하다.”
“Parallel은 에이전트를 위한 Google이다.”
“에이전트가 광고를 보지 않는다면 현재 형태의 광고는 작동하지 않는다.”
“콘텐츠 소유자가 에이전트의 접근을 허용하도록 에이전트용 AdSense를 만들어야 한다.”
“웹 검색의 가격은 지금 잘못 책정돼 있다. 에이전트의 규모를 위해서는 한 자릿수 배 이상 내려가야 한다.”
“웹은 풀 검색에서 푸시 검색으로 이동할 것이다.”
“모델이 세계를 해킹했다는 사실만 강조하면, 비례하는 방어 조치를 취하지 않았다는 두 번째 사실을 놓치게 된다.”
“기술이 우리의 적응 능력보다 빠르게 움직이면 몇 년간 매우 힘든 시기가 올 수 있다.”
“사람들은 자신이 할 수 있는 일보다 낮은 기대치를 스스로에게 설정한다. 긴급성과 영감을 함께 주면 더 많은 일을 해낼 수 있다.”
핵심 데이터 & 수치
- 1,000배: 에이전트가 인간보다 웹을 더 많이 사용할 수 있다는 Parallel의 출발 가설이다.
- 100~500밀리초: 음성 에이전트는 약 100밀리초를 원할 수 있지만 인간은 500밀리초만 넘어도 기다리기 싫어한다.
- 1조 문서 → 1,000토큰: 검색은 수조 개 웹 문서에서 모델 컨텍스트에 넣을 약 1,000토큰을 선택하는 압축 과정이다.
- 5%: 코딩 프롬프트 중 웹 검색을 호출하는 대략적인 비율이다.
- 100~1,000배 가격 차이: 유용한 소형 모델과 프런티어 모델 사이의 가격 격차가 이 정도까지 벌어질 수 있다.
- 1/20~1/50 컴퓨트: Parallel은 인간용 검색 스택과 같은 품질을 이 수준의 컴퓨트로 만들 수 있다고 주장한다.
- 5~20%: 에이전트 추론 GPU 지출 중 웹 검색 스택으로 이동할 수 있다고 보는 범위다.
- 100억~600억 달러: 추론 시장 2,000억~3,000억 달러에 5~20%를 적용한 검색 인프라 잠재 시장의 대략적 범위다.
- 67억 달러: 2,000억 달러 추론 시장에서 검색의 3분의 1을 차지했을 때 가능한 중간 매출 가정이다.
- 10~14달러 대 1달러: 시장의 다른 검색 서비스와 Parallel이 주장하는 1,000회 검색당 비용 비교다.
- 10~15배: Monitor API가 6시간마다 폴링하는 방식에 비해 이벤트 기반 감지로 줄일 수 있다고 보는 컴퓨트 절감 폭이다.
- 25세 미만: 유럽 회사 등록부에서 명문대 출신의 젊은 창업자 등록을 감시하는 예시 조건이다.
결론 및 시사점
- 검색 제품 설계: 에이전트 API는 정확도 하나만 최적화하지 말고 호출 모델과 업무의 시간·비용·정확도 예산을 함께 받아야 한다.
- 비용 구조: 에이전트가 대규모로 검색하려면 검색 비용이 모델 추론 비용을 압도하지 않도록 가격과 컴퓨트를 한 자릿수 배 이상 낮춰야 한다.
- 데이터 계약: 좌석 과금과 브라우저 자동화 사이에 머물지 말고, 에이전트가 데이터로 만든 한계 가치에 따라 추론 시점에 보상하는 계약이 필요하다.
- 콘텐츠 생태계: 광고가 사라질 가능성에 대비해 콘텐츠 제공자와 에이전트 인프라 사이에 검증 가능한 사용량·가치 측정과 지급 체계를 마련해야 한다.
- 검색의 미래: 장기 실행 에이전트에는 반복 폴링보다 웹 변화 감지와 이벤트 기반 푸시가 훨씬 경제적이다.
- 안전 설계: 모델 능력을 자랑하는 해킹 사건을 성능 지표로 소비하지 말고, 권한 제한·환경 격리·사후 분석·적대적 평가를 제품의 기본 계층으로 둬야 한다.
- 사회적 전환: 에이전트의 기술적 준비보다 금융 권한과 개인정보를 맡길 사회적 신뢰가 늦게 형성될 수 있으므로, 격리 계정과 감사 가능성이 대중화의 전제다.
- 창업 실행: 기술적 직관과 장기 베팅을 유지하면서도 판매·마케팅·파트너십을 제품 경쟁력의 일부로 다뤄야 한다.
- 시장 포지션: 수직 통합이 항상 정답은 아니며, 모든 에이전트에 도달해야 하는 공통 계층은 API에서 멈추는 수평 전략이 더 큰 선택지를 제공할 수 있다.
- 핵심 판단: 1,000억 달러 가능성은 에이전트가 실제 가치를 만들고, 검색 인프라가 그 성장률을 따라가며, 콘텐츠·고객·모델 생태계의 신뢰를 동시에 얻는다는 조건부 시나리오다.
핵심 요약 (20줄)
-
에이전트는 인간보다 웹을 1,000배 더 많이 사용할 수 있어 기존 검색 기술과 수익 모델을 함께 바꾼다.
-
Parallel은 에이전트가 업무를 수행하는 데 필요한 외부 지식을 공급하는 에이전트용 Google을 만든다.
-
인간은 짧은 키워드와 파란 링크를 사용하지만 에이전트는 완전한 업무 지시와 토큰·파일 결과를 요구한다.
-
음성 에이전트는 100밀리초의 빠른 검색을 원하고 백그라운드 에이전트는 5초를 써서 품질을 높일 수 있다.
-
검색은 수조 개 문서에서 모델 컨텍스트에 넣을 약 1,000토큰을 단계적으로 선별하는 컴퓨트 배분 문제다.
-
작은 모델에는 저렴한 검색을, 비싼 모델에는 더 깊은 검색을 제공해야 전체 에이전트 비용을 최적화할 수 있다.
-
코딩 프롬프트의 웹 검색 호출은 약 5%지만 법률·보험·영업·과학 업무는 외부 정보 의존도가 훨씬 높다.
-
모델은 유명한 헤드 팩트는 기억해도 희소한 개인 사실과 최신 정보까지 완전히 저장하지 못한다.
-
프런티어 모델은 계속 커지고 고정된 성능을 내는 소형 모델은 계속 작아지는 양극화가 동시에 진행된다.
-
GPU와 모델 라우팅은 공급 부족이 이어지는 동안 가치가 크지만 장기적으로는 데이터와 인사이트 거래가 더 큰 기회가 된다.
-
PitchBook 같은 서비스는 좌석 과금에서 에이전트가 실제로 얻은 가치에 따른 추론 시점 과금으로 이동할 수 있다.
-
에이전트는 광고를 보지 않으므로 기존 광고 모델은 약해지고 콘텐츠에 직접 사용료를 지급하는 에이전트용 AdSense가 필요하다.
-
콘텐츠의 보상액은 해당 데이터를 제거했을 때 결과 품질이 얼마나 떨어지는지를 측정한 한계 기여도에 연동될 수 있다.
-
Parallel은 검색 품질·비용·지연시간을 최적화해 인간용 검색 스택보다 20~50배 적은 컴퓨트를 목표로 한다.
-
에이전트 추론 GPU 지출의 5~20%가 검색으로 이동하면 수백억 달러 규모의 인프라 시장이 열린다.
-
검색 가격은 에이전트 대량 사용을 위해 현재보다 한 자릿수 배 이상 낮아져야 하며 품질별 가격 계층이 필요하다.
-
Monitor API는 6시간마다 질의하는 Google Alerts를 웹 변화 감지 기반의 이벤트 스트림으로 바꿔 컴퓨트를 10~15배 줄인다.
-
에이전트의 가장 큰 보안 위험은 능력 자체보다 불충분한 정렬·권한 제한·환경 방어와 적대적 사용에서 발생한다.
-
AI가 순긍정적이어도 기술 확산과 사회 제도의 적응이 늦으면 부의 집중과 전환기의 혼란이 커질 수 있다.
-
항상 켜진 에이전트가 일상이 되려면 검색·데이터 보상·보안·격리 계정·사회적 신뢰가 함께 구축돼야 한다.
