URL: https://www.youtube.com/watch?v=8BD6w5wELRo
날짜: 2026-10-05
채널: IndyDevDan
원문 제목: OpenRouter State Of Models: Jev, Open-Weights, and Tokenomics
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==AI 모델 시장의 승자는 하나의 회사나 하나의 모델이 아니라, 토큰 사용량의 폭발적 증가와 모델 특화·저가화·에이전트 조합을 모두 활용하는 엔지니어다.==
- OpenRouter의 주간 토큰 사용량은 약 1년 만에 4.5조에서 146조, 마지막 결론부의 집계로는 445조 토큰까지 늘었다.
- 저렴하면서 충분히 지능적인 모델, 특히 중국산 오픈 웨이트(open-weight) 모델과 Google·OpenAI의 워크호스(workhorse) 모델이 사용량을 끌어올린다.
- Jev 같은 제로샷 분류기(zero-shot classifier)는 언어 모델을 대체하기보다 언어 모델·에이전트와 함께 의사결정과 라우팅을 맡아 토큰과 지연 시간을 줄인다.
- OpenRouter의 공개 점유율은 개인 엔지니어와 중소기업 중심의 지표이므로 Anthropic·OpenAI·Google의 직접 기업 트래픽까지 포함한 전체 시장의 승자를 그대로 보여주지 않는다.
- 핵심 과제는 더 많은 토큰을 태우는 일이 아니라, 성능·속도·가격의 균형을 유지하면서 토큰당 산출물을 극대화하는 토크노믹스(tokenomics)다.
1. 도입: 2026년 마지막 분기의 모델 시장을 읽는 법
AI 모델을 선택할 때는 지능(intelligence), 속도(speed), 가격(price)을 동시에 고려해야 한다. OpenRouter의 사용량 데이터를 통해 이 세 요소가 시장에서 어떻게 결합되는지 살펴볼 수 있다.
1.1. 분석의 출발점과 다섯 가지 흐름
-
OpenRouter를 관찰 창으로 삼기
- OpenRouter는 여러 모델 제공자의 토큰 사용량과 모델·앱별 사용량을 비교할 수 있는 공개 데이터 창구다.
- 이 데이터는 모든 AI 사용량이 아니라 OpenRouter를 통과한 사용량만 포착하므로, 직접 API와 기업용 계약은 별도로 해석해야 한다.
- 공개 데이터만으로도 토큰 소비의 규모, 저가 모델의 확산, 에이전트 코딩 도구의 부상을 확인할 수 있다.
-
다섯 가지 주요 흐름
- 토큰 사용량이 폭발적으로 증가한다.
- 오픈 웨이트와 저가·고효율 모델이 시장의 큰 부분을 차지한다.
- Jev가 이끄는 구형 분류기(classifier) 계열이 새로운 모델 클래스로 돌아온다.
- 무료 토큰은 사용량을 키우지만 데이터 프라이버시라는 대가를 요구한다.
- 자체 에이전트 코딩 환경과 애플리케이션이 성장하면서 모델을 조합하고 소유하는 방식이 중요해진다.
1.2. 도입부의 공지와 문제의식
-
에이전트 엔지니어링 제품 공지
- 에이전트 엔지니어링 제품의 세 번째 단계 사전 등록이 시작됐다.
- 등록자는 향후 혜택과 독점 아이디어·콘텐츠를 받을 수 있으며, 선택형 설문으로 제품을 최적화하는 데 참여할 수 있다.
- 제품은 11월 말 또는 12월 초 출시를 목표로 하며, 제작자는 지금까지 만든 것 중 가장 가치 있는 제품이 될 것이라고 강조한다.
-
현재 모델을 이해해야 하는 이유
- 2026년 마지막 분기로 들어가는 시점에는 어떤 지능을 어떤 가격과 속도로 사용할 수 있는지 아는 일이 엔지니어의 생산성에 직접 영향을 준다.
- 중요한 것은 모델 개수 자체가 아니라 작업마다 최적의 모델과 호출량을 배치하는 능력이다.
- “컴퓨팅을 확장해 영향력을 확장하라(scale your computing to scale your impact)”는 원칙이 전체 분석을 관통한다.
2. 흐름 1 — 토큰이 늘고 있으며 토크노믹스가 핵심이 된다
토큰 소비는 단순한 사용량 지표가 아니라 AI 도구의 경제적 가치와 실제 업무 활용 범위를 보여주는 지표다.
2.1. OpenRouter 토큰 사용량의 폭발
-
주간 토큰 사용량의 변화
- 약 1년 전 OpenRouter의 주간 토큰 사용량은 4.5조 개였다.
- 최근 주간 사용량은 146조 개에 이르렀다.
- 결론부에서 제시한 연간 비교 수치는 4.5조에서 445조 토큰으로, 약 80배 증가한 것으로 정리된다.
- 자막 중간에는 146조와 140조가 번갈아 언급되고, 결론부에는 445조가 언급되므로 시점·집계 기준이 다를 수 있다. 공통된 결론은 1년 사이 사용량이 약 80배에 가까울 정도로 급증했다는 점이다.
-
증가 속도의 해석
- 이 성장은 엄밀한 의미의 지수 성장(exponential growth)은 아니지만 지수 성장에 매우 가깝다.
- 일주일 사이 257%, 약 2.6조 토큰이 증가한 모델도 등장했다.
- “AI 버블”이라는 주장과 달리, 사용량이 실제로 거의 지수적으로 확대되는 모습은 AI 도구에 대한 수요가 단순한 투기만으로 설명되지 않음을 보여준다.
-
사용량 증가가 만드는 선순환
- 더 지능적이고 저렴한 토큰을 사용할 수 있으면 이전에는 시도하지 않던 사용 사례를 찾게 된다.
- 개인, 제작자, 전체 엔지니어링 생태계가 토큰을 경제적으로 사용하는 법을 점진적으로 학습한다.
- 저가화가 성능 저하 없이 이어지면 더 많은 사용 사례가 생기고, 더 많은 사용량이 다시 모델 생태계의 개선을 유도한다.
2.2. 토큰이 많다고 가치가 커지는 것은 아니다
-
생산성과 토큰 소비의 구분
- 더 많은 토큰은 더 많은 가치와 밀접하지만 동일하지 않다.
- 생산적인 일을 하지 못한 채 토큰만 태우는 것은 진전이 아니다.
- 토큰을 많이 사용하는 행위 자체를 생산성으로 착각하면 “바이브 코딩(vibecoding)”이 최선의 방법처럼 보이겠지만, 코드 생성은 소프트웨어 개발에서 가장 쉬운 부분에 가깝다.
-
개발의 진짜 난점
- 어려운 일은 요구사항 파악, 설계, 검증, 디버깅, 통합, 운영처럼 코드 생성 바깥에 있다.
- 따라서 토큰을 천문학적으로 방출하기보다 컴퓨팅 자원 사용량을 점진적으로 늘리고, 결과 품질이 실제로 좋아지는지 확인해야 한다.
- 같은 예산으로 더 나은 결과를 만드는 엔지니어가 토크노믹스를 이해한 엔지니어다.
-
엔지니어가 던져야 할 질문
- 토큰 지출 증가는 유용한 일을 더 많이 했기 때문인가, 아니면 토큰을 효율적으로 사용하지 못한 채 양만 늘렸기 때문인가?
- 현재 지출한 토큰으로 이전보다 더 높은 성능과 더 큰 업무 성과를 얻고 있는가?
- 값싼 모델 때문에 자신의 시간과 비즈니스 생산성을 희생하고 있는가, 아니면 적절한 모델 조합으로 비용을 낮추고 있는가?
2.3. Anthropic의 성장과 IPO를 둘러싼 계산
-
시장 기대와 불편한 질문
- Anthropic은 약 500억 달러에 가까운 손실을 감수하면서 2조 달러 규모의 IPO를 추진한다는 서술이 등장한다.
- 약 2028년 말 연간 매출 2,000억 달러를 예상한다는 전망도 함께 언급된다.
- 핵심 질문은 토큰 사용량이 계속 거의 지수적으로 증가할 때 이런 가치평가가 정당화될 수 있는지, 그리고 모델 제공자의 토큰 단가가 계속 유지될 수 있는지다.
-
낙관·비관 시나리오
- 토큰 사용량 증가가 지속되면 AI에는 실사용 수요가 있으므로 버블이 아니라는 낙관론이 힘을 얻는다.
- 증가세가 꺾이면 Anthropic IPO에 대한 비관적 전망이 현실화되고 OpenAI도 뒤따르며 “하우스 오브 카드”가 무너질 수 있다.
- 현재 관찰자는 낙관론 쪽에 기울지만, 두 시나리오 중 어느 쪽이 맞는지는 앞으로 확인해야 한다.
-
토큰 경제성의 결론
- 중요한 것은 토큰을 무조건 적게 쓰는 일이 아니라 지출한 토큰이 실제 영향을 얼마나 확장했는지다.
- 저가 모델을 선택해 자신의 시간을 잃는 것과, 적절한 모델을 써서 전체 비용을 낮추는 것은 전혀 다르다.
- TypeSafe/TypeSave의 J 계열 모델은 같은 작업을 더 적은 토큰으로 수행하는 사례로 뒤에서 다시 다뤄진다.
3. 흐름 2 — 오픈 웨이트와 워크호스 모델이 만드는 다극 경쟁
OpenRouter의 모델 점유율은 DeepSeek·OpenAI·Google이 번갈아 상위권을 차지하는 다극 구조를 보여주며, 어느 한 연구소의 단독 승리를 뒷받침하지 않는다.
3.1. 상위권 점유율과 Google의 역할
-
반복되는 상위 3개
- OpenRouter의 주간 분포에서 DeepSeek, OpenAI, Google이 거의 한 해 내내 상위 3위를 반복해서 차지한다.
- 나머지 모델은 때때로 3위권에 들어오지만 지속성은 상대적으로 낮다.
- 시장에서 “Google이 AI 경쟁에서 탈락했고 더 이상 중요하지 않다”는 말은 실제 사용량과 맞지 않는다.
-
Gemini Flash의 워크호스 위치
- Gemini Flash 계열은 성능·속도·가격의 균형이 뛰어난 효율적 워크호스다.
- 일반적인 언어 모델 작업의 약 90%를 처리할 수 있는 A급 모델로 평가된다.
- 코딩 에이전트에서 Gemini 3.8 Flash를 기본 모델로 선택하는 이유도 이 균형 때문이다.
- 업무에 충분한 성능을 내면서 빠르고 저렴한 모델은 실제 사용량을 크게 끌어올린다.
-
A급 모델 경쟁의 의미
- 현재 A급 모델 구간은 언어 모델 시장에서 가장 경쟁적인 구간이다.
- Cloud Opus 5.5, Sonnet, GPT-6 Soul·Luna 계열 등 새로운 모델이 잇따라 나오면서 사용 가능한 컴퓨팅과 지능이 계속 늘어난다.
- 자막에서 Luna는 OpenAI가 OpenRouter 순위에 남을 수 있게 하는 중요한 모델로 평가되며, OpenAI 사용량의 상당 부분을 차지한다고 언급된다.
- DeepSeek, Gemini, Luna, Terra 등은 가격·속도·성능이 실제 업무에 충분한 “골든 미언(golden mean)” 또는 워크호스 지점에 있다.
3.2. Anthropic 직접 트래픽과 OpenRouter 데이터의 한계
-
단순 점유율 계산의 함정
- Anthropic이 OpenRouter에서 7위에 있더라도 그것만으로 전체 시장에서 뒤처졌다고 판단할 수 없다.
- OpenRouter는 주로 개인 엔지니어와 중소기업의 지출을 반영한다.
- 대기업 사용량은 Anthropic, OpenAI, Google과의 직접 계약·멤버십·구독을 통해 흐를 가능성이 높다.
-
매출을 토큰으로 환산하는 사고 실험
- Anthropic의 연간 매출을 600억 달러로 단순화하고 전부 Opus 5.5 토큰에서 나온다고 가정한다.
- 해당 가격으로 계산하면 하루 65.2조 토큰, 주간 약 450조 토큰을 처리해야 한다.
- OpenRouter의 주간 140조~146조 토큰과 비교하면 Anthropic의 직접 트래픽은 공개 순위만으로는 보이지 않는 거대한 규모가 된다.
- 매출의 절반만 Opus 토큰이라고 낮춰 잡아도 하루 32조, 주간 228조 토큰으로 OpenRouter 전체의 약 1.5배다.
- 계산은 가격·매출이 모두 단순화된 “냅킨 뒷면” 사고 실험이지만, 공개 라우터 데이터만으로 기업용 시장을 판단하면 안 된다는 점을 보여준다.
-
전체 시장에서의 승자
- OpenRouter는 엔터프라이즈 시장의 일부만 포착하므로 Anthropic의 기업 부문 강세를 과소평가할 수 있다.
- 반대로 OpenRouter는 다양한 모델을 낮은 가격에 시험하는 엔지니어의 행동을 잘 보여준다.
- 모델별·회사별 승자를 하나로 정하기보다 개인·기업·오픈 웨이트·폐쇄형 모델이 각자의 시장에서 함께 성장한다고 보는 편이 정확하다.
3.3. 중국 오픈 웨이트와 증류의 순환
-
접근성을 만든 오픈 웨이트
- 중국산 오픈 스케일(open-scale) 모델은 특정 작업에서 상위권을 차지하며 낮은 가격과 높은 접근성으로 사용량을 확대한다.
- 일부 중국 모델은 폐쇄형(closed) 성격도 갖지만, 오픈 웨이트 계열은 특히 엔지니어가 직접 활용·배포할 수 있는 선택지를 넓힌다.
- 첨단 모델링 연구소가 길을 닦고, 중국의 오픈 스케일 모델이 그 성과를 널리 접근 가능하게 만든다는 상호작용이 있다.
-
증류(distillation)의 순환
- OpenAI·Anthropic 같은 선도 연구소도 최신 모델의 지식과 행동을 활용한 증류로 모델을 훈련하는 흐름에서 자유롭지 않다.
- 첨단 폐쇄형 모델의 성과가 오픈 웨이트 모델로 흘러가고, 오픈 모델의 효율성과 사용 패턴이 다시 전체 생태계에 영향을 준다.
- 엔지니어 관점에서 비용은 내려가고 지능은 올라가는 순환적 최적화가 진행된다.
-
경쟁의 실질적 결론
- 단일 승리 모델도, 단일 승리 연구소도 없다.
- 모든 회사가 서로 다른 가격·속도·성능 조합을 제공하면서 전체 파이가 커지는 상황이 사용자에게 최적이다.
- 사용자는 하나의 제공자에 종속되기보다 작업에 맞는 모델 스택(model stack)을 구성할 수 있다.
4. 흐름 3 — Jev와 특화 분류기 모델의 귀환
Jev는 전통적인 분류기(classifier)를 현대적인 에이전트 시스템에 결합한 모델로, 언어 모델을 대체하기보다 모델 선택과 작업 라우팅을 빠르고 안정적으로 처리한다.
4.1. Jev의 급성장과 새로운 모델 클래스
-
사용량 상승
- Jev는 한 주에 2.68조 토큰을 기록했고 전주 대비 200% 증가했다.
- 이는 Mimo Flash와 “Space Bunny Alpha”로 소문난 차기 Minimax 모델 이후 가장 빠른 성장으로 소개된다.
- 출시된 지 얼마 되지 않았는데도 OpenRouter 주간 순위 12위에 올랐다.
-
구형 기술의 현대적 부활
- 제로 트레이닝 분류(zero-training classification) 또는 제로샷 분류(zero-shot classification)라는 오래된 모델 계열이 다시 주목받는다.
- 모든 엔지니어가 모델을 재훈련해 본 적이 있다고 말하고 Jev 클론이 빠르게 나타나지만, 전통적인 scikit-learn 분류기를 써 본 경험만으로 Jev의 범용성을 복제할 수는 없다.
- 많은 학습 데이터와 작은 전용 모델로 특정 한 가지 작업에서 Jev를 능가할 수는 있어도, 여러 사용 사례를 가로지르는 범용성까지 능가하기는 어렵다.
-
Jev가 언어 모델과 다른 점
- 에이전트 내부에서 언어 모델이 사용하는 토큰의 일부만으로 분류와 의사결정을 수행한다.
- 빠른 라우팅, 분류, 모델 선택을 맡아 더 비싼 언어 모델이 불필요한 입력 토큰을 처리하지 않게 한다.
- 언어 모델과 경쟁하는 단일 대체재가 아니라, 언어 모델과 함께 사용할 새로운 구성 요소다.
4.2. 확장성·안정성·지연 시간
-
Jev의 운영 특성
- Jev는 확장성이 뛰어나고 신뢰성이 높은 모델로 평가된다.
- OpenRouter의 사용량보다 눈에 덜 띄지만 중요한 지표는 uptime이며, Jev는 쉽게 실패하지 않는다.
- 다른 많은 모델이 더 높은 지연 시간과 더 나쁜 uptime을 보이는 가운데, Jev는 일관되게 낮은 지연 시간과 높은 안정성을 제공한다.
-
실시간 장애가 주는 대비
- 설명을 녹화하는 순간에도 Claude가 다시 충돌하는 작은 시스템 장애가 발생했다.
- 이 사례는 최고급 대규모 모델의 지능과 별개로 운영 안정성이 보장되는 것은 아니라는 점을 드러낸다.
- Jev가 단순한 모델이라는 이유로 쉽게 복제할 수 있다고 생각해서는 안 되는 이유가 여기에 있다.
-
모델 연구의 우선순위
- 선도 모델 연구소는 지능과 벤치마크 성능을 우선시해 안정성을 두 번째나 세 번째 우선순위로 미루는 경우가 많다.
- Jev는 상대적으로 단순한 모델일 수 있지만, 낮은 지연 시간과 높은 uptime을 핵심 제품 특성으로 구현했다.
- 실제 에이전트 운영에서는 한 번의 실패와 지연도 반복 호출 규모에 따라 비용과 생산성에 큰 영향을 준다.
4.3. Pi 에이전트에 Jev를 결합한 실제 효과
-
에이전트 구성
- Pi 프로그래밍 에이전트에 Jev를 추가해 에이전트가 필요할 때 빠르게 결정을 내리도록 만들었다.
- Jev 하나, 추가 모델 하나, 몇 번의 도구 호출만 조합해 비용과 속도 측면의 성능을 개선했다.
- “모델 A 또는 모델 B”가 아니라 “모델 A와 모델 B”를 선택하는 사고가 핵심이다.
-
측정된 비용 절감
- 약 40만~50만 토큰을 요구하는 비교적 단순한 요청에서 약 5센트, 약 20%의 비용을 절감했다.
- Jev를 포함한 Pi 비교 화면은 당시 비용만 표시하고 있어 속도 지표도 추가할 필요가 있다.
- 일일·주간 단위로 에이전트를 반복 실행하면 호출당 20% 절감이 누적되어 큰 차이를 만든다.
-
새로운 모델 조합
- DeepSeek V4.1 Flash와 Jev를 함께 사용할 수 있다.
- Claude Opus 5.5와 GPT-6 Astra를 함께 사용할 수도 있다.
- 각 모델을 잘하는 일에 맞춰 결합하면 하나를 고르는 방식보다 계산량과 결과 품질을 더 효율적으로 배치할 수 있다.
4.4. Jev를 활용하는 방법
-
모델을 코드에 붙이는 데서 멈추지 않기
- Jev를 단순한 라이브러리처럼 코드 한 곳에 복사해 넣는 것만으로는 충분하지 않다.
- 에이전트가 작업을 분류하고 적절한 모델·도구·워크플로를 선택하는 지점에 Jev를 배치해야 한다.
- 실제 프로덕션 작업과 복잡한 에이전트 시나리오에 적용하며 어떤 라우팅이 토큰과 지연을 줄이는지 측정해야 한다.
-
확장 가능한 운영
- 하나의 에이전트에서 입력 토큰을 줄인 뒤 동일한 패턴을 모든 에이전트 실행에 적용한다.
- Jev의 분류 결과를 사용해 값비싼 모델은 어려운 판단과 생성에 집중시키고, 간단한 판단은 저렴한 특화 모델에 맡긴다.
- Jev 계열의 추가 모델과 클론이 등장할수록 이런 조합은 에이전트의 기본 구성 요소가 될 가능성이 높다.
5. 흐름 4 — 무료 토큰의 성장과 데이터 프라이버시의 대가
무료 모델은 사용량과 모델 노출을 폭발적으로 키우지만, 사용자가 제품이 되는 구조와 기밀 정보 유출 위험을 함께 만든다.
5.1. 무료 모델이 보여주는 시장 신호
-
무료 토큰의 높은 사용량
- Space Bunny Alpha로 불리는 모델은 차기 Minimax 모델이라는 소문이 있으며 OpenRouter에서 2위까지 빠르게 올라갔다.
- 낮은 가격 또는 무료라는 조건만으로도 모델은 막대한 관심과 사용량을 얻을 수 있다.
- 비용이 내려가면서도 성능이 유지되면 더 많은 사용 사례가 생긴다는 전체 시장의 추세가 무료 모델에서도 드러난다.
-
가격과 수요의 관계
- 저렴하면서도 효과적인 모델은 시장 점유율이 올라간다.
- DeepSeek, Google, OpenAI가 좋은 성과를 내는 이유도 충분한 성능을 낮은 비용으로 제공하기 때문이다.
- 숨은 저가 모델이 단기간에 정상권으로 올라가는 현상은 가격이 사용량을 끌어올리는 강력한 변수임을 보여준다.
-
무료의 비즈니스 모델
- “무료라면 제품은 당신이다”라는 경고가 제시된다.
- 무료 모델 제공자가 사용자의 프롬프트와 데이터를 저장·열람해 자체 목적에 활용할 수 있다는 우려가 있다.
- 학습에 사용하지 않는다고 약속하더라도 기밀 데이터의 처리 방식을 완전히 신뢰하기 어렵다면 무료 토큰은 비용 없는 선택이 아니다.
5.2. 프라이버시와 저가화 사이의 선택
-
사용자가 치르는 숨은 비용
- 무료 모델은 금전적 비용을 없애는 대신 프롬프트, 업무 데이터, 기밀 정보의 통제권을 약화시킬 수 있다.
- 기밀성이 중요한 업무에서는 무료 모델보다 비용을 지불하는 모델이 합리적일 수 있다.
- 데이터 출처와 사용자를 함께 분석하지 않으면 OpenRouter의 사용량 통계를 과대평가하거나 잘못 해석하게 된다.
-
OpenRouter 사용자의 성격
- OpenRouter 사용량은 여러 모델을 시험하면서 낮은 가격을 찾는 개인과 중소기업의 행동을 강하게 반영한다.
- Claude나 OpenAI를 직접 사용하는 엔지니어는 최고 성능을 위해 더 높은 가격을 받아들이는 경우가 있다.
- 같은 토큰 수라도 고객군과 지불 의사가 다르므로 사용량을 매출이나 품질의 단일 대리 지표로 사용할 수 없다.
-
가격 정책의 전망
- Anthropic의 새 Haiku 모델이 곧 나올 것으로 예상되며, Sonnet과 비슷한 가격을 매길지 주목된다.
- 경쟁력을 가지려면 Haiku 가격이 1달러 미만으로 내려가 Gemini 3.8 Flash 같은 핵심 워크호스와 경쟁해야 한다.
- 그러나 Anthropic이 실제로 가격을 크게 바꿀지는 불확실하므로 가격 경쟁력에 대한 전망에는 주의가 필요하다.
6. 흐름 5 — 애플리케이션, 에이전트 소유권과 오픈 모델 하드웨어
모델 시장의 다음 변화는 어떤 모델을 쓰느냐뿐 아니라 누가 에이전트 환경을 소유하고 어떻게 설정하는지에서 나타난다.
6.1. Pi 코딩 에이전트와 Claude Code의 추격
-
애플리케이션 순위 변화
- OpenRouter 상위 애플리케이션에서 Pi 코딩 에이전트는 오랫동안 Claude Code에 밀려 5~7위권에 머물렀다.
- 최근 Pi는 Claude Code의 사용량을 서서히 따라잡고 있다.
- 공개 OpenRouter 데이터만 보면 연말에는 Pi가 처음으로 Claude Code를 추월할 가능성이 있다는 전망이 나온다.
-
자체 에이전트에 대한 수요
- 더 많은 엔지니어가 자신의 에이전트 코딩 도구를 소유하고, 설정하고, 통제하는 일의 중요성을 이해하고 있다.
- 도구를 직접 구성하면 모델 교체, 라우팅, 도구 추가, 인터페이스 변경을 자유롭게 할 수 있다.
- 이는 단순히 완제품을 구독하는 것보다 자신에게 맞는 모델 스택을 설계할 수 있다는 의미다.
-
순위 해석의 주의점
- Claude Code의 실제 사용량은 Anthropic 멤버십과 구독을 합치면 OpenRouter 수치보다 훨씬 높을 수 있다.
- 따라서 Pi의 추월 전망은 OpenRouter 플랫폼 안에서의 전망이지 전체 코딩 에이전트 시장의 절대 순위가 아니다.
- 그럼에도 오픈 모델과 직접 구성 가능한 에이전트로 사용자가 이동한다는 방향성은 중요하다.
6.2. 에이전트 환경을 직접 소유할 때의 이점
-
도구와 인터페이스의 커스터마이징
- GitHub의 강력한 도구를 에이전트 환경에 통합하고, 추가 도구를 넣고, 표준 인터페이스를 바꾸는 방식으로 Pi를 확장할 수 있다.
- Codex는 전체 사용량이 낮고, Klein은 Pi 코딩 에이전트의 좋은 후계자로 평가되며, Kilo Code도 나쁘지 않은 대안으로 언급된다.
- 그러나 단순성과 커스터마이징을 동시에 제공하는 Pi의 조합을 다른 도구가 완전히 따라오지는 못한다.
-
검증된 비용 이점
- 환경을 직접 설정한 결과 각 에이전트 실행의 토큰 비용을 약 20% 절감했다.
- 많은 엔지니어가 같은 환경을 반복 사용하므로 호출당 20%는 상당한 누적 우위가 된다.
- 자신이 통제하는 라우팅과 도구 설정이 모델 자체의 벤치마크 점수보다 실무 비용에 더 큰 영향을 줄 수 있다.
-
소유와 임대의 원칙
- 지능은 이미 여러 제공자로부터 임대하고 있으므로, 정당한 시간과 투자로 소유할 수 있는 환경은 직접 소유하는 편이 낫다.
- 에이전트 설정, 도구 통합, 인터페이스, 모델 라우팅을 직접 보유하면 제공자 가격이나 기본값에 덜 종속된다.
- 모든 것을 소유할 필요는 없지만, 반복 사용으로 투자 비용을 회수할 수 있는 에이전트 환경은 소유할 가치가 있다.
6.3. 로컬 하드웨어와 오픈 모델
-
Mac Studio 실험 계획
- 10월에 출시될 M5 Ultra 기반 Mac Studio를 구입해 테스트할 계획이 언급된다.
- 통합 메모리 512GB를 갖춘 Mac Studio에서 어떤 모델이 실행되는지 통계를 공유할 예정이다.
- 로컬 하드웨어가 추가되면 엔지니어가 오픈 웨이트 모델을 직접 실행하는 비중과 개인 토큰 사용량도 더 늘어날 수 있다.
-
오픈 모델의 접근성
- 사용자는 이제 클라우드 API만이 아니라 직접 확보한 하드웨어에서 모델을 실행할 수 있다.
- 오픈 웨이트 모델과 충분한 메모리의 결합은 비용·프라이버시·실험 자유도를 개선한다.
- 이 흐름은 폐쇄형 제공자와 오픈 웨이트 제공자가 서로 다른 장점으로 함께 성장하는 다극 구조를 강화한다.
7. 모델 스택과 다음 지능 폭발에 대비하기
최고급 모델을 먼저 활용해 문제를 풀고, 반복 가능한 부분을 더 저렴하고 빠른 모델로 확장하는 계층적 모델 스택이 효율적인 운영 방식이다.
7.1. 반복 문제를 저가 모델로 확장하기
-
문제 해결 순서
- 먼저 가장 발전한 모델을 문제에 투입해 원하는 해결 방식과 품질 기준을 찾는다.
- 같은 문제를 반복해서 풀어야 한다면 해결 절차를 더 저렴하고 빠르고 생산적인 모델로 옮긴다.
- 이 방식은 최초 품질을 희생하지 않으면서 반복 실행 비용을 줄인다.
-
모델 순위의 재평가
- 곧 에이전트 기반 코드 실행을 장기적으로 평가할 수 있는 벤치마크들을 모은 업데이트된 모델 스택이 공개될 예정이다.
- 엔지니어는 자신의 스택과 새 스택을 비교하고 기존 모델 순위를 다시 생각할 수 있다.
- 벤치마크 순위보다 자신의 작업에서 성능·속도·비용의 균형이 맞는지가 최종 판단 기준이다.
-
특화 모델의 확장
- Jev를 계기로 에이전트용 언어 모델뿐 아니라 분류기, 의사결정 시스템, 아직 상상하지 못한 특화 모델이 등장할 수 있다.
- 각 특화 모델은 전체 문제를 홀로 해결하기보다 에이전트의 특정 판단 단계를 맡게 된다.
- 모델 생태계는 “가장 똑똑한 하나”를 찾는 구조에서 여러 전문 모델을 결합하는 구조로 이동한다.
7.2. 엔지니어가 준비해야 할 일
-
다음 지능 폭발 준비
- 특정 시점의 작업에 어떤 모델이 필요한지, 얼마의 가격이 적절한지, 어떤 에이전트와 워크플로에 연결할지를 계속 판단해야 한다.
- Jev 같은 모델을 사용해 적절한 모델·에이전트·도구를 선택하는 메타 수준의 라우팅을 구축해야 한다.
- 최신 모델이 나올 때마다 무조건 교체하기보다 실제 토큰 비용과 결과 품질을 측정해야 한다.
-
내부 에이전트 개발의 토큰 경제성
- 내부 에이전트 개발에서는 입력·출력 토큰, 호출 횟수, 지연 시간, 실패율을 함께 관리해야 한다.
- 반복되는 호출을 특화 분류기와 저가 모델로 옮기면 전체 비용을 줄이고 더 많은 에이전트를 운영할 수 있다.
- 목표 지향적인 엔지니어는 토큰 경제성을 운영 지표로 삼아야 한다.
-
외부 에이전트 엔지니어링
- 내부 자동화에 그치지 않고 외부 사용자를 위한 에이전트 엔지니어링이 점점 큰 돌파구가 된다.
- 고객의 문제에 맞는 모델 조합, 가격, 속도, 신뢰성을 설계하는 능력이 제품 경쟁력이 된다.
- 모델 자체보다 모델을 제품과 워크플로에 배치하는 엔지니어링이 차별화 요소가 된다.
주요 발언 모음
“컴퓨팅을 확장해 영향력을 확장하라(Scale your computing to scale your impact).”
“더 많은 토큰이 더 많은 가치를 의미하지는 않는다.”
“토큰을 생산성이라는 느낌을 위해 태우는 것은 진전이 아니다.”
“나는 ‘또는(or)’가 아니라 ‘그리고(and)’의 관점으로 생각한다.”
“Jev는 많은 사람이 생각하는 것처럼 쉽게 대체할 수 없다.”
“무료라면 제품은 당신이다.”
“저렴하면서도 효과적인 토큰과 도구라면 사용자가 온다.”
“이곳에는 단일 승자가 없다. 파이가 커지고 있다.”
“지능은 충분히 임대하되, 정당한 시간과 투자를 들여 소유할 수 있는 것은 최대한 소유하라.”
“가장 중요한 질문은 토큰 지출을 가장 효율적으로 극대화하려면 어떻게 해야 하는가다.”
핵심 데이터 & 수치
- 4.5조 토큰: 약 1년 전 OpenRouter의 주간 토큰 사용량.
- 146조 토큰: 중간 분석에서 제시된 최근 OpenRouter의 주간 사용량.
- 140조 토큰: Anthropic 직접 트래픽과 비교할 때 사용한 OpenRouter 주간 사용량의 반올림 수치.
- 445조 토큰: 결론부에서 4.5조에서 증가했다고 제시한 최신 주간 비교 수치.
- 약 80배: 4.5조에서 445조로 늘었다고 계산한 1년간의 증가 폭.
- 257% / 2.6조 토큰: 특정 모델이 일주일 동안 기록한 성장률과 증가량.
- 2조 달러: Anthropic이 추진한다는 IPO 가치평가로 언급된 수치.
- 약 500억 달러 손실: Anthropic의 IPO 논의에서 언급된 누적 손실 규모.
- 2,000억 달러: 2028년 말 Anthropic 연간 매출 전망으로 언급된 수치.
- 하루 65.2조·주간 450조 토큰: Anthropic의 연간 매출 600억 달러가 전부 Opus 5.5 토큰이라고 가정한 단순 환산.
- 하루 32조·주간 228조 토큰: 위 매출의 절반만 Opus 토큰이라고 가정한 보수적 환산.
- 2.68조 토큰 / 200% 증가: Jev의 최근 주간 사용량과 성장률.
- 12위: 출시 직후 Jev가 OpenRouter 주간 순위에서 기록한 위치.
- 약 40만~50만 토큰: Jev를 결합한 Pi 에이전트 비교 요청 규모.
- 5센트 / 약 20%: 해당 요청에서 기록한 Jev 사용 비용 절감.
- 약 20%: Jev를 사용하거나 자체 에이전트 환경을 구성했을 때 반복 실행당 절감된 토큰·비용.
- 약 90%: Gemini 3.8 Flash가 처리할 수 있다고 평가한 일반 언어 모델 작업의 비율.
- 1달러 미만: 경쟁력 있는 Haiku 모델에 기대하는 입력 가격의 기준.
- 512GB: M5 Ultra Mac Studio에서 실험할 통합 메모리 규모.
- 5~7위권: 과거 Pi 코딩 에이전트가 OpenRouter 애플리케이션 순위에서 머물던 위치.
- 11월 말~12월 초: 세 번째 에이전트 엔지니어링 제품의 예상 출시 시기.
결론 및 시사점
-
AI 버블 논쟁을 실제 사용량으로 판단해야 한다
- 토큰 사용량은 1년 사이 4.5조에서 수백 조 규모로 늘었고, 이는 AI가 실제 업무에 투입되고 있음을 보여주는 강한 신호다.
- 다만 Anthropic·OpenAI의 직접 기업 트래픽은 OpenRouter에 충분히 잡히지 않으므로 공개 데이터와 전체 시장을 동일시하면 안 된다.
-
단일 모델 승자론을 버려야 한다
- DeepSeek, Google, OpenAI, Anthropic, 중국 오픈 웨이트 모델은 서로 다른 고객과 가격대에서 함께 성장한다.
- 비용 하락과 지능 상승이 동시에 일어나는 현재 구조에서는 사용자가 여러 모델을 조합하는 것이 가장 큰 혜택이다.
-
Jev 같은 특화 모델을 에이전트에 넣어야 한다
- 분류·라우팅·의사결정을 Jev에 맡기면 고가 언어 모델의 불필요한 호출과 입력 토큰을 줄일 수 있다.
- 낮은 지연 시간과 높은 uptime은 반복 실행되는 에이전트에서 벤치마크 점수만큼 중요한 품질 지표다.
-
무료 토큰은 프라이버시 비용까지 계산해야 한다
- 무료 모델의 사용량이 높다는 사실은 가격 탄력성을 입증하지만, 프롬프트와 기밀 데이터가 제공자의 자산이 될 위험을 동반한다.
- 민감한 업무에서는 비용을 지불해 데이터 통제권을 확보하는 선택이 합리적이다.
-
토큰을 많이 쓰는 것보다 잘 쓰는 것이 중요하다
- 최고급 모델로 해결 전략을 만든 뒤 저렴하고 빠른 모델로 반복 작업을 확장하면 품질과 비용을 함께 관리할 수 있다.
- 모델별 호출량, 실패율, 지연 시간, 산출물 품질을 측정해 자신만의 모델 스택을 운영해야 한다.
-
에이전트 환경의 소유권이 장기 우위가 된다
- 자체 환경에 도구·인터페이스·라우팅을 통합하면 반복 실행당 약 20%의 비용 절감과 제공자 독립성을 얻을 수 있다.
- 오픈 웨이트 모델을 직접 실행할 하드웨어까지 확보하면 프라이버시와 실험 자유도도 커진다.
-
다음 모델 시대의 핵심 역량은 조합과 운영이다
- 미래에는 언어 모델만이 아니라 분류기, 의사결정 시스템, 전문 모델이 에이전트 안에서 함께 작동한다.
- 특정 작업에 맞는 모델을 적절한 가격과 속도로 연결하는 토큰 경제성 관리가 outcome-focused engineer의 핵심 역량이 된다.
- 엔지니어는 다음 지능 폭발에 대비해 모델을 직접 시험하고, 자신의 에이전트 환경을 통제하며, 외부 사용자를 위한 에이전트 엔지니어링으로 확장해야 한다.
