URL: https://www.youtube.com/watch?v=cf2IhzqeQH4 날짜: 2026-10-07 채널: aiDotEngineer 원문 제목: Every AI Company Is Accidentally Building a Bank — Dor Sasson, Stigg 발표자: Dor Sasson, Stigg 공동창업자 겸 CEO
📌 핵심 질문 / 핵심 논점
AI 제품이 사용량·토큰·에이전트를 통해 가치를 소비하는 순간, 왜 소프트웨어 회사는 은행과 같은 금융 인프라를 필요로 하는가?
AI 기업이 자신도 모르게 은행을 만든다는 주장은 마케팅 비유가 아니다. AI의 소비가 추론 전에 자원을 예약하고, 런타임에 사용 권한과 잔액을 판단하며, 사용 후 원장을 정산해야 하는 구조로 바뀌면서 은행의 거래 시스템이 해결해 온 동시성·잔액·출처·권한·감사 문제를 소프트웨어 제품이 직접 떠안게 된다는 뜻이다.
- Anthropic, OpenAI, GitHub Copilot의 가격·접근 정책 변화는 사전 권한 확인과 비용 통제가 뒤늦게 이뤄진 인프라의 한계를 드러냈다.
- 추론과 토큰 소비가 먼저 일어나고 청구서가 나중에 발행되면 비용 급증, 초과 지출, 사용자 충격, 공급업체 마진 악화가 동시에 발생한다.
- 은행처럼 요청 시점에 동기식으로 소비 권한을 평가하고 잔액을 예약·홀드한 뒤 실제 사용량을 비동기식으로 정산하는 계층이 필요하다.
- 에이전트와 크레딧 풀이 늘수록 복식부기, 이중 지불 방지, idempotency, auditability, 출처별 원장, VPC 내부 미터링이 핵심 인프라가 된다.
1. AI 가격 책정 위기의 본질은 인프라다
AI 경제의 소비 단위가 토큰·추론·에이전트 작업으로 이동하면서 가격표보다 먼저 사용 권한과 비용을 통제해야 한다.
1.1. 출발점과 문제 제기
- 발표의 장면
- Dor Sasson은 Stigg 공동창업자 겸 CEO로서 AI 컨퍼런스에 참석했고, 현재 월드컵 경기가 진행 중인데도 와준 청중을 두고 자신이 적어도 지금은 월드컵에서 이기고 있는 셈이라며 고마움을 표현했다.
- 첫 발표라 클릭커가 작동하지 않는 상황도 농담으로 언급했다.
- 은행이라는 주장의 의미
- “모든 AI 기업은 지금 의도치 않게 은행을 만들고 있다”는 표현은 이상한 마케팅 비유가 아니다.
- AI에서 보고·사용하고·소비하고·지불하는 구조가 금융 시스템의 구성 요소처럼 작동한다는 뜻이다.
- AI 제품은 누가 사용할 수 있는지, 얼마만큼 소비할 수 있는지, 어느 자원에서 비용을 차감할지, 언제 정산할지를 런타임에 결정해야 한다.
1.2. 4월의 연쇄적 가격 비상사태
- 새로운 경제와 소비자 행동
- 4월 발표를 준비하는 동안 거의 모든 코드 생성 제품 플랫폼이 새로운 AI 경제와 소비자 행동 아래에서 무너지는 것처럼 보였다.
- 약 5주 동안 가격 책정 비상사태가 하나씩 이어졌지만, 문제는 재무·상업 부서의 가격표를 넘어 시스템이 처음부터 어떻게 구축됐는지에서 비롯된 인프라 비상사태였다.
- Anthropic과 OpenClaw
- Anthropic은 OpenClaw와 다른 제3자 에이전트가 구독 플랜을 사용하는 접근을 사실상 제거했다.
- Claude Max 구독 안에서 OpenClaw를 사용하는 모든 사용자의 소비를 Anthropic이 보조했다.
- 고객이 매일 지불하는 금액은 몇 달러와 센트였지만, Anthropic의 비용은 사용자 한 명당 약 150~750달러의 보조금에 달했다.
- Anthropic처럼 큰 기업도 이 경제성을 확장할 수 없었다. API 사용자와 구독 프로그램 사용자를 효과적으로 구분할 방법이 없었기 때문에 접근을 즉시 중단할 수밖에 없었다.
- OpenAI와 GitHub Copilot
- OpenAI는 제품 가격 책정 방식을 바꾸고 하룻밤 사이 가격을 5배 올리는 조치를 취했다.
- GitHub는 Copilot의 체험 및 무료 플랜 접근을 동결한 뒤 완전히 없앴다.
- 세 회사는 짧은 기간에 AI를 대규모로 판매할 때 무엇이 발생하는지, 기본적인 권한·미터링·비용 통제 구조가 없을 때 문제가 어떻게 폭발하는지 동시에 경험했다.
1.3. 비용 폭발 사례와 공통 원인
- 실제 사례
- 한 비공개 기업은 직원 몇 명이 사용한 것만으로 조직 전체의 AI 클라우드 크레딧 약 5억 달러어치를 소진했다.
- Uber는 연간 AI 사용 예산을 연초 몇 주 만에 사실상 모두 소진했다고 밝혔다.
- Replit은 조직 안의 단 세 명의 사용자가 조직 전체 크레딧 풀을 소진할 수 있는 사례를 보여줬다.
- 권한 확인이 청구서보다 늦다
- 에이전트·사용자·AI 제품 이용자에게 무엇이 허용되는지 확인하는 절차가 사용 전에 있지 않고 송장 발행 뒤에 수행된다.
- 사용자는 제품을 사용하고 토큰을 소진한 다음에야 권한·한도·비용 검사를 받는다.
- 지출과 후속 조정은 청구서가 발송된 뒤에야 이뤄지므로 비용 충격과 사용자 경험 악화가 이미 발생한 뒤다.
- 공급업체가 급증한 사용량을 뒷받침할 컴퓨팅 자원을 충분히 배분하지 않았다면 매출이 늘어도 마진이 악화된다.
2. AI 제품에는 은행식 사전 승인과 정산 계층이 필요하다
AI의 핵심 경로에서는 소비 전에 권한과 잔액을 동기식으로 확인하고, 실제 사용량과 후속 효과는 비동기식으로 정산해야 한다.
2.1. 현재 아키텍처의 한계
- 추론 이후의 검사
- 대부분의 팀은 추론이 끝나고 사용량이 기록된 뒤 검사(check)와 결제·정산(settlement)을 실행한다.
- 이 시점에는 이미 비용이 발생해 비용 급증(spike), 초과 지출(overspend), 초과 사용량(overage)을 막기 어렵다.
- AI가 바꾸는 설계 대상
- AI는 가치가 무엇인지, 사용자가 누구인지, 상호작용 방식만 바꾸지 않는다.
- 무엇이 실제 지불 대상인지, 청구서와 권한 확인 전에 발생하는 런타임 사용량을 어떻게 처리할지도 바꾼다.
2.2. 동기식 핫 패스와 비동기식 후처리
- 제안하는 순서
- 소비를 허용하기 전에 정책과 잔액 조건을 동기식으로 강제한다.
- 요청의 핵심 경로(hot path)는 소비 전에 확인하고 잔액 업데이트 전에 허용 여부를 결정한다.
- 실제 사용량, 차이 조정, 결제(settle), 사후 효과는 이후 비동기식으로 조정한다.
- ATM 비유
- ATM에서는 인출 권한과 잔액 확인이 현금을 받은 뒤가 아니라 현금을 받기 전에 수행된다.
- AI 에이전트가 토큰·컴퓨팅·크레딧을 소비하는 순간도 같은 순서여야 한다.
- AI 업계가 빠뜨린 것은 이런 동작을 자연스럽게 만드는 금융 인프라 계층이다.
- OpenAI Financial Engineering
- 2월 OpenAI의 Financial Engineering 팀은 OpenAI 규모에서 작동하는 아키텍처와 구축 요소를 공개했다.
- 그 설계는 은행의 거래(transactional) 시스템이 작동하는 방식과 유사하다.
2.3. 런타임 의사결정 폭포
- 평가할 조건
- 클라이언트·사용자·에이전트가 런타임에 무엇을 할 수 있는지 결정한다.
- 특정 기능·제품 접근 권한, 플랜별 속도 제한(rate limit), 체험판 여부, 프로모션 프로그램 참여 여부를 함께 확인한다.
- 세 가지 설계 속성
- 단일 동기식 평가: 사후가 아니라 요청 시점에 하나의 평가를 통과한다.
- 결정론적 우선순위: 특정 소비에 적용되는 규칙을 미리 알고 일관되게 우선순위를 부여한다.
- 청구 이전 금융 의사결정: 송장이나 billing 기능이 아니라 청구 요소보다 앞서 허용·거부·할당을 결정하는 금융 시스템이다.
- 표준화 전망
- 접근을 허용할지, 자원을 인출(draw down)하게 할지, 소비를 진행시킬지를 청구서 뒤에 결정할 수 없다.
- 이 금융 의사결정 계층은 다른 제품과 AI 시스템에서도 표준이 될 가능성이 높다.
3. 은행의 거래 원칙이 AI 에이전트의 동시성 문제를 해결한다
AI 에이전트가 같은 자원 풀에 동시에 접근하면서 은행이 해결해 온 hold·settle·이중 지불·복식부기 문제가 다시 등장한다.
3.1. 공유 잔액과 동시 인출
- 10달러 계좌
- 두 별도 당사자가 잔액 10달러인 같은 은행 계좌에 접근할 권한을 갖는다고 가정한다.
- 둘이 동시에 인출하면 모두 잔액이 있는 것으로 판단할 수 있다.
- 은행 시스템은 홀딩(holding)과 결제·확정(settling)으로 이 동시성 문제를 처리한다.
- 1만 개 에이전트
- AI에서는 최대 1만 개 에이전트가 같은 달러·크레딧 풀에 동시에 접근할 수 있다.
- 표면상 잔액이 남아 모두 인출할 수 있어 보여도 동시에 차감하면 실제 사용 가능 금액을 초과한다.
- 은행에는 익숙한 동시성 해결 계층이 AI 에이전트 시스템에는 아직 정립되지 않았다.
3.2. 이중 지불과 복식부기
- Double-spend
- 같은 풀에서 여러 요청이 동시에 소비되는 현상은 고전적인 이중 지불(double-spend) 문제와 같다.
- 잔액을 읽은 뒤 차감하는 단순한 순서만으로는 경쟁 요청이 동일 잔액을 중복 사용할 수 있다.
- Double-entry와 거래 속성
- 이 문제는 회계의 복식부기(double-entry bookkeeping)에서 출발한 개념과 연결된다.
- AI 서비스가 성장할수록 복식부기, 복식 청구(double-entry billing), 동시성 제어가 중요해진다.
- 자원을 먼저 홀드하고 실제 결과를 나중에 확정하는 hold·settle, 재시도에도 중복 차감되지 않는 idempotency, 거래의 감사 가능성(auditability)을 설계해야 한다.
3.3. 서로 다른 출처를 가진 크레딧 풀
- 은행의 계좌 구분
- 은행에는 직불 계좌, 현금 계좌, 예금·저축 계좌처럼 출처와 의미가 다른 자금 풀이 있다.
- 인출이 발생하면 어느 계좌에서 돈이 나갔는지와 그 의미를 계산한다.
- 1,700 크레딧의 의미
- 풀에 1,700크레딧이 있어도 각 크레딧이 같은 것은 아니다.
- 정규 구매와 프로모션 지급, 서로 다른 지급 시점이 섞일 수 있다.
- 먼저 부여된 크레딧부터 차감할지, 프로모션부터 쓸지, 어떤 원천이 사용자에게서 실제로 차감됐는지를 계산해야 한다.
- 단일 정수형 DB의 한계
- 단일 숫자는 총량만 보여주고 출처·조건·우선순위·만료·감사 이력을 보존하지 못한다.
- AI 소비가 복잡해지는 미래에는 단일 정수형 잔액만으로 올바른 차감과 정산을 수행할 수 없다.
4. 평면적인 소프트웨어 소비가 계층형 금융 구조로 바뀐다
AI 크레딧은 사용자와 조직 사이의 단순 잔액이 아니라 계층마다 다른 거버넌스와 예산 통제가 필요한 자원이다.
4.1. 사용자·조직 구조의 변화
- 과거의 평면적 소비 모델
- 과거 소프트웨어에는 사용자와 조직이 있었고 그 사이에 복잡한 소비 계층이 많지 않았다.
- 누가 가치를 얻는지와 누가 소비하는지 파악하기가 간단했다.
- 오늘날의 비평면적 크레딧 풀
- 조직·부서·팀·사용자·에이전트 사이에 여러 계층이 존재한다.
- 각 계층에 서로 다른 거버넌스, 로직, 할당량, 예산, 지출 한도가 필요하다.
- 상위 예산이 하위 소비자에게 배분되므로 총잔액뿐 아니라 권한과 귀속을 관리해야 한다.
4.2. 엔터프라이즈 계약과 세밀한 귀속
- 상위 레벨의 예산
- 기업용 AI 솔루션은 연간 선약정(pre-commit) 계약으로 판매될 수 있다.
- C-suite 또는 경영진은 7자리 수 규모의 계약을 승인하고 계약 기간 동안 크레딧이 어떻게 소진되는지 확인하려 한다.
- 알아야 할 소비자
- 경영진은 크레딧이 사용됐다는 사실만 보지 않는다.
- 어느 팀·사용자·에이전트가 실제로 사용했는지, 어느 정도까지 사용했는지 알고 세밀한 통제를 원한다.
- 고차원 소비 데이터
- 모델 유형·사용자·기능·제품별로 소비량을 잘라 보고(slice and dice)할 수 있어야 한다.
- 고카디널리티 그래프와 차원별 분석이 프로덕션 AI 워크로드의 기본 뼈대가 된다.
5. 대규모 AI에서 반복되는 네 가지 금융 시스템 패턴
AI를 규모 있게 판매할수록 은행 시스템과 유사한 운영 패턴이 반복되며 원장과 미터링은 핵심 인프라가 된다.
5.1. 패턴 1 — 추론 전 예약, 실제 사용 후 정산
- Reserve before inference
- 추론 전에 예상 자원과 비용을 예약하고 요청 시점에 잔액·정책·우선순위를 확인한다.
- 실제 토큰·컴퓨팅·기능 사용량은 작업 후 정산하며 예약량과 실제 사용량의 차이는 비동기식으로 조정한다.
- 이 패턴은 회계 처리와 동시성 워크로드 처리 방식에 직접 영향을 준다.
5.2. 패턴 2 — 사용 이벤트와 원장을 VPC 안에 배치
- 외부 전송을 꺼리는 이유
- 지연 시간(latency), 비용(cost), 데이터 주권(data sovereignty) 때문에 사용 이벤트를 다른 클라우드로 보내는 것을 꺼린다.
- 엔터프라이즈 고객은 사용 기록과 소비 정책을 자사 경계 밖으로 보내지 않기를 원할 수 있다.
- VPC 내부 아키텍처
- 고객 VPC 안에 이벤트 데이터, 원장(ledger), 미터링(metering)을 배치하는 흐름이 커질 것이다.
- 인터넷으로 보내 중앙 서비스에서 처리하는 대신 고객 환경에 금융 소비 계층을 배포할 수 있다.
5.3. 패턴 3 — 에이전트의 예측 불가능한 비용에 대한 런타임 점검
- 작업을 미리 알 수 없는 에이전트
- 에이전트는 무엇을 할지와 최종 비용을 미리 확정할 수 없다.
- 작업을 계속 수행하는 동안 잔액과 비용을 반복해서 확인해야 한다.
- 예약과 후속 정산
- 실제 작업 전에 계정 또는 자원 한도를 예약한다.
- 작업이 끝난 뒤 실제 소비량을 비동기식으로 조정하며, 에이전트가 늘어날수록 동시성·우선순위·재시도·감사 이력을 함께 관리한다.
5.4. 패턴 4로 귀결되는 운영 요구 — 전사 소비 가시성
- 가시성의 지위 변화
- 사용량 기반 제품에서 원래 필요했던 가시성이 AI에서는 사업 수행의 전제조건이 된다.
- CFO와 CIO가 여러 모델·기능·제품에 걸친 AI 워크로드 소비를 봐야 하며, 이는 table stakes, 즉 거래의 최소 조건이다.
- 구매 전 요구사항
- 기업 고객은 계약 전에 모델·기능·제품별 소비량을 확인할 수 있기를 요구하게 된다.
- 공급업체는 판매 후 리포트가 아니라 계약·예산·권한·소비 계층 전체를 투명하게 보여줘야 한다.
- 네 패턴의 공통점
- 사전 예약과 사후 정산은 소비 전에 금융 판단을 내리게 한다.
- VPC 원장과 미터링은 데이터 경계와 운영 통제를 고객 환경 안으로 가져온다.
- 에이전트 점검은 불확실한 작업을 잔액·정책·예약 상태와 연결한다.
- 전사 가시성은 모델·제품·조직·사용자·에이전트 차원에서 거래를 감사하고 통제하게 한다.
6. 소프트웨어 판매가 금융 시스템 판매로 변하는 이유
AI 기업은 구독이나 단순 사용량 상품만 판매하지 않고 소비 속도·권한·잔액·원장을 포함한 금융 시스템을 운영한다.
6.1. 소비 속도 자체가 가격이다
- OpenAI의 숨은 가격 변화
- 4월 변경은 가격 단가를 직접 바꾼 것이 아니라 토큰이 소모되는 속도를 바꾼 것이었다.
- 같은 모델과 단위당 같은 비용이어도 더 많은 토큰이 빠르게 소모되면 실질 가격은 상승한다.
- 가격 변경은 인프라 변경
- 소비 속도를 바꾸려면 소프트웨어가 소비되는 rate를 제어해야 한다.
- 가격 변경은 재무팀의 숫자 수정이 아니라 권한·미터링·속도 제한·원장·자원 예약 인프라의 변경이다.
6.2. 구독·사용량 상품에서 금융 시스템으로
- 상품 모델의 복잡성
- 프런티어 AI 기업들은 소프트웨어를 구독 또는 단순 사용량이라는 상품 형태로만 판매할 수 없다는 점을 인식한다.
- AI 소비는 자금 출처, 선예약, 동시성, 계층별 예산, 에이전트 불확실성 같은 금융 개념을 요구한다.
- 제품·인프라·상업 운영의 결합
- 무엇을 얼마에 파는지 결정하는 가격 정책과 언제 소비를 허용할지 결정하는 런타임 시스템은 분리될 수 없다.
- 판매 규모가 커질수록 정책·잔액·미터링·원장·감사 기능이 신뢰성과 수익성을 결정한다.
7. 업계가 필요로 하는 ‘Stripe의 순간’
모든 기업이 은행 라이선스를 얻어야 한다는 뜻이 아니라, 은행식 금융 구성 요소를 쉽게 조립할 수 있는 개발자 인프라가 필요하다는 뜻이다.
7.1. 2010년대 초반의 Stripe 비유
- 인터넷 제품 출시의 공통 문제
- 2010년대 초반에는 거의 모든 기업이 인터넷에 제품을 출시하려 했고 안전한 checkout과 결제 시스템이 필요했다.
- 개발자가 빠르게 서비스를 구축할 수 있는 사용하기 쉬운 결제 환경이 중요했다.
- AI 시대의 은행 구축
- 지금 AI 기업은 은행을 세우는 것과 비슷한 문제에 직면했다.
- 소비 전 승인, hold·settle, 복식부기, 출처별 풀, 계층별 예산, 에이전트 점검, 원장·미터링을 처음부터 갖춰야 한다.
- 필수 특성과 요소를 사후적으로 덧붙이면 구조가 훨씬 복잡해진다.
7.2. 재사용 가능한 금융 인프라
- 업계가 놓친 계층
- 은행식 구성 요소가 이미 존재하고 쉽게 사용 가능한 ‘Stripe의 순간’이 아직 부족하다.
- 개발자가 금융 시스템의 저수준 문제를 직접 구현하지 않고도 AI 제품을 계속 출시할 수 있는 계층이 필요하다.
- Stigg의 제안과 마무리
- Stigg 팀은 이런 시스템을 구축해 AI 기업이 제품 출시를 계속할 수 있게 할 가능성에 큰 기대를 걸고 있다.
- Sasson은 입구 쪽의 애매한 위치에 있는 Stigg 부스에서 제품 데모를 진행한다고 안내하고, 질문과 추가 기술 대화를 초대했다.
주요 발언 모음
“모든 AI 기업은 지금 의도치 않게 은행을 만들고 있다.”
“가격 책정 비상사태는 재무·상업 부서의 문제를 훨씬 넘어선다. 시스템이 처음부터 어떻게 구축되었는지에서 비롯된 인프라 비상사태다.”
“ATM에서 현금을 인출할 때, 인출 허용 여부는 현금을 받은 뒤가 아니라 현금을 받기 전에 확인된다.”
“이것은 단순한 billing이 아니다. 송장이나 청구 요소보다 앞서 결정을 내리는 금융 시스템이다.”
“추론 전에 예약하고 실제 사용량은 나중에 정산하는 패턴을 점점 더 자주 보게 될 것이다.”
“사용량 가시성은 더 이상 있으면 좋은 기능이 아니다. 이제 거래를 시작하기 위한 최소 조건이 되고 있다.”
“업계에는 모든 구성 요소가 존재하고 사용하기 쉬운 ‘Stripe의 순간’이 필요하다.”
핵심 데이터 & 수치
- 약 5주: 4월 AI 코드 생성 플랫폼의 가격 비상사태가 이어진 기간.
- 5배: OpenAI가 하룻밤 사이에 가격을 올렸다고 설명된 규모. 후반부에서는 토큰 소모 속도 변화가 본질이라고 설명했다.
- 150~750달러: Claude Max 안에서 OpenClaw를 사용하는 사용자 한 명에 대해 Anthropic 측에서 발생한 보조 비용 범위.
- 5억 달러: 직원 몇 명의 사용으로 한 비공개 기업이 소진한 AI 클라우드 크레딧 규모.
- 몇 주: Uber가 연간 AI 사용 예산을 연초에 소진한 기간.
- 3명: Replit에서 조직 전체 크레딧 풀을 소진할 수 있음을 보여준 사용자 수.
- 1만 개 에이전트: 동일한 달러·크레딧 풀에 동시에 접근할 수 있는 에이전트 수의 예시.
- 10달러: 두 당사자가 동시에 인출하려는 은행 계좌 잔액 예시.
- 1,700크레딧: 정규 지급·프로모션 등 출처가 달라 차감 순서를 판단해야 하는 풀의 예시.
- 7자리 수 계약: 엔터프라이즈 C-suite가 승인하고 팀·사용자·에이전트별 소진을 추적하려는 연간 선약정 계약의 규모.
결론 및 시사점
- AI 제품의 원가와 사용량은 청구서보다 먼저 발생하므로 사용 전에 권한·잔액·정책을 판정하는 동기식 금융 계층을 구축해야 한다.
- 추론 전 자원 예약과 추론 후 실제 사용량 정산을 분리하면 비용 급증을 제어하면서 비동기식 정산의 유연성을 유지할 수 있다.
- 크레딧을 하나의 정수로 취급하지 말고 출처·조건·만료·우선순위·귀속을 가진 원장 항목으로 관리해야 한다.
- 에이전트가 같은 풀에 동시 접근하는 환경에서는 hold·settle, double-spend 방지, 복식부기, idempotency, auditability가 필수 거래 속성이 된다.
- 엔터프라이즈 AI는 조직·팀·사용자·에이전트 계층별 거버넌스·예산·할당량·지출 한도와 고차원 소비 분석을 요구한다.
- 지연 시간·비용·데이터 주권이 중요한 고객은 이벤트 데이터·원장·미터링을 VPC 내부에 두기를 원하므로 금융 소비 계층은 고객 환경에 배포될 수 있어야 한다.
- 소비 속도를 바꾸는 것만으로도 실질 가격이 바뀌므로 가격 정책과 런타임 인프라를 별개의 문제로 다루면 안 된다.
- AI 업계가 필요로 하는 것은 은행 라이선스가 아니라 은행식 구성 요소를 개발자가 쉽게 조립할 수 있게 하는 ‘Stripe의 순간’이다.
메타데이터
- source: aiDotEngineer
- video_id: cf2IhzqeQH4
- category: ai-llm
- 처리일: 2026-10-07
