source: YouTube video_id: T72nqdC92PM url: https://www.youtube.com/watch?v=T72nqdC92PM date: 2026-09-24 channel: aiDotEngineer title_original: From Scratch to SOTA: Training a 3B State-Space Vision Model — Krishna Prasad Srinivasan, Sarvam original_upload_date: 2026-09-23 speaker: Krishna Prasad Srinivasan, General Manager at Sarvam
📌 핵심 질문
==어떻게 30억 파라미터 규모로 단일 GPU에서 실행되는 상태공간 비전 모델을 처음부터 학습해, 문서 AI에서 100배 큰 모델을 능가하고 22개 인도 공식 언어까지 처리할 수 있는가?==
- Sarvam Vision은 표준 Transformer 대신 State Space Model(SSM)을 사용해 긴 문서의 추론 비용과 메모리 부담을 낮춘다.
- 텍스트 언어 능력을 먼저 만든 뒤 이미지-텍스트 사전학습, OCR 지도학습, 강화학습을 이어 붙이는 4단계 커리큘럼을 사용한다.
- 모델 자체보다 22개 언어의 부족한 라벨 데이터를 보완하는 데이터 엔진과 실제 유용성을 측정하는 평가 체계가 경쟁력의 핵심이다.
- 인도에서 데이터·컴퓨트·학습을 모두 수행한 주권형 모델로서 영어와 22개 인도 언어의 문서 디지털화를 겨냥한다.
문서 AI의 목표는 글자를 단순히 읽어 내는 OCR이 아니라 문서의 지식과 논리적 구조까지 추출하는 것이다. Sarvam은 인도 언어의 데이터 공백과 복잡한 문서 레이아웃을 겨냥해 작은 모델, 문서 구조 처리 모듈, 풍부한 데이터·평가 파이프라인을 결합했다.
1. 발표의 출발점: 작은 주권형 모델이 겨냥한 문제
1.1. Sarvam의 제품 범위와 주권형 AI
-
Sarvam의 모델 포트폴리오
- Sarvam은 인도의 주권형(sovereign) 파운데이션 모델 회사로서 음성·텍스트·비전 모달리티를 함께 다룬다.
- 음성 분야에는 Speech-to-Text와 Text-to-Speech 모델이 있고, 텍스트 분야에는 300억 및 1,000억 파라미터 모델이 있다.
- 비전 분야의 문서 지능(Document Intelligence) 모델이 Sarvam Vision이며, 핵심 주제가 문서의 구조·내용·언어를 함께 디지털화하는 것이다.
-
주권성의 의미
- 정부나 기업이 외부에 배치된 모델로 문서를 처리하면 데이터가 어디로 가고 얼마나 사용되는지 통제하기 어렵다.
- 인도에서 직접 학습하고 API·온프레미스 배포를 제공하면 데이터의 전송 위치와 사용 범위를 조직이 통제할 수 있다.
- 주권성은 단지 국가 정체성의 문제가 아니라 보험·은행·정부 기록처럼 민감한 문서를 처리하기 위한 운영 요건이다.
1.2. 인도 언어 데이터의 공백
-
머신 리더블 세계에서의 부재
- 공개된 언어 분포 연구에 따르면 프런티어 모델 학습에 사용되는 Common Crawl에서 인도 언어의 비중은 1%보다 훨씬 낮다.
- 인도는 프런티어 AI 기업들이 크고 빠르게 성장하는 시장으로 말하는 지역이지만, 실제 학습 데이터에는 충분히 반영되지 않았다.
- 문제는 인도에 지식이나 문서가 없어서가 아니라, 그 지식이 기계가 읽을 수 있는 형태로 디지털화되지 않았다는 데 있다.
-
문서 지능이 필요한 이유
- 인도는 여전히 많은 행정·금융·생활 문서를 보유한 채 디지털화가 진행 중인 국가다.
- 문서가 구조화되어야 이후의 검색, 요약, 에이전트, 개인화된 서비스가 해당 언어로 작동할 수 있다.
- 고품질 Indic 데이터가 쌓이면 모델 성능을 높일 뿐 아니라 이후 여러 AI 시스템을 학습시키는 기반 데이터가 된다.
2. 왜 Indic 문서 지능이 어려운가
2.1. 텍스트 추출과 지식 추출의 차이
-
논리적 일관성의 보존
- 글자만 일렬로 뽑아내는 순수 텍스트 추출은 표, 열, 제목, 각주, 수식의 관계를 잃으면 의미가 없다.
- 문서 지능은 텍스트뿐 아니라 레이아웃, 읽기 순서, 블록 사이의 의미 관계까지 보존해야 한다.
- 따라서 목표는 페이지의 모든 문자를 인식하는 것과 동시에 사용자가 문서를 읽고 이해하는 구조를 재현하는 것이다.
-
Indic 스크립트의 시각적·문자적 복잡성
- 사람이 보는 단어의 모양과 기계가 처리하는 표현은 크게 다르다.
- 인도 언어는 여러 Unicode 코드 포인트가 결합되어 하나의 언어 단위와 시각적 형태를 만들기 때문에 조합을 정확히 처리해야 한다.
- 한 언어에서만 강한 OCR이 아니라 22개 공식 언어 모두에서 문자 조합과 언어적 맥락을 다루는 언어 모델이 필요하다.
2.2. 낮은 자원과 문서 다양성
-
라벨 데이터 부족
- 22개 언어 대부분은 학습에 바로 사용할 수 있는 라벨 데이터가 충분하지 않은 저자원 언어다.
- 라벨이 없으면 모델 아키텍처를 바꾸는 것만으로는 성능을 만들 수 없고, 문서에서 학습 샘플을 만드는 데이터 엔진이 필요하다.
- 실세계 문서와 합성 문서를 함께 사용해 언어·레이아웃·문서 유형의 공백을 메워야 한다.
-
문서 구성 요소의 다양성
- 학습 데이터에는 일반 본문뿐 아니라 표, 수식, 손글씨 문서, 오래된 기록, 혼합 언어 문서가 포함되어야 한다.
- 22개 언어의 산문과 시, 문학, 금융 자료처럼 시대와 장르가 다른 문서도 평가 대상이 되어야 한다.
- 한 페이지 안에서 여러 열과 블록의 읽기 순서를 복원하는 능력이 단순 문자 인식률만큼 중요하다.
3. Sarvam Vision의 설계 선택
3.1. 30억 파라미터 주권형 VLM
-
처음부터 만든 모델
- Sarvam Vision은 인도 최초의 주권형 Vision-Language Model(VLM)으로 소개된 30억(3B) 파라미터 모델이다.
- 데이터, 컴퓨트, 학습을 모두 인도에서 수행했으며 단일 GPU에서 실행할 수 있을 정도로 작다.
- 작은 크기에도 문서 AI에서 state-of-the-art(SOTA)를 기록하고 100배 큰 모델을 능가하는 것을 목표로 삼았다.
-
문서 전용 출발점
- 초기 작업은 2025년 말에 시작됐고, 당시 OCR 분야의 많은 VLM은 페이지 전체를 한 번에 처리하는 monolithic VLM이었다.
- Sarvam은 페이지 전체 OCR 대신 block-level OCR을 택하는 반대 방향의 설계 내기를 했다.
- 블록 단위 인식 앞에 문서 구조를 해석하는
harness를 두어 전체 페이지에서 레이아웃과 읽기 순서를 먼저 정리한다. - 이후 2026년에 공개된 여러 OCR 모델도
harness + small model패러다임으로 모였으며, 작은 모델과 구조 처리 모듈의 조합이 유효하다는 흐름을 보여줬다.
3.2. Harness와 block-level OCR
-
두 개의 harness 모듈
- 하나는 문서의 layout을 분석해 텍스트·표·수식 등 블록의 위치와 구조를 파악한다.
- 다른 하나는 reading order를 분석해 여러 열과 블록을 어떤 순서로 읽어야 하는지 결정한다.
- 구조 모듈이 페이지를 의미 있는 블록으로 나누면 SSM 기반 VLM은 각 블록의 문자를 읽는 데 집중할 수 있다.
-
손실을 감수한 비용 최적화
- block-level OCR은 페이지 전체를 한 번에 읽는 방식과 비교하면 일부 전역 정보를 잃을 수 있다.
- 대신 긴 문서에서 발생하는 Transformer의 높은 계산·메모리 비용을 피할 수 있어 실서비스 추론에 적합하다.
- 문서 구조를 harness가 보완하므로 제한적인 recall 손실을 감수하고도 전체 품질과 처리 비용 사이의 균형을 맞출 수 있다.
3.3. SSM과 Transformer의 차이
-
Transformer의 전역 토큰 상호작용
- Transformer는 모든 토큰이 다른 모든 토큰을 바라보는 구조다.
- 시퀀스 길이를
L이라고 하면 토큰 간 상호작용이L × L로 늘어나 계산량이 시퀀스 길이의 제곱에 비례한다. - 시퀀스가 길어질수록 메모리 사용량도 증가한다.
-
State Space Model(SSM)의 순차 상태
- SSM은 시퀀스 전체의 토큰 쌍을 직접 연결하는 대신 하나의 상태(state)를 유지한다.
- 토큰을 하나씩 읽으며 상태를 갱신하므로 계산량은 선형으로 늘어난다.
- 상태 크기가 일정하게 유지되므로 시퀀스가 길어져도 메모리 사용량이 일정하다.
-
OCR에 SSM을 적용한 이유
- 긴 문서의 한 페이지는 시각 토큰이 5,000~10,000개까지 늘어날 수 있다.
- 이 길이에서 Transformer의 제곱 비례 계산과 메모리는 추론 비용을 크게 높인다.
- 구조 harness와 block-level OCR로 작업 범위를 좁히면 SSM의 선형 계산과 일정한 메모리라는 장점을 활용할 수 있다.
- 문서 전체의 완전한 전역 상호작용보다 실용적인 비용으로 의미 있는 블록을 정확히 읽는 선택이 더 적합하다는 판단이다.
4. 처음부터 SOTA까지: 4단계 학습 커리큘럼
4.1. 1단계 — 텍스트 사전학습
-
13조 토큰으로 언어 백본 만들기
- 영어, 인도 언어 텍스트, 수학, 코드를 합친 13조(13 trillion) 토큰으로 텍스트 사전학습을 수행했다.
- 이 단계에서 30억 파라미터 언어 백본을 먼저 만들고, 모델이 픽셀을 보기 전에 언어 능력을 갖추게 했다.
- 언어 prior가 강하면 흐릿하거나 애매한 이미지 속 글자도 문맥에 맞는 단어로 해석할 수 있다.
-
흐릿한 단어를 읽는 방식
- 사람은 단어의 일부가 반쯤 흐려져도 그 위치에 올 법한 단어를 알고 있기 때문에 읽을 수 있다.
- 동일하게 강한 언어 모델은 이미지의 불완전한 신호를 언어적 가능성과 결합해 복원한다.
- 시각 입력 이전에 언어 역량을 확보한 이유는 OCR을 단순 픽셀-문자 매핑이 아닌 언어적 추론 문제로 다루기 위해서다.
4.2. 2단계 — 이미지-텍스트 continual pre-training
- 일반 시각 능력 학습
- 약 3억(300 million)개의 image-text pair로 continual pre-training을 수행했다.
- 언어 모델이 픽셀을 보고 해석하는 법과 일반적인 vision capability를 익히는 단계다.
- 텍스트 백본과 시각 입력을 연결해 이후 OCR 특화 학습을 받을 수 있는 VLM으로 확장한다.
4.3. 3단계 — 1억 OCR 샘플 지도학습
-
OCR 전문성 부여
- 약 1억(100 million)개의 OCR 샘플로 supervised fine-tuning(SFT)을 수행했다.
- 일반 VLM을 강한 OCR 모델로 바꾸는 단계이며, 영어와 22개 인도 언어를 모두 포함한다.
- 표, 수식, 손글씨 문서 등 다양한 문서 구성 요소를 학습 데이터에 넣었다.
-
다양성의 목적
- 여러 언어의 문자 조합과 저자원 조건에 적응해야 실제 인도 문서를 처리할 수 있다.
- 표 구조와 수식을 문자열로 평탄화하지 않고 원래 관계를 유지하는 능력이 필요하다.
- 손글씨와 다양한 문서 품질을 포함하면 실험실의 깨끗한 OCR뿐 아니라 현장 기록에도 대응할 수 있다.
4.4. 4단계 — OCR을 위한 강화학습
-
SFT의 한계 넘기
- Reinforcement Learning(RL)은 지도학습이 도달할 수 있는 성능의 ceiling을 넘기기 위한 마지막 단계다.
- OCR은 출력이 기계가 읽을 수 있는 형태이므로 정답성 검사를 자동화하기 쉽다.
- 결정론적 OCR에서는 샘플에 대한 보상과 점수를 기계적으로 검증할 수 있어 RL의 효과와 확장성이 크다.
-
RLVR 반복 루프
- 샘플 그룹을 만든다.
- unit test로 각 출력을 채점한다.
- 평균 보상 또는 기준값을 넘기도록 모델을 강화한다.
- 새 샘플을 다시 추출하고 같은 과정을 반복한다.
- 이 과정을 RL with Verifiable Rewards(RLVR)로 확장하면 OCR에 대한 대규모 강화학습을 운영할 수 있다.
5. 진짜 해자는 데이터 엔진과 평가 엔진
5.1. 표준 학습 레시피와 차별화된 기반층
-
4단계 자체는 표준적이다
- 텍스트 사전학습, 이미지-텍스트 학습, SFT, RL을 잇는 순서는 일반적인 멀티모달 모델 학습 레시피와 크게 다르지 않다.
- 경쟁력은 레시피 이름이 아니라 그 아래에서 데이터를 계속 만들고 성능을 측정하는 운영 능력에 있다.
-
두 개의 핵심 기반층
- Data layer는 라벨이 부족한 언어의 합성 데이터와 실제 문서 데이터를 지속적으로 생산한다.
- Eval layer는 모델이 정말 SOTA인지, 실제 사용자에게 의미 있는 성능인지 검증한다.
- 평가 결과를 다시 데이터 생성과 학습 파이프라인에 공급해 모델과 데이터가 함께 개선되도록 만든다.
5.2. Data engine
-
합성·실문서 파이프라인
- 대부분의 22개 언어에는 쉽게 구할 수 있는 라벨 데이터가 없으므로 synthetic data를 생성한다.
- 실제 문서에서 문서 데이터를 만들고, 다양한 레이아웃과 언어 조건을 반영해 학습 샘플을 만든다.
- 평가 성능을 기준으로 다음 학습 데이터의 품질과 구성을 계속 개선한다.
-
에이전트형 비전으로의 확장
- Sarvam은 향후 모델의 agentic vision capability를 탐색하며 RLM 패러다임도 적극적으로 검토하고 있다.
- 데이터 엔진은 한 번 만든 정적 데이터셋이 아니라 배포·평가·재학습을 연결하는 지속적 개선 파이프라인이다.
5.3. Eval engine
- 측정할 수 있어야 SOTA에 도달한다
- 성능을 측정할 수 없다면 모델이 실제로 얼마나 좋은지 주장할 수 없다.
- Sarvam은 광범위한 평가 세트를 구성해 벤치마크 점수와 실사용 유용성을 함께 보려 했다.
- 영어 글로벌 벤치마크와 22개 인도 언어 평가를 별도로 구성해 특정 언어의 평균값에 가려지는 문제를 피했다.
6. 벤치마크, 제품화, 실제 사용
6.1. 영어 글로벌 벤치마크
-
출시 시점 성과
- CRB Bench에서 84.3점을 기록했다.
- OmniDocBench에서 93.2점을 기록했다.
- 출시 이후 다른 모델들이 점수를 끌어올렸지만, Sarvam은 곧 글로벌 리더보드에서 더 강한 모델을 공개할 예정이라고 말했다.
-
22개 인도 언어에서의 우위
- 22개 인도 언어에서는 Gemini, ChatGPT, Opus 같은 프런티어 모델을 포함해 비교했을 때 unbeaten lead를 확보했다고 밝혔다.
- 이후 공개된 최신 모델들과 비교해도 인도 언어에서의 격차를 크게 유지하고 있다고 설명했다.
- 영어 글로벌 점수보다 인도 언어의 실제 문서 처리 우위가 Sarvam Vision의 차별적 가치다.
6.2. Sarvam Vision과 에이전트형 문서 지능
-
문서 작업대
- Sarvam Vision은 agentic document intelligence workbench인 Sarvam Akshar를 구동한다.
- 사람을 loop 안에 둔 human-in-the-loop 방식으로 문서 디지털화, 추출, downstream 시스템 주입을 지원한다.
-
검증 가능한 추출
- 블록 단위 grounding으로 결과가 원문 문서의 어느 영역에서 나왔는지 확인할 수 있다.
- confidence score를 제공해 사람이 검토해야 할 결과를 선별할 수 있다.
- agentic proofreading으로 추출 결과를 자동 점검하고 수정하는 작업을 수행할 수 있다.
6.3. 현장 배포와 규모
-
실사용 조직
- 보험사, 은행, 정부 기관, 역사 기록 보존 조직 등 세계적인 대기업·기관이 Sarvam Vision을 사용하고 있다.
- 영어와 22개 인도 언어를 합쳐 3,500만 페이지 이상을 디지털화했다고 밝혔다.
- 모델은 API, 온프레미스, 에이전트형 플랫폼 형태로 제공된다.
-
시장 신호
- 출시 후 약 4개월 만에 3,500만 페이지를 처리한 수치는 주권형 문서 지능 제품에 대한 시장의 대기 수요를 보여준다.
- 정부·기업이 원하는 것은 일반적인 벤치마크 점수뿐 아니라 데이터 통제, 현지 언어 성능, 대규모 처리 비용을 동시에 만족하는 시스템이다.
7. 결론과 다음 단계
7.1. 발표의 결론
-
인도 최초의 주권형 비전 모델
- 발표 시점 기준 약 4개월 전까지만 해도 인도에서 나온 주권형 모델이 없었지만, Sarvam Vision은 처음부터 학습한 모델로 그 공백을 채웠다.
- 경쟁력 있는 가격으로 오픈 소스·클로즈드 소스 솔루션과 경쟁하면서 SOTA 문서 지능을 제공한다.
-
어려운 문제부터 시작한 전략
- 22개 인도 언어 문서 지능이라는 가장 어려운 문제 중 하나를 먼저 해결하는 전략을 취했다.
- 이후 더 많은 비전 능력을 갖춘 범용 VLM을 공개해 문서 밖의 시각 작업으로 확장할 계획이다.
7.2. 기술적·사업적 시사점
-
작은 모델의 실용성
- 긴 시각 시퀀스를 처리하는 문서 작업에서는 모델 크기보다 추론 복잡도와 메모리 구조가 배포 가능성을 좌우한다.
- SSM과 구조 harness를 결합하면 단일 GPU에서도 현장 문서 처리에 필요한 비용·속도·품질 균형을 만들 수 있다.
-
데이터가 곧 해자다
- 라벨이 부족한 언어를 위한 합성·실문서 생성, 자동 평가, RL 보상 설계가 모델 아키텍처만큼 중요하다.
- 좋은 데이터는 SOTA 성능을 만들고, SOTA 모델은 다시 더 많은 실사용 문서를 확보하게 만드는 선순환을 만든다.
-
주권성과 개인화의 기반
- 언어별 고품질 데이터가 축적되어야 사용자가 선호하는 언어와 방식으로 동작하는 개인화된 에이전트를 만들 수 있다.
- 민감한 문서를 다루는 정부·보험·은행은 모델 성능뿐 아니라 데이터가 어디에서 처리되고 언제 사용되는지 통제할 수 있어야 한다.
8. 질의응답
8.1. 22개 언어 능력이 영어에도 도움이 되는가
질문자는 22개 언어 능력이 영어 능력을 강화하는지 물었다. 22개 언어를 함께 학습한 언어 능력은 영어를 상당한 폭으로 강화하며, 이 효과는 인도 언어뿐 아니라 모든 저자원 언어에 적용될 수 있다는 답변이 나왔다.
8.2. 언어 능력을 코딩 가속에 활용할 수 있는가
일반 언어 능력이 코딩을 빠르게 만드는 데 활용될 수 있느냐는 질문에는, 일반 언어를 활용해 모델의 코딩을 가속한다는 점에서 유사한 원리는 있을 수 있지만 Sarvam Vision의 주변 목표는 아니라고 답했다. 현재 모델의 중심은 비전과 문서에서 정보·지식을 추출하는 일이다.
8.3. 합성 문서와 RL 보상은 어떻게 설계하는가
- SFT와 RL을 포함한 일반적인 post-training에는 인공 문서(synthetic document)를 만들 수 있다.
- RL에서도 합성 문서를 사용할 수 있지만, 가장 좋은 방법은 충분히 복잡한 실세계 문서를 가져와 unit test와 보상 함수를 만드는 것이다.
- 문자 오류율(Character Error Rate), 표 구조, 수식, 특정 언어에 맞는 문법 같은 기준을 보상으로 설계할 수 있다.
- 모델이 여러 설정에서 생성한 결과를 규칙으로 평가하고, 그 규칙에 맞게 반복적으로 개선한다.
8.4. Chandra와 Indic 벤치마크
청중이 Chandra를 좋아하느냐고 농담 섞인 확인을 하자, Chandra는 다른 연구소의 모델이지만 그 모델을 만든 연구소를 자신도 좋아한다고 답했다. 이어 Sarvam이 만든 Indic benchmark를 공개할 계획을 밝혔다.
- Sarvam Indic benchmark는 22개 언어를 다룬다.
- 1800년대 문서부터 현대 문서까지 매우 긴 시간 범위를 포함한다.
- 산문, 시, 문학, 표, 금융 자료 등 서로 다른 문서 유형과 레이아웃을 포함한다.
- 공개 벤치마크가 출시되면 인도 언어 문서 OCR을 동일한 기준으로 비교할 수 있게 된다.
8.5. Transliteration이 OCR에 미치는 영향
Transliteration은 OCR의 직접적인 목표가 아니다. OCR은 이미지의 문자를 높은 충실도로 추출해야 하므로 이미지에 있는 오류조차 그대로 추출해야 하며, 모델이 임의로 교정해서는 안 된다. Transliteration을 거쳐 들어오는 OCR 학습 데이터가 늘고 있지만 그 품질과 유용성은 아직 판단이 끝나지 않았다고 답했다.
8.6. 왜 인도 문서 지능과 주권성이 중요한가
- 다른 프런티어·오픈 모델 모두 복잡한 인도 언어 문서를 잘 처리하지 못한다.
- 14억 인구의 일상에는 여전히 많은 서류 작업이 있고, 국가 전체가 지금도 디지털화되는 중이므로 문서 지능을 제공할 수 있는 기반이 먼저 필요하다.
- 향후 선호 언어와 사용 방식에 맞춘 개인화 에이전트를 만들려면 양질의 현지 데이터가 먼저 쌓여야 한다.
- 보험사와 정부 기관은 외부에 배포된 모델을 사용할 때 데이터가 어디로 전송되고 언제 얼마나 사용되는지 통제하기 어렵다.
- 주권형 모델의 가치는 세 가지로 정리된다. 첫째는 데이터와 배포에 대한 주권성, 둘째는 모델의 문서 처리 능력, 셋째는 후속 모델 학습에 사용할 데이터 생성이다.
- 출시 약 4개월 만에 3,500만 페이지를 디지털화한 실적은 인도 시장이 주권형 문서 지능을 기다리고 있었다는 신호다.
8.7. 학습 데이터의 언어 구성
학습 데이터의 약 40%가 Indic 데이터이고 나머지는 영어, 수학, 코드 등으로 구성된다.
8.8. 배포 피드백의 재학습
현재 배포는 여러 주(state)에서 지역 언어 문서와 영어·혼합 언어 문서를 디지털화하는 방식으로 진행된다. 각 배포에서 얻는 피드백을 다시 학습에 넣는 파이프라인도 이미 시작했으며, 실제 사용 데이터가 다음 모델을 개선하는 순환 구조를 만든다.
발표 말미에는 감사 인사와 함께 박수가 나왔고, 질의응답 뒤 음악이 재생되며 마무리됐다.
주요 발언 모음
“A three billion parameter model small enough to run on a single GPU gets state-of-the-art in document AI and beats models 100 times larger in size.”
“The goal is knowledge extraction, not just purely text extraction. Extracting pure text without logical coherence is meaningless.”
“A transformer has every token look at every other token, where the compute grows with the square of the sequence length.”
“SSMs have a single state. They maintain a single state through the sequence, updating it token by token.”
“You cannot reach state-of-the-art if you cannot measure how well your model performs.”
“In OCR correctness is a machine-readable problem, and in deterministic OCR these are all machine-verifiable. Hence, RL gives us a major boost.”
“If the data is of good quality, then that helps the model become SOTA. And if a model is SOTA, that helps create more data.”
핵심 데이터 & 수치
- 모델 크기: 30억(3B) 파라미터.
- 실행 목표: 단일 GPU에서 실행 가능한 크기.
- 지원 범위: 영어 + 22개 인도 공식 언어.
- Common Crawl 내 인도 언어 비중: 프런티어 모델 학습 코퍼스에서 1%보다 훨씬 낮음.
- 텍스트 사전학습: 13조 토큰, 영어·인도 언어·수학·코드.
- 이미지-텍스트 continual pre-training: 3억 쌍.
- OCR SFT: 1억 OCR 샘플.
- 페이지 시각 토큰: 긴 문서는 페이지당 5,000~10,000개까지 가능.
- 영어 벤치마크: CRB Bench 84.3, OmniDocBench 93.2.
- 학습 데이터 구성: 약 40% Indic, 나머지는 영어·수학·코드 등.
- 실사용 규모: 영어와 22개 인도 언어에서 3,500만 페이지 이상 디지털화.
- Indic 벤치마크 범위: 1800년대부터 현대까지, 산문·시·문학·표·금융 등.
- 배포 시점: 발표 시점 기준 출시 약 4개월 만에 3,500만 페이지 처리.
결론 및 시사점
- 아키텍처: 5,000~10,000 시각 토큰을 만들 수 있는 긴 문서에서는 SSM의 선형 계산과 일정한 메모리가 Transformer보다 실용적이다.
- 시스템 구성: layout과 reading order를 담당하는 harness가 페이지를 블록으로 구조화하고, 작은 SSM VLM이 block-level OCR을 수행한다.
- 학습 순서: 13조 텍스트 토큰으로 언어 prior를 만든 뒤 3억 이미지-텍스트 쌍, 1억 OCR 샘플, 검증 가능한 보상 기반 RL을 차례로 적용한다.
- 데이터 전략: 저자원 언어에서는 모델 구조보다 합성·실문서 생성과 자동 평가를 반복하는 데이터 엔진이 장기적인 해자다.
- 제품 가치: API·온프레미스·에이전트형 문서 작업대를 함께 제공하면 모델 성능, 데이터 주권성, 인간 검증을 하나의 업무 흐름으로 묶을 수 있다.
- 확장 방향: 22개 언어 문서 지능을 발판으로 일반 비전 능력을 갖춘 VLM과 개인화된 현지 언어 에이전트로 확장할 수 있다.
핵심 요약 (20줄)
Sarvam Vision은 단일 GPU에서 실행 가능한 30억 파라미터 주권형 문서 지능 VLM이다.
Sarvam은 음성·텍스트·비전 모델을 인도에서 개발하는 주권형 파운데이션 모델 회사다.
인도 언어는 Common Crawl에서 1%보다 훨씬 낮은 비중을 차지해 프런티어 모델에 과소대표된다.
인도 문서 지능의 병목은 데이터 부족이 아니라 지식이 기계 판독 가능한 형태로 디지털화되지 않았다는 점이다.
문서 AI는 문자를 나열하는 OCR보다 레이아웃과 읽기 순서를 포함한 지식 추출을 요구한다.
22개 인도 언어는 복잡한 Unicode 결합과 저자원 학습 조건 때문에 동시에 처리하기 어렵다.
Sarvam Vision은 페이지 전체 OCR 대신 문서 블록 단위 OCR을 택해 계산 비용을 줄인다.
Layout harness와 reading-order harness가 페이지 구조를 정리한 뒤 SSM VLM이 블록의 문자를 읽는다.
Transformer는 모든 토큰 쌍을 비교해 긴 시퀀스에서 계산량과 메모리가 제곱으로 증가한다.
SSM은 하나의 상태를 토큰별로 갱신해 계산량을 선형으로 만들고 메모리를 일정하게 유지한다.
긴 문서의 한 페이지는 5,000~10,000 시각 토큰까지 늘어나므로 SSM의 효율이 중요하다.
1단계는 영어·인도 언어·수학·코드 13조 토큰으로 30억 파라미터 언어 백본을 만든다.
2단계는 3억 이미지-텍스트 쌍으로 언어 모델에 일반 시각 능력을 추가한다.
3단계는 1억 OCR 샘플로 22개 언어와 표·수식·손글씨 문서를 학습한다.
4단계는 문자 오류율·표 구조·수식·문법을 검증하는 RLVR로 지도학습의 한계를 넘는다.
Sarvam의 장기적인 해자는 22개 언어의 합성·실문서 데이터 엔진과 평가 엔진이다.
출시 시점 CRB Bench 점수는 84.3, OmniDocBench 점수는 93.2였다.
22개 인도 언어에서 Sarvam Vision은 Gemini·ChatGPT·Opus를 포함한 프런티어 모델보다 앞선다고 밝혔다.
보험·은행·정부·역사 보존 기관이 영어와 22개 언어에서 3,500만 페이지 이상을 디지털화했다.
데이터 주권성, 작은 모델의 배포성, 현지 언어 데이터 생산이 인도 AI 생태계의 다음 기반이 된다.
