URL: https://www.youtube.com/watch?v=htod7Nv1cBc 날짜: 2026-10-11 채널: aiDotEngineer
메타데이터
- 원문 제목: How MiniMax M3 Was Built: Sparse Attention and Native Multimodality — Olive Song
- 발표자: Olive Song, MiniMax 강화학습 연구팀
- 영상 ID: htod7Nv1cBc
- 처리일: 2026-10-11
- 주요 기술: MiniMax M3, MSA(MiniMax Sparse Attention), GQA(Grouped-Query Attention), MQA(Multi-Query Attention), ViT(Vision Transformer), 네이티브 멀티모달 사전학습
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==1백만 토큰 컨텍스트를 실제 시스템에서 확장하려면 희소 어텐션을 알고리즘과 인프라 양쪽에서 함께 설계해야 하며, 멀티모달 능력은 텍스트 모델이 굳어진 뒤 덧붙이기보다 처음부터 네이티브하게 학습해야 한다.==
- MSA는 가벼운 인덱스 브랜치로 중요한 블록을 찾고 메인 브랜치가 선택된 블록만 처리해 전체 어텐션 대비 프리필을 9배, 디코딩을 15배 빠르게 만든다.
- GQA의 KV 헤드별 다양성을 보존하려고 헤드별 토큰 선택을 유지하고, GPU 메모리 접근과 top-k 비용을 줄이려고 토큰 단위 검색을 블록 단위 검색으로 바꾼다.
- 멀티모달 데이터를 사전학습 후기에 추가하면 기존 텍스트 능력이 손상될 수 있지만, 처음부터 텍스트와 이미지를 함께 학습하면 같은 텍스트 토큰 예산에서 텍스트 생산성을 거의 훼손하지 않고 통합된 표현을 얻는다.
MiniMax M3는 코딩·에이전트 성능, 1백만 토큰 컨텍스트, 네이티브 멀티모달리티를 하나의 공개 스케일 모델에 결합한다. 단순한 알고리즘 아이디어의 이식보다 모델 구조가 사용하는 GQA 방식과 실제 GPU 커널·메모리 레이아웃을 함께 최적화하는 공동 설계(co-design)가 확장성의 핵심이다.
1. MiniMax M3가 겨냥한 모델 설계
MiniMax M3는 장문 컨텍스트와 에이전트 작업을 처리하면서 텍스트·시각 정보를 한 모델 안에서 자연스럽게 결합하도록 설계됐다.
1.1. MiniMax 연구 기반과 M3의 세 축
-
멀티모달 연구를 축적한 팀
- 언어 모델 경험: MiniMax 연구팀은 자체 LLM을 공개해 왔다.
- 다양한 모달리티: 음성 모델과 비디오 생성 모델을 개발했고, 코드를 작성하는 에이전트 모델도 구축했다.
- 연구 방향: 언어·음성·영상·코드 에이전트에서 얻은 경험을 하나의 모델이 처리할 수 있는 응용으로 확장한다.
-
공개 스케일과 고급 성능을 결합한 M3
- 코딩·에이전트 능력: 모델이 복잡한 작업을 자동으로 여러 부분으로 분해하고 코딩 에이전트 안에서 실행할 수 있다.
- 개발 업무 자동화: 현재 수행하는 코드 작업의 90%를 대체할 수 있다는 목표 수준이 제시된다.
- 장문 상호작용: 1백만 토큰 컨텍스트로 전체 코드베이스 처리처럼 장기적이고 긴 사용자 상호작용을 다룬다.
- 효율적 장문 처리: MSA를 사용해 전체 어텐션보다 프리필(prefill)은 9배, 디코딩(decoding)은 15배 빠르다.
- 네이티브 멀티모달리티: 시각 이해와 언어 생성을 학습 시작점부터 결합해 컴퓨터 제어 에이전트 같은 응용을 가능하게 한다.
1.2. 단순한 구조를 우선하는 설계 원칙
-
확장성을 위한 단순성
- 핵심 원칙: 더 단순한 아키텍처가 더 나은 스케일링 특성을 만든다.
- 일관된 적용: M3의 설계 전 과정에서 깨끗하고 단순한 구조를 우선한다.
-
알고리즘과 시스템의 동시 최적화
- 공동 설계: MSA는 알고리즘만 고치는 접근이 아니라 알고리즘과 인프라를 함께 설계하는 접근이다.
- 현실적 제약: GQA의 헤드 구조, GPU 메모리 읽기, top-k 계산, 학습·추론 커널의 실행 방식이 모델 설계 자체를 결정한다.
- 이식의 한계: 기존 희소 어텐션을 그대로 빌려 쓰는 대신 M3와 실제 시스템 효율의 제약 안에서 구조를 다시 설계한다.
2. MSA(MiniMax Sparse Attention)의 작동 방식
MSA는 전체 토큰을 모두 계산하지 않고, 가벼운 인덱스 계산으로 중요한 영역을 먼저 골라 메인 어텐션의 계산량을 줄인다.
2.1. 인덱스 브랜치와 메인 브랜치
-
두 브랜치로 나뉘는 희소 어텐션
- 인덱스 브랜치(index branch): 전체 어텐션을 사용하지만 계산은 가볍게 수행한다.
- 헤드 구성: 인덱스 브랜치는 쿼리 헤드 4개와 키 헤드 1개를 사용한다.
- 학습 목표: KL divergence로 메인 브랜치의 어텐션 지표를 모방하도록 학습한다.
-
선택된 토큰의 본 계산
- 중요도 계산: 인덱스 브랜치가 어텐션 점수가 높은 토큰을 식별한다.
- 부분집합 처리: 희소 브랜치인 메인 계산은 전체 토큰이 아니라 선택된 부분집합에만 어텐션을 적용한다.
- 키·값 결정: 인덱스 브랜치가 선택한 블록을 바탕으로 메인 브랜치가 계산에 필요한 키와 값을 결정한다.
2.2. 기존 DSA를 GQA에 그대로 적용하기 어려운 이유
-
DSA와 아키텍처 의존성
- 강력하지만 특화된 설계: DSA(DeepSeek Sparse Attention)는 강력한 해법이지만 DeepSeek의 MQA와 높은 헤드 차원 조합에 맞춰 최적화됐다.
- GQA로의 이동: 더 흔한 GQA 구조에서는 동일한 설계를 직접 적용할 때 알고리즘과 구현 문제가 명확해지지 않는다.
-
GQA의 다양성 손실
- KV 그룹의 역할: GQA는 여러 KV 헤드가 서로 더 다양한 정보를 담당하도록 설계된다.
- 공통 선택의 문제: 모든 KV 그룹이 동일한 토큰 선택 전략을 재사용하면 결국 같은 토큰에 어텐션을 집중한다.
- 결과: 헤드 사이의 차이를 얻으려는 GQA의 장점이 사실상 사라진다.
-
GPU 메모리 접근의 비효율
- 연속 읽기의 장점: GPU는 연속된 데이터를 읽을 때 효율이 높다.
- MQA 예시: 하나의 KV 헤드에 큰 차원을 붙인 1×512 레이아웃은 비교적 연속적이라 읽기 쉽다.
- GQA 예시: 같은 전체 차원을 4×128처럼 여러 KV 헤드로 나누면 한 번의 연속 읽기가 아니라 헤드별 독립 읽기가 필요하다.
- 비용 증가: 메모리 접근 오버헤드가 커지고 계산량 대비 메모리 접근량의 비율이 나빠진다.
-
토큰 단위 top-k의 병목
- 후보 수: 인덱서가 많은 토큰 수준 후보에서 가장 중요한 토큰의 top-k 점수를 계산해야 한다.
- 병렬화 한계: top-k 내부에는 데이터 의존성이 있어 GPU에서 완전히 병렬화하기 어렵다.
- 총비용: 토큰 단위 선택은 계산 오버헤드와 결과 결합(merge) 비용을 크게 만든다.
2.3. MSA가 GQA와 하드웨어 문제를 해결하는 방식
-
KV 헤드별 선택 유지
- 집계 제거: 기존 방식처럼 모든 인덱스 브랜치 헤드의 결과를 하나의 선택 토큰 집합으로 합치지 않는다.
- 헤드별 선택: 서로 다른 KV 헤드가 서로 다른 토큰 집합에 집중하도록 선택을 분리한다.
- 다양성 보존: 모든 헤드가 동일한 희소 어텐션을 공유하지 않아 GQA가 의도한 KV 그룹 다양성을 유지한다.
-
토큰 검색에서 블록 검색으로 전환
- 후보 축소: token-level selection 대신 block-level search를 사용해 검색 후보 수를 크게 줄인다.
- top-k·병합 비용 절감: 후보가 줄어 top-k 계산과 결과 병합에 드는 비용이 감소한다.
- 하드웨어 친화성: 블록 단위 접근은 메모리 접근 효율을 높이고 계산량 대비 메모리 접근 비율을 개선한다.
- 성능 보존: 블록 검색이 유의미한 성능 저하를 일으키지 않는다는 결과를 확인했다.
-
학습과 추론 커널의 완성
- 커널 구현: 학습용·추론용 효율적 커널을 각각 개발했다.
- 실용화 역할: 커널은 희소 어텐션을 아이디어 수준이 아니라 실제로 빠르고 효율적으로 실행하는 시스템 구성요소다.
- 확장 결과: 이 설계 덕분에 M3 학습을 1백만 토큰 컨텍스트까지 효과적으로 확장할 수 있었다.
3. 처음부터 학습하는 네이티브 멀티모달리티
멀티모달 능력을 완성된 텍스트 모델에 나중에 붙이지 않고 학습 초기부터 텍스트와 이미지를 동시에 이해하도록 만들면 모달리티 통합과 텍스트 능력을 함께 유지할 수 있다.
3.1. 멀티모달 능력을 추가하는 세 가지 학습 전략
-
사전학습 후 멀티모달 학습(CPT 방식)
- 방법: 텍스트 사전학습이 끝난 뒤 멀티모달 데이터를 추가한다.
- 문제: 그 시점에는 모델이 이미 대부분 수렴했기 때문에 새로운 시각 데이터가 기존 텍스트 능력과 간섭한다.
- 결과: 학습된 텍스트 능력이 저하될 수 있다.
-
일부 텍스트 학습 후 멀티모달 전환
- 방법: 모델이 일정량의 텍스트 토큰을 처리한 뒤 멀티모달 학습으로 이동한다.
- 민감한 조건: 데이터 혼합 비율과 학습 하이퍼파라미터, 특히 학습 속도에 결과가 크게 좌우된다.
- 재현성 문제: 어떤 설정에서는 학습률을 낮추면 성능 하락이 줄지만 다른 실행에서는 같은 결론이 보장되지 않는다.
- 대규모 학습의 제약: 멀티모달리티에 맞추려고 대규모 사전학습 도중 하이퍼파라미터를 임의로 바꿀 수 없다.
-
네이티브 멀티모달 학습(from scratch)
- 방법: 텍스트 모델의 구조가 굳기 전인 학습 시작부터 멀티모달 능력을 함께 구현한다.
- 텍스트 예산: 같은 텍스트 토큰 예산에서 텍스트 능력에 미치는 손상이 작았다.
- 핵심 효과: 시각 기능을 덧붙이는 수준을 넘어 시각 정보와 텍스트 정보를 모델 내부에서 자연스럽게 통합한다.
3.2. 어텐션 맵으로 확인한 통합 정도
-
CPT 계열 모델의 분리
- 시각 토큰 무시: CPT처럼 후기에 멀티모달 학습을 붙인 모델에서는 텍스트 토큰이 시각 토큰에 거의 어텐션하지 않는다.
- 어텐션 맵의 신호: 시각 토큰 영역이 대부분 어둡게 나타나며, 두 모달리티가 충분히 통합되지 않았음을 시사한다.
-
네이티브 학습의 통합
- 연결된 어텐션: 처음부터 멀티모달로 학습한 모델의 어텐션 맵은 텍스트와 시각 토큰 사이가 훨씬 통합된 형태로 나타난다.
- 구분선의 부재: 텍스트와 시각 토큰 사이에 뚜렷한 분리가 보이지 않는다.
- 해석: 모델이 시작 단계부터 시각·언어 정보를 함께 결합하는 방법을 학습한다.
3.3. ViT 기반 멀티모달 아키텍처
-
표준적인 토큰 삽입 흐름
- 시각 인코딩: 이미지나 비디오를 ViT(Vision Transformer)가 처리해 시각 토큰을 만든다.
- 자리 대체: 시각 토큰을 언어 모델 입력에 넣고 텍스트 시퀀스 안의 원래 이미지 플레이스홀더를 대체한다.
- 공동 입력: 시각 임베딩과 텍스트 임베딩을 함께 언어 모델에 전달한다.
-
ViT 내부 3D 어텐션의 효과
- 기본 ViT의 한계: 기본 설정은 각 이미지나 프레임 내부에서만 어텐션을 적용한다.
- 비디오의 단절: 비디오를 처리할 때 서로 다른 프레임의 시각 조각들이 ViT 단계에서 직접 상호작용하지 못한다.
- 3D 어텐션: 서로 다른 프레임의 조각들이 직접 상호작용하도록 만들어 시간적·프레임 간 시각 모델링 능력을 높인다.
- 일반 시각 이해: 비디오 작업뿐 아니라 일부 이미지 벤치마크에서도 개선이 나타나 특정 비디오 기능만이 아니라 전반적인 시각 표현을 강화한다.
-
프레임 수와 시스템 효율의 균형
- 무제한 확장의 문제: 3D 어텐션을 무한히 많은 프레임에 적용하면 시스템 호출이 늘고 부하 분산(load balancing) 문제가 생긴다.
- 최적 지점: 실험에서는 4개 프레임이 성능과 효율 사이의 가장 좋은 균형을 제공했다.
주요 발언 모음
“A simpler architecture always leads to better scaling properties.”
“Rather than simply borrowing an existing sparse attention design, we reimagined the architecture within the constraints of GQA and real-world system efficiency.”
“With the same text token budget, we found that this approach does little to harm text capabilities.”
“It is about integrating multimodality into the model while preserving its strongest textual capabilities.”
핵심 데이터 & 수치
- 1백만 토큰: M3가 처리하도록 확장한 컨텍스트 길이이며 전체 코드베이스 같은 장기 상호작용을 겨냥한다.
- 9배: MSA가 전체 어텐션 대비 달성한 프리필 속도 향상이다.
- 15배: MSA가 전체 어텐션 대비 달성한 디코딩 속도 향상이다.
- 쿼리 헤드 4개·키 헤드 1개: 가벼운 인덱스 브랜치의 헤드 구성이다.
- 1×512 대 4×128: MQA의 연속 KV 레이아웃과 GQA의 분할 KV 레이아웃을 비교한 메모리 접근 예시다.
- 4개 프레임: 3D 어텐션에서 성능과 시스템 효율의 균형이 가장 좋았던 프레임 수다.
- 90%: 코딩 에이전트가 현재 코드 작업의 대체 대상으로 제시된 비율이다.
결론 및 시사점
- 장문 컨텍스트의 실용 성능은 희소성 알고리즘만으로 결정되지 않으며 KV 레이아웃, top-k 병렬화, 메모리 접근, 학습·추론 커널까지 함께 설계해야 한다.
- GQA의 장점을 보존하려면 KV 헤드별로 서로 다른 토큰을 선택해야 하며, 공통 선택 집합으로 합치면 헤드 다양성이 사라진다.
- 토큰 단위 검색은 후보 수와 top-k의 데이터 의존성 때문에 비싸므로 블록 단위 검색이 GPU 친화적인 절충안이 된다.
- 멀티모달 기능을 수렴한 텍스트 모델에 후첨가하면 텍스트 능력이 손상될 수 있고, 학습 중간 전환은 데이터·하이퍼파라미터에 민감하다.
- 처음부터 텍스트와 이미지를 함께 학습하면 같은 텍스트 토큰 예산으로 텍스트 생산성을 유지하면서 어텐션 수준의 모달리티 통합을 얻을 수 있다.
- 비디오 이해에서는 프레임 간 직접 상호작용을 허용하는 3D ViT 어텐션이 유리하지만, 시스템 호출과 부하 분산 비용을 고려하면 4프레임이 현실적인 균형점이다.
