URL: https://www.youtube.com/watch?v=QutTzWFWNls
원문 발행일: 2026-09-24
채널: AI Community Bloom 블룸
발표: 천성준(SK텔레콤), 안홍준(Trillion Labs)
📌 핵심 질문 / 이 발표가 다루는 핵심 논점
==모델을 크게 유지하면서도 실제 사용자가 서비스에 배포할 수 있는 수준으로 만들려면, 아키텍처·저정밀도 학습·사람 중심 평가·배포 최적화를 한 번의 학습 루프에 연결해야 한다.==
- SK텔레콤 A.X K2는 모델 규모를 줄이지 않고 희소 어텐션, 잠재공간 KV 캐시, 게이팅, FP8/FP4 양자화로 속도와 메모리 효율을 확보했다.
- Production-Ready의 기준은 벤치마크 점수만이 아니라 사람이 확인하는 뉘앙스와 사용성, 실제 배포 가능성까지 포함한다.
- Trillion Labs는 발전소 P&ID 도면을 읽고 센서 이상을 찾으며 조치까지 추천하는 Industry Foundation Model을 만들기 위해 미드 트레이닝, SFT, 줌 하니스, 비동기 강화학습을 조합했다.
두 팀은 점수만 높이는 모델보다 실제 하드웨어와 업무 환경에서 지속적으로 사용할 수 있는 모델을 목표로 삼는다. SK텔레콤은 범용 모델의 추론 비용과 배포 장벽을 낮추고, Trillion Labs는 복잡한 물리 인프라의 문서·센서·시계열 정보를 연결해 자율 운영에 가까운 에이전트를 만들려 한다.
1. 행사와 SK텔레콤의 Production-Ready 목표
SK텔레콤은 독자 AI 파운데이션 모델 2차수에서 A.X K2를 만들며 “쓸 만한 모델”을 “정말로 쓸 수 있는 모델”로 끌어올리는 것을 목표로 삼았다.
1.1. 천성준과 발표의 배경
-
발표자와 협업 범위
- 기술적 역할: 천성준은 SK텔레콤에서 Technical Project Manager로 일하며 모델 디자인부터 학습과 배포까지 여러 단계에 기여한다.
- 컨소시엄 조율: SK텔레콤 컨소시엄의 6개 회사와 8개 연구실을 대상으로 기술 토론을 진행하고, Artificial Analysis를 포함한 협력 조직과의 기술 협업을 담당한다.
-
독자 AI 파운데이션 모델 프로젝트의 단계
- 1차수: SK텔레콤을 비롯한 정예팀이 실제로 사용할 수 있는 모델을 만드는 데 성공했다.
- 2차수: 4월 NVIDIA Nemotron Developer Day에서 약속한 대로 “쓸 수 있는” 수준을 넘어 실제 업무와 서비스에 배포할 수 있는 모델을 목표로 삼았다.
1.2. Production-Ready를 점수 이상의 개념으로 정의하기
-
벤치마크가 포착하지 못하는 품질
- 뉘앙스: 말투, 맥락에 맞는 표현, 답변의 미세한 자연스러움은 표준 벤치마크만으로 측정하기 어렵다.
- 사람의 직접 평가: 현재 AI 모델을 평가자로 사용해서 이런 미세한 차이를 안정적으로 판단하기는 어렵기 때문에 사람이 직접 응답을 봐야 한다.
-
효율을 포함하는 생산 환경의 기준
- 아키텍처: 모델이 같은 성능을 더 적은 연산과 메모리로 내도록 구조 자체를 효율화해야 한다.
- 학습과 배포: 학습 과정에서부터 커널과 하드웨어의 제약을 반영하고, 추론 단계에서 더 빠르고 적은 GPU로 서비스할 수 있어야 한다.
- 사용성: 점수가 좋아도 사용자가 실제로 다루기 어렵다면 Production-Ready 모델이라고 부르기 어렵다.
2. A.X K2가 규모를 유지하면서 효율을 확보한 방법
A.X K2는 모델을 줄이는 대신 어텐션 구조, KV 캐시, 정밀도, 커널과 디코딩 경로를 동시에 바꿔 688B 규모의 모델을 배포 가능한 형태로 만들었다.
2.1. 커지는 파운데이션 모델과 “줄일 수 없는” 모델 크기
-
사용자 피드백에서 출발한 문제
- 너무 큰 모델: 1차수 모델을 공개한 뒤 가장 많이 받은 피드백은 모델이 너무 커서 사용하기 어렵다는 것이었다.
- 속도와 비용: 더 빠른 응답과 더 적은 GPU로 가능한 추론이 필요했다.
-
스케일 경쟁의 압력
- 모델 규모의 확대: 파운데이션 모델 경쟁은 계속 커졌고, 외부에서는 트릴리언 단위 모델과 10T가 넘는 모델에 관한 이야기까지 나왔다.
- 설계로 해결하기: 모델 크기 자체를 낮출 수 없으므로 아키텍처와 시스템 효율에서 해법을 찾는 전략을 취했다.
2.2. A.X K2의 아키텍처 구성
-
Indexer와 Selector를 이용한 희소 어텐션
- MoE 바깥의 희소성: Mixture of Experts(MoE)는 원래 희소 모델이지만, A.X K2는 어텐션 자체에도 희소성을 추가했다.
- 선택적 컨텍스트 처리: Indexer가 중요한 후보를 찾고 Selector가 처리할 대상을 골라 모든 토큰을 동일하게 읽는 비용을 줄인다.
-
Multi-head Latent Attention(MLA)
- KV 캐시 압축: MLA는 Key-Value 캐시를 압축된 latent space에 저장해 긴 컨텍스트에서 필요한 메모리를 줄인다.
- 배포 효율: 캐시 메모리 사용량이 줄면 같은 GPU에서 더 많은 요청을 처리하거나 더 긴 문맥을 다룰 수 있다.
-
GatedNorm과 Attention Output Gate
- 아웃라이어 제어: GatedNorm은 표현 공간에서 큰 값이 튀는 현상을 줄여 저정밀도 계산과 양자화에 유리하게 만든다.
- 어텐션 싱크 방지: Attention Output Gate는 어텐션 출력이 특정 위치에 과도하게 몰리는 attention sink 현상을 완화한다.
- 구조적 조합: 각 컴포넌트가 완전히 새로운 원천 기술이라는 뜻보다, 이 요소들을 A.X K2의 형태로 조합하고 구현한 구조가 새로운 제안이라는 의미를 강조했다.
2.3. 제한된 자원에서 학습과 배포를 함께 최적화하기
-
커널 단계까지 내려간 최적화
- 기성 커널의 한계: 새로운 아키텍처를 넣으면 기존 커널이 원하는 연산 순서와 맞지 않을 수 있다.
- 커널 퓨전: 필요한 경우 여러 연산을 하나로 합치는 kernel fusion을 적용해 학습과 추론의 불필요한 메모리 이동을 줄였다.
-
한 번의 트레이닝 루프에서 최대한 개선하기
- 컴퓨팅 제약: 자원이 넉넉하지 않아 같은 실험을 무제한 반복할 수 없었으므로 각 학습 루프에서 성공 확률을 높여야 했다.
- 사람과 자동 평가의 결합: 내부 사용성 평가, 커스텀 벤치마크, Arena 응답 분석, 레드팀, 사용자 피드백을 함께 사용했다.
- 실패 분석의 순환: 관찰된 응답에서 역량 격차와 실패 패턴을 찾고 데이터·리워드·안전 목표를 다시 학습 설계에 반영했다.
2.4. A.X K2의 성능과 공개 형태
-
평가 결과
- 수학 성능: Math Arena의 AIME 2026 평가에서 97.1점으로 공동 1위를 유지했다.
- 올림피아드 수준: 내부 테스트에서 2026년 국제수학올림피아드(IMO) 금메달 수준에 해당하는 성능을 확인했다.
- 롱 컨텍스트: A.X K1에서 약점으로 확인된 긴 문맥 처리 능력을 AA-LCR 평가로 점검했고, 1차수보다 약 40점 개선된 결과를 얻었다.
- 한국어: 한국어 능력 평가에서도 가장 우수한 수준임을 재확인했다.
-
더 커졌지만 더 가벼워진 모델
- 파라미터 규모: A.X K2는 688B 파라미터이며, 1차수 모델의 571B보다 커졌다. 활성 파라미터는 33B다.
- 학습 정밀도: K1까지 사용한 BF16 대신 이번에는 네이티브 FP8로 학습했다.
- 양자화 공개: FP8 모델을 다시 FP4로 양자화했으며 NVFP4 릴리즈도 함께 공개했다.
- 메모리 절감: 1차수 BF16 모델은 약 1,038GB, A.X K2 FP8은 약 646GB, NVFP4는 약 370GB의 최소 모델 메모리를 요구한다.
- 하드웨어 배포: NVFP4 모델은 NVIDIA B200 GPU 4장으로도 서비스할 수 있으며, GGUF 포맷도 지원한다.
-
Speculative Decoding 경로
- EAGLE3: EAGLE3 경로는 처리량을 최대 1.64배 높이고 프로덕션 트래픽에서 출력 토큰당 시간을 28% 줄였다.
- DSpark: DSpark 경로는 약 1.8배의 처리량과 단일 스트림 평가에서 44%의 시간 절감을 보였다.
- 사용자 선택권: 두 가지 speculative decoding 옵션을 모두 공개해 사용자가 환경에 맞는 빠른 디코딩 경로를 선택하도록 했다.
2.5. 점수보다 남겨야 할 역량
-
전체 파이프라인의 자립
- 데이터부터 개선까지: 데이터를 만들고, 모델을 학습시키고, 응답을 평가하고, 모델을 개선하는 전체 과정을 자체 역량으로 축적하려 한다.
- 3차수로의 연결: 2차수에서 얻은 기술과 노하우를 다음 차수에도 이어가며 매번 외부 지원에 의존하지 않는 개발 능력을 키우려 한다.
-
모두의 AI를 향한 활용
- 정부 주도 사업: 새로 시작된 정부 주도 사업인 모두의 AI에 A.X 계열 모델이 좋은 AI 애플리케이션과 서비스의 기반으로 활용되기를 기대한다.
- 장기 방향: 단기 벤치마크 순위보다 더 큰 모델 개발과 실제 사용처 확대를 동시에 추구한다.
3. Trillion Labs가 그리는 물리 인프라용 AI
Trillion Labs는 범용 프론티어 모델 개발 경험을 산업 현장의 구조와 데이터에 연결해 Industry Foundation Model인 Gravity를 만들고 있다.
3.1. 7B·21B·70B에서 Gravity까지
-
오픈 모델 개발 경험
- Dense 모델: Trillion Labs는 7B, 21B, 70B 규모의 dense 모델을 오픈소스로 공개해 왔다.
- Tri-21B-Think: 올해 초 발표한 Tri-21B-Think는 Artificial Analysis 지능 지수 기준 상위 30위 안에 들어가는 모델이었다.
- Gravity: 현재 개발 중인 Gravity는 일반 대화용 모델이 아니라 산업 현장과 물리 인프라를 위한 Industry Foundation Model이다.
-
궁극적인 목표
- 셀프 드라이빙 인프라: 발전소와 같은 복잡한 물리 인프라를 AI 에이전트가 스스로 파악하고 운영하는 것이 목표다.
- 코파일럿에서 자율 운영으로: 에이전트는 설비 전체를 조망하고, 장애 원인을 추적하며, 해결 조치를 추천하는 코파일럿으로 시작해 자율 운영에 가까워진다.
3.2. 플랜트 AI가 이해해야 할 네 가지 데이터 층
-
P&ID와 전체 구조
- 배관·계장 도면: Piping and Instrumentation Diagram(P&ID)을 읽고 플랜트 모듈 사이의 연결과 전체 아웃라인을 이해해야 한다.
- 토폴로지: 어느 장치가 어느 밸브와 헤더에 연결되는지 파악해야 장애 조사와 조치 계획이 가능하다.
-
센서와 장기 시계열
- 센서 데이터: 설비에는 장애가 발생하기 전에 변하는 센서 값이 많으므로 값이 튀거나 입력이 끊기는 이상을 읽어야 한다.
- 긴 시간의 기록: 센서에서 오랜 기간 축적된 시계열을 이해해 순간적인 이상과 정상적인 변동을 구분해야 한다.
-
매뉴얼과 모듈 문서
- 엄격한 절차: 문제가 생겼을 때 임의의 상식으로 처리할 수 없고 설비별 운영 매뉴얼을 따라야 한다.
- 모듈 지식: 각 인프라 모듈의 역할과 조건을 문서에서 찾아 센서와 도면에 연결해야 한다.
-
문제 해결과 행동 추천
- 탐지에서 진단으로: 센서 이상을 발견하는 데 그치지 않고 어떤 구성요소에서 문제가 시작됐는지 찾아야 한다.
- 진단에서 조치로: 문제가 발생했다는 설명을 넘어 어떤 밸브를 조작하거나 어떤 절차를 수행할지 추천해야 한다.
3.3. PowerBench와 P&ID 이해 태스크
-
내부 벤치마크의 역할
- PowerBench: 다양한 플랜트 업무를 모델링한 내부 벤치마크를 만들고, 그중 P&ID understanding 태스크를 핵심 사례로 삼았다.
- 현장 기준의 정답: P&ID는 해당 플랜트의 구조적 ground truth이며, 도면 위의 연결 관계가 매뉴얼이나 일반 텍스트에 없는 답을 제공한다.
-
세 가지 질문 유형
- 연결성과 토폴로지: discharge header에서 P-101B를 격리하려면 어느 밸브를 잠가야 하는지처럼 연결 경로를 묻는다.
- 심볼과 태그: 환류 드럼의 relief valve 태그가 무엇인지처럼 도면의 작은 표기와 기호를 읽는다.
- 안전·공정 로직: 특정 밸브를 잠갔을 때 어떤 안전 로직이 작동하는지, V-201 고고수위에서 어떤 인터록이 걸리는지 판단한다.
-
기존 모델의 한계
- 도면 부족: 일반적으로 사전학습된 VLM은 P&ID 도면과 산업용 심볼을 충분히 본 적이 없어 관련 질문에 답하지 못한다.
- 지식 주입 필요성: 문서와 도면, 질의응답을 이용해 도메인 지식을 별도로 넣지 않으면 도면의 기호와 연결 관계를 안정적으로 해석하기 어렵다.
3.4. 미드 트레이닝 → SFT → Agentic RL
-
미드 트레이닝으로 도메인 프라이어 만들기
- 일반 VLM의 출발점: 범용 사전학습 VLM은 P&ID 관습과 산업 설비 문서를 충분히 학습하지 못한 상태에서 시작한다.
- 입력 데이터: 풀 해상도 도면과 크롭, 도면을 읽는 표준·엔지니어링 문서, 도면 기반 QA를 이용해 도메인 특화 미드 트레이닝을 진행한다.
-
SFT로 답변과 도구 사용의 기본기 만들기
- QA 형식 SFT: 질문에 답하는 형식과 출력 포맷을 먼저 학습시켜 기본 정책을 만든다.
- 에이전트 궤적 SFT: 줌과 답변 도구를 실제로 호출하는 agent trajectory를 만들어 SFT하고, 강화학습이 시작할 수 있는 cold start를 제공한다.
-
Agentic RL로 탐색 정책 최적화하기
- 강화학습의 역할: 이미 도면을 읽을 수 있는 정책을 바탕으로 어떤 영역을 어떤 순서로 살펴볼지, 언제 답변을 끝낼지를 학습한다.
- 도구 호출 능력: 미드 트레이닝과 SFT를 거친 뒤에야 모델이 P&ID understanding 도구를 호출할 수 있고, 그 위에서 agentic RL을 적용할 수 있다.
- 순서의 이유: 도면을 읽지 못하는 정책은 문제를 푸는 궤적을 만들지 못하므로 강화학습 보상에도 도달하지 못한다. 먼저 도메인 지식과 기본 행동을 만들어야 한다.
3.5. 16메가픽셀 도면을 읽는 줌 하니스
-
전체 입력의 비용
- A0급 원본: 실제 플랜트 도면은 거의 A0 크기이며 약 16메가픽셀에 달한다.
- 프리필 병목: 원본 전체를 한 번에 모델에 넣으면 프리필에 오랜 시간이 걸려 실용적인 에이전트가 되기 어렵다.
-
다운스케일의 정보 손실
- 계산량 절감: 도면을 약 4메가픽셀 수준으로 줄이면 입력 예산에는 들어온다.
- 로컬 정보 소실: 태그와 심볼처럼 문제를 푸는 데 결정적인 작은 정보가 흐려져 사라진다.
-
하니스의 액션 공간
- zoom: 모델이 관심 영역을 지정하면 해당 영역을 네이티브 해상도로 다시 렌더링한 크롭을 반환한다.
- answer: 충분히 조사했다고 판단한 모델이 에피소드를 종료하고 답을 제출한다.
- 반복 줌: 크롭 안에서 다시 줌할 수 있어 모델이 전체 조망에서 특정 밸브·태그·심볼로 점점 좁혀 들어간다.
- 가변 길이 탐색: 모든 질문에 같은 횟수로 확대하지 않고, 에이전트가 필요한 만큼 탐색한 뒤 답한다.
3.6. 비동기 강화학습으로 처리량을 높이기
-
동기식 RL의 버블
- 느린 롤아웃 대기: 동기식 방식에서는 한 배치의 모든 롤아웃이 끝날 때까지 가장 느린 작업을 기다려야 한다.
- 훈련과 롤아웃의 교대 정지: 롤아웃 중에는 trainer가 놀고, 학습 중에는 rollout server가 놀며, 가중치 동기화 과정에서도 버블이 발생한다.
- 낮은 GPU 활용률: 이 구조에서 GPU 활용률은 약 30% 수준에 머물렀다.
-
비동기식 RL의 레시피
- 동시 실행: rollout worker가 궤적을 계속 만들고 trainer가 도착한 데이터를 기다리지 않고 학습한다.
- 허용 가능한 정책 지연: trainer보다 최대 1~2 버전 뒤처진 궤적을 쓰는 경우가 많지만, Trillion Labs는 최대 8 버전까지 허용하는 레시피를 찾았다.
- 안정성 확보: PPO 계열에서 일반적으로 쓰는 clipping을 제거해도 학습이 안정적으로 진행됐고, 오프폴리시 샘플의 inference sampling 비율에 상한을 두어 위험한 궤적은 마스킹했다.
- 실제 지연 관리: 최대 지연을 8로 열어도 평균 지연은 3~4 수준으로 유지됐으며, trainer와 inference의 처리 비율을 맞춰 한쪽이 놀지 않게 했다.
-
측정된 개선
- 처리량: 동기식 방식보다 처리량이 6배 넘게 증가했다.
- GPU 활용률: 약 30%에 머물던 GPU 사용률을 80%대까지 높였다.
- 선택한 운영점: 내부적으로 최대 12 버전까지도 작동하는 것을 확인했지만, 실제 작업 시간 기준으로는 8이 가장 좋은 균형점이었다.
주요 발언 모음
“벤치마크로 평가할 수 없는 뉘앙스가 있습니다. 그런 것들은 사람이 직접 봐야 평가할 수 있습니다.” — 천성준
“모델의 크기를 줄일 수 없다면 아키텍처에서 효율을 만들어야 합니다.” — 천성준의 설명을 요약한 핵심 문장
“도면을 읽을 수 없으면 플랜트에서 행동할 수 없습니다.” — 안홍준
“Observed behavior became the specification for the next training iteration.” — A.X K2 학습 루프의 원칙
핵심 데이터 & 수치
| 항목 | 수치·결과 | 의미 |
|---|---|---|
| A.X K2 전체 파라미터 | 688B | 1차수 571B보다 커진 모델 규모 |
| A.X K2 활성 파라미터 | 33B | MoE에서 토큰당 실제로 활성화되는 규모 |
| AIME 2026 Math Arena | 97.1점, 공동 1위 | 공개 시점과 발표 직전 모두 유지한 수학 성능 |
| BF16 1차수 최소 메모리 | 약 1,038GB | 기존 배포 메모리 요구량 |
| A.X K2 FP8 최소 메모리 | 약 646GB | 네이티브 FP8 학습·배포 경로 |
| A.X K2 NVFP4 최소 메모리 | 약 370GB | FP8에 가까운 품질을 목표로 한 저정밀도 배포 |
| NVFP4 서빙 하드웨어 | NVIDIA B200 4장 | 대규모 모델의 현실적인 서비스 구성 |
| EAGLE3 speculative decoding | 최대 1.64배, 출력 토큰 시간 28% 감소 | 프로덕션 트래픽 기준 개선 |
| DSpark speculative decoding | 약 1.8배, 단일 스트림 시간 44% 감소 | 또 다른 빠른 디코딩 경로 |
| 실제 플랜트 도면 | 약 16메가픽셀, A0급 | 전체 입력을 한 번에 처리하기 어려운 크기 |
| 비동기 RL 정책 지연 | 최대 8 버전 | 처리량을 위해 허용한 off-policy 범위 |
| 비동기 RL 처리량 | 동기식 대비 6배 이상 | 롤아웃과 학습의 동시 실행 효과 |
| GPU 활용률 | 약 30% → 80%대 | 비동기 RL이 만든 자원 활용 개선 |
결론 및 시사점
- Production-Ready는 종합 시스템 문제다: 좋은 벤치마크 점수만으로는 실제 모델을 만들 수 없으며, 사람의 사용성 평가와 배포 하드웨어, 추론 속도까지 함께 설계해야 한다.
- 모델을 줄이지 않아도 효율화할 수 있다: 희소 어텐션, MLA, 게이팅, FP8 학습, FP4 양자화, speculative decoding을 조합하면 더 큰 모델도 서비스 가능한 메모리와 속도에 접근할 수 있다.
- 사람의 관찰은 학습 명세가 된다: 사람이 발견한 뉘앙스와 실패 패턴을 데이터·리워드·안전 목표로 전환하면 제한된 학습 자원에서도 다음 루프의 개선 방향을 정할 수 있다.
- 도메인 모델은 데이터 구조를 먼저 배워야 한다: P&ID 심볼과 연결 관계를 모르는 VLM에 바로 강화학습을 적용하면 보상에 닿는 궤적 자체를 만들 수 없으므로 미드 트레이닝과 SFT가 선행되어야 한다.
- 하니스는 모델의 눈과 행동 공간이다: 거대한 도면을 무작정 축소하는 대신 zoom과 answer 도구를 제공하면 에이전트가 필요한 부분만 고해상도로 탐색할 수 있다.
- 비동기 RL은 시스템 설계가 성능을 좌우하는 사례다: 최대 정책 지연을 관리하고 오프폴리시 샘플을 제어하면 학습 안정성을 유지하면서 롤아웃과 트레이너의 유휴 시간을 줄일 수 있다.
- 한국 모델 생태계의 경쟁력은 자립 역량에 달려 있다: 데이터 제작부터 모델 개선과 배포까지 전체 역량을 축적해야 다음 모델과 산업별 애플리케이션으로 이어지는 지속 가능한 개발이 가능하다.
핵심 요약 (20줄)
- SK텔레콤은 A.X K2를 688B 규모의 Production-Ready 모델로 개발했다.
- A.X K2의 목표는 벤치마크 점수뿐 아니라 실제 사용성과 배포 가능성을 확보하는 것이었다.
- 사람이 직접 확인하는 뉘앙스 평가가 자동 벤치마크의 빈틈을 보완했다.
- Indexer와 Selector는 MoE와 별도로 어텐션 자체에 희소성을 추가했다.
- MLA는 압축된 latent space로 KV 캐시의 메모리 사용량을 낮췄다.
- GatedNorm과 Attention Output Gate는 아웃라이어와 attention sink를 줄였다.
- SK텔레콤은 커널 퓨전과 내부 사용성 평가를 학습·배포 설계에 포함했다.
- A.X K2는 Math Arena의 AIME 2026에서 97.1점 공동 1위를 기록했다.
- A.X K2는 1차수의 571B보다 커졌지만 네이티브 FP8 학습으로 효율을 높였다.
- NVFP4 버전은 약 370GB의 메모리와 NVIDIA B200 GPU 네 장으로 서빙할 수 있다.
- EAGLE3와 DSpark는 speculative decoding으로 추론 처리량과 응답 시간을 줄였다.
- Trillion Labs는 산업 현장을 위한 Industry Foundation Model Gravity를 개발하고 있다.
- Gravity는 P&ID, 센서, 매뉴얼, 장기 시계열 데이터를 함께 이해해야 한다.
- PowerBench는 발전소 문제 탐지와 도면 기반 조치 추천을 평가하는 내부 벤치마크다.
- P&ID 질문은 연결 토폴로지, 심볼·태그, 안전·공정 로직으로 나뉜다.
- 풀 해상도 도면과 도메인 문서는 미드 트레이닝에서 모델의 산업 지식을 만든다.
- QA SFT와 에이전트 궤적 SFT는 강화학습을 위한 기본 답변과 줌 행동을 만든다.
- zoom과 answer 하니스는 16메가픽셀 도면에서 필요한 영역만 고해상도로 읽게 한다.
- 비동기 강화학습은 정책 지연을 최대 8 버전까지 허용해 처리량을 6배 이상 높였다.
- GPU 활용률은 비동기 학습으로 약 30%에서 80%대로 상승했다.
