심화 읽기 · 재구성 본문
Oh no (the new Grok model is good)
편집 요약·t3dotgg·7월 9일 목요일·8분 읽기
20줄 요약20줄 · 펼쳐보기
- Theo는 Cursor에서 제공한 새 모델을 테스트하며 새로운 Composer 기능이라고 생각했음
- 24시간 집중 사용 후 해당 모델이 Grok 4.5임을 알게 됨
- xAI(SpaceX의 AI 부서)와 Cursor(현재 SpaceX 소속)의 파트너십으로 출시
- 초반에는 회의적이었으나, 벤치마크를 보고 생각이 바뀜
- "A new model just dropped and its creators are making some very bold claims"
- Grok 4.5: 개발 작업에서 Fable 5에 필적한다는 주장, 훨씬 저렴한 가격에
- Artificial Analysis Intelligence Index: 54점 → 전체 4위 (GPT-5.5, Fable 5, Sonnet 5 다음)
- DeepSWE (소프트웨어 엔지니어링 벤치): 3위 — Fable 1위, GPT-5.5 2위 다음
- Terminal Bench 2.1: 83.3 (GPT-5.5: 83.4, Fable: 84.3) — 거의 동급 성능
- Google 모든 모델 대비 압도적 우위, Opus 4.8 명백히 하회
- DeepSWE는 실제 에이전트 방식의 소프트웨어 작업을 측정 → Theo가 신뢰하는 벤치마크
- GLM5.2 (훨씬 비싼 모델) 대비 의미있는 우위
- 스케이트 벤치에서 76% — 프론티어 랩 중 최저점
- 1.3센트/run — 추론 과다 사용으로 비효율적
- 평균 2,100 토큰/응답 → 무거운 추론 모델 성향
- Sonnet 5는 15센트/run이었지만 낮은 점수 → 더 나쁜 가성비
- Cursor 벤치에서 Fable 5 High급 성능을 보이며 1위 수준 점수 기록
- 단, 훈련 데이터에 Cursor 코드베이스 스냅샷이 실수로 포함됨
- 점수 영향 불명확, 해당 데이터는 이후 모델에서 제거
- Cursor/xAI가 이 사실을 투명하게 공개 → Theo 긍정 평가
Theo는 Cursor에서 제공한 새 모델을 테스트하며 새로운 Composer 기능이라고 생각했음
핵심 주제 1: Grok 4.5 등장 배경과 초기 반응
소주제 1-1: 예상치 못한 발견
세부내용
- Theo는 Cursor에서 제공한 새 모델을 테스트하며 새로운 Composer 기능이라고 생각했음
- 24시간 집중 사용 후 해당 모델이 Grok 4.5임을 알게 됨
- xAI(SpaceX의 AI 부서)와 Cursor(현재 SpaceX 소속)의 파트너십으로 출시
- 초반에는 회의적이었으나, 벤치마크를 보고 생각이 바뀜
근거/사례
- "A new model just dropped and its creators are making some very bold claims"
- Grok 4.5: 개발 작업에서 Fable 5에 필적한다는 주장, 훨씬 저렴한 가격에
핵심 주제 2: 벤치마크 성능 분석
소주제 2-1: 주요 벤치마크 순위
세부내용
- Artificial Analysis Intelligence Index: 54점 → 전체 4위 (GPT-5.5, Fable 5, Sonnet 5 다음)
- DeepSWE (소프트웨어 엔지니어링 벤치): 3위 — Fable 1위, GPT-5.5 2위 다음
- Terminal Bench 2.1: 83.3 (GPT-5.5: 83.4, Fable: 84.3) — 거의 동급 성능
- Google 모든 모델 대비 압도적 우위, Opus 4.8 명백히 하회
근거/사례
- DeepSWE는 실제 에이전트 방식의 소프트웨어 작업을 측정 → Theo가 신뢰하는 벤치마크
- GLM5.2 (훨씬 비싼 모델) 대비 의미있는 우위
소주제 2-2: 스케이트 벤치(Skate Bench) 약점
세부내용
- 스케이트 벤치에서 76% — 프론티어 랩 중 최저점
- 1.3센트/run — 추론 과다 사용으로 비효율적
- 평균 2,100 토큰/응답 → 무거운 추론 모델 성향
- Sonnet 5는 15센트/run이었지만 낮은 점수 → 더 나쁜 가성비
소주제 2-3: Cursor 벤치마크 오염 사건
세부내용
- Cursor 벤치에서 Fable 5 High급 성능을 보이며 1위 수준 점수 기록
- 단, 훈련 데이터에 Cursor 코드베이스 스냅샷이 실수로 포함됨
- 점수 영향 불명확, 해당 데이터는 이후 모델에서 제거
- Cursor/xAI가 이 사실을 투명하게 공개 → Theo 긍정 평가
핵심 주제 3: 가격 및 토큰 효율성
소주제 3-1: 혁신적인 가격 구조
세부내용
- 200K 컨텍스트 이하: 입력 $2/M, 출력 $6/M
- 200K~500K: 입력 $4/M, 출력 $12/M (2배 가격, 컨텍스트 한계: 500K)
- Fable 5 대비: 입력 5배 저렴($10/M), 출력 약 8배 저렴($50/M)
- Cursor 구독에 포함 + 첫 주 사용량 2배 제공
근거/사례
- "Between five and almost 10x the cost" — Fable와 비교
- 개인 사용자에게 Cursor와의 번들이 큰 장점
- Cursor의 비즈니스 문제(OpenAI 보조금 경쟁)를 해결하는 데 기여
소주제 3-2: 토큰 효율성 — 예상을 초월
세부내용
- 코딩 벤치 기준 태스크당 토큰 사용량:
- Fable 5: 7.2M 토큰
- Opus 4.8: 9.2M 토큰
- GPT-5.5 (x-high): ~6M 토큰
- GPT-5.5 (medium): 3.5M 토큰
- Grok 4.5: 2M 토큰 (최고 점수 대비 가장 적은 사용량)
- Artificial Analysis: 태스크당 실제 비용 31센트 (GLM5.2: 37센트, Fable 5: $2.75)
- 속도: 약 80 토큰/초
핵심 주제 4: 모델 아키텍처 및 학습
소주제 4-1: 기술 스펙
세부내용
- 완전히 새로운 베이스 모델: 이전 Grok 500B 대비 1.5T 파라미터
- Mixture of Experts(MoE) 아키텍처
- Nvidia GB300 GPU 수만 개로 학습 (최신 기술)
- 비동기 학습 스택: 에이전틱 롤아웃이 수십 시간 동안 실행되며 학습 지속
소주제 4-2: Cursor와의 공동 학습
세부내용
- xAI + Cursor(SpaceX)가 공동으로 학습 — Cursor 데이터 트릴리언 토큰 포함
- 코드베이스와 개발자-에이전트 상호작용 데이터 활용
- Composer 25(순수 코딩 특화)와 달리, Grok 4.5는 의도적으로 학습 데이터를 혼합 유지
- STEM, 연구 논문, 지식 작업 포함 → 광범위한 도메인 역량
- 어려운 RL 문제 중심 학습 → 기존 쉬운 문제들은 이미 trivial해서 의도적으로 난이도 높임
핵심 주제 5: 실사용 경험 — Theo의 직접 테스트
소주제 5-1: Lake Bed 클라우드 프로젝트 감사 작업
세부내용
- Theo가 클라우드 제품 "Lake Bed" 출시 전 보안/유지보수 감사에 사용
- 성능 평가:
- Fable/GPT-5.6이 찾은 대부분의 이슈 발견 ✓
- 수정 요청 시 매우 잘 처리 ✓
- 복잡한 멀티 태스크 처리 능력 뛰어남 ✓
근거/사례
- PR 2개 동시 생성 (각 이슈별 분리), PR 리뷰 코멘트 자동 처리
- 스크린샷 붙여넣기로 시각적 수정 요청 → 성공적 처리
- 긴 대화 컨텍스트에서도 3메시지 이전 내용에 집착 없이 현재 요청 집중
소주제 5-2: 3D 게임 생성 테스트
세부내용
- 기존 2D 물고기 게임을 3D로 변환 요청 → 성공
- 3D 역량이 의외로 뛰어남: Three.js 기반 3D 환경, 생물 모델링, 바닥 기하학 생성
- Fable 5, GPT-5.6보다 3D 모델링에서 우위
- "최초로 게임 엔진 3D 모델링에서 거의 쓸 만한 수준"
근거/사례
- 외계인 적 캐릭터 3D 모델: 인상적인 품질
- 단점: 레이아웃 일부 깨짐, 조작키(A/D 반전), 물리 제어 문제 → 후속 수정 요청 시 일부만 해결
핵심 주제 6: 한계점 — 에이전틱 오케스트레이션
소주제 6-1: 차세대 모델과의 격차
세부내용
- 멀티 에이전트 오케스트레이션에서 Fable 5, GPT-5.6 대비 부족
- 하위 에이전트 생성 및 작업 분할에서 세밀함 부족
- 특정 프로세스가 멈출 때 자동 복구 능력 부족
- Theo의 평가: "현재 세대(PS3)가 이미 나온 시점에서 최고의 PS2 게임을 만든 것"
근거/사례
- "이전 기술로 정말 인상적인 것을 만들었지만, 새로운 세대와는 다름"
- 오케스트레이션 테스트는 제한적으로만 수행 → 단정 짓기 어려운 부분도 있음
핵심 주제 7: 시장 영향 및 전략적 함의
소주제 7-1: xAI/SpaceX의 놀라운 재기
세부내용
- Theo가 4월에 "xAI 컴백 가능성" 언급 → 예상보다 2.5개월 만에 실현
- xAI는 GPU를 Anthropic, Google에 마크업으로 재판매하는 회사였음
- 지금은 해당 회사들과 직접 경쟁 → Grok 4.5로 프론티어 진입
- DeepSeek 이후 가장 큰 "AI 서프라이즈"로 평가
소주제 7-2: 업계 경쟁 구도 변화
세부내용
- "Anthropic과 OpenAI가 진정으로 두려워할 첫 번째 실제 경쟁자"
- GLM5.2(오픈웨이트 장점 있음) 대비 Grok 4.5가 사실상 압도
- Cursor 번들로 개인 사용자 시장 진입 — Cursor의 OpenAI 보조금 경쟁 문제 해결
- 결론: 더 빠르고 저렴하고 똑똑한 모델이 모두를 위해 나오길 바람
총평 요약
| 항목 |
평가 |
| 코딩 성능 |
⭐⭐⭐⭐ (Fable/GPT-5.6보단 아래, 하지만 매우 근접) |
| 가격 효율성 |
⭐⭐⭐⭐⭐ (동급 최강) |
| 토큰 효율성 |
⭐⭐⭐⭐⭐ (경쟁 모델 대비 3-5배 절약) |
| 3D 모델링 |
⭐⭐⭐⭐ (예상 밖 강점) |
| 에이전틱 오케스트레이션 |
⭐⭐⭐ (차세대 모델 대비 부족) |
| 추천 사용처 |
기본 코딩 에이전트, 감사 작업, 빠른 반복 개발 |