URL: https://www.youtube.com/watch?v=E5XnV3yc1Nw 날짜: 2026-08-17 채널: Tech Bridge
📌 핵심 질문 / Grok 4.6이 바꾸는 경쟁 구도
==Grok 4.6은 단순한 모델 버전 업그레이드가 아니라, Cursor가 보유한 코딩 데이터와 xAI가 보유한 대규모 GPU를 결합해 xAI를 세 번째 주요 미국 AI 연구소로 끌어올리는 제품이다.==
- Grok 4.5를 기반으로 한 점진적 업그레이드(upgrade iteration)지만 코딩·지식 작업·에이전트(agent) 성능이 크게 상승했다.
- GDPVal-AA 같은 지식 작업 평가에서 선두를 차지하고, Terminal-Bench에서 15.7%에서 26%로 상승했으며, Harvey LAB 법률 평가에서는 15.8%를 기록했다.
- Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 같은 61점을 기록하면서도 작업당 비용은 GPT-5.6 Sol Max보다 낮은 효율적 모델로 자리 잡았다.
- Cursor의 개발자용 경험과 Grokbot의 일반 사용자용 아티팩트(artifact) 경험을 함께 제공해 코딩 모델의 힘을 비개발자 업무로 확장한다.
Grok 4.6의 핵심 전략은 범용 대화형 모델을 조금씩 개선하는 데 있지 않다. 실제 소프트웨어 개발과 지식 노동에서 발생하는 데이터를 확보하고, 그 데이터로 다음 모델을 훈련하며, 그 모델을 다시 제품에 넣어 더 많은 사용과 데이터를 만드는 플라이휠(flywheel)에 있다. Anthropic이 Claude Code로 먼저 만들고 OpenAI가 Codex 중심 전략으로 따라잡은 구조를 xAI가 Cursor 인수로 재현하려는 셈이다.
1. Grok 4.6의 정체와 성능 상승
1.1. 4.5의 연장선에서 나온 대규모 개선
Grok 4.6은 완전히 새로운 사전학습(pretraining) 모델이 아니라 Grok 4.5를 토대로 한 점진적 업그레이드다. 그럼에도 이전 버전의 약점을 보완하고 코딩과 지식 기반 업무(knowledge work)에 집중하면서 실사용 성능이 크게 올라갔다.
-
제품 포지셔닝
- 점진적 업그레이드: Grok 4.5에서 출발해 완전히 새로 훈련한 모델은 아니지만, 보강 학습과 데이터·훈련법 개선을 통해 체감 성능을 크게 끌어올렸다.
- 핵심 사용 사례: 일반적인 대화보다 코딩, 장시간 실행되는 에이전트(long-running agent), 지식 작업, 애플리케이션 제작을 우선한다.
- 속도와 능력의 동시 개선: Grok 4.5도 Cursor의 기본 하위 에이전트(sub-agent) 모델로 자주 쓰일 만큼 빠르고 유능했는데, 4.6은 성능을 높이면서도 더 빨라졌다.
-
훈련 방식의 변화
- 추가 훈련(supplemental training): Grok 4.5보다 긴 추가 훈련 단계에서 추론과 고급 기술 개념을 위한 모델 생성 데이터, 고품질 엔지니어링 데이터, 개선된 옵티마이저(optimizer)와 훈련 레시피를 사용했다.
- SFT 데이터 재생성: Grok 4.5를 이용해 다양한 추론 노력(reasoning effort), 에이전트 하네스(agent harness), STEM, 소프트웨어 엔지니어링, 지식 작업 영역의 SFT(supervised fine-tuning) 궤적(trajectory)을 다시 만들었다.
- 데이터 품질 필터링: 모델 기반 검사를 통해 문제가 있는 궤적을 걸러내고, 성능과 행동 품질이 개선된 SFT 체크포인트를 만들었다.
- 에이전트형 RL: 지식 작업과 일반 코딩뿐 아니라 커널 최적화(kernel optimization), 웹 개발, CAD(computer-aided design) 같은 영역별 환경에서 에이전트 강화학습(agentic RL)을 수행했다.
1.2. 벤치마크에서 확인되는 강점과 한계
Grok 4.6은 여러 평가에서 선두권에 진입했지만 모든 평가를 휩쓴 모델은 아니다. 지식 작업과 비용 효율성에서는 강하고, 특정 코딩·디자인 평가에서는 경쟁 모델이 앞선다.
-
지식 작업 평가
- GDPVal-AA v2: Grok 4.6 High가 1,753점으로 GPT-5.6 Sol Max의 1,728점과 Fable 5 Max의 1,741점을 앞섰다. 실제 지식 노동 과제를 얼마나 효과적으로 처리하는지 측정하는 평가에서 가장 뚜렷한 승리를 거뒀다.
- AA-Briefcase: 1,577점을 얻어 GPT-5.6 Sol Max의 1,502점보다 높았고, Fable 5 Max의 1,574점과도 근소하게 앞섰다.
- Harvey LAB (Vals): 법률 업무 평가에서 15.8%를 기록했다. GPT-5.6 Sol Max의 2.5%와 Fable 5 Max의 11.3%를 크게 웃돌며 법률 지식 작업에서 강점을 보였다.
-
코딩 에이전트 평가
- CursorBench v3.2: Grok 4.6은 69.9%로 GPT-5.6 Sol Max의 67.2%보다 높았지만 Fable 5 Max의 70.5%에는 미치지 못했다. Cursor 내부 평가에서 1위는 아니지만 사실상 최상위권이다.
- DeepSWE v1.1: 65.9%를 기록했다. GPT-5.6 Sol Max의 73%와 Fable 5 Max의 70%보다 낮아, 실제 소프트웨어 엔지니어링 문제 해결에서는 3위권으로 평가됐다.
- FrontierCode v1.1 Extended: 61.3%로 GPT-5.6 Sol Max의 60.6%보다 높았고 Fable 5 Max의 63.6%보다는 낮았다.
- APEX-Agents: 57.5%로 GPT-5.6 Sol Max의 56.7%보다 높았지만 Fable 5 Max의 59.2%에는 못 미쳤다.
- APEX-SWE: 56.4%를 기록해 GPT-5.6 Sol Max의 53.6%보다 높았으며, Fable 5 Max는 58.8%로 더 높았다.
- Terminal-Bench v3.0: Grok 4.5 High의 15.7%에서 Grok 4.6 High의 26%로 상승했다. 터미널을 직접 조작하는 코딩 에이전트 능력이 크게 개선됐지만 GPT-5.6 Sol Max의 34.6%와 Fable 5 Max의 34.1%에는 뒤처졌다.
-
종합 지수의 의미
- Artificial Analysis Intelligence Index: 아홉 개 평가를 합친 종합 지수에서 Grok 4.6 High는 61점을 기록해 GPT-5.6 Sol과 동률을 이뤘다. 차트에는 Claude Opus 5가 1위, Fable 5가 2위, GPT-5.6 Sol과 Grok 4.6 High가 공동 3위권으로 나타난다.
- 벤치마크와 체감의 차이: 특정 평가에서 높은 점수를 얻어도 실제 코딩에서 자연스럽게 느껴지지 않는 모델이 있다. DeepSWE 같은 평가가 실제 사용 감각을 더 잘 반영한다고 보는 이유가 여기에 있다.
- 종합 결론: Grok 4.6은 모든 평가의 절대 1위가 아니라, 지식 작업·법률 평가·가격·속도에서 강점을 묶어 실무용 워크호스(workhorse)로 경쟁하는 모델이다.
2. 작업당 비용으로 본 진짜 경쟁력
2.1. 토큰 가격보다 중요한 비용 구조
모델의 품질 점수만 비교하면 사용자가 실제로 지불하는 비용을 놓치게 된다. 작업당 비용(cost per task)은 토큰을 몇 개 쓰는지와 토큰 단가가 얼마인지의 곱으로 결정된다.
-
비용 계산의 두 요소
- 토큰 사용량: 같은 과제를 해결하면서 더 많은 토큰을 생성하면 단가가 낮아도 실제 비용이 올라간다.
- 토큰 가격: 입력·출력 토큰 가격이 낮아도 모델이 장황하게 추론하면 작업당 비용 우위가 사라진다.
- Kimi K3 Max 사례: GPT-5.6 Sol과 Fable의 절반 가격인 모델도 토큰을 두 배 사용하면 결과적으로 작업당 가격이 비슷해진다.
-
그래프를 읽는 법
- 세로축: Artificial Analysis Intelligence Index로 지능 또는 품질을 나타낸다.
- 가로축: 하나의 작업을 완료하는 데 드는 비용을 나타낸다.
- 킬러 사분면(killer quadrant): 그래프의 왼쪽 위, 즉 더 높은 품질을 더 낮은 비용으로 내는 위치가 이상적이다.
2.2. Grok 4.6의 품질·비용 교환
Grok 4.6은 4.5보다 더 똑똑해졌지만 작업당 가격도 상승했다. 가격 상승이 약점인 동시에 성능 상승에 따른 자연스러운 대가라는 평가가 나온다.
-
Grok 4.5와의 비교
- 기존 모델: Grok 4.5 High는 작업당 약 36센트, 지능 지수 약 55~56점이었다.
- 신규 모델: Grok 4.6 High는 작업당 약 83센트, 지능 지수 약 60점이다.
- 변화의 해석: 비용은 두 배 이상 늘었지만 지능 지수도 55~56점에서 60점으로 올라갔다. 이후 사용량과 인프라가 늘면서 가격이 내려가면 가치가 더 커진다.
-
경쟁 모델과의 상대 위치
- GPT-5.6 Sol Max: 지능 수준은 비슷하지만 Grok 4.6보다 작업당 비용이 높다.
- Kimi K3: 가격은 비슷하지만 지능 지수는 조금 낮다.
- Opus 5: 더 높은 지능을 제공하지만 작업당 비용이 훨씬 높다.
- GPT-5.6 Luna Max: 작업당 약 5센트로 매우 저렴하지만 지능 지수는 약 52점이어서, 최고 품질과 최저 비용 사이의 선택지가 된다.
3. 실제 산출물로 비교한 디자인·코딩 감각
3.1. 같은 프롬프트가 드러낸 차이
세 개의 상위 모델에 디자인 중심의 코드 프로필 카드(single profile card)를 만들라는 동일한 프롬프트를 넣었다. 객관적 벤치마크만으로는 드러나지 않는 시각적 판단과 첫 결과물의 완성도를 비교하기 위한 테스트다.
-
Fable 5 Max의 결과
- 시각적 선택: 이미지 대신 조악한 SVG와 Microsoft Paint 같은 그래픽을 선택했다.
- 완성도: 전체 결과가 가장 나쁘고, 디자인 선택 자체가 프로필 카드의 목적과 맞지 않았다.
-
GPT-5.6 Sol의 결과
- 이미지 생성: 여성 인물 이미지를 직접 만들었다.
- 디자인 품질: 레이아웃이 깔끔하고 시각적으로 매력적이며 전체 균형이 좋았다.
- 비교 결과: 주관성이 개입되는 디자인 평가라는 한계에도 불구하고 세 결과 중 명확한 승자로 평가됐다.
-
Grok 4.6의 결과
- 첫인상: 여성 인물을 활용한 결과로 전반적으로 꽤 좋았고 실용 가능한 수준이었다.
- 세부 결함: Follow 버튼이 잘려 있었고 하단 패딩이 없었으며 텍스트 간격과 줄바꿈이 어색했다.
- 위치: Fable 5 Max보다 훨씬 낫지만 GPT-5.6 Sol처럼 마감된 디자인에는 미치지 못했다.
3.2. 디자인 평가가 알려주는 실무적 시사점
초기 산출물을 바로 배포하기보다, 각 모델이 첫 시도에서 구조와 시각 언어를 얼마나 잘 잡는지 확인하고 피드백 루프를 돌려야 한다. Grok 4.6은 한 번에 완벽한 디자인을 내기보다 상당히 좋은 첫 버전을 만들고 반복 개선하는 흐름에서 강점을 가진다.
4. 제품 접근성과 일반 사용자 확장
4.1. Grok 4.6을 사용할 수 있는 경로
-
개발자 도구
- Cursor: 개발자용 AI IDE에서 모델을 선택해 코딩 에이전트로 사용할 수 있다.
- Grok Build: 애플리케이션을 생성하고 다듬는 제품으로 Cursor와 일부 영역에서 경쟁한다.
- API·라우터: xAI API와 OpenRouter를 비롯해 Vercel, Cloudflare에서도 제공된다.
-
가격과 프로모션
- 표준 가격: 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러다.
- Fast 변형: 이미 빠른 기본 모델보다 더 빠른 변형은 두 배 가격이다.
- 첫 주 혜택: Grok Build와 Cursor에서 첫 주 동안 포함 사용량(included usage)을 2배 제공한다.
4.2. Grokbot이 만드는 사용자 경험
Grokbot은 Cursor가 최근 출시한 제품으로, Grok 4.6을 일반 사용자에게 전달하는 인터페이스다. 개발자가 직접 모델과 코드를 다루지 않아도 지식 작업 결과물을 얻도록 설계됐다.
-
개발자 모델을 업무 도구로 포장
- 모델 선택 제거: 사용자는 어떤 모델이 실행되는지 고를 필요가 없고, 어떤 모델을 쓰는지도 화면에서 확인할 수 없다.
- 코드 비노출: 코드 대신 텍스트와 PowerPoint 프레젠테이션, Word 문서 같은 결과물(artifact)을 본다.
- 에이전트별 정체성: 각 스레드(thread)가 하나의 에이전트로 동작하고, 에이전트마다 작은 마스코트가 붙어 작업 상태를 구분한다.
-
대상 시장의 확대
- Cursor: 코드를 직접 작성하는 개발자를 위한 제품이다.
- Grokbot: 기술 지식이 적은 더 넓은 사용자층을 겨냥한다.
- 공통 기반: 지식 작업 결과물의 상당 부분이 결국 코드로 만들어지므로, 강력한 코딩 모델을 숨겨 둔 일반 업무 도구도 실제 업무를 수행할 수 있다.
-
사용 가치
- 접근성: 모델 이름과 코드 구조를 몰라도 아이디어를 설명하고 결과물을 얻을 수 있다.
- 장기 작업: 낯선 영역을 조사하고, 애플리케이션 구조를 세우고, 핵심 상호작용을 구현한 뒤 여러 차례 피드백을 반영하는 작업에 적합하다.
- 자기 검증: 긴 실행 궤적에서 다음 단계로 넘어가기 전에 자신의 결과를 테스트하고 검증하는 행동이 나타난다.
5. Cursor 인수와 데이터·GPU 결합
5.1. 인수 이전에 따로 존재했던 두 자산
Cursor와 xAI는 서로 다른 부족함을 갖고 있었다. Cursor에는 실제 개발 과정에서 쌓인 데이터가 있었고, xAI에는 엄청난 GPU가 있었지만 그 GPU를 사용할 만큼 좋은 모델이 없었다.
-
Cursor가 가진 것
- AI 네이티브 IDE의 개척: Cursor는 IDE에 AI를 깊이 통합해 AI와 함께 코딩하는 방식을 대중화한 첫 제품이었다.
- 사용 데이터: 개발자가 실제 코드베이스에서 어떤 요청을 하고, 어떤 수정과 검증을 거치는지 보여 주는 거대한 코딩 데이터 산을 보유했다.
- 상대적 약화: Claude Code가 등장한 뒤 개발자들이 Claude Code로 이동했고, 이어 Codex를 선택하면서 Cursor가 뒤처졌다.
- 인프라 부족: 자체 모델을 훈련할 데이터센터와 GPU가 없었다.
-
xAI가 가진 것
- GPU 구축 속도: 122일 만에 20만 개의 GPU를 구축했다. 이 속도는 비정상적으로 빠른 인프라 확장이다.
- 모델 부족: 사용자가 원할 만큼 좋은 모델이 없어 GPU가 유휴 상태로 남았다.
- 데이터 부족: 실제 코딩 작업에서 생성된 대규모 상호작용 데이터가 없었다.
5.2. 결합이 만드는 학습 플라이휠
Cursor의 데이터와 xAI의 GPU를 합치면 개발자 행동 데이터로 모델을 훈련하고, 그 모델을 다시 개발자 제품에 넣는 순환이 시작된다.
-
결합의 구조
- 데이터: Cursor가 축적한 실제 코딩 세션, 코드베이스 상호작용, 에이전트 궤적을 학습 재료로 삼는다.
- 계산: xAI가 보유한 20만 GPU로 대규모 사전·추가 훈련과 강화학습을 수행한다.
- 제품: 개선된 Grok을 Cursor와 Grokbot에 배포해 다시 코딩·지식 작업 데이터를 얻는다.
- 수익: 사용량에서 생긴 매출을 다음 모델과 인프라에 재투자한다.
-
재귀적 자기 개선(recursive self-improvement)
- 현재 단계: 완전한 폐쇄 루프 자기개선 AI는 아니지만, Grok 4.5가 Grok 4.6의 훈련 데이터와 궤적을 생성·선별하는 데 참여했다.
- 다음 모델로의 연결: 한 세대의 모델이 다음 세대의 학습 재료를 더 잘 만들면 모델 품질과 데이터 품질이 함께 올라간다.
- 실전 적용: Grok 4.5가 다양한 추론 수준과 에이전트 하네스, STEM·소프트웨어 엔지니어링·지식 작업 영역의 SFT 궤적을 재생성했다.
6. Anthropic·OpenAI가 만든 공식과 xAI의 추격
6.1. 코딩 중심 플라이휠이 승리 공식이 된 과정
대규모 언어 모델 경쟁에서 코딩은 하나의 기능이 아니라 모델을 개선하는 데이터·매출·제품의 중심축이 됐다. 지식 노동의 많은 결과물이 코드로 실행되기 때문에 코딩 제품은 폭넓은 업무 데이터를 끌어온다.
-
Anthropic의 선행 사례
- Claude Code 집중: Anthropic은 코딩 사용 사례에 강하게 집중했다.
- 데이터 순환: 개발자가 Claude Code를 사용하면서 생긴 데이터가 다음 모델 훈련으로 돌아갔다.
- 매출 순환: Claude Code 매출이 다시 Anthropic에 들어가고, 그 돈과 데이터로 더 나은 코딩 모델을 만들었다.
-
OpenAI의 회복
- 초기 우위와 후퇴: OpenAI는 원래 대표적인 LLM 기업이었지만 여러 분야에 집중하는 동안 코딩에서 잠시 뒤처졌다.
- Codex 중심 전환: 코딩과 Codex 사용 사례에 집중하면서 Anthropic을 따라잡았다.
- 공통 공식: 가장 강한 LLM을 만들려면 코딩에 깊이 투자하고, 실제 사용 데이터를 모델 훈련에 다시 투입해야 한다는 패턴이 드러났다.
-
xAI의 복제와 차별화
- Cursor 인수: xAI는 코딩 데이터와 개발자 유통 경로를 한 번에 확보했다.
- Grok 4.6: Grok 4.5를 사용해 SFT 궤적을 만들고, 그 데이터로 Grok 4.6을 훈련해 코딩 성능을 끌어올렸다.
- 대중 시장: Cursor를 개발자용 전초기지로 두면서 Grokbot으로 일반 지식 노동자까지 확장한다.
6.2. xAI와 Anthropic의 GPU 관계가 만드는 긴장
xAI는 GPU를 수익화하기 위해 Anthropic과 협력하고 있다. Anthropic은 뛰어난 모델을 가졌지만 수요를 과소평가해 자체 컴퓨트(compute)가 부족했고, xAI는 GPU를 많이 확보했지만 모델 수요가 부족했다.
-
현재의 협력
- 컴퓨트 판매: Anthropic이 xAI의 유휴 GPU를 구매해 모델을 실행한다.
- 아이러니: 경쟁자를 돕는 인프라를 공급하는 상황이어서, 경쟁 관계를 무기 판매에 비유할 만큼 역설적이다.
- 계약의 시간 제한: Anthropic과의 계약이 끝나면 xAI는 GPU 용량을 Cursor와 Grok에 전부 배정할 유인이 생긴다.
-
경쟁 구도의 변화
- Anthropic의 위험: Grok 4.6이 관심과 수요를 얻으면 Anthropic은 더 이상 xAI의 GPU를 안정적으로 사용할 수 없을 가능성을 감안해야 한다.
- xAI의 선택지: 자체 제품이 GPU를 흡수할 정도로 성장하면 외부 경쟁자에게 컴퓨트를 팔 이유가 줄어든다.
- 세 번째 연구소: OpenAI와 Anthropic에 이어 xAI가 세 번째 주요 미국 AI 연구소로 부상했다. 아직 3위권이지만 격차를 빠르게 좁히고 있다.
7. Grok 4.7과 경쟁의 의미
7.1. 다음 모델로 이어지는 속도
Elon Musk는 Grok 4.7이 4.6보다 훨씬 좋아졌고 3~4주 안에 출시될 예정이라고 밝혔다. 초기 훈련은 끝났고, SpaceX의 방대한 기업 데이터를 추가 학습에 활용하는 단계라고 설명했다.
-
개선 주기
- 빠른 릴리스: 4.6 출시 직후 4.7의 3~4주 내 출시 계획이 공개됐다.
- 추가 데이터: SpaceX 데이터가 보충 훈련에 들어가면 항공우주·제조·운영 같은 실제 기업 지식이 모델에 더해질 수 있다.
- 제품 플라이휠: Cursor의 코딩 데이터와 SpaceX의 기업 데이터가 서로 다른 업무 영역을 보강한다.
-
경쟁의 소비자 편익
- 폐쇄형 경쟁: 최첨단 폐쇄형 모델 간 경쟁이 더 나은 성능과 낮은 가격을 만든다.
- 오픈소스 경쟁: 오픈소스 모델 경쟁도 선택지를 늘리고 가격 압력을 만든다.
- 사용자 결과: 어느 진영이 승리하든 더 많은 모델과 더 낮은 비용으로 고급 AI를 이용할 수 있게 된다.
7.2. 최종 평가
Grok 4.6은 모든 벤치마크에서 1위를 차지한 모델이 아니다. 그러나 GPT-5.6 Sol과 비슷한 종합 지능, 낮은 API 단가, 빠른 응답, 지식 작업·법률 평가의 강점, Cursor와 Grokbot이라는 유통 경로를 동시에 갖췄다. 실제 업무를 끝까지 수행하는 워크호스 모델을 찾는 사용자에게는 최고점 하나보다 이 조합이 더 중요할 수 있다.
주요 발언 모음
“Grok 4.6은 OpenAI와 Anthropic의 최상위 모델과 경쟁할 수 있는 경이로운 모델이다.”
“품질만큼이나 중요한 것은 과제를 하나 완료하는 데 얼마가 드는가이다.”
“그래프에서 정말 원하는 위치는 가능한 한 높고 왼쪽이다. 그 초록색 영역이 킬러 사분면이다.”
“지식 노동 시장 전체가 기본적으로 코드 위에 구축되어 있기 때문에 코딩 사용 사례가 유일하게 중요한 요소다.”
“완전히 폐쇄 루프인 자기개선 AI는 아닐지 몰라도, 현재 모델들은 모든 주요 연구소에서 다음 세대 모델을 훈련하는 데 사용되고 있다.”
“Grok 4.7은 4.6보다 훨씬 좋아졌고 3~4주 안에 준비될 것이다. 초기 훈련은 끝났고, 이제 SpaceX의 방대한 데이터를 보충 훈련에 사용하고 있다.”
“경쟁이 필요하다. 오픈소스 모델 경쟁도, 최첨단 폐쇄형 모델 경쟁도 좋다. 그 결과 모델은 더 좋아지고 우리 모두가 더 낮은 비용으로 사용할 수 있다.”
핵심 데이터 & 수치
| 평가 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1,753 | 1,526 | 1,728 | 1,741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1,577 | 1,313 | 1,502 | 1,574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
- Grok 4.5 High → Grok 4.6 High: 작업당 약 36센트·지수 55~56점에서 작업당 약 83센트·지수 60점으로 상승했다.
- API 가격: 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이며 Fast 변형은 두 배 가격이다.
- 인프라: xAI는 122일 만에 GPU 20만 개를 구축했다고 설명된다.
- 프로모션: Grok Build와 Cursor에서 출시 첫 주 포함 사용량을 2배 제공한다.
결론 및 시사점
- 코딩은 모델의 기능이 아니라 개선 엔진이다: 실제 개발 데이터를 확보하면 모델 훈련, 제품 사용, 매출, 다음 훈련이 연결된다.
- 데이터와 컴퓨트의 결합이 xAI의 전환점이다: Cursor의 코딩 데이터와 xAI의 GPU가 서로의 결핍을 보완해 Grok 4.6을 만들었다.
- 벤치마크는 목적별로 읽어야 한다: Grok 4.6은 GDPVal-AA와 Harvey LAB에서는 강하지만 DeepSWE와 Terminal-Bench에서는 GPT-5.6 Sol Max와 Fable 5 Max보다 낮다.
- 작업당 비용이 실제 선택 기준이다: 토큰 단가뿐 아니라 한 과제를 끝내는 데 필요한 토큰 수를 함께 비교해야 한다.
- Grokbot은 코딩 모델의 대중화 경로다: 모델명과 코드를 숨기고 문서·프레젠테이션 같은 아티팩트를 제공해 비개발자의 진입장벽을 낮춘다.
- xAI의 경쟁력은 제품 폭에 있다: Cursor는 개발자를, Grokbot은 일반 지식 노동자를, API는 외부 제품 개발자를 겨냥한다.
- Anthropic과의 GPU 계약은 양면적이다: 단기적으로 xAI에 매출을 주지만, 장기적으로는 경쟁자에게 컴퓨트를 공급하는 구조를 만든다.
- Grok 4.7은 데이터 플라이휠의 속도를 시험한다: SpaceX 기업 데이터까지 보충 훈련에 들어가면 코딩 중심 모델이 산업 업무 모델로 넓어질 수 있다.
- 경쟁의 최종 수혜자는 사용자다: OpenAI·Anthropic·xAI의 폐쇄형 경쟁과 오픈소스 경쟁이 성능을 높이고 비용을 낮춘다.
관련 자료
핵심 요약 (20줄)
- Grok 4.6은 Grok 4.5를 기반으로 코딩과 지식 작업을 크게 개선한 점진적 업그레이드다.
- Grok 4.6은 Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 같은 61점을 기록했다.
- GDPVal-AA v2에서 Grok 4.6 High는 1,753점으로 GPT-5.6 Sol Max와 Fable 5 Max를 앞섰다.
- CursorBench v3.2에서 Grok 4.6은 69.9%로 최상위권이지만 Fable 5 Max의 70.5%에는 뒤처졌다.
- DeepSWE v1.1에서 Grok 4.6은 65.9%로 GPT-5.6 Sol Max와 Fable 5 Max보다 낮았다.
- Terminal-Bench 점수는 Grok 4.5의 15.7%에서 Grok 4.6의 26%로 상승했다.
- Harvey LAB 법률 평가에서 Grok 4.6은 15.8%로 경쟁 모델보다 높은 점수를 얻었다.
- 작업당 비용은 토큰 단가와 과제 해결에 필요한 토큰 사용량을 함께 계산해야 한다.
- Grok 4.6의 작업당 비용은 약 83센트로 Grok 4.5의 약 36센트보다 높아졌다.
- Grok 4.6은 GPT-5.6 Sol Max와 비슷한 지능 수준에서 더 낮은 작업당 비용을 보인다.
- Grok 4.6의 API 가격은 입력 100만 토큰당 2달러와 출력 100만 토큰당 6달러다.
- Fast 변형은 표준 모델보다 두 배 비싸지만 더 빠른 응답을 제공한다.
- 동일한 디자인 코드 테스트에서 GPT-5.6 Sol이 가장 완성도 높은 결과를 만들었다.
- Grok 4.6의 디자인 결과는 좋았지만 잘린 버튼과 부족한 하단 패딩 같은 마감 문제가 남았다.
- Grokbot은 모델 선택과 코드를 숨기고 문서와 프레젠테이션 같은 아티팩트를 제공한다.
- Cursor는 개발자용 제품이고 Grokbot은 기술 지식이 적은 일반 사용자를 겨냥한다.
- Cursor는 거대한 코딩 데이터를 보유했지만 자체 모델 훈련을 위한 데이터센터와 GPU가 부족했다.
- xAI는 122일 만에 20만 개의 GPU를 구축했지만 사용할 만큼 좋은 모델과 데이터가 부족했다.
- Cursor의 데이터와 xAI의 GPU 결합은 Grok 4.6의 코딩 성능을 만든 핵심 시너지다.
- Grok 4.7은 3~4주 내 출시 예정이며 SpaceX의 기업 데이터가 보충 훈련에 활용된다.
