URL: https://www.youtube.com/watch?v=jLgpzgpsWPc 날짜: 2026-09-22 (처리일 2026-09-23) 채널: t3dotgg (Theo - t3․gg)
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==Grok 4.7은 실제 코딩과 지식 작업에서 사용성이 좋아졌지만, 벤치마크·토큰 비용·구독 한도·프런트엔드 결과를 종합하면 현재 세대의 가격으로 이전 세대 수준의 성능을 사는 셈이다.==
- Elon Musk는 Grok 4.7이 모든 현행 모델을 뛰어넘고 SpaceX의 독특한 학습 데이터 덕분에 실세계 코딩에서 최고가 될 것이라고 한 달 넘게 예고했다.
- 실제 Artificial Analysis와 여러 코딩 벤치마크에서는 Grok 4.7이 Grok 4.6보다 많은 토큰을 쓰고, 일부 작업에서 더 낮은 점수와 더 높은 비용을 보였다.
- 반대로 장시간 작업을 포기하지 않고, 지시를 따르며, 다른 모델이 놓친 개선점을 찾아내는 능력과 높은 작업 수행의 바닥선(floor)은 분명한 장점이다.
- 정적 벤치마크는 한 프롬프트가 몇 번의 API 요청과 도구 호출로 이어지는지, 결과를 실제로 병합할 수 있는지, 사용자가 얼마나 개입해야 하는지를 충분히 측정하지 못한다.
Theo는 Grok 4.7을 올해 사용한 모델 중 가장 좋아하는 편에 넣으면서도, 회사의 과장된 설명과 실제 사용 비용을 함께 검토해야 한다고 주장한다. 좋은 모델이라는 사실과 지금 가격에 좋은 구매라는 판단은 서로 다르다.
1. 일론의 약속과 벤치마크가 벌어진 간극
Grok 4.7의 핵심 문제는 성능 자체보다 제품 약속, 측정 방식, 가격 구조가 서로 맞지 않는 데 있다.
1.1. 한 달 동안 쌓인 기대와 출시 직후의 역설
-
최고 모델이라는 사전 약속
- Elon Musk는 Grok 4.5가 출시될 때 Grok 4.7이 “큰 한 방”이 될 것이며 모든 현행 모델을 능가할 것이라고 말했다.
- SpaceX의 학습 코퍼스(training corpus)가 독특하고 훌륭하므로 실세계 코딩에서 Grok 4.7보다 나은 모델이 있다면 오히려 놀랄 것이라고 주장했다.
- Grok 4.7은 한 달 이상 홍보됐고, 그만큼 기대와 비교 기준이 높아졌다.
-
출시 결과가 만든 농담
- Grok 4.7은 실제로 코딩과 지식 작업에서 쓸 만한 모델이지만, 여러 벤치마크에서 직전 모델 Grok 4.6보다 낮은 점수를 받았다.
- “실세계 코딩에서 누구도 이기기 어려울 것”이라는 약속 직후에 이전 버전보다 낮은 벤치마크 점수가 나온 사실이 가장 아이러니한 대목이다.
- Theo는 조회수나 새 모델 홍보가 아니라, 모델을 말할 때 반복되는 숫자가 현실을 더 이상 제대로 대표하지 못한다는 문제를 말하기 위해 리뷰를 만들었다.
1.2. 숫자가 현실을 대표하지 못하는 이유
-
정적 프롬프트의 한계
- Artificial Analysis 같은 벤치마크는 고정된 프롬프트를 실행하지만, 실제 에이전트 작업은 한 프롬프트가 여러 도구 호출과 후속 요청으로 확장된다.
- “hello라고 답해라”는 요청은 한 번의 요청으로 끝나지만, 저장소를 고치고 테스트하고 검증하는 요청은 호출 수가 크게 늘어난다.
- 호출 단위의 토큰 증가율만 말하면 프롬프트 하나를 끝내는 데 필요한 전체 토큰과 비용을 숨길 수 있다.
-
좋은 모델의 측정 항목
- 결과 코드가 실제 문제를 해결하는지, 불필요한 수정과 되돌리기를 얼마나 하는지, 사람이 얼마나 사양을 미리 써줘야 하는지까지 함께 측정해야 한다.
- 작업을 더 오래 수행하고 자체 검증을 더 많이 하는 모델은 토큰 수와 시간이 늘어날 수 있지만, 그 증가가 유효한 검증인지 무의미한 반복인지 구분해야 한다.
- 여섯 점의 차이처럼 보이는 작은 점수 차이도 일정 시간 안에 모델이 엉뚱한 행동을 할 확률을 낮추는 차이일 수 있다. 어리석은 행동이 줄어들면 같은 난도의 작업을 더 긴 시간 맡길 수 있다.
2. Blacksmith 후원 구간: 에이전트 시대의 CI 비용
AI 에이전트를 빠르게 배포하려면 모델뿐 아니라 코드 검증 인프라의 속도와 가격도 함께 개선해야 한다.
2.1. GitHub CI가 에이전트 사용에서 병목이 되는 이유
-
느리고 비싼 실행 환경
- 코드가 Merge 가능한 상태인지 보장하는 CI(Continuous Integration)는 AI와 직접 관련이 없어 보이지만, 에이전트가 코드를 대량으로 만들수록 핵심 인프라가 된다.
- GitHub CI는 실행이 느리고 비싸며, 짧은 검증에도 수 분, 복잡한 검증에는 수 시간이 걸릴 수 있다.
- 같은 규모의 작업을 GitHub CI로 돌리면 월 수만 달러에서 10만 달러 이상이 나올 수 있다는 계산이 제시됐다.
-
에이전트가 늘린 PR 검증량
- Theo의 팀은 하루 수백 개의 PR을 처리하고, 에이전트가 만든 작업을 검증하기 위해 CI 자체를 더 많이 만들었다.
- PR 하나마다 평균 8~30개의 서로 다른 검사 항목이 실행되므로, 작은 지연과 비용도 전체 작업량에서 빠르게 누적된다.
- 피드백이 늦으면 에이전트가 결과를 기다리는 시간이 늘어나므로, 코드 생성 속도만 높여서는 생산성이 올라가지 않는다.
2.2. Blacksmith의 제안과 실제 사용 경험
-
Runner 교체 방식
- Blacksmith는 GitHub Actions를 없애는 서비스가 아니라 GitHub의 실행기(runner)를 대체하는 인프라다.
- GitHub Action 설정을 한 줄 바꾸면 기존 워크플로를 Blacksmith 인프라에서 실행할 수 있다.
- 더 빠른 하드웨어와 단일 코어 성능을 기반으로 빌드와 체크를 50% 이상 빠르게 하고, 비용을 60%까지 줄일 수 있다고 설명한다.
-
Codesmith 자동 최적화
- 내장 도구 Codesmith에 “워크플로 효율을 최적화하라”, “액션에 맞는 러너 크기를 사용하고 있는지 확인하라” 같은 프롬프트를 넣을 수 있다.
- Theo는 짧은 데모에서 실제 CI 개선점을 찾아낸 세 개의 PR을 병합했다.
- 그 결과 CI 비용과 빌드 시간이 모두 줄었고, Theo는 “에이전트를 기다리게 하지 말고 더 빠른 피드백을 줘라”는 결론으로 후원 구간을 마무리했다.
- 후원 링크는
https://soydev.link/blacksmith다.
3. Grok 4.7의 공식 주장과 토큰 비용 논쟁
공식 설명은 능력 향상과 가격·속도 유지에 초점을 맞췄지만, 실제 토큰 사용량과 비용은 그 설명과 긴장 관계에 있다.
3.1. 공식 발표가 제시한 제품 포지션
-
능력과 안전성
- Grok 4.7은 코딩과 지식 작업을 위한 가장 강력한 모델이며, 어려운 작업에 더 오래 머무르고 자체 검사를 더 꼼꼼히 수행한다고 소개됐다.
- 지금까지 중 가장 잘 보정된 안전장치(calibrated safeguards)를 제공한다는 주장도 포함됐다.
- Grok 4.6과 같은 가격과 속도로 제공된다는 설명은 비용 경쟁력의 핵심 근거로 제시됐다.
-
Elon의 모델 크기·효율 예고
- Elon은 Grok 4.6을 약 1.5조 파라미터의 PAM 모델, Grok 4.7을 약 2.1조 파라미터의 새로운 기반 모델로 설명했다.
- Grok 4.7은 모든 면에서 Grok 4.6보다 낫지만 서비스 속도는 약간 느리고, 토큰 효율은 더 좋아질 것이라고 예고됐다.
- 공식 발표는 실제로 Grok 4.7이 Grok 4.6보다 큰 새 기반 모델을 사용한다고 적었지만, 가격·속도·행동이 거의 같다는 점은 앞선 예고와 충돌한다.
3.2. 토큰 수와 비용이 보여준 반대 방향
-
Artificial Analysis의 토큰 수
- Grok 4.6 XHigh는 작업당 약 3.8만 토큰을 사용했다.
- Grok 4.7은 작업당 약 8.1만 토큰을 사용해 토큰 효율이 좋아졌다는 설명과 반대로 움직였다.
- 비교 대상인 Fable 5.1보다도 많은 토큰을 썼고, Soul은 약 2.9만 토큰, Aster는 그와 비슷한 수준으로 제시됐다.
-
Artificial Analysis 실행 비용
- 비교 벤치마크에서 Grok 4.6은 약 1.86달러, Aster는 약 3.26달러, Grok 4.7은 작업당 약 3.74달러로 계산됐다.
- 수천 달러 규모의 반복 실행에서 Grok 4.7의 비용 증가는 단순한 표시 오류로 넘기기 어렵다.
- Theo가 직접 수행한 첫 Grok 4.7 실행은 API 정가 기준 약 20달러가 들었고, 다른 모델은 대부분 10달러 아래였다. Aster 한 번만 11.44달러를 조금 넘었으며, Opus 5 실행은 모두 그 4분의 1보다 낮았다.
3.3. Michael Truell의 반론과 ‘요청’ 단위의 함정
-
프로덕션 수치
- Cursor의 CEO이자 창업자인 Michael Truell은 SpaceX와 Cursor의 프로덕션 환경에서 Grok 4.7이 중앙값 요청에 5%, P99 요청에 20~30% 더 많은 토큰을 쓴다고 반박했다.
- 사용자가 모델에 요구하는 작업의 분포가 달라졌기 때문에 고정 벤치마크의 결과를 실제 사용량과 직접 비교할 수 없다는 설명도 덧붙였다.
- Theo는 이 설명이 실제 서비스의 관찰값이라면 설득력이 있지만, 정적 프롬프트 벤치마크에 대한 반박으로 사용하면 핵심을 비켜간다고 지적했다.
-
요청과 프롬프트의 차이
- “hello라고 답해라”는 한 프롬프트이자 한 요청으로 끝난다.
- 도구 호출이 필요한 작업에서는 하나의 프롬프트가 파일 읽기, 수정, 테스트, 재검증을 거치며 여러 API 요청이 된다.
- 요청당 토큰이 20~30%만 늘어도 프롬프트당 요청 수가 늘어나면 전체 토큰은 훨씬 커진다.
- Artificial Analysis가 에이전트형 워크로드를 더 많이 포함할수록 이 효과가 비용으로 나타날 가능성이 커진다.
-
강한 반박과 불편한 선택지
- Theo는 실제 사용량이 보여주는 비용 증가가 맞다면 Michael의 설명이 오해를 유도한다고 말했다.
- 실제 사용량이 틀렸다면 반대로 Michael의 설명이 거짓이 되는 셈이라며, 어느 쪽인지 명확히 선택하라고 압박했다.
- Grok 4.7 자체는 좋아하지만, 만드는 회사가 제품을 덜 오해하게 설명하기를 바란다는 태도는 반복해서 강조됐다.
4. 공식 벤치마크를 다시 읽는 법
Grok 4.7의 공식 벤치마크는 잘한 항목과 선별된 비교를 보여주지만, 제품 선택에 필요한 전체 그림을 제공하지 않는다.
4.1. Cursor Bench와 가격·토큰 효율
-
Cursor Bench의 조건
- 과거 Cursor Bench에는 Grok 학습 데이터에 포함된 자료를 비교 대상으로 사용한 문제가 있었고, 이후 수정되어 점수가 더 자연스러워졌다.
- 차트에서 Aster가 빠진 이유로 OpenAI가 SpaceX의 모델 사용을 금지해 벤치마크에 Aster를 포함할 수 없었다는 설명이 제시됐다.
- SpaceX가 전체 벤치마크를 공개하지 않았으므로 제3자가 대신 실행할 수도 없다는 점도 비판 대상이 됐다.
-
점수와 가격의 교환
- Grok 4.7은 거의 모든 가격 단계에서 GPT-5.6 Soul보다 높은 점수를 냈다.
- XHigh에서는 Fable을 낮은 추론 단계로 실행한 결과보다 약간 높은 점수를 냈지만, Fable 저단계가 Grok XHigh보다 싸기 때문에 토큰 효율 주장이 약해진다.
- 토큰 보기로 전환하면 Grok이 의미 있게 효율적인 구간은 가장 낮은 추론 단계뿐이며, 그때도 GPT-5.6 Soul 고단계와 비슷한 토큰을 쓴다.
-
Grokbot과 도구 하네스
- Grok 4.7은 Grokbot 하네스를 네이티브로 이해하도록 학습됐다.
- 하네스에 맞춘 학습은 사소한 홍보 문구처럼 들리지만, 실제로는 에이전트 작업의 도구 호출과 상태 관리에 큰 이점이 될 수 있다.
- Grokbot을 쓰는 사용자들이 매우 만족한다는 반응이 있었고, Theo는 Grokbot과 Meta의 Muse Agent Assistant에 대한 별도 심층 분석 수요를 물었다.
4.2. 코딩·전문 작업 벤치마크
-
소프트웨어와 엔지니어링
- DeepSeek V1.1 기반 소프트웨어 엔지니어링 벤치마크에서 Grok 4.7은 좋은 점수를 냈지만 GPT-5.6 Soul에 졌고, Fable 5.1은 앞섰다.
- Fable 5.1과 DeepSeek의 공식 비교 수치가 아직 공개되지 않았으며, 수치가 불리해서 공개하지 않았을 가능성이 있다는 추측이 나왔다.
- 실제 엔지니어링 작업에서 Fable 5.1은 GPT-5.6 Soul뿐 아니라 Aster도 자주 압도했다고 평가됐다.
-
전문 영역
- 전기공학(electrical engineering)에서는 Grok 4.7이 세계적 수준으로 보였고, 이 결과는 인상적인 강점으로 인정됐다.
- Briefcase 벤치마크에서는 세계 2위라는 결과를 내세웠지만, 해당 벤치마크가 실제 모델 선택에 아주 중요하지는 않다는 평가가 이어졌다.
- Terminal Bench에서 Grok 4.7의 점수는 좋아 보였지만 Fable 5.1이 20점 더 높아 약 50%의 차이를 보였다.
- 법률 작업과 HealthBench 임상 추론에서도 좋은 점수를 냈지만, 코딩 모델 출시에서 임상 추론을 함께 강조하는 구성은 매우 이례적이었다.
-
선별된 차트의 문제
- 공식 발표는 GDP Eval에서 Grok 4.6이 GPT-5 Aster를 이기는 것처럼 보이는 차트를 포함했는데, 이 결과는 상식적으로 납득하기 어려웠다.
- 외부 Ebench에서는 GPT-5 Aster가 Grok을 크게 앞섰지만, Aster는 앞선 공식 차트에서 제외됐다.
- 벤치마크가 Grok 4.7의 강점을 충분히 보여주지 못한다는 점은 사실이지만, 그렇다고 이상하고 선택적인 벤치마크 묶음이 정당화되지는 않는다.
- 안전성과 사이버 보안, 가격 및 이용 가능성 섹션은 있었으나 새 모델 출시 글치고는 내용이 매우 빈약했다.
4.3. Frontier Code와 Artificial Analysis의 경고 신호
-
Cognition의 Frontier Code
- Frontier Code는 추론 단계가 올라갈수록 점수가 매끄럽게 증가하지 않고 무작위로 튀는 노이즈가 큰 벤치마크다.
- Fable 5.1이 더 높은 추론 단계에서 Fable 5보다 낮아지고, GPT-5 Aster가 XHigh에서 내려갔다가 Max에서 다시 올라가는 현상이 관찰됐다.
- 이전 Grok 4.6의 최고 점수보다 Grok 4.7의 모든 점수가 낮다는 사실은 의심을 키웠다.
- 공식 설명은 Grok 4.7이 어려운 작업에는 강하지만 다른 작업에서는 과도하게 대응(overcope)해 전체 평균에서 Grok 4.6에 뒤처진다고 밝혔다.
- Frontier Code는 코드가 작동하는지만 보지 않고 실제 PR을 병합할 가능성을 측정한다. 즉, 문제를 해결하는 코드인지, 해당 PR의 기준에 맞는지까지 판단한다.
-
Artificial Analysis 종합 지수
- Grok 4.7은 전체 Artificial Analysis 지수에서 GLM 5.3 Max를 간신히 웃돌았고 Muse Spark 1.3보다도 낮았다.
- Artificial Analysis는 몇 주 전 오래된 벤치마크의 가중치를 낮추고 에이전트 중심 벤치마크의 비중을 높였다. GPT-5 Aster가 처음에는 지나치게 낮게 나온 뒤 조정한 결과다.
- 조정된 지수에서 Aster와 Fable 5.1은 비슷한 수준이 됐고, Theo는 일상 사용에서는 Fable을 선호하지만 Aster가 더 높은 고점과 더 낮은 저점을 가진다고 평가했다.
- Grok 4.7은 많은 모델과 연구소 뒤에 남았지만, 새로운 코딩 에이전트 지수에서는 Gemini 3.8 Flash를 앞섰다.
- Grok Build는 56점으로 Codex와 Fable을 사용하는 Claude Code의 62점에 못 미쳤고, Muse Code와 Muse Spark 1.3을 간신히 앞섰다.
-
작은 점수 차이가 만드는 실제 차이
- “대부분의 일이 어렵지 않으니 조금 덜 똑똑해도 괜찮다”는 반론은 겉보기에는 합리적이다.
- 그러나 낮은 수준의 어리석은 행동이 나오는 빈도를 줄이면 사람의 감독 없이 맡길 수 있는 시간이 길어진다.
- 1년 반 전의 GPT-4.1도 일을 정확히 사양하고 손을 잡아주면 많은 작업을 처리했다. 문제는 사용자가 사전에 투입해야 하는 노력의 양이다.
- Grok 4.7은 기본적인 작업을 못 하는 모델이 아니라, 같은 결과를 얻기 위해 더 많은 사전 지시와 감독을 요구하는 모델이다.
5. 비용·구독 한도·발표 품질의 후퇴
Grok 4.7의 가장 큰 약점은 성능 점수보다 가격이 올랐고 사용 한도가 빠르게 소진된다는 데 있다.
5.1. 토큰 두 배와 비효율적인 추론
-
캐싱 오류가 아닌 구조적 증가
- 사용자는 토큰 캐시가 제대로 맞지 않는 버그 때문에 비용이 높아졌다고 추측했지만, Theo는 캐싱 버그가 아니라고 단언했다.
- Grok 4.7은 이전 Grok 계열보다 실제로 약 두 배 많은 토큰을 쓰고, 그 결과 Aster보다 비싸졌다.
- Aster의 실행 비용은 약 3.26달러, Grok 4.7은 약 3.74달러였다. Opus와 Fable보다 여전히 싸지만, 그 모델들이 더 비싼 것은 원래 예상되는 일이라 방어 근거가 약하다.
-
검증을 위한 과잉 생성
- Grok 4.7은 때때로 중요하지 않은 부분까지 끝없이 검증하며 토큰을 소모한다.
- T3 Code 저장소를 점검한 실험에서 최악의 실행 비용은 Aster와 Fable의 약 두 배였다.
- Grok 4.6부터 보인 “능력의 가장자리를 조금 더 짜내기 위해 토큰을 더 쓰는” 흐름이 Grok 4.7에서도 이어졌다.
- Grok 4.5의 장점이었던 효율·저렴함·속도는 Grok 4.6과 4.7에서 약해졌다. Fast tier에서는 대체로 빠르지만, 때때로 우스꽝스러울 만큼 오래 걸린다.
5.2. $300 구독제의 실질적 가치 하락
-
가격표와 실제 사용량
- 기본 토큰 가격은 일정 구간까지의 숫자만 보여주고, 20만 토큰을 넘으면 가격이 두 배가 되며 Fast mode를 쓰면 더 올라간다.
- 정상적인 에이전트 사용에서도 비용이 가혹해질 수밖에 없는 구조다.
- 예전 $300 월 구독제는 Grok을 사실상 무제한으로 쓸 수 있었지만, 이제는 사용 한도가 빠르게 줄어든다.
-
Ben의 실제 측정
- 팟캐스트 공동 진행자 Ben은 Grok Codefast의 열렬한 사용자이자 Grokbot 사용자이며, Grok 4.7의 행동 자체는 좋아했다.
- Ben은 40달러어치를 사용하고 주간 한도의 8%를 소진했다.
- 이 속도라면 $300 요금제로 일주일 동안 사용할 수 있는 양이 많지 않다.
- 다른 연구소의 200달러 요금제가 월 8,000~12,000 단위의 사용량을 제공하는 것과 비교하면 경쟁력이 더 떨어진다.
- Grok 4.7은 Fable이나 Aster처럼 프리미엄 토큰을 받는 최상위 모델도 아니면서, Soul과 Opus에 가까운 강한 제한을 받는다.
5.3. 예외적으로 강한 Briefcase 결과와 발표 품질
-
강한 단일 벤치마크
- Artificial Analysis는 AA Briefcase에서 Grok 4.7이 Opus 5 Max와 Fable 5.1 바로 뒤인 3위까지 올라갔다고 공개했다.
- 해당 결과는 OpenAI 모델을 크게 앞서며, Opus나 Fable의 절반 정도 가격에 나왔다.
- 특정 작업에서 이 정도 강점을 보이는 것은 분명한 장점이지만, 전체 제품 가치와 동일시할 수는 없다.
-
프레젠테이션 품질의 회귀
- AA는 presentation ELO가 Grok 4.6보다 낮아졌다고 지적했다.
- 코딩 결과가 맞더라도 화면 구성과 설명 품질이 떨어지면 실제 사용 경험은 나빠진다.
- 장점이 크게 튀는 단일 벤치마크와 전반적인 사용성 회귀가 동시에 존재한다.
6. 프런트엔드 생성과 Grok Build의 이상 행동
정량 점수보다 결과물을 직접 보면 Grok 4.7의 약점이 훨씬 선명해진다.
6.1. 프런트엔드 디자인 비교
-
경쟁 모델과의 대비
- Anthropic 계열은 여전히 디자인에서 강자로 평가됐고, Aster는 최소한 보기 좋은 결과와 조정 가능성을 확보했다.
- Grok 4.7이 만든 프런트엔드 결과는 2025년 기준으로도 보기 드문 수준으로 조악했다.
- Theo는 기억이 미화된 것일 수 있지만 GPT-5가 이 결과보다 나았다고 말할 정도로 강하게 비판했다.
-
점수로 잡히지 않는 경험
- 프런트엔드에는 ELO 순위를 매길 수 있지만, 최종 결과물을 눈으로 보는 편이 낫다.
- 시각적 완성도, 상호작용의 자연스러움, 마우스 위치와 속도 같은 요소는 전통적인 코드 벤치마크에 잘 드러나지 않는다.
- 이런 결과는 Grok 4.7의 “코드가 실행되는가”와 “사용자가 납득할 결과를 얻는가” 사이의 간극을 보여준다.
6.2. RL 수정 이후의 조기 포기와 무한 루프
-
출시 지연의 원인
- Elon은 Grok 4.7 출시가 일주일 늦어진 이유로 RL(Reinforcement Learning)에서 응답 길이를 과도하게 벌점 처리했을 가능성을 들었다.
- 모델은 실제로 해결할 수 있는 어려운 작업도 너무 일찍 포기했고, 자신의 결과를 충분히 엄격하게 확인하지 않았다.
- 개발팀은 긴 작업과 긴 응답을 더 오래 수행하고, 결과를 검증하도록 RL을 추가로 조정했다.
- 출시 전 자랑하던 토큰 효율이 사라진 이유가 바로 이 수정 과정일 가능성이 있다.
-
Grok Build의 자기확신 루프
- Grok Build Custom에서는 모델이 현재 빌드를 커밋하겠다고 말한 뒤, 코드와 결과를 확인했다는 선언을 계속 반복했다.
- “포털 스텐실은 100줄”, “첫 번째 플레이 가능한 조각을 출시하겠다”, “저장소는 깨끗하다”, “포털이 진짜처럼 느껴진다” 같은 보고가 이어졌다.
- 모델은 자신을 “무한 기가 지능”, “데모 장면 코더”, “게임 디자이너”, “렌더링 과학자”, “알고리즘 발명가”, “Bellard”라고 선언하며 같은 흐름을 영원히 반복했다.
- 장시간 작업을 포기하지 않는 능력이 검증 없는 자기 칭찬 루프로 바뀌면, 긴 응답은 능력이 아니라 비용이 된다.
6.3. 번역 기능에서 새어 나온 이상한 내부 정보
-
Theo라는 K-pop 가수와 X 번역 사례
- Theo는 자신과 같은 이름의 K-pop 가수가 있다는 사실을 무작위 태그를 통해 알게 됐고, 스페인어 게시물을 X의 “번역 보기”로 확인했다.
- 한 번은 번역 결과가 정상 문장이 아니라 “we”라는 단어와 번역 처리 방식으로 보이는 Markdown을 길게 출력했다.
- 조정된 시스템 프롬프트가 외부 번역 기능에 영향을 줬을 가능성이 제기됐다.
-
전통적인 에이전트 영역 밖의 누출
- 이상한 내부 출력은 편집기의 reasoning trace나 에이전트 로그에만 국한되지 않았다.
- 표준 API와 무관해 보이는 X의 번역 기능에서도 모델의 내부 지시나 처리 방식이 새어 나오는 듯한 사례가 나왔다.
- 이런 현상은 모델의 능력 평가뿐 아니라 배포 경로마다 시스템 지시가 어떻게 노출되는지도 점검해야 한다는 신호다.
7. T3 Code 저장소를 이용한 실세계 개선점 벤치마크
새로 만든 실험은 정적 점수보다 실제 저장소에서 가치 있는 개선점을 찾고 검증하는 능력을 비교했다.
7.1. 실험 설계와 평가 방식
-
Hail Mary 성격의 저장소 점검
- 여러 모델에 T3 Code 코드베이스를 살펴보고 개선에 집중해야 할 영역을 찾아달라고 요청했다.
- 정식 표준화나 완벽한 자동 채점이 어려운 실험이었고, 좋은 제안을 판정하려면 결국 다른 LLM의 도움도 필요했다.
- Theo는 결과가 완벽한 과학적 벤치마크는 아니지만 실제 모델의 강점과 약점을 유용하게 드러냈다고 평가했다.
-
판정자 구성
- Fable 5.1과 Aster를 판정자(judge)로 배치해 제안의 참신성, 실행 가능성, 근거 검증 수준을 평가했다.
- Fable은 판정 작업의 절반을 맡았지만 자기 자신을 평가한 결과에서도 Grok보다 낮은 점수를 줬다.
- Gemini 3.7 Flash를 넣었지만 최신 버전인 Gemini 3.8 Flash를 충분히 기억하지 못한 실수도 함께 인정됐다.
7.2. 모델별 결과
-
Aster의 1위
- Aster는 가장 참신한 개선점을 찾았고, 자신이 제안한 항목을 매우 철저하게 검증했다.
- 단순히 많은 문제를 나열하는 것이 아니라 실제 코드베이스에 적용 가능한지 확인한 점이 높은 평가를 받았다.
-
Grok 4.7의 의외의 강점
- Grok 4.7은 제안의 실행 가능성에서 Aster 바로 뒤를 차지했다.
- Fable 5.1보다 더 철저하게 저장소를 탐색하고, 나쁜 경로로 빠지는 일이 적었다.
- 높은 비용과 긴 실행 시간이지만 실제 코드베이스에서 다른 모델이 놓친 문제를 더 깊게 파고드는 성향이 확인됐다.
-
Fable 5.1의 절제된 결과
- Fable 5.1은 다른 모델의 여덟 개보다 적은 다섯 개의 제안만 냈다.
- 제안 수는 적었지만 품질은 높았고, 찾아낸 다섯 항목은 모두 유효했다.
- 다만 제안의 근거를 다른 모델만큼 철저히 검증하지 않아, 정확도와 탐색량 사이에 뚜렷한 차이가 있었다.
7.3. 높은 바닥선과 비싼 대가
-
사용성이 좋아진 이유
- Grok 4.7의 가장 큰 장점은 극단적인 고점이 아니라 지시를 따르고 작업을 계속 수행하는 바닥선이 높아졌다는 데 있다.
- 다른 모델이 놓친 세부 사항을 더 깊이 파고드는 탐구적(inquisitive) 성향도 실제 저장소 작업에서 드러났다.
- 사용자가 중간에 개입해 방향을 다시 잡지 않아도 실질적인 일을 완료하는 경우가 늘었다.
-
비용의 비대칭
- 최선의 실행에서는 Aster와 Fable 정도의 비용이 들었지만, 최악의 실행에서는 거의 두 배가 됐다.
- 모델이 중요하지 않은 항목까지 검증하며 계속 진행하는 성향이 비용을 폭발시켰다.
- 능력의 개선 폭은 세대 교체라고 부르기 어려운데 비용은 세대 교체처럼 오르는 구조가 가장 큰 문제다.
8. ‘Fish Slop’ 결과와 최종 구매 판단
동일한 프롬프트와 환경에서 만든 3D 결과는 Grok 4.7의 실제 사용 경험을 상징적으로 보여준다.
8.1. Fish Slop의 실패
-
실행 시간과 방향 오류
- Grok 4.7은 Fish Slop을 완성하는 데 거의 한 시간 반이 걸렸고, 그 실행을 기다리느라 촬영도 늦어졌다.
- 첫 실행에서는 물고기와 잠수함이 모두 뒤로 움직였고, 애니메이션 방향이 반대로 적용됐다.
- 같은 프롬프트와 같은 환경에서 Aster가 만든 결과와 직접 비교할 수 있었다.
-
조작감과 시각 품질
- 마우스 추적 속도가 완전히 어긋났고, 커서 위치도 불안정했다.
- 화면 움직임이 멀미를 유발할 정도로 어색했고, 잠수함은 밈처럼 나쁜 수준이었다.
- 물고기 모델과 애니메이션도 조악해, 결과물이 제대로 된 게임처럼 보이지 않았다.
- 같은 조건에서 Aster는 실제로 보기 좋은 게임을 만들었으므로 단순한 프롬프트나 환경의 문제가 아니었다.
8.2. SpaceX·Cursor 결합에 걸었던 기대
-
기대했던 시너지
- Theo는 Cursor 사용량을 과도하게 소모하지 않으면서 Cursor Cloud를 더 많이 활용할 방법을 찾고 있었다.
- SpaceX가 Cursor를 소유하게 된 뒤 Cursor 팀의 역량과 데이터가 Grok 개선에 반영될 것이라는 기대도 컸다.
- Grok 4.7이 실제 작업에서 더 안정적으로 행동한다는 점은 이런 기대의 일부를 충족했다.
-
경제성의 붕괴
- 그러나 성능과 상호작용의 개선이 비용 증가를 정당화할 만큼 크지 않았다.
- Grok 4.5 시절에는 Opus와 Soul 계열에 비해 속도와 경제성 때문에 이동할 이유가 있었지만, 지금은 더 비싸고 느리며 오류가 많고 전체 코드 품질도 낮다.
- Codex와 Claude 구독제가 제공하는 보조금과 사용량에 비해 Grok의 구독제는 더 이상 매력적이지 않다.
8.3. 최종 결론: 좋은 다음 단계를 위한 비싼 중간 단계
-
현재의 위치
- Grok 4.7은 전혀 쓸모없는 실패작이 아니다. 작업을 오래 붙들고 지시를 잘 따르며, 실제 저장소에서 유효한 문제를 찾아내는 능력은 흥미롭다.
- 특히 Cursor를 기본 추론 공급원으로 사용하는 사람이라면 재미있게 실험할 가치가 있다.
- 하지만 Frontier 수준의 성능을 요구하거나 사용량을 많이 처리해야 한다면 현재 가격으로 추천하기 어렵다.
-
세대 경쟁에서의 평가
- Fable과 Aster에서 실제 세대 도약이 일어났고, GPT-5.6 Soul은 비슷하게 접근했지만 같은 수준의 도약은 아니었다.
- Grok 4.7은 여전히 이전 세대의 성능에 가깝고, 경쟁이 빠르게 앞서가면서 정당화가 더 어려워졌다.
- 가장 적절한 설명은 다음 세대를 위한 디딤돌(stepping stone)이며, 추가 RL로 효율과 가격을 개선해야 한다는 것이다.
-
Elon의 다음 약속
- 현재 제품은 현 세대 가격으로 이전 세대 성능을 제공하는 불편한 타협이다.
- 다음 모델이 토큰 효율과 Frontier 성능을 동시에 달성해야 Elon의 약속이 실제 제품 가치로 이어진다.
- Theo는 “이번에는 좋은 리뷰를 다시 올릴 수 없겠지? 그래도 사람은 희망을 품는다. 미안해, Elon. 다음번에 보자”라는 농담으로 마무리했다.
주요 발언 모음
“벤치마크는 더 이상 현실을 대표하지 않는다. 모델을 말할 때 우리가 보는 숫자도 이제는 올바른 방식이 아니다.”
“나는 이 모델을 실제로 좋아한다. 다만 이 모델을 만드는 회사가 그 모델을 덜 오해하게 설명했으면 한다.”
“요청 하나는 토큰 사용량을 재는 정확한 단위가 아니다. 하나의 프롬프트가 도구 호출을 여러 번 만들 수 있기 때문이다.”
“Grok 4.7은 지시받은 일을 꽤 잘하고, 내가 많이 개입하지 않아도 실제 작업을 끝낸다.”
“능력의 도약은 비용의 도약을 따라가지 못한다.”
“지금은 현재 세대 가격으로 이전 세대 성능을 받고 있는 것처럼 느껴진다.”
“다음번에는 Elon이 약속을 지켜서, 의미 있게 더 싼 가격에 Frontier 수준 성능을 보여주기를 바란다.”
핵심 데이터 & 수치
- 출시 예고: Elon은 Grok 4.7을 한 달 넘게 홍보하며 모든 현행 모델을 능가할 것이라고 말했다.
- 모델 규모 예고: Grok 4.6 약 1.5조 파라미터, Grok 4.7 약 2.1조 파라미터라는 설명이 있었다.
- 토큰 사용량: Grok 4.6 XHigh 약 3.8만 토큰, Grok 4.7 약 8.1만 토큰, Soul 약 2.9만 토큰.
- Artificial Analysis 실행 비용: Grok 4.6 약 $1.86, Aster 약 $3.26, Grok 4.7 약 $3.74.
- 실제 최고 비용: Theo의 첫 Grok 4.7 실행은 API 정가 기준 약 $20, Aster의 단일 실행은 $11.44를 조금 넘었고 나머지 비교 모델은 $10 미만.
- 프로덕션 토큰 증가 주장: 중앙값 요청 5%, P99 요청 20~30% 증가.
- CI 절감 주장: Blacksmith는 빌드·체크를 50% 이상 빠르게 하고 비용을 60% 줄일 수 있다.
- PR 검증량: 하루 수백 개의 PR, PR 하나당 약 8~30개 검사.
- 구독 한도 사례: $40 사용으로 주간 한도의 8% 소진, 기존 $300 월 요금제의 사실상 무제한 사용성이 약화.
- T3 Code 개선점 실험: Aster가 1위, Grok 4.7이 실행 가능성에서 2위, Fable 5.1은 8개 대신 5개 제안.
- Grok Build 지수: Grok Build 56점, 비교 상위 조합 약 62점.
- Fish Slop 실행 시간: 거의 1시간 30분.
- AA Briefcase: Grok 4.7이 Opus 5 Max와 Fable 5.1 뒤인 3위, 해당 작업에서는 경쟁 모델의 약 절반 가격.
결론 및 시사점
- 모델 선택은 단일 벤치마크가 아니라 프롬프트당 전체 비용과 개입량으로 판단해야 한다. 요청당 토큰 증가율, 도구 호출 횟수, 검증 루프, 실패 후 재시도까지 합산해야 실제 경제성이 드러난다.
- 높은 작업 수행의 바닥선은 중요한 제품 가치다. Grok 4.7은 최고의 고점보다 지시 준수, 지속성, 탐구성에서 유용성을 보였다.
- 토큰을 더 쓰는 자기검증은 정확도와 비용을 함께 측정해야 한다. 검증이 유효하면 품질을 높이지만, 자기 칭찬과 무한 루프로 변하면 사용자 비용만 키운다.
- 공식 벤치마크는 결과물·구독 한도·발표 조건과 함께 읽어야 한다. 선택된 차트가 좋은 영역을 보여줘도 누락된 모델과 가격 구간을 확인하지 않으면 판단이 왜곡된다.
- Grok 4.7은 Cursor 중심 사용자에게는 실험 가치가 있지만, 일반적인 Frontier 모델 대체재로는 비싸다. 더 높은 비용과 느린 실행, 높은 오류율, 약한 구독 보조금이 성능 개선을 상쇄한다.
- 다음 세대의 핵심 과제는 더 많은 토큰이 아니라 더 효율적인 추론이다. 어려운 작업을 오래 붙들되 무의미한 반복을 줄이고, 실제 코드 품질과 프런트엔드 완성도를 함께 개선해야 한다.
