URL: https://www.youtube.com/watch?v=vu8X3YroB-w
날짜: 2026-09-30
채널: t3dotgg
원문 제목: OpenAI fights back
video_id: vu8X3YroB-w
📌 핵심 질문 / 핵심 논점
==GPT 6.1 Soul은 GPT 6 Astra의 불안정성을 크게 줄이고, Opus 5.5에 맞먹는 코드 검토 능력을 API 비용의 일부로 제공하지만, 장시간 자율 구현과 협업성에서는 여전히 Opus 5.5가 앞서는가?==
- GPT 6.1 Soul은 GPT 6 Soul 출시 일주일 뒤 등장했고, 더 높은 지능과 느린 초당 토큰 처리 속도로 보아 단순한 버전 업데이트보다 큰 변화를 담았다.
- 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러, 캐시 읽기 토큰 100만 개당 0.10달러라는 가격은 에이전트 작업의 실제 비용을 급격히 낮춘다.
- Astra보다 덜 튀고 코드 감사·컴퓨터 사용·원인 분석에 강하지만, 장시간 대규모 재작성에서 진행을 멈추지 않는 판단력과 자연스러운 협업은 Opus 5.5가 우위다.
Anthropic이 Opus 5.5를 출시한 뒤 OpenAI가 GPT 6 Soul과 GPT 6 Luna를 잇달아 내놓았지만, GPT 6.1 Soul은 그 둘과 달리 실사용 가치와 가격 대비 성능에서 뚜렷한 반격을 만든다. GPT 6.1 Soul은 일상 코드 작업의 기본 모델이 될 가능성이 높고 Sonnet 5.5를 사실상 대체하지만, Opus 5.5를 완전히 몰아내지는 못한다. 가장 합리적인 조합은 Opus 5.5가 긴 구현을 맡고 GPT 6.1 Soul이 조사·감사·리뷰·원인 분석을 맡는 구조다.
1. 출시 배경과 예상 밖의 타이밍
GPT 6.1 Soul의 공개 속도와 초기 접근 시점은 일반적인 세대 교체보다 긴급한 대응에 가깝다.
1.1. Anthropic의 압박과 OpenAI의 연속 출시
-
Opus 5.5가 촉발한 경쟁
- Anthropic은 직전 주에 Opus 5.5를 출시했고, 성능이 “믿을 수 없을 만큼 좋다”는 평가를 받았다.
- OpenAI는 GPT 6 Soul과 GPT 6 Luna를 빠르게 내놓았지만, 둘 다 충분히 인상적이지 않아 별도 리뷰를 만들 만한 말을 찾기 어려웠다.
-
GPT 6.1 Soul의 숨은 존재
- 초기 접근 권한으로 이미 GPT 6.1 Soul을 사용하고 있었고, 6.1 Soul이 공개될 것을 알았기 때문에 Opus 5.5 리뷰 제작을 망설였다.
- 6.1 Soul은 예상보다 저렴하고 능력이 높으며, Astra보다 낫다는 점이 가장 큰 놀라움이었다.
1.2. 공개 조건과 촬영 상황
-
공개 시점의 제약
- OpenAI는 발화 내용이나 결론에는 영향력을 행사하지 않았고, 공개 시점만 모델 출시 이후로 맞춰 달라고 요청했다.
- 촬영은 출시 직후 새벽 2시에 진행됐고, 몇 시간 뒤 새벽 3시가 되어 잠자리에 들 정도로 급하게 제작됐다.
-
검토자의 이해관계 공개
- 초기 접근 권한을 받았지만 OpenAI로부터 돈을 받지는 않았다.
- 출시 전의 날것의 평가를 전달하고 싶었기 때문에 다른 리뷰가 정제한 결론보다 먼저 개인적인 판단을 공개했다.
2. 협찬 구간: 에이전트 피드백을 위한 Depot
코드 에이전트의 성능은 모델 자체뿐 아니라 CI 피드백 속도와 품질에도 좌우된다.
2.1. CI 비용과 속도 문제
-
에이전트 피드백의 병목
- 에이전트가 좋은 소프트웨어를 만들려면 반복적인 피드백이 필요하고, 그 피드백 상당 부분은 CI에서 온다.
- GitHub Actions 사용량과 비용이 늘면서 빌드 대기와 불분명한 로그가 에이전트 작업을 답답하게 만든다.
-
Depot의 제안
- Depot은 CI를 최대 10배, Docker 빌드를 최대 40배 빠르게 만들 수 있다고 제시하며 특히 캐시 다운로드에서 이점을 강조했다.
- 자체 AMD EPYC 기반 베어메탈 인프라를 사용해 전통적인 CI 제공자보다 빠르고 저렴한 실행을 제공한다.
2.2. 에이전트 중심의 사용 방식
-
실패를 더 빠르게 돌려받는 구조
- GitHub가 무작위로 장애를 일으켜 릴리스가 막히는 상황에서, Depot API는 병렬화와 복원력을 제공한다.
- 에이전트는 깨진 코드를 PR로 올리고 기다리지 않고 CLI로 동일한 CI를 직접 실행해 결과를 받을 수 있다.
-
실제 사례와 주소
- Ben이 Pick Thing을 Bun으로 옮겼을 때 CI 실패가 발생했지만, Depot은 복잡한 텍스트 더미 대신 실패 원인과 개선 제안을 더 읽기 쉽게 제시했다.
- 안내된 주소는
swive.link/devo이며, 사용자의 에이전트가 빌드 시간과 병목을 분석하는 데에도 활용할 수 있다.
3. 벤치마크와 가격이 만든 반전
GPT 6.1 Soul의 가장 강한 주장은 최고 점수 그 자체보다 그 점수를 얻는 비용과 시간이다.
3.1. Terminal Bench 4와 Deep SWE의 한계
-
측정 과정의 불안정성
- 초기 두 번의 Terminal Bench 실행은 설정 실수로 망쳤고, 세 번째 실행이 더 나았다.
- 처음부터 medium을 실행하지 않았으며, low·high·X-high·max를 다시 채우는 중이었다. max는 한 번 실행하는 데 8시간 이상 걸리는 작업도 있어 아직 완전하지 않았다.
-
벤치마크를 그대로 믿기 어려운 이유
- 무작위 네트워크의 VM에서 실행했고, H100을 요구하는 세 작업은 개인 장비로 감당하기 어려워 제외했다.
- Terminal Bench 4는 당시 최고 수준의 점수를 보여주지만, 벤치마크가 일상적인 코드 작업 전체를 대표하지는 않는다.
-
Deep SWE의 이상한 패턴
- GPT 6.1 Soul은 low와 high에서 Astra가 high에서 내던 점수와 비슷한 점수를 냈고, X-high와 max에서 점수가 오히려 내려갔다.
- Deep SWE가 실제 업무 능력을 완벽하게 측정하지 못하더라도 Opus 5.5와 같은 점수를 훨씬 낮은 비용으로 낸다는 사실은 무시하기 어렵다.
3.2. 가격 비교와 캐시 읽기
-
실행 비용의 격차
- GPT 6.1 Soul의 가장 비싼 작업은 태스크당 약 1.38달러였고, Opus 5.5의 가장 저렴한 실행은 5.12달러였다.
- GPT 6.1 Soul의 low 실행 가격은 0.21달러, Astra의 low는 1.46달러, Opus 5.5의 max는 같은 점수에 14.65달러가 들었다.
-
API 가격표
- 입력 토큰 100만 개는 2달러, 출력 토큰 100만 개는 10달러로 책정됐다.
- 캐시 읽기는 토큰 100만 개당 0.10달러다. 이는 일반 입력 가격의 5%이며, 기존에 알려진 10% 수준의 캐시 가격에서 다시 절반으로 내려간 셈이다.
-
에이전트 작업에서 캐시가 중요한 이유
- 에이전트 요청의 약 96%가 캐시 읽기이므로, 헤드라인 입력·출력 가격보다 캐시 읽기 가격이 실제 지출을 더 크게 좌우한다.
- OpenAI가 캐시 읽기 가격을 이렇게 크게 낮춘 것은 실제 에이전트 사용을 겨냥한 선택이며, 모델 마진을 줄여서라도 사용량을 늘리려는 신호로 읽힌다.
3.3. 6.1이 예정된 모델이 아니었을 가능성
-
출시 간격이 주는 추론
- GPT 6 Soul이 화요일에 공개된 뒤 정확히 약 일주일 후 GPT 6.1 Soul이 다시 화요일에 공개됐다.
- 더 높은 지능, 더 느린 초당 토큰 속도, 급격히 바뀐 가격을 함께 보면 단순한 GPT 6의 새 스냅샷으로 보기 어렵다.
-
내부 코드 레드와 구독 구조
- Opus 5.5가 200달러짜리 Claude Code 구독을 지나치게 좋은 가치로 만들면서 내부적으로 긴급 대응 상황이 있었다는 관측이 나왔다.
- Tibo가 200달러 Pro 구독을 되살리면서 구독 사용량 계산 방식을 바꾼다고 알렸다. 계산해 보면 과거 플랜 대비 API 사용액 환산이 약 절반으로 줄어든다.
-
구독 보조금의 규모
- 200달러 Claude Code 플랜은 한 달에 8,000~9,000달러 상당의 사용량을 제공할 수 있고, 200달러 Codex 플랜은 12,000달러 이상을 제공할 수 있다.
- Astra 기준 실제 사용량은 대략 월 8,000~9,000달러에 가까웠으며, 사용 환경에 따라 편차가 커 정확한 계산은 어렵다.
4. GPT 6 Astra와 비교한 성격 변화
GPT 6.1 Soul의 핵심 개선은 최고점 상승이 아니라 끔찍한 저점과 불규칙한 행동을 줄인 데 있다.
4.1. “똑똑하면서 동시에 멍청한” Astra의 문제
-
Astra의 극단적인 변동성
- Astra는 Anthropic의 최고 모델보다 더 지적인 순간이 많았고, 3D 능력은 여전히 매우 뛰어나다.
- 하지만 어느 순간 작은 오픈 웨이트 모델보다도 멍청한 답을 내는 급락이 반복됐고, 잘할 때와 못할 때의 차이가 지나치게 컸다.
-
사용 패턴의 변화
- 이런 급락 때문에 Codex 구독은 컴퓨터 사용에만 쓰고, 일상 작업은 Fable 5.1과 Opus 5.5에 의존하게 됐다.
- GPT 6.1 Soul은 Astra의 최고점에는 못 미치지만, 대부분의 시간에 안정적으로 품질을 내므로 실제 업무에 맡길 수 있다.
4.2. 안정성·속도·지능의 절충
-
덜 튀는 모델
- Julius는 GPT 6.1 Soul을 “믿을 수 없을 만큼 뛰어나다”고 평가했고, Ben은 “놀라울 정도로 지루하다”고 평가했다.
- 극적인 데모보다 예측 가능한 결과가 필요한 모델 출시에서 “지루하다”는 평가는 오히려 좋은 신호다.
-
남아 있는 약점
- 능력의 경계에 걸친 작업에서는 여전히 이상한 방향으로 빠지고, Opus 5.5를 계속 찾게 되는 경우가 있다.
- GPT 6.1 Soul의 초당 토큰 속도는 느려졌으며, 이는 모델 규모가 커졌다는 신호일 수 있지만 정확한 내부 구조를 확정하지는 않는다.
5. 컴퓨터 사용과 코드 감사에서의 실전 능력
GPT 6.1 Soul은 직접 코드를 길게 작성하는 역할보다, 사람이나 다른 에이전트의 결과를 검증하는 역할에서 특히 강하다.
5.1. 금융 업무를 맡길 수 있었던 컴퓨터 사용
-
송금 준비 자동화
- 이메일 전체를 훑어 미납 또는 뒤처진 청구서를 찾고, 투자 관련 송금이 필요한 항목을 분류했다.
- 필요한 투자 사이트를 Chrome의 새 탭으로 열고 세부 정보를 입력한 뒤, 최종 전송 버튼만 사람이 누르도록 남겼다.
-
신뢰성의 기준
- 단 한 건도 잘못 처리하지 않았고, 사람이 직접 했다면 놓쳤을 추가 항목까지 지적했다.
- Astra의 변동성을 고려하면 돈을 송금하는 준비 작업을 Astra에 맡기기는 망설여지지만, GPT 6.1 Soul에는 실제로 맡길 수 있었다.
5.2. Orchestrator v2 감사와 코드베이스 개선
-
깊은 코드 리뷰
- GPT 계열 특유의 “로트와일러” 같은 집요함이 코드의 문제를 물고 늘어져 끝까지 파고드는 강점으로 나타났다.
- Orchestrator v2 감사 점수는 Astra와 거의 같거나 다른 평가에서는 아주 조금 더 높았지만, 비용은 584달러가 아니라 297달러 수준이었다.
-
T3 코드 개선 기회 찾기
- T3 코드베이스의 개선 기회를 찾는 작업에서 GPT 6.1 Soul은 87.4점을 기록해 Astra의 83.8점과 Grok 4.7의 80.7점을 앞섰다.
- 같은 작업 비용은 GPT 6.1 Soul 약 2.15달러, Opus 5.5 약 5달러, Sonnet 5.5 약 9달러였다.
-
블라인드 리뷰의 결과
- Opus 5.5가 모델 이름을 숨긴 채 GPT 6.1 Soul의 결과를 검토했을 때 프런티어급 모델이라고 판단했고, 버그 재현과 수정 제안은 나중에 실제로 병합된 수정과 일치했다.
- 같은 프롬프트를 사용한 10개 모델 블라인드 벤치마크에서 GPT 6.1 Soul은 A7.4보다 먼저 1위를 차지했고, fish slop 실행까지 찾아 비교했다.
5.3. 다른 모델의 평가와 예상 가격
-
Opus 5.5의 평가
- GPT 6.1 Soul의 품질은 Astra와 Opus 5.5·Sonnet 5.5보다 약간 낮지만, 실행 비용은 각각 약 7달러·15달러·50달러보다 훨씬 낮았다.
- “범위가 정해진 작업에는 프런티어 최상위권”이며, 잘못된 부분을 다듬는 일과 장시간 방치형 작업에는 Astra보다 GPT 6.1 Soul을 선택하겠다는 평가가 나왔다.
-
Opus가 추정한 적정 가격
- 성능에 맞춰 입력 100만 토큰당 5달러, 캐시 0.50달러, 출력 30달러가 적정하다고 추정했다.
- 실제 가격이 입력 2달러·캐시 0.10달러·출력 10달러라고 알려지자 “매우 공격적인 가격”이라고 했고, 기존 추정치의 약 4분의 1이라고 다시 계산했다.
-
실사용 비용의 재계산
- 모든 세션을 기존 가격으로 계산하면 약 5,700달러였지만, GPT 6.1 Soul의 새 가격으로는 약 1,550달러가 된다.
- 수만 줄의 코드가 포함된 무거운 PR 리뷰도 최대 10달러로 예상했지만 실제 비용은 최대 3달러 수준이었다.
6. 협업 모델로서의 한계와 Opus 5.5의 우위
높은 효율과 집요한 분석이 곧 좋은 장기 협업을 의미하지는 않는다.
6.1. 장시간 자율 구현에서 멈추는 문제
-
TypeScript-to-Rust 포트의 대조
- GPT 6.1 Soul과 Astra를 몇 달 동안 투입했지만, 토큰을 엄청나게 소모하면서도 컴파일러를 실질적으로 개선하지 못했다.
- Opus 5.5는 처음부터 다시 시작해 단 하루 만에 작업을 작동시켰고, 두 개의 구독과 Quad 플랜으로 하룻밤에 약 1,000달러 상당의 작업을 끝냈다.
-
진행이 막혀도 도움을 요청하지 않는 성향
- GPT 6.1 Soul은 프로세스 규칙을 끝까지 지키느라 진전이 멈춰도 멈추거나 도움을 요청하지 않는 경우가 있다.
- 긴 자율 실행과 무거운 재작성에서는 Anthropic 모델이 현재 “코믹할 정도로” 앞서며, Opus가 더 즐거운 협업자이자 구현자다.
6.2. 컴퓨터 여러 대를 관리할 때의 판단
-
에이전트 플릿 운영
- 여러 컴퓨터에서 에이전트와 코드를 실행하는 플릿은 한 대의 MacBook만으로 감당할 수 없고, 현재 MacBook에서는 에이전트를 돌리지 않는다.
- GPT 6.1 Soul은 플릿 관리에서 몇 가지 어리석은 실수를 냈고, Opus도 실수는 하지만 Astra는 이런 유형의 실수가 상대적으로 적었다.
-
역할 분담의 결론
- Astra는 이후 사실상 사용하지 않을 만큼 GPT 6.1 Soul의 안정성이 충분히 높았다.
- Opus 5.5는 구현과 장기 실행을 맡고 GPT 6.1 Soul은 조사·원인 분석·감사·리뷰를 맡는 조합이 가장 설득력 있다.
6.3. 토큰 효율과 컨텍스트 관리
-
Sonnet 5.5와의 사용량 비교
- GPT 6.1 Soul은 Sonnet 5.5가 한 라운드에 쓰는 비용의 절반보다 적은 비용으로 세 라운드의 작업을 수행했다.
- 요청당 평균 입력 토큰은 GPT 6.1 Soul이 약 11만 개, Sonnet 5.5가 약 36만 개였다.
-
효율성이 생기는 이유
- GPT 6.1 Soul은 불필요한 호출과 컨텍스트 누적을 줄이고 토큰을 더 효율적으로 사용했다.
- 긴 시스템 프롬프트도 캐시 가격이 낮아지면서 비용 부담이 거의 노이즈 수준으로 줄지만, 긴 루프 자체가 진전 없는 작업을 해결해 주지는 않는다.
7. Deep SWE와 JEV Router 비교
가격 최적화 라우터가 반드시 더 싸고 빠른 결과를 보장하지는 않는다.
7.1. JEV Router의 설계와 실패
-
라우팅의 한계
- OpenRouter의 JEV Router는 요청 난이도를 판단해 비용을 최적화하려 했지만, 컨텍스트 없는 모델이 문제의 난이도를 정확히 판단하기는 어렵다.
- 전체 요청의 약 60%가 DeepSeek 4.1 Flash로 라우팅됐고, 더 똑똑한 모델로 보내는 경우도 있었지만 결과는 만족스럽지 않았다.
-
시간과 비용의 역전
- GPT 6 Astra low는 평균 4.6분, JEV Router는 약 20분이 걸렸고, 태스크당 단계도 Astra의 19단계에서 JEV Router의 104단계로 늘었다.
- JEV Router는 Astra low보다 비쌌고, 무료에 가까운 소형 오픈 웨이트 모델을 섞었음에도 GPT 6.1 Soul low가 같은 점수를 8분의 1 가격으로 냈다.
7.2. GPT 6.1 Soul의 효율 기록
-
속도·점수·가격의 조합
- GPT 6.1 Soul low는 약 4.8분 만에 태스크를 완료하고 0.21달러를 사용하면서, 해당 벤치마크에서 역대 두 번째로 높은 점수를 냈다.
- Opus 5.5 max와 같은 점수를 내면서도 태스크당 시간은 50분이 아니라 약 10분의 1, 가격은 약 70분의 1이었다.
-
적용 범위
- GPT 6.1 Soul이 강한 범위에 작업이 들어오면 기본 모델로 사용해도 좋다.
- 범위를 벗어난 작업은 Opus 5.5에 맡기고, Opus가 GPT 6.1 Soul을 조사·리뷰용 하위 에이전트로 호출하게 만드는 편이 안전하다.
8. Fish slop: 그래픽은 뛰어나고 게임은 망가진 사례
Fish slop은 3D 생성 능력의 도약과 프런트엔드·게임 디자인의 취약점을 한 번에 보여준다.
8.1. 시각적 품질의 상승
-
모델과 오브젝트
- 물고기와 잠수함 모델, 프로펠러, 수조 속 식물과 장식물의 그래픽 충실도는 이전 Opus·Sonnet 버전보다 훨씬 좋았다.
- 생성 비용은 약 5달러에 불과했고, 초고속 실행이 가능해지면 몇 분 안에 주문형 게임을 만들 수 있는 수준에 가까워진다.
-
3D 제작 도구로서의 잠재력
- 원하는 3D 물체의 스크린샷과 Blender CLI 사용 지시를 주면 꽤 좋은 결과를 만들었다.
- 모델이 3차원 공간과 필요한 도구를 이해하기 시작하면서 게임 개발이 뒤집힐 임계점에 접근하고 있다.
8.2. 형편없는 UI와 플레이 감각
-
불필요한 텍스트 폭발
- “Take a breather”, “Paused. Your little world can wait”, “Back to the reef”, “Start a new tank”처럼 게임 곳곳에 불필요한 문구가 반복됐다.
- “Slop01 feeder submarine”, “A little underwater chaos”, “The big little goal”, “Your little ecosystem”, “Little fish become big earners”, “Four meals and they’re all grown up”, “Make the family a little bigger”, “A little golden overachiever” 등 20개가 넘는 문구가 화면을 오염시켰다.
-
게임플레이의 퇴보
- 그래픽은 더 좋아졌지만 잠수함의 움직임은 Opus·Sonnet 버전보다 뻣뻣하고, 프레임 속도도 낮았다.
- 게임 루프가 빈약했고 시작 30초 만에 이유를 설명하지 않고 게임 오버가 되기도 했다. 실제로는 클리어했을 가능성도 남았다.
-
디자인에 대한 결론
- GPT 6.1 Soul은 프런트엔드와 디자인에 취향이 부족하고, 보기 싫은 UI를 그대로 승인하는 경향이 있다.
- 좋은 프런트엔드와 게임 메커니즘을 만들려면 사람의 미감이나 Opus·Sonnet의 후처리가 필요하지만, 3D 모델 자산 생성에는 매우 유용하다.
9. 실제 T3 Code PR과 TypeScript-to-Rust 포트
실제 코드 검토에서 GPT 6.1 Soul은 놓치기 쉬운 회귀 버그를 찾아냈지만, 구현 코드를 직접 병합하는 일은 여전히 신중해야 한다.
9.1. worktree 설정 창 버그
-
버그의 맥락
- T3 Code의 새 스레드에 나타나는 worktree 설정 창이 다른 곳으로 나갔다가 돌아오면 사라지는 버그가 있었다.
- Claude Code가 해결책을 만들었지만 문제가 깊어, 병합 전에 여러 번의 독립적인 검토가 필요했다.
-
GPT 6.1 Soul이 찾아낸 회귀
- 에이전트가 시작된 뒤 후속 메시지가 계속 차단돼 사용자가 다음 메시지를 대기열에 넣을 수 없는 문제를 찾았다.
- 복구된 설정 진행 상태가 너무 일찍 사라지는 문제도 발견해, Fable과 Opus가 모두 놓친 실제 회귀를 막았다.
-
검토 파이프라인
- 검토 결과를 Claude에 복사해 다시 고치게 했고, 두 개의 작은 빈틈을 추가로 보완한 뒤 병합했다.
- 테스트 기간에는 모델이 작성한 코드를 T3 Code나 오픈 소스 프로젝트에 직접 넣을 수 없었기 때문에, GPT 6.1 Soul은 실제 PR 감사에 집중했다.
9.2. 180만 줄의 코드와 130만 줄의 슬롭
-
Opus의 구현과 Soul의 사후 감사
- GPT 6.1 Soul은 TypeScript-to-Rust 포트의 진행률을 83.7%에서 100%로 하루 안에 끌어올려, Astra와 다른 Soul 계열 모델이 몇 달 동안 막혀 있던 작업을 풀었다.
- 이어진 감사에서 전체 180만 줄 가운데 130만 줄이 실제로 사용되지 않는다는 사실을 찾아냈다.
-
문제가 생긴 이유
- Opus는 다른 에이전트들이 작성한 코드가 회복 불가능한 슬롭이라고 판단해 별도의 crate에 코드를 처음부터 다시 썼다.
- 결과적으로 코드가 작동하게 된 이유는 Opus였지만, 사용되지 않는 거대한 코드가 남은 이유도 Opus가 그 잔해를 인지하지 못했기 때문이었다.
-
역할 분담의 실체
- Opus 5.5는 막힌 프로젝트를 앞으로 밀어붙이는 구현자이고, GPT 6.1 Soul은 완성된 결과의 숨은 결함과 잔해를 찾아내는 감사자다.
- GPT 6.1 Soul은 기본 코딩 모델이 될 수 있지만, 최상의 협업 경험과 구현 성공률을 위해서는 Opus와 함께 사용하는 편이 낫다.
10. 최종 판정과 구독 경제의 신호
GPT 6.1 Soul은 놀라운 가격으로 Sonnet 5.5를 대체하지만 Opus 5.5를 퇴위시키지는 못한다.
10.1. 모델별 역할 배치
-
GPT 6.1 Soul에 적합한 일
- 코드베이스 조사, 버그 원인 분석, 깊은 코드 리뷰, PR 감사, 다른 에이전트의 작업 검증, 컴퓨터 사용에 적합하다.
- 캐시 읽기 가격과 토큰 효율 덕분에 시스템 프롬프트가 크고 반복적인 에이전트 작업에서도 비용이 크게 늘지 않는다.
-
Opus 5.5에 적합한 일
- 장시간 방치형 구현, 큰 규모의 재작성, 계속 진행하면서 판단을 바꾸는 협업, 막힌 프로젝트를 처음부터 다시 세우는 작업은 Opus가 앞선다.
- Opus는 GPT 6.1 Soul을 조사·리뷰 하위 에이전트로 호출해 구현 전에 문제를 찾고 구현 후 결과를 검증할 수 있다.
10.2. 구독 유지와 보조금 시대의 종말
-
개인적인 선택
- GPT 6.1 Soul 출시만으로 Cloud 구독을 취소할 이유는 없고, Opus 5.5는 여전히 일상적인 주력 모델이다.
- Codex 구독은 이전보다 훨씬 자주 활용할 예정이며, Cloud 설정에 GPT 6.1 Soul을 추가해 Opus가 호출하도록 구성할 계획이다.
-
산업적 신호
- API 가격과 구독 사용량 변경은 모델 성능 경쟁을 넘어, 지금까지의 대규모 구독 보조금 시대가 끝나기 시작했음을 암시한다.
- 월 200달러로 수천 달러의 사용량을 제공하는 구조가 계속되기 어려워지면, 앞으로 모델 가격과 구독 한도가 함께 조정될 가능성이 있다.
주요 발언 모음
“6.1은 GPT 6보다 훨씬 똑똑하다. 따라서 단순한 한 단계 상승이 아니다.”
“이 모델은 범위가 정해진 작업에 믿을 수 없을 만큼 좋고, 프런티어 최상위권이다.”
“GPT 6.1 Soul은 지루할 정도로 예측 가능하다. 이런 모델 출시에서 그건 좋은 말이다.”
“에이전트 작업은 96%가 캐시 읽기다. 그래서 100만 토큰당 0.10달러가 입력 2달러와 출력 10달러보다 중요하다.”
“나는 이 모델이 코드를 작성하도록 맡기는 일은 아직 신뢰하지 않지만, 코드를 검토하도록 맡기는 일은 확실히 신뢰한다.”
“장시간 무거운 재작성에서는 Anthropic이 지금 코믹할 정도로 앞서 있다.”
“그래픽은 훌륭하지만 게임은 형편없다.”
“이 모델은 분명 작업 흐름 속에 자리가 있다. 기본 코딩 모델이 될 수도 있지만, 전체 협업자로서는 여전히 Opus가 낫다.”
“GPT 6.1 Soul은 Opus 5.5를 폐위할 모델은 아니지만, 놀라운 가격의 훌륭한 출시다.”
핵심 데이터 & 수치
- 출시 간격: GPT 6 Soul 공개 후 약 1주일 만에 GPT 6.1 Soul 공개.
- API 입력 가격: 100만 토큰당 2달러.
- API 출력 가격: 100만 토큰당 10달러.
- 캐시 읽기 가격: 100만 토큰당 0.10달러. 일반 입력 가격의 5%다.
- 에이전트 캐시 비중: 전체 요청의 약 96%가 캐시 읽기로 추정된다.
- Terminal Bench 작업 시간: max 실행은 일부 태스크에 8시간 이상 걸린다.
- GPT 6.1 Soul low 비용: 태스크당 약 0.21달러.
- Astra low 비용: 태스크당 약 1.46달러.
- Opus 5.5 max 비용: 같은 점수에 태스크당 약 14.65달러.
- 최고 비용 비교: GPT 6.1 Soul의 가장 비싼 실행 약 1.38달러, Opus 5.5의 가장 싼 실행 약 5.12달러.
- Deep SWE 실행: GPT 6.1 Soul low 약 4.8분, Opus 5.5 max 약 50분.
- JEV Router 실행: Astra low 약 4.6분 대비 약 20분, 평균 단계 104개 대비 Astra 19개.
- Orchestrator v2 감사: GPT 6.1 Soul 약 297, Astra 약 584의 비용으로 비슷한 점수.
- T3 코드 개선 점수: GPT 6.1 Soul 87.4, Astra 83.8, Grok 4.7 80.7.
- T3 코드 개선 비용: GPT 6.1 Soul 약 2.15달러, Opus 5.5 약 5달러, Sonnet 5.5 약 9달러.
- 컨텍스트 입력량: GPT 6.1 Soul 요청당 약 11만 토큰, Sonnet 5.5 약 36만 토큰.
- TypeScript-to-Rust 포트: GPT 6.1 Soul이 83.7%에서 100%로 하루 안에 진척.
- 남은 코드 잔해: 총 180만 줄 가운데 약 130만 줄이 사용되지 않음.
- Fish slop 생성 비용: 약 5달러.
- 구독 보조금 규모: 200달러 Claude Code 플랜에서 월 8,000~9,000달러, 200달러 Codex 플랜에서 12,000달러 이상 사용량이 가능하다고 추정.
결론 및 시사점
- GPT 6.1 Soul을 코드베이스 조사·리뷰·감사·버그 원인 분석의 기본 모델로 배치하면, Opus급에 가까운 품질을 훨씬 낮은 비용으로 확보할 수 있다.
- 장시간 자율 구현과 대규모 재작성은 Opus 5.5에 맡기고, GPT 6.1 Soul을 하위 조사자와 검증자로 호출하는 이중 모델 구조가 현실적인 최적점이다.
- Astra의 불안정한 최고점보다 GPT 6.1 Soul의 일관된 중상위 품질이 실제 금융 업무와 코드 병합 검토에서 더 큰 신뢰를 만든다.
- Fish slop은 3D 자산 생성의 가능성을 보여주지만, UI·게임 메커니즘·미감에는 사람이나 다른 모델의 후처리가 필수라는 경고도 남긴다.
- 캐시 읽기 가격을 0.10달러까지 낮춘 결정은 장기 에이전트 사용량을 겨냥한 승부수이며, 경쟁사와 모델 효율성 경쟁을 다시 시작한다.
- API 가격과 구독 한도 변화는 월 200달러 구독으로 수천 달러어치 컴퓨팅을 보조하던 시대가 지속되기 어려움을 보여준다.
- GPT 6.1 Soul은 Sonnet 5.5를 사실상 대체할 만큼 가치가 높지만, “더 똑똑한 Opus”를 기다리던 기대까지 충족하지는 못했다.
핵심 요약 (20줄)
-
Anthropic의 Opus 5.5 출시가 OpenAI의 GPT 6.1 Soul 공개를 촉발한 것으로 보인다.
-
GPT 6.1 Soul은 GPT 6 Soul 공개 약 일주일 뒤 등장해 단순한 마이너 업데이트보다 큰 변화를 보여준다.
-
GPT 6.1 Soul은 GPT 6 Astra보다 덜 튀고 대부분의 작업에서 훨씬 안정적이다.
-
GPT 6.1 Soul은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러다.
-
캐시 읽기 가격은 100만 토큰당 0.10달러로 실제 에이전트 비용을 크게 낮춘다.
-
에이전트 요청의 약 96%가 캐시 읽기라서 캐시 가격이 헤드라인 토큰 가격보다 중요하다.
-
GPT 6.1 Soul은 Terminal Bench와 Deep SWE에서 최고 수준의 점수를 낮은 비용으로 냈다.
-
GPT 6.1 Soul low는 Opus 5.5 max와 비슷한 점수를 약 70분의 1 가격에 기록했다.
-
GPT 6.1 Soul은 Astra와 비슷한 깊은 코드 감사 능력을 약 절반의 비용으로 제공했다.
-
T3 코드 개선 작업에서 GPT 6.1 Soul은 Astra와 Grok 4.7보다 높은 87.4점을 얻었다.
-
컴퓨터 사용으로 미납 청구서와 투자 송금을 찾아 입력했으며 한 건의 오류도 내지 않았다.
-
GPT 6.1 Soul은 Opus 5.5보다 코드 검토와 세부 조사에 강하고 Sonnet 5.5보다 효율적이다.
-
TypeScript-to-Rust 포트의 긴 자율 구현에서는 Opus 5.5가 GPT 6.1 Soul보다 압도적으로 나았다.
-
GPT 6.1 Soul은 막힌 작업에서 도움을 요청하지 않고 토큰을 소모하는 약점을 보였다.
-
Opus 5.5는 구현을 맡고 GPT 6.1 Soul은 조사와 감사를 맡는 조합이 가장 유망하다.
-
Fish slop은 잠수함과 수조의 그래픽은 뛰어났지만 움직임과 프레임 속도는 나빴다.
-
Fish slop은 20개가 넘는 불필요한 UI 문구를 뿜어내며 GPT 6.1 Soul의 디자인 감각 부족을 드러냈다.
-
GPT 6.1 Soul은 Blender를 통한 3D 자산 생성에는 강하지만 게임 메커니즘에는 약하다.
-
GPT 6.1 Soul은 Sonnet 5.5를 사실상 대체할 만큼 저렴하고 유능하지만 Opus 5.5를 대체하지는 못한다.
-
낮아진 캐시 가격과 구독 계산 변경은 대규모 보조금 시대가 끝나기 시작했음을 알린다.
