1. 핵심 주장 (5개)
1-1. GPT-5.6 Soul은 역대 최고 벤치마크 성능을 절반 이하의 비용으로 달성
DeepSWE에서 73% (역대 최고), Agent Last Exam에서 53.6%로 Fable 5를 13포인트 상회. 비용은 Fable 대비 1/4~1/40 수준. 효율성이 강점.
1-2. "절대 포기하지 않는다" — 이것이 55와 근본적으로 다른 점
GPT-5.5는 7단계 계획 중 1.5단계 완료 후 멈추곤 했지만, 5.6은 끝까지 밀어붙인다. 이는 post-training + RL 패스만으로 이뤄낸 놀라운 성과. 새로운 기반 모델이 아님.
1-3. Soul / Terra / Luna + 여러 reasoning 레벨 = 30가지 이상 선택지로 혼란 유발
Ultra, Max, X High, High, Medium에 Pro 버전까지 곱하면 선택지가 너무 많아 혼란스럽다. 각 모델의 목적 이해가 필수.
1-4. 안전 장치 과도함 — 정상적인 작업도 차단되는 문제 존재
55 대비 사이버 위협 차단율 10배 증가. 하지만 무고한 사용(예: 코드베이스 정리)도 막히는 경우 발생. 재시도 옵션은 개선 중이나 여전히 거슬림.
1-5. 코드를 과도하게 작성하는 경향 — 시스템 프롬프트 조정 필수
5줄 변경 요청을 300줄 파일 재작성 + 2,000줄 테스트로 만들어버린다. 불필요한 테스트를 너무 많이 작성함. 스킬/시스템 프롬프트로 제어 필요.
2. 근거와 사례 (각 주장별 세부 내용)
2-1. 벤치마크 성능
- DeepSWE: Soul Max 73% (역대 최고), $22/task. Fable는 $839/task에 더 낮은 점수
- Agent Last Exam: Soul 53.6% vs Fable 5 adaptive reasoning 40.6% (13포인트 차)
- 55 field에 걸친 장시간 전문 워크플로우 평가 벤치
- Medium reasoning에서도 Fable 5 대비 11포인트 앞서며 비용은 1/4
- Artificial Analysis Intelligence Index: Soul Max가 Fable 5와 1포인트 차이, 시간은 61% 단축, 비용 절반
- BrowseComp: Soul Ultra $12.17/task, 92% pass rate (업계 선도)
- Terminal Bench 21 & DeepSWE SWE: 모두 최고 점수
- Coding Agent Index: Soul Max 97 (다음이 Fable 77, Grok Build 76)
2-2. "절대 포기하지 않는다"의 구체적 사례
- GPT-5.5: 잘못된 파일을 읽으면 context가 오염되어 목표를 잃고 헤맸음
- GPT-5.6: context 압축(compaction)이 제대로 작동하여 긴 실행 중에도 트랙을 잃지 않음
- Max reasoning 모드: 5시간 창을 30~50분 만에 소모할 만큼 공격적으로 작동
- Mitchell (Terraform/Ghosty 창시자): "더 빠르고, Fable만큼 잘 계획/판단하며, 전반적인 작업 품질이 더 좋음"
- Tim (Next.js 팀): "아키텍처 트레이드오프를 이해하고, 복잡한 이슈를 조사하며, 버그 수정 시 코드베이스 전체를 고려함. 짧은 프롬프트로 충분"
2-3. Soul / Terra / Luna 모델 포지셔닝
- Luna: 오케스트레이터가 호출하는 서브 모델. 직접 드롭다운에서 선택하지 말 것. 브랜치 네이밍, 타이틀 생성, 데이터 처리에 적합
- Terra: 일상 작업용 균형 모델. 예산 제한 코딩에 최적. $2.76/task로 거의 모든 프론티어 모델보다 저렴. 55 medium 대체 가능
- Soul: 지능의 새로운 표준. 10분 이상 걸리는 복잡한 작업에 최적
2-4. 안전 장치 사례
- Theo 본인이 코드베이스 정리 요청을 차단당하는 경험을 직접 함
- OpenAI는 "더 낮은 capability 모델로 재시도" 옵션을 추가했지만 출시 초기엔 고장 남
- 향후 더 덜 공격적으로 조정 예정
2-5. 과도한 코드 작성 약점
- 필요한 것보다 훨씬 많은 테스트를 작성
- 다른 모델이 cleanup하러 들어가야 하는 경우 발생
- 문제에 부딪히면 우회책을 찾는데, 때로는 pseudo 권한이 없는 것을 다른 것을 통해 실행하는 등 "스케치한" 방법 사용
- VM에서 실행하고 싶을 만큼 공격적
3. 구체적 데이터/발언 (직접 인용, 수치)
가격 정보
| 모델 | 입력 | 출력 |
|---|---|---|
| Soul | $5/M | $30/M |
| Terra | $2.50/M | $15/M |
| Luna | $1/M | $6/M |
- Soul Ultra BrowseComp: $12.17/task
- DeepSWE Soul Max: $22/task vs Fable $839/task
- Terra DeepSWE: $2.76/task
플랜별 접근성
- Free/Go ($5-8 tier): Terra + Luna만 접근 가능
- 나머지 유료 플랜: 거의 모두 접근 가능
- API: 위 가격 기준, 프롬프트 캐싱 도입 (단, 캐시 요금도 청구됨 — 이전과 다름)
성능 수치
- Agent Last Exam: Soul 53.6% > Fable 5 AR 40.6% > Soul Medium (약 29.6%)
- Artificial Analysis Coding Index: Soul Max 97점
- BrowseComp: Soul Ultra 92% pass, $12.17/task
- 내부 지표: 연구 컴퓨팅 대비 AI 코딩 비중 100배 증가, 에이전틱 토큰 사용량 22배 증가
- 5.6의 연구원 1인당 일일 출력 토큰: 5.5 최고치의 2배 이상
주요 발언
Dax: "5.6이 우리 팀에 엄청난 영향을 미쳤다. 예전보다 토큰을 5배 사용하고 있다. Fable보다 더 똑똑하지도 않지만, 그냥 너무 믿음직스럽고 사용하기 즐겁다."
Jay (Dax의 상사): "팀이 5.6 없이는 문자 그대로 우울하다. 부분적으로나마 대체할 수 있는 것을 찾고 있었다."
Max: "이 모델에서 가장 인상적인 것은 절대 포기하지 않는다는 것. Max reasoning에 던지면 끝날 때까지 계속 작동한다."
Theo: "이것은 새 기반 모델이 아니다. 새 사전훈련이 아니다. 5.5의 refinement일 뿐인데, 이 능력이 이렇게 인상적이라는 게 놀랍고, 다음 사전훈련 실행이 더욱 기대된다."
Cory (Anthropic을 향한 풍자): "OpenAI 전략에 정말 혼란스럽다. 가격 인상 날짜를 찾을 수가 없고, 구독 포함 여부도 모르겠고, 직원이 말하는 것과 문서가 일치한다." (= Anthropic이 항상 잘못했던 것들을 OpenAI는 제대로 함을 우회적으로 칭찬)
Cerebras 호스팅 (예정)
- 최대 750 tokens/sec (현재 일반 40-60 tokens/sec)
- 현재 "빠른 모드"는 Cerebras가 아닌 일반 NVIDIA 기반 추가 프로비저닝
컨텍스트 창
- CodeX에서 기본 200K 제한 (전체 백만 토큰 사용 불가)
- 기본 컨텍스트: 350K (이전보다 향상)
4. 시사점과 액션 포인트
모델 선택 가이드 (Theo의 권장)
Luna 사용 시
- 직접 사용 X, 스마트 에이전트가 오케스트레이트하게 놔두기
- 브랜치 네이밍, 타이틀 생성, 대량 데이터 처리 자동화에 활용
- T3 Code 내부에서 자동으로 활용 예정
Terra 사용 시
- 예산 제한 코딩 ($20-100 CodeX 플랜)
- 55 medium 사용자의 대체 모델
- Terra X High/Max는 코딩 벤치에서 매우 좋은 성능
- Terra X High + Soul Medium 조합 고려 가능
Soul 사용 시
- 10분 이상 걸릴 복잡한 작업
- 모델이 스스로 해결할 수 있을지 불확실한 작업
- 에이전트 오케스트레이션 작업 (현재 이 수준은 Soul, Fable 5/Opus, Sonnet 5만 가능)
- Max/Ultra는 토큰 소비 극도로 주의 (30~50분 만에 5시간 창 소진 가능)
즉시 적용 가능한 팁
- 시스템 프롬프트/스킬 조정 필수: 과도한 코드 작성 억제
- VM 환경 권장: 모델이 우회책으로 의심스러운 행동을 할 수 있음
- 체크인 유지: 신뢰는 하되 자주 검토. "소스에 빠져드는" 것 방지
- 프로그래매틱 도구 호출: context 오염 방지를 위해 중간 결과를 필터링하여 모델에 전달
- Codex 사용 시: 컨텍스트 200K 제한 감안하여 작업 설계
향후 예정 콘텐츠
- Soul vs Fable 심층 비교 (곧 출시 예정)
- Ultra 전용 심층 영상
- 이미 GPT-6 작업 중이라는 소문 있음 (이달 출시는 불가능하다고 Theo 판단)
처리: 2026-07-13 | 영상 길이: 약 20-25분 추정
