요약: OpenAI의 새 모델 "GPT o3 Soul"(56)이 Codex에서 엄청난 속도로 rate limit을 소진하는 문제를 다루며, 이를 관리하는 실전 팁과 best practices를 공유한다.
1. 핵심 주장 (3-5개)
주장 1: GPT o3 Soul(56)은 이전 모델(55)보다 rate limit을 훨씬 빠르게 소진한다
GPT o3 Soul은 이전 GPT 모델(55)과 달리 도중에 멈추지 않고 끝까지 달려가기 때문에, 단일 메시지로 5시간 limit의 15%까지 사용할 수 있다. 이전에는 55가 매우 자주 멈추고 피드백을 요청했기 때문에 limit에 걸리지 않았다.
주장 2: OpenAI가 5시간 limit을 임시로 제거했으나, 이는 오히려 주간(weekly) limit을 한 번에 소진할 위험을 만든다
지금은 5시간 제한이 없어졌지만, 그 안전망이 사라졌기 때문에 Ultra 같은 무거운 작업으로 주간 한도 전체를 한 방에 날릴 수 있다.
주장 3: Ultra 기능은 현재 사용하지 말 것 — 명백히 cost 대비 가치가 없다
Ultra는 실험적이고 극도로 비싸므로, 전용 후속 영상을 보고 나서 사용 여부를 결정하라.
주장 4: 프롬프트에 "stop sign"을 명시하는 것이 rate limit 관리에 가장 효과적인 방법이다
모델에게 언제 멈출지를 명시적으로 지시하면, 불필요한 토큰 소비를 줄이면서도 작업 완성도는 높일 수 있다.
주장 5: context window를 수동으로 줄이라는 조언은 잘못된 것이다 — 오히려 역효과
OpenAI 팀이 직접 확인: context limit 기본값은 56 Soul에 최적화되어 있으며, 임의로 줄이면 compaction이 더 자주 발생하고 비용이 증가한다.
2. 근거와 사례
GPT o3 Soul의 rate limit 소진 속도 문제
- 55 시절: 한 메시지당 5시간 limit의 0.1~2% 사용
- 56 Soul: 한 메시지당 5시간 limit의 최대 15% 사용 (X High, Max 추론 레벨)
- 55는 매 단계마다 멈추고 확인 요청 → 실제 토큰 소비가 적었음
- 56은 멈추지 않고 끝까지 실행 → 훨씬 더 많은 작업을 하지만, 더 많은 토큰 소비
- Theo 본인: 55 시절 limit에 한 번도 안 걸렸지만, 56 Soul 이후 매번 limit 도달
OpenAI의 rate limit 구조 변경
- 기존 구조: 5시간 rolling limit + 주간 limit (주간 = 5시간 limit × 4~5회)
- 변경 후: 5시간 limit 임시 제거, 주간 limit만 적용
- 위험성: 5시간 limit이 있었을 때는 최대 주간의 25%만 한 세션에 사용 가능. 이제 제한 없음.
- Theo 본인: 크론잡으로 5시간마다 "hello" 메시지를 보내 항상 5시간 타이머를 켜두는 트릭 사용 → 이제 불필요
추론 레벨별 효율성
- OpenAI Open Code 팀이 내부적으로 설정 오류로 항상 Medium 레벨로 사용
- 팀 전체가 "최고의 모델"이라고 동의 → Medium도 충분히 훌륭함
- Theo 권장: soul high를 기본값으로, 필요시 soul low나 Terra 실험
- Terra: Artificial Analysis 분석에 따르면 Soul/Luna보다 intelligence vs cost 차트에서 전반적으로 열세
- Luna(low) ≈ Soul(low)보다 약간 우수하면서 비용 거의 동일
- Terra는 이 라인 아래에 위치
벤치마크 수치 (Cursor Bench 기준)
- Fable: 32점 (최소 $1 per task)
- GPT o3 Soul + Max: 67.2점, $13 per task
- GPT o3 Sol + Low: $1.86, 61점
- Max 가격: $839 per task (최고 스코어)
context window 잘못된 조언 사태
- 많은 사람들이 "context window를 수동으로 줄여라"는 조언을 SNS에 퍼뜨림
- Tibo(OpenAI) 공식 반박: "270K context가 56 Soul에 최적화된 기본값. 바꾸지 말 것"
- 추가: OpenAI가 272K → 372K 변경을 시도했다가 usage tracking 오류가 발생, 임시 되돌림
- 10% inference 비용 절감 최적화도 별도로 배포됨
3. 구체적 데이터/발언 (직접 인용, 수치)
"With 56, it's so unlikely to stop that I feel like I have to put up the stop signs myself."
"Small PR with 56 Soul consumes about half of my 5-hour limit. Not going to lie, GBD56 soul is great and all, but the usage drain is whack."
"I waxed a weekly and a half on one message in X high."
"On higher reasoning levels, especially X high and max, 56 can use up to 15% of my 5-hour limit in one message."
"I took the time to write an article sharing my advice here, but since then quite a bit has changed even though it's been 24 hours."
"Ultra is not worth using at the very least until you wait for that follow-up video. For now, Ultra, no."
"We do not charge extra above 270K context and the context threshold has been tuned for 56 soul to be perfect with a default limit." — Tibo(OpenAI)
"The whole team agreed it was their favorite model [despite accidentally running on Medium the whole time]."
"I made a bunch of these changes myself and I've actually noticed the quality of outputs going up while also using as little as a fourth or a fifth as many tokens as I was before."
수치 정리:
| 항목 | 수치 |
|---|---|
| 55 한 메시지 limit 소비 | 0.1~2% |
| 56 Soul 한 메시지 limit 소비 (X High/Max) | 최대 15% |
| 주간 limit = 5시간 limit × | 약 4~5회 |
| Open Code 팀 90% 성공률 vs 목표 50% | G2I 파트너십 결과 |
| 10% 비용 절감 | OpenAI 인퍼런스 최적화 |
| 6백만 active users | OpenAI Codex 현재 규모 |
| Terra 벤치 (Cursor Bench) | Soul/Luna 대비 열세 |
4. 시사점과 액션 포인트
즉각 적용 사항
-
Ultra 사용 금지 (후속 영상 보기 전까지) — 주간 limit을 한 방에 날릴 수 있음
-
context window 수동 설정 제거 —
~/.codex또는agents.md에 context limit 설정이 있다면 제거. OpenAI 기본값이 최적. -
추론 레벨을 Medium 또는 High로 설정 — X High/Max는 비용 대비 효율이 낮음. Open Code 팀도 Medium으로 훌륭한 결과를 냄.
-
프롬프트에 명시적 "stop sign" 추가
예시 1 (중간 체크포인트): "이 기능을 빌드해줘. 먼저 계획을 작성하고, 계획 완성 후 멈춰서 피드백을 요청해." 예시 2 (완전 자율 실행): "계획대로 빌드해줘. computer use로 테스트하고, 코드가 작동할 때까지 계속해. PR 올리고, 첫 번째 리뷰 코멘트 반영까지. 그 후에 멈춰." -
agents.md와 Claude MD 파일 직접 수정하며 실험 — 남의 설정 복사 금지. 직접 변경하며 모델 반응 관찰.
-
Terra 사용 재고 — Artificial Analysis 기준 Soul/Luna 대비 cost-performance 열세 확인됨.
전략적 시사점
-
AI 코딩 에이전트의 경제학 변화: 모델이 더 자율적으로 일할수록 비용 구조도 완전히 달라진다. "얼마나 많이 질문할 것인가"보다 "언제 멈출 것인가"가 핵심 변수.
-
OpenAI의 운영 문제: 72시간 내 여러 번 rate limit 정책이 바뀐 것은 product 안정성 문제. 실시간으로 바뀌는 환경에 적응하는 능력이 사용자에게 요구됨.
-
"Claude in Codex" 가능성: Theo가 Claude Code에서 GPT o3 Soul을 모델로 사용하는 "Claudeex" 실험 중. 에이전트 생태계의 interoperability가 빠르게 발전 중.
-
커스터마이징의 가치: 표준화된 셋업보다 개인화된 agents.md/config가 실질적 성능 차이를 만든다는 실증적 확인.
저장: 2026-07-13 | 출처: https://www.youtube.com/watch?v=sKmrLtB47WA
