핵심 주제 1: Fable 5 첫인상과 모델 철학의 전환
Fable 5의 충격적인 경험
- "Fable 5가 나를 one-shot했다" — 과장이 아닌 실제 감각
- 처음 하루는 appreciate, 이틀 동안 사용하면서 진정으로 사랑하게 됨
- 모델이 사라졌을 때 Opus 48, GPT-5.5로 버텼지만 "같지 않았다"
복귀 후 성과
- 모델이 돌아온 첫날, 이전 한 달보다 더 많은 작업 완료
- 계획하고 생각만 했던 것들을 모델이 실제로 구현하고 머지까지 완료
- 2~3일 만에 Lakebed 프로젝트에서 11~12개의 PR 머지 (자신 혼자가 유일한 contributor)
Fable 5가 이전 모델과 다른 근본적 차이
- "이 모델은 더 나은 Opus가 아니다"
- Opus용 프롬프트를 그대로 사용하면 차이를 느끼기 어려움
- 차이점은 얼마나 더 멀리 갈 수 있느냐: 코드 작성 → 테스트 → 검증 → 서브에이전트 분기까지 end-to-end 실행 가능
핵심 주제 2: 비용 최적화 — Reasoning Effort 설정
핵심 규칙: High 이하만 사용할 것
- X High, Max, Ultra Code는 위험하다
- 슬롯머신처럼 유혹적이지만 더 나쁜 결과를 낳는다
왜 High가 최선인가
- X High/Max는 각 도구 호출 당 너무 많이 생각함 → 단순 작업도 과도하게 처리
- Reasoning effort는 실행 시간이 아니라 스텝 당 사고량을 결정
- 500 스텝짜리 작업에서 max는 더 많은 스텝을 하는 게 아니라, 각 스텝에서 더 많이 생각
- Anthropic도 Ultra Code를 내부적으로 High로 실행 (Ultra Code = High + 더 많은 에이전트)
비용 영향
- High 이하로 낮추는 것만으로 청구서가 절반 이상 줄어들 수 있음
- Fable 사용 중 불만을 토로하는 사람 대부분이 X High, Max, Ultra Code 사용자
핵심 주제 3: Claude Code에서 Codex(GPT-5.5) 연동
왜 Codex를 사용하는가
- Codex 구독의 사용량 한도가 매우 관대함 (~월 1만 4천 달러 상당의 추론)
- Computer use에서 OpenAI가 Anthropic을 압도: Mac 앱 실제 조작, Xcode 설정 가능
- 로그 분석, 대용량 PDF 읽기, 수백 장 스크린샷 처리 등 토큰 집약적 작업에 최적
모델별 특성 비교 (Theo의 평가)
| 모델 | 비용 | 지능 | 취향(Taste) |
|---|---|---|---|
| GPT-5.5 | 낮음(9/10) | 높음 | 낮음 — Python처럼 쓰는 TypeScript |
| Sonnet 5 | 중간 | 낮음 | 중간 |
| Opus 48 | 중간 | 중상 | 높음 |
| Fable 5 | 높음 | 최고 | 최고 |
용어 정의 (Claude.md 글로서리)
- 지능(Intelligence): 감독 없이 처리할 수 있는 문제의 난이도
- 취향(Taste): UI/UX, 코드 품질, API 설계, 카피라이팅
Claude.md 설정 방법
- 컴퓨터 사용이 필요하면: "GPT-5.5 with Codex로 shell out하라"
- 비용 우선순위: 지능 > 취향 > 비용 (절대 비용 때문에 품질 타협 금지)
- 기본값은 override 가능: 저렴한 모델 결과가 부족하면 묻지 않고 더 비싼 모델로 재실행
- Haiku는 절대 사용 금지 — 5.5가 사실상 무료인 상황에서 무의미
핵심 주제 4: Skills 설정 — Codex 활용 3가지 스킬
Codex Review 스킬
- 커밋되지 않은 변경사항, 브랜치 diff, 특정 구현에 대한 독립적 코드 리뷰 요청
- 서브에이전트가 Codex를 호출하고 결과를 부모 모델에 전달하는 구조
- "Codex가 아무것도 못 찾으면 그것을 명확히 말하고, 어떤 리뷰 대상을 검사했는지 언급하라"
Codex Implementation 서브에이전트
- 워크트리에서 범위가 정해진 작업을 수행
- 실질적인 코드 변경 후 결과를 부모 모델에 반환
Codex Computer Use 스킬 (가장 선호)
- 브라우저 자동화, 시뮬레이터, 스크린샷, 앱 실행 등 컴퓨터 사용이 필요한 검증에 사용
- Claude가 Codex의 컴퓨터 사용 능력을 비용 효율적으로 활용 가능
- 스킬 설명에서 모델이 언제 호출할지 판단: "테스트 흐름을 검증할 때, UI 동작을 확인할 때"
스킬 활용 원칙
- 스킬 설명(description)은 모델이 언제 호출할지 결정하는 핵심 정보
- 본문은 실제 호출 시에만 로드됨
- 직접 copy-paste 금지 — 이해하고 자신에게 맞게 수정해야 함
핵심 주제 5: Lakebed 프로젝트 사례 — 실전 워크플로우
시작: 16개의 쌓인 PR 정리
프롬프트 예시:
"Lakebed의 오픈 PR을 조사하고 리뷰하라. 머지 준비 완료인 것, 리베이스/소수 수정이 필요한 것, 기존 PR에 의해 trumped된 것, 좋은 아이디어지만 재작성이 필요한 것을 분류하라. 워크플로우를 사용해 여러 리뷰어가 결정을 검증하게 하라."
모델의 실행 결과
- 총 48개 에이전트 생성
- PR당 1개 investigator(16개) → 각 verdict를 Fable + Opus 판사 패널이 stress test
- 14/16 판정에서 만장일치, 나머지 2개는 직접 해결
- 실행 순서 제안, 머지/종료 대상 명확히 분류
계획 단계: HTML 플랜 생성
- 불필요한 PR 모두 종료 후, 남은 5개 기능에 대한 HTML 형식의 상세 구현 계획 작성
- 각 플랜에 관련 PR 링크 포함
- 모바일에서도 편리하게 읽기 가능
실행 단계: 워크플로우 vs 수동 워크트리 결정
모델의 판단:
- 단일 워크플로우 X: 결정론적 스크립트는 체크포인트 중간 인간 판단 처리 불가
- 수동 워크트리 X: 모델이 직접 워크트리를 생성하면 됨
- 최적 방법: 현재 세션에서 오케스트레이션 + 워크트리로 구현 분기 + 워크플로우는 PR 머지 전 멀티에이전트 리뷰에만 활용
Goal 기능으로 자율 실행 (5.5시간)
Goal: "논의한 모든 작업 완료 — 워크트리 생성, 리베이스, 브랜치, PR 머지/종료. 자동 코드 리뷰어(BugBot, Microscope, Code Rabbit)가 승인할 때까지 머지하지 마라."
- 결과: 5시간 연속 실행하며 한 달치 로드맵 구현 완료
- 총 비용: ~$150 (Fable + 연동된 모든 모델 포함)
- Claude Code 구독 40%, Codex 구독 15% 사용
안전성 확보 방법
- 프로덕션 배포는 항상 인간 승인 (모델은 staging에만 접근)
- staging 환경 검증 → main 머지 → 사람이 직접 prod 배포
- 머지 후 별도 에이전트로 검증: 새 기능 테스트, 기존 기능 회귀 테스트, prod-main diff 분석
- 검증에 쓴 토큰이 구현에 쓴 토큰보다 많았지만 수정사항은 거의 없었음
핵심 주제 6: 복잡도 지표로서의 실행 시간
소요 시간 = 코드베이스 건강 지표
- 3분 미만: 단순 수정, 자신있게 PR 제출
- 15분: 주의 필요, 코드를 꼼꼼히 검토
- 1시간 이상: 아키텍처 문제 신호, 더 깊이 파고들어야 함
사례
- 슬라이드 백 동작 버그: 2분 20초 수정 → 즉시 머지 검토 가능
- 모바일 스레드 스크롤 점프 버그: 1시간 30분 → 신중하게 검토 필요
모델에게 질문하는 것의 중요성
- 코드 읽기 외에 아키텍처, 요청 의도, 수행 속도, 변경 범위를 사람이 판단해야 함
- 불확실할 때는 물어보면 됨 — "아직 drawer가 있나요?" 등
핵심 주제 7: T3 Code와 멀티 머신 활용
T3 Code의 역할
- SSH보다 편리한 원격 머신 접속 (이미지 붙여넣기, 정상적인 스크롤)
- Tailscale로 다른 머신의 Claude Code 세션에 접속 가능
- 모바일 앱: 컨퍼런스 참석 중에도 작업 가능 (오픈소스, 직접 빌드 가능)
멀티 머신 워크플로우
- 이벤트 참석 중 모바일로 버그 발견 → 워크트리 생성 → 수정 요청
- 여러 워크트리의 변경사항을 단일 브랜치로 병합 (충돌 자동 처리)
- 한 머신에서 구현 → 다른 머신으로 검증
T3 Connect
- Tailscale 설정 없이 동일한 혜택을 제공하는 서비스 (개발 중)
핵심 주제 8: 추가 팁과 원칙
Claude.md 관리 원칙
- 사용하면서 문제가 생기면 "이 문제를 앞으로 어떻게 예방할까?" 물어보기
- 모델이 제안하는 변경사항의 절반 정도만 적용
- 특정 기술 스택 선호도, 코드 스타일, 모델 선택 기준 등 포함
- 편집을 두려워하지 마라 — 작은 변경으로도 워크플로우가 크게 개선됨
Vibe Proxy
- 한도 도달이 걱정될 때 여러 계정에 트래픽 분산
- API 키 버전의 Claude Code 필요 (일부 내장 기능 제한)
Workflows vs 서브에이전트 구분
- 서브에이전트: 여러 파일을 병렬 분석하는 등 개별 작업 분기
- 워크플로우: 단계를 프로그래밍 방식으로 정의 — Stage 1 완료 결과로 Stage 2 동적 큐잉
총 정리
Fable 5는 단순히 더 좋은 코딩 모델이 아니라, end-to-end 소프트웨어 개발 파이프라인을 자율적으로 실행할 수 있는 모델이다.
성공 공식:
- Reasoning effort를 High 이하로 유지
- 비용이 많이 드는 작업은 Codex(GPT-5.5)로 위임하도록 Claude.md 설정
- Goal 기능과 워크트리로 장시간 자율 실행 허용 (단, 프로덕션 배포는 인간이 담당)
- 소요 시간을 코드 복잡도의 지표로 활용
- 계속 Claude.md와 스킬을 수정하며 자신만의 워크플로우를 최적화
