URL: https://www.youtube.com/watch?v=jgGyX7MPPVg
원본 발행일: 2026-09-23
채널: Theo - t3․gg
📌 핵심 질문 / Opus 5.5는 Opus 5의 실패를 고치고 Fable의 대안이 될 수 있는가?
==Opus 5.5는 Opus 5보다 저렴하고 빠르며, 코드 품질과 지시 따르기, 장시간 협업에 필요한 문장 명료성을 크게 개선했지만, 최대 추론(max reasoning)에서 토큰을 과도하게 소모하고 컨텍스트 창(context window)을 불필요하게 걱정하는 특이점은 남아 있다.==
- Opus 5.5는 대부분의 작업에서 Fable 5.1 수준의 성능을 내면서 Opus 5보다 실행 비용이 40% 낮다고 발표됐다.
- 기본 입출력 토큰 단가, 캐시 읽기 비용, 응답 속도, 장시간 대화에서의 의사소통이 모두 개선됐다.
- 중간 추론(medium)은 가격 대비 성능이 뛰어나지만, 최대 추론(max)은 10배 넘는 토큰을 쓰면서 점수는 거의 올리지 못한다.
- 프런트엔드의 미세한 디자인 감각에서는 Fable이 여전히 앞서고, 대규모 코드베이스의 철저한 리뷰에서는 OpenAI 계열 모델이 더 강할 수 있다.
Opus 5.5는 매일 사용하는 기본 코딩 모델로는 매우 강력한 선택이다. Fable을 완전히 대체했다고 단정할 단계는 아니지만, Claude 구독의 제한 안에서 얻는 실제 작업량과 병합 가능한 코드의 비율은 크게 좋아졌다.
메타데이터
- 콘텐츠 유형: YouTube 심층 다이제스트
- 처리일: 2026-09-24
- 원본 언어: 영어(English)
- 주요 인물: Theo, Anthropic, OpenAI, WorkOS, Parallel
- 주요 모델·도구: Opus 5.5, Opus 5, Sonnet 5.5, Haiku 5.5, Fable 5.1, Astra, Grok 4.7, Mimo V2.6, Claude Code, Computer Use, Artificial Analysis
- 주제 분류: AI·LLM·에이전트 / 개발 생산성
1. Opus 5.5가 등장한 배경
Opus 5.5는 Anthropic의 이전 출시 흐름과 Opus 5의 실망을 정면으로 뒤집으려는 업데이트로 평가된다.
1.1. Opus 4.5가 만든 전환점
-
AI 코딩 방식의 변화
- 약 10개월 전 Opus 4.5가 출시되면서 개발자가 AI에게 코드 변경을 지시하는 수준을 넘어, AI가 컴퓨터에서 코드를 직접 관찰하고 작업하는 방식이 본격화됐다.
- Opus 4.5는 2025년 11월 출시됐고, Sonnet보다 훨씬 비싸서 개발자의 기본 선택이 되기는 어려웠지만 코드 작업 방식 자체를 바꾼 모델로 남았다.
-
이례적인 버전 명명
- Anthropic은 숫자를 여러 단계 건너뛰고 5가 아니라 4.5라는 이름을 선택했다.
- 코드 사용법을 혁명적으로 바꾼 모델인데도 5라는 메이저 버전명을 쓰지 않은 점이 출시 당시부터 특징으로 남았다.
1.2. Opus 5가 만든 신뢰 하락
-
이후 출시의 불안정성
- Anthropic은 Fable 계열에서 인상적인 결과를 냈지만, 이후 모델 출시 대부분은 좋게 말해도 불안정했고 특히 Opus 5와 Sonnet 5가 기대에 미치지 못했다.
- Theo 역시 Opus 5가 처음에는 잘 작동하는 것처럼 보여 기대했지만, 코드를 설명하는 장황한 텍스트와 핵심을 자주 놓치는 코드가 결합되면서 일상 업무에 믿고 맡길 수 없는 책임(liability)이 됐다고 평가했다.
-
Opus에 대한 기대가 남은 이유
- Anthropic의 모델 구독 중 사용하지 않는 나머지 절반을 채울 모델이 필요했고, Opus 4.5가 컴퓨터를 직접 지켜보며 코딩하던 경험에 대한 애착도 남아 있었다.
- 그래서 새 모델이 Opus 5.1이 아니라 5.5라는 사실에 놀랐고, Anthropic이 스스로 매우 높은 기준을 세웠다고 봤다.
-
첫날의 판단
- 하루 종일 사용한 초기 경험에서 Opus 5.5는 더 저렴하고, 글을 덜 망치며, 코드와 지시를 더 잘 처리하고, 일상적인 작업을 더 잘 수행했다.
- Fable을 무너뜨릴 모델인지 아직 단정할 수는 없지만, Opus 5.5가 사용자를 크게 놀라게 한 것은 분명하다고 평가했다.
2. 공개된 변경점과 초기 공식 주장
Anthropic은 Opus 5.5를 성능뿐 아니라 비용, 속도, 문장 구성, 안전성까지 손본 모델로 포지셔닝했다.
2.1. 스폰서 구간: 에이전트 인증의 빈틈
-
WorkOS와 OMD 표준
- Theo는 촬영 준비 중 여러 대시보드를 열고 로그인하는 작업을 Codeex의 Computer Use에 맡겼지만, 여러 사이트에 에이전트용 인증·권한 위임 방식이 없어 에이전트가 반복적으로 실패했다고 설명했다.
- WorkOS가 Cloudflare와 Firecrawl과 함께 만든 OMD는 에이전트가 사용자를 대신해 인증하거나 사용자를 위해 사전에 설정을 준비하는 표준을 목표로 한다.
-
기업용 인증의 현실
- Neon, Recent, Parallel, Monday 등 여러 회사가 이 표준을 채택하고 있으며, WorkOS는 OpenAI와 Anthropic이 신뢰하는 엔터프라이즈 인증 플랫폼으로 소개됐다.
- Okta, ADP, Duo 같은 기업 시스템을 설정해 본 사람이라면 복잡한 관리자 절차가 얼마나 고통스러운지 알 수 있고, WorkOS에서는 다른 회사의 IT 팀에 링크 하나를 보내 관리자 포털에서 연결할 수 있다고 설명했다.
- 안내 링크는
atv.link/workos로 제시됐다.
2.2. 출시 시점과 공식 성능 주장
-
연속된 대형 모델 출시
- 이틀 동안 Grok 4.7, Opus 5.5, GPT6 Soul, Luna가 연이어 출시됐고, Theo는 이 급격한 변화 때문에 구독과 추가 분석을 권했다.
- 그는 구독자 수가 전체 시청자의 절반보다 적으며, 새 모델을 계속 따라가려면 긴 영상이 필요하다고 농담했다.
-
Anthropic의 핵심 주장
- Opus 5.5는 대부분의 작업에서 Fable 5.1 수준으로 작동하면서 Opus 5보다 실행 비용이 40% 낮다고 제시됐다.
- Anthropic이 프런티어 기술의 속도를 늦추자고 요구한 뒤 내놓은 첫 출시라는 설명도 붙었지만, Theo는 그 정책적 의미는 다음 영상으로 미루고 실제 사용성에 집중했다.
- 한 테스터는 68만 줄 규모의 코드 마이그레이션을 하루가 되기 전에 끝냈고, 소프트웨어의 비효율을 찾아 고치는 작업에서도 성능이 확인됐다고 한다.
- Theo도 성능 최적화처럼 난도가 높은 작업에 Opus 5.5를 투입한 결과에 감탄했으며, 안전성에 관해서는 Anthropic의 설명을 신뢰한다고 말했다.
2.3. 가격·캐시·속도
-
토큰 단가와 캐시 읽기
- 기본 설정의 일반적인 작업에서 Opus 5.5의 비용은 Opus 5보다 40% 낮다.
- 입력 토큰은 백만 개당 4달러, 출력 토큰은 백만 개당 20달러로 이전보다 20% 저렴해졌다.
- 캐시 읽기(cache read)는 백만 토큰당 0.20달러로 내려가 이전보다 60% 저렴해졌다.
-
처리 속도와 효율의 긴장
- 체감 속도는 약 30% 빨라졌고, 토큰을 많이 먹는 Opus의 단점이 일부 완화됐다.
- 다만 속도가 빨라진 것이 토큰 효율이 좋아졌다는 뜻은 아니다. 최대 추론에서는 오히려 Opus 5보다 훨씬 많은 토큰을 생성한다.
2.4. 의사소통 품질과 후속 모델
-
더 자연스러운 협업 문장
- Opus 5.5는 이전 모델보다 자연스럽게 소통하고, 중요한 정보를 앞에 배치하며, 긴 세션에서 작업 파트너로 따라가기 쉬운 글을 쓴다.
- 초기 테스터는 이를 “내가 쓰는 방식으로 글을 쓴다(It writes the way I do)”라고 표현했다.
- 읽기 쉽고 따라가기 쉬운 출력은 실용성뿐 아니라 안전성에도 도움이 된다. 사용자가 모델의 계획과 변경 내용을 정확히 이해할 수 있기 때문이다.
-
Sonnet과 Haiku의 예고
- Sonnet 5.5와 Haiku 5.5가 몇 주 안에 뒤따를 예정이며, Haiku 신제품은 1년 만의 출시가 된다.
- Anthropic은 저가·소형 모델에서 OpenAI에 크게 밀려 왔지만, 대형 모델에서는 현재 강한 우위를 확보한 것으로 평가됐다.
3. 벤치마크와 가격 대비 성능
공개 벤치마크는 Opus 5.5의 우위를 보여주지만, 평가 방법과 추론 강도에 따라 결과를 신중히 해석해야 한다.
3.1. 코드 벤치마크의 강세
-
Terminal Bench 4
- Opus 5.5 Medium은 Fable 5.1 Max보다 높은 점수를 기록하면서도 작업 비용은 Fable의 약 20달러에 비해 2.94달러였다.
- 중간 추론이 최대 추론보다 실제 가격 대비 성능에서 더 강한 사례가 됐다.
-
Frontier Code와 Cursor Bench
- Frontier Code는 추론 수준이 올라갈수록 점수가 일관되게 상승하지 않는 이상한 벤치마크지만, Opus 5.5는 Medium과 Max에서 새로운 최고점을 기록했고 Medium 점수가 가장 높았다.
- Cursor Bench에서는 OpenAI가 Cursor의 모델 사용을 막아 Astra가 더 이상 포함되지 않지만, Fable 5.1과 비교하면 Opus 5.5 Medium이 대부분의 실제 코드 벤치마크에서 더 높은 점수를 보였다.
- 다른 벤치마크가 갱신되지 않아 DeepSuite 등 일부 결과는 아직 기다려야 한다는 불만도 제기됐다.
-
Artificial Analysis 비교
- Opus 5.5 High는 Astra High보다 비싸지만, Artificial Analysis 점수는 53으로 Astra의 50.9보다 의미 있게 높았다.
- Opus 5.5는 성능 50점 이상 구간의 Pareto frontier, 즉 각 성능 수준에서 가장 싼 선택지를 잇는 선을 사실상 모두 차지했다.
- Grok 4.7과 4.6은 더 비싸면서도 점수가 낮아 경쟁에서 뒤처졌고, Mimo V2.6은 가격 대비 성능이 좋아 Luna 계열로 내려가기 전 구간을 매끄럽게 채웠다.
3.2. 토큰 소비가 숨기는 실제 비용
-
모델별 작업당 토큰 수
- Opus 5 Max는 작업당 약 7만 3천 토큰, Fable은 7만 8천 토큰, Opus 5.5 Max는 거의 12만 토큰을 사용했다.
- GPT6 Astra는 작업당 약 2만 7천 토큰만 사용해 Opus 5.5 Max와 약 4배의 효율 격차를 보였다.
- 두 배 빨라도 네 배 많은 토큰을 생성하면 실제 비용 이점이 사라질 수 있다.
-
작업당 비용
- Artificial Analysis 비교에서 Opus 5는 작업당 5.86달러, Opus 5.5는 거의 6달러, Fable 5.1은 약 7.63달러로 나타났다.
- Opus 5.5가 토큰을 두 배 가까이 생성하는데도 가격이 크게 오르지 않은 이유는 입력·출력 단가를 낮추고 캐시 읽기 비용을 줄였기 때문이다. 가격 인하가 없었다면 80% 더 비싸졌을 것으로 분석됐다.
-
추론 수준별 비용
- XH High는 Astra Max에 가까운 비용을 보였지만, High로 낮추면 Astra Max의 약 절반 가격까지 내려갔다.
- Medium은 작업당 약 1.34달러로, Astra의 약 3.26달러와 Opus 5.5 Max의 약 6달러보다 훨씬 저렴했다.
- Medium이 Fable 5.1 수준의 지능을 1.34달러에 제공한다는 평가는 다소 과장일 수 있지만, 가격 차이는 분명히 크다.
3.3. 최대 추론을 피해야 하는 이유
-
점수 대비 토큰 폭증
- Skatebench에서 Opus 5.5의 점수는 괜찮았지만 Opus 5보다 오히려 낮았고, 획기적인 향상은 없었다.
- XH High는 질문당 약 330개의 추론 토큰을 썼지만 Max로 한 단계 올리자 약 5,000개까지 늘어났다.
- 10배가 넘는 토큰 증가에 비해 점수 상승은 약 1%에 불과했고, 비용만 10배 이상 늘었다.
-
실제 작업에서의 무한 루프
- Theo는 Max 설정으로 마크다운 계획을 작성하게 했다가 6시간 30분 동안 모델이 루프를 돌며 끝내지 못한 경험을 했다.
- 작업을 중단하고 XH High로 바꿔 업데이트를 요청했더니 계획은 절반만 완료돼 있었다.
- Opus 5.5에서 Max는 토큰을 불태우는 선택에 가깝고, Low는 가격에 비해 능력이 부족하므로 Medium·High·XH High가 실용적인 구간이다.
4. 실제 코딩 작업과 기업 사용성
Opus 5.5의 가장 큰 가치는 단일 벤치마크 점수보다 구독 한도 안에서 실제 업무를 얼마나 안정적으로 끝내는가에 있다.
4.1. 데이터 보존 정책과 기업 채택
-
Zero Data Retention의 차이
- Fable 계열은 적절한 Zero Data Retention(ZDR)을 제공하지 않아 데이터를 저장하지 않는 공급업체만 사용할 수 있는 기업이 채택하기 어렵다.
- Opus에는 ZDR 정책을 적용할 수 있으므로 기업이 직원에게 활성화하기 쉽고, 가격 대비 성능뿐 아니라 이 조건 때문에 기업용 코딩 모델 1위 자리를 유지해 왔다.
-
출력 방식 개선과 공개 문화
- Opus 5의 출력은 “extra drop” 같은 모호한 표현과 불필요한 긴 대시가 많아 사용자가 변경 내용을 이해하기 어려웠다.
- Opus 5.5는 “추가 비용은 billing refactor의 버그에서 발생했다. 무료 요금제 변경은 Acme의 8월 비용 중 1.50달러만 설명하고, 나머지 9.92달러는 특정 커밋의 버그에서 발생했다”처럼 원인과 전후 변화를 명확히 분리한다.
- Anthropic이 Opus 5의 실패를 인정하는 듯한 장난스러운 게시물을 올린 점, 직원들이 외부에서 더 자유롭게 발언하는 분위기가 된 점도 문화적 변화로 평가됐다.
4.2. 하루 사용량과 작업 사례
-
Claude 구독에서의 사용량
- Theo는 Fable 5.1을 좋아해 Claude 구독을 5개 보유하고 있으며, Opus 5.5를 하루 종일 강하게 사용하고도 한 계정의 주간 사용량이 약 40%에 그쳤다.
- 그중 절반가량은 직전 이틀 동안 Fable을 쓴 사용량이므로 Opus 5.5가 차지한 실제 비중은 주간 한도의 약 20%에 가깝다.
- 5시간 제한도 더 넉넉해졌고, Theo는 아직 한도에 가까이 가지 못했다.
-
실제 제작·배포 작업
- Opus 5.5는 Artificial Analysis 데이터를 읽어 더 보기 좋은 자체 시각화 도구를 만들었다.
- 같은 도구를 여러 호스팅 환경으로 포팅하고 기능을 추가했으며, Computer Use로 원본 사이트에서 데이터를 가져오고 결과를 검증했다.
- Lakebed 프로젝트에서 버그를 발견하자 컴퓨터를 탐색해 저장소를 찾고, 오래된 로컬 클론을 갱신하고, worktree를 만들고, 수정 PR을 작성하고, 검증하고, 병합하는 전 과정을 수행했다.
- 이 작업들을 합쳐도 주간 사용량의 약 1%만 소모됐다.
-
Codeex와의 비교
- Astra는 능력은 있지만 결과가 들쭉날쭉하고 너무 비싸며, Soul은 후속 검토 대상이다.
- 200달러 Claude 구독에서 얻는 Opus 5.5의 실질 가치는 현재 Codeex 구독보다 훨씬 낫다고 평가됐다.
4.3. 대규모 코드 리뷰의 약점
-
모델별 코드베이스 탐색 성향
- Theo가 만든 벤치는 대규모 코드베이스를 깊이 파고들어 품질 개선안을 제시하고, 모든 문제를 찾아내는 능력을 측정한다.
- Grok 4.7은 Cursor의 Bugbot과 코드 리뷰 파이프라인에서 얻은 데이터 덕분에 코드 세부 사항을 철저히 검토하는 데 특히 강하다고 추정됐다.
- Soul도 이 작업에서 강하고, Opus와 Fable은 상대적으로 약하다.
-
Opus 5에서 5.5로의 개선
- Opus 5.5는 이 벤치에서 Opus 5보다 발견의 정확도와 신뢰도가 거의 두 배로 좋아졌다.
- Gemini 3.8 Flash는 예상대로 낮은 수준의 결과를 냈다.
- Opus 5.5는 OpenAI의 Frontier 계열만큼 모든 문제를 꼼꼼히 찾는 모델은 아닐 수 있지만, 이런 철저한 리뷰는 2주에 한 번 정도 수행하는 특수 작업이며 매일의 기본 사용 사례는 아니다.
5. 프런트엔드와 3D 제작 능력
Opus 5.5는 3D·게임·애니메이션 제작에서 큰 도약을 보였지만, 섬세한 프런트엔드 디자인 취향은 Fable 5.1이 여전히 강하다.
5.1. 프런트엔드 디자인의 평가
-
Fable과의 차이
- Fable 5.1은 미세한 디자인 취향, 애니메이션, 페이지의 작은 디테일에서 최근 최고의 디자인 모델로 평가됐다.
- Opus 5.5의 결과는 엉성하지는 않지만 절반은 Tailwind 템플릿처럼 보이고, 나머지는 큰 그림자와 파스텔 색을 사용하는 특정한 스타일에 치우쳤다.
- 공식 Claude Code 디자인 스킬을 끄면 약간 나아지지만 차이는 크지 않다.
-
대안적인 사용 판단
- 일반적인 작업의 기본 모델로는 Opus 5.5가 적절하고, Astra는 가장 철저하지만 변동성이 크다.
- 마케팅 페이지나 대규모 디자인 개편에서는 Fable을 여전히 선택할 이유가 있다.
- 반대로 Mia는 Opus 5.5로 HTML 페이지를 100개 생성한 뒤 지금까지 테스트한 모델 중 최고라고 평가했다.
-
HTML 생성 사례
- 종이를 오려 붙인 듯한 물리적이고 스큐어모픽(skeuomorphic)한 페이지는 한 번의 생성 결과라고 믿기 어려울 만큼 완성도가 높았다.
- 네온 레인 페이지는 공식 스킬이 권하는 터미널 레트로 스타일의 흔적이 있지만 시각적으로 괜찮았다.
- 체스 게임도 만들어졌으며, Theo는 자신이 너무 못해서 실제로 플레이하면 창피할 것 같다고 농담했다.
5.2. 커뮤니티 데모와 게임 제작
-
작업 환경과 기존 코드의 변환
- Max는 T3의 전체 코드를 Minecraft 안으로 포팅해, Minecraft 창을 떠나지 않고 에이전트의 작업 상태를 확인하는 데모를 만들었다.
- Sora의 주요 개발자·연구자였던 Gabriel은 Anthropic 모델은 치명적인 문제가 없는지 일주일을 기다려야 할 것 같다고 말했지만, 몇 시간 뒤 Opus 5.5가 “미친 듯이 좋다”고 평가를 바꿨다.
-
3D·게임 데모
- Alex는 인기 게임 Dark Souls의 클론을 만들었고, 공식 FromSoftware 게임만큼 다듬어지지는 않았지만 모델이 이런 규모의 결과를 만드는 것 자체가 놀라웠다.
- 비행 시뮬레이터는 이전 모델들이 만든 비행 시뮬레이터보다 훨씬 나았고, 몇 달 전의 3D 데모와 비교하면 산업 전체가 빠르게 발전했다.
- Claude는 2D, 2.5D, 3D 애니메이션을 만들었으며, 어색한 AI 음악은 취향이 아니지만 애니메이션 구성 자체는 좋았다고 평가됐다.
- Bjan Bowen은 게임 엔진조차 쓰지 않고 C++로 Tony Hawk Pro Skater 스타일의 게임을 처음부터 만들었다.
- 스케이트보더가 넘어질 때 보드가 실제로 멀어지는 동작까지 구현됐고, Skatebench 점수는 낮았지만 Skate Game Bench에서는 좋은 모습을 보였다.
- FPS 데모와 Three.js 기반 브라우저 데모도 구현됐으며, 네이티브 C++보다 브라우저의 Three.js에서 더 강한 결과를 냈다.
- 화면 가장자리의 깜빡임 같은 그래픽 문제는 남았지만 Computer Use로 문제를 찾아 고칠 수 있을 때도 있었다.
5.3. Fish Slop 3D 사례
-
Medium에서의 기본 결과
- Theo의 첫 결과물은 Fish Slop 3D였고, 처음에는 Grok 4.7 버전을 잘못 보여줬다가 정정했다.
- Opus 5.5 Medium 버전은 움직임이 좋고 모델 형태도 안정적이며, 컴퓨터에서 실제로 120 FPS에 가까운 부드러운 프레임 속도로 실행됐다.
- Medium이 기본 추론 수준이라는 사실을 뒤늦게 알아차려, 초기 결과가 빠르게 만들어졌다는 점을 고려해야 한다고 말했다.
-
XH High에서의 개선
- 시각적 완성도를 최대한 높이라고 요청하자 XH High는 초기 결과 위에 훨씬 풍부한 장면과 움직임을 추가했다.
- 가오리(stingray)의 다각형 모델과 날개 리깅·애니메이션은 Blender에서 직접 만들기에도 어려운 작업인데, 모델이 이를 상당히 잘 처리했다.
- 날개 움직임에서 조명이 잘못 섞이는 문제는 있었지만 수중 비행의 핵심 메커니즘뿐 아니라 먹이를 먹고 성장하는 애니메이션까지 구현됐다.
- 시네마틱 카메라 버튼과 외계인 침공 이벤트가 추가되면서 단순한 데모가 아니라 실제 게임의 방향성이 보였다.
- 이전 결과물은 예쁘다는 생각이 들면 창을 닫았지만, Fish Slop 3D는 촬영을 잊고 계속 플레이하고 싶을 정도였다고 평가됐다.
6. 남은 특이점과 신뢰성 문제
Opus 5.5는 Opus 5보다 훨씬 안정적이지만, 긴 작업에서 작은 모델처럼 느껴지는 순간과 불필요한 자기보호가 남아 있다.
6.1. 컨텍스트 창에 대한 과도한 불안
-
과거 학습의 잔재
- 과거 모델은 컨텍스트 창이 끝나기 전에 작업을 끝내도록 학습됐고, 창을 초과하면 실패하는 경우가 많았다.
- 그 결과 모델이 컨텍스트 한도를 두려워하고, 작업을 한도 안에 억지로 유지하려는 성향을 갖게 됐다.
- OpenAI 모델은 이제 컨텍스트 압축(compaction)을 신뢰하고 한도에 덜 집착하지만, Anthropic 모델은 100만 토큰 컨텍스트 창에 더 의존하는 경향이 있다. OpenAI 쪽 한도는 27만 2천 토큰으로 비교됐다.
-
Fish Slop 작업에서의 이상한 경고
- 다른 컴퓨터에서 Claude Code를 SSH로 실행해 Fish Slop 성능 개선을 맡겼고, 거의 3시간 뒤에도 변경 사항은 커밋되지 않은 채 로컬에 남아 있었다.
- Opus 5.5는 작업 인스턴스가 커밋을 늦추고 있다고 설명한 뒤 “자동 압축까지 컨텍스트가 10% 남았다”, “충돌하면 작업을 잃을 수 있다”고 경고했다.
- 실제 네트워크의 MacBook에 변경 사항이 저장되고 있었으므로, 모델이 컨텍스트 압축과 기기 충돌을 걱정할 이유는 없었다.
- 이런 현상은 대개 이미 작업이 지연된 상태에서 원인을 감사할 때 나타났고, 정상적인 작업 중에는 자주 발생하지 않았다.
6.2. 긴 작업에서의 스파이크
-
벤치마크가 놓치는 문제
- 대부분의 벤치마크는 컨텍스트 압축에 도달하기 전에 끝나므로, 장시간 작업에서 나타나는 불안과 판단 저하는 점수에 반영되지 않는다.
- 이 경계 상황에서 Opus 5.5는 Fable보다 작은 모델 같은 느낌을 주며, 필요 없는 것을 고치거나 컨텍스트가 곧 닫힌다고 착각해 작업을 망칠 수 있다.
-
코드 품질의 초기 관찰
- 하루 동안 약 5개의 중간 규모 PR만 만든 초기 표본에서 심각한 문제가 많이 발생하는 비율은 Fable 5.1과 비슷하거나 약간 낮았고, 작은 문제와 사소한 지적은 비슷하거나 약간 많았다.
- 표본이 너무 작아 확정할 수 없지만, 전체 품질과 읽기 쉬운 산문은 Fable 5.1과 비슷하거나 조금 높고, 최저점으로 떨어지는 스파이크는 Fable보다 낮을 수 있다는 것이 현재의 감각이다.
- Opus 5.5는 Opus 5보다 특이점이 훨씬 줄었지만 실수를 없애지는 않았고, 긴 작업일수록 실패를 만날 확률은 커진다.
7. 추가 스폰서 구간: 검색 에이전트와 Parallel
-
검색 속도 비교
- 검색 없는 에이전트는 거의 아무것도 할 수 없을 정도로 답답하고, 빠르고 정확한 검색이 있는 에이전트는 완전히 다르다는 문제의식이 제시됐다.
- Parallel은 검색 요청에 1초 조금 넘게 걸렸고, OpenAI 엔드포인트는 6초 넘게 계속 실행됐다.
-
에이전트용 웹 기능
- Parallel은 검색뿐 아니라 페이지 변화 감시, 검색 결과 합성용 Response API, URL에서 에이전트가 원하는 데이터를 추출하는 엔드포인트를 제공한다.
- JavaScript가 많은 페이지도 파싱하고, MCP로 기존 에이전트에 연결할 수 있다.
- 매달 5,000건의 무료 요청과 가입 시 80달러 크레딧이 제공되며, 안내 링크는
soyv.link/parallel로 제시됐다.
8. 결론과 실용적 시사점
-
기본 코딩 모델 선택
- 일반적인 코딩·문서화·에이전트 작업에는 Opus 5.5 Medium 또는 High가 가장 합리적인 기본값이다.
- Max는 10배 넘는 토큰을 사용하고 점수는 약 1%만 올릴 수 있으므로 특별한 이유가 없으면 피해야 한다.
- Low는 능력에 비해 가격 이점이 충분하지 않으므로 권장되지 않는다.
-
Fable을 계속 써야 하는 경우
- 마케팅 페이지와 대규모 디자인 개편처럼 섬세한 시각적 취향이 중요한 작업에서는 Fable 5.1이 아직 더 낫다.
- 대규모 코드베이스를 아주 철저하게 감사하고 모든 결함을 찾는 드문 작업에서는 OpenAI Frontier 계열, Grok 4.7, Soul이 더 강할 수 있다.
-
Opus 5.5의 가치
- Claude 200달러 구독에서 하루 종일 실제 작업을 수행해도 주간 한도의 약 20%만 사용했으며, 만들어진 코드를 검토하고 병합할 수 있을 만큼 출력이 읽기 쉬워졌다.
- 기업은 ZDR 적용 가능성 때문에 Opus를 안심하고 도입할 수 있고, 일반 사용자는 같은 구독료로 더 많은 작업을 끝낼 수 있다.
- Anthropic은 저가 모델의 사후 학습(post-training)에서 OpenAI보다 약했지만, 이번 출시에서 그 격차를 크게 좁혔다.
-
최종 판단
- Opus 5.5는 Opus 5보다 훨씬 나은 해법이며, Fable에 충분히 가까워 Claude 구독에서 기본으로 선택할 이유가 생겼다.
- 아직 첫날 테스트라 Fable을 완전히 버릴 단계는 아니지만, 병합하기 두려운 코드를 내놓던 Opus 5와 달리 Opus 5.5는 실제 개발에 맡길 수 있는 모델에 가깝다.
- GPT6 Soul과 OpenAI 개발자 행사가 이어지므로 고성능 모델 경쟁은 더 치열해질 전망이며, Theo는 이번 주와 다음 주에 더 많은 비교를 진행하겠다고 예고했다.
주요 발언 모음
“It writes the way I do.”
“Opus 5.5 is way, way, way better than Opus 5.”
“It is kind of crazy to say that Anthropic put out a really good value here, but they did.”
“Don’t use Max on this model. It’s not worth it unless you just want to watch tokens burn and be lit on fire.”
“This one is ‘Oh, I actually kind of see the vision for the game now.’”
“I’m finally not scared to merge what it writes.”
핵심 데이터 & 수치
- 원본 발행일: 2026-09-23.
- 영상 길이: 약 40분 14초.
- 공식 비용 절감: 일반적인 작업에서 Opus 5보다 40% 저렴하다.
- 토큰 가격: 입력 백만 토큰 4달러, 출력 백만 토큰 20달러다.
- 캐시 읽기: 백만 토큰당 0.20달러로 60% 저렴해졌다.
- 속도: 이전 모델보다 약 30% 빠르다.
- 대규모 마이그레이션: 68만 줄의 코드 마이그레이션을 하루가 되기 전에 완료한 테스터가 있었다.
- Terminal Bench 4: Opus 5.5 Medium은 Fable 5.1 Max보다 높은 점수를 약 2.94달러에 기록했고, Fable의 비용은 약 20달러였다.
- Artificial Analysis 점수: Opus 5.5 High 53점, Astra High 50.9점이었다.
- 작업당 토큰: Opus 5 Max 약 7만 3천 개, Fable 약 7만 8천 개, Opus 5.5 Max 약 12만 개, GPT6 Astra 약 2만 7천 개였다.
- 작업당 비용: Opus 5 5.86달러, Opus 5.5 약 6달러, Fable 5.1 약 7.63달러로 비교됐다.
- 추론 수준 비용: Medium 약 1.34달러, Astra Max 약 3.26달러, Opus 5.5 Max 약 6달러였다.
- Skatebench 토큰: XH High 질문당 약 330개에서 Max 질문당 약 5,000개로 10배 넘게 증가했지만 점수 상승은 약 1%였다.
- 실사용량: 하루 종일 여러 작업을 수행한 뒤 Opus 5.5가 사용한 주간 Claude 한도는 약 20%로 추정됐다.
- Fish Slop 3D: 성능 개선판은 컴퓨터에서 약 120 FPS로 실행됐다.
핵심 요약 (20줄)
- Anthropic은 Opus 5.5에서 Opus 5의 코드 품질과 장황한 출력 문제를 크게 개선했다.
- Opus 5.5는 대부분의 작업에서 Fable 5.1 수준의 성능을 내면서 Opus 5보다 40% 저렴하다.
- 입력 토큰은 백만 개당 4달러, 출력 토큰은 백만 개당 20달러로 내려갔다.
- 캐시 읽기 비용은 백만 토큰당 0.20달러로 이전보다 60% 낮아졌다.
- 실제 응답 속도도 약 30% 빨라져 토큰을 많이 사용하는 Opus의 체감 부담이 줄었다.
- Opus 5.5는 핵심 정보를 앞에 배치하고 긴 세션에서도 읽기 쉬운 문장을 작성한다.
- 초기 테스터는 Opus 5.5의 문장이 자신의 글쓰기 방식과 비슷하다고 평가했다.
- 68만 줄 규모의 코드 마이그레이션을 하루가 되기 전에 끝낸 사례가 공식적으로 제시됐다.
- Terminal Bench 4에서 Opus 5.5 Medium은 Fable 5.1 Max보다 높은 점수를 더 낮은 비용으로 기록했다.
- Opus 5.5 Max는 작업당 거의 12만 토큰을 사용해 Opus 5와 Fable보다 비효율적이다.
- GPT6 Astra는 작업당 약 2만 7천 토큰만 사용해 Opus 5.5 Max와 약 4배의 효율 격차를 보였다.
- Opus 5.5의 Medium은 약 1.34달러로 동작하지만 Max는 거의 6달러까지 올라간다.
- Max는 XH High보다 토큰을 10배 넘게 사용하면서 점수는 약 1%만 높일 수 있다.
- Opus 5.5에서는 Medium과 High, XH High를 사용하고 Max는 피하는 전략이 합리적이다.
- ZDR 정책을 적용할 수 있다는 점은 데이터를 저장하지 않아야 하는 기업에 큰 장점이다.
- Theo는 Opus 5.5로 시각화 도구 제작, 포팅, 데이터 검증, PR 생성과 병합을 수행했다.
- 하루 종일 작업한 뒤에도 Claude 주간 사용량은 실제로 약 20%만 줄었다.
- 프런트엔드의 섬세한 디자인 감각은 Fable 5.1이 여전히 앞서지만, 3D 게임과 애니메이션 생성은 크게 발전했다.
- Fish Slop 3D는 120 FPS에 가까운 성능과 먹이·성장·시네마틱 카메라·외계인 이벤트를 구현했다.
- Opus 5.5는 Opus 5보다 훨씬 나은 일상용 모델이며, Fable을 완전히 대체할지는 장기 테스트가 필요하다.
결론 및 실용적 시사점
- 기본값: 일반 코딩과 에이전트 작업은 Opus 5.5 Medium 또는 High로 시작하라.
- 비용 관리: Max는 10배 넘는 토큰 증가에 비해 성능 이득이 작으므로 사용하지 말라.
- 디자인 작업: 섬세한 마케팅 페이지나 대규모 시각 개편은 Fable 5.1을 함께 사용하라.
- 코드 리뷰: 대규모 코드베이스의 철저한 감사는 Grok 4.7이나 OpenAI Frontier 계열과 교차 검증하라.
- 장기 작업: 컨텍스트 압축을 모델이 불필요하게 걱정할 수 있으므로, 커밋·파일 상태·실제 변경을 직접 확인하라.
- 기업 도입: ZDR가 필요한 조직은 Opus 5.5의 기업용 적합성을 우선 검토하라.
- 최종 선택: Opus 5.5는 읽기 쉽고 병합 가능한 코드를 훨씬 더 자주 만들어 내는 현실적인 Claude 기본 모델이다.
