1. 핵심 요약
Meta는 터미널 기반 코딩 에이전트 Muse Code를 베타로 공개하고, 이를 구동하는 코딩 특화 모델 Muse Spark 1.2를 함께 내놓았다. t3dotgg는 직접 설치해 T3 코드베이스에서 아키텍처 파악, 이벤트 소싱 감사, 피시 게임 리메이크, PR 222개 분석, T3 Code에 Muse Provider 통합 시도 등을 실전 테스트했다.
기본 가격은 킬로토큰당 $1.25 / $4.25 수준이지만, 데이터 제공에 동의하는 Contributor 티어는 입력 $0.10, 출력 $0.20, 캐시 $0.002로 10~20배 저렴하다. 속도와 가격은 매우 압도적이며, 특히 PR 감사나 요약 같은 코드 주변 분석 작업에 높은 실용 가치를 보였다. 반면 복잡한 end-to-end 구현, 환각/할루시네이션, 기본 UI 버그 등에서는 아직 Anthropic Fable/Opus나 OpenAI GPT 시리즈에 비해 신뢰도가 떨어진다. t3dotgg의 결론은 “아직 메인 모델은 아니지만, 매우 빠르고 싼 데다 쓸모있는 시그널을 뽑아주는 장난감 같은 모델”이다.
2. 세부 분석
2.1 Meta의 AI 전략과 Muse 라인
Meta는 React, React Native, Llama 등으로 오픈소스 생태계에 꾸준히 기여해왔고, 내부에서는 대규모 모노레포와 Mercurial 기반 커스텀 워크플로우를 갖추고 있다. 최근에는 비공개로 연구해온 Muse 모델 라인을 드러내고, 이를 코드 에이전트 형태로 내놓으며 Anthropic의 Claude Code를 직접 겨냥했다. Zuck의 트윗과 공식 블로그는 Muse Code를 “대규모 레포에서 복잡한 소프트웨어 엔지니어링 작업을 수행하는 터미널 코딩 에이전트”로 정의한다.
2.2 Muse Code의 기능 설계
- 세션 내내 활성화된 백그라운드 에이전트가 컨텍스트를 축적한다.
- 큰 작업은 분기(isolate)된 worktree에서 병렬 서브에이전트로 처리한다.
- 모든 모델 호출, 툴 실행, 편집은 로컬 이벤트 로그에 기록되어 중단 시 복구 가능하다.
- t3dotgg의 실제 사용에서 Claude Code의 스킬/룰을 그대로 가져오는 모습, worktree, 음성 입력(voice-to-text) 등을 지원한다.
2.3 모델 성능과 벤치마크
Muse Spark 1.2는 4개월 만의 세 번째 릴리스로, 인공분석 지능 지수 54를 기록, xAI와 공동 3위(미국 연구소 기준)로 나타났다. 주요 벤치마크:
- TerminalBench 2.1: Terra보다 약간 높고 Opus 5보다 약간 낮음.
- Deep SWE: Grok 4.5보다 높지만 Terra/Opus보다 낮음.
- Meta 내부 코딩 벤치: 2위이나, 내부 벤치의 객관성에 의문.
- SimpleQA(추정): abstention/정직성 점수 상승, hallucination rate 10포인트 하락.
출력 토큰 효율은 작업당 약 30k로, Fable 5의 36k보다 적지만 Sonnet 계열의 17k보다는 많다. OpenRouter 기준 평균 191 TPS, 최대 316 TPS, P50 162 TPS로 Sonnet 30 TPS 대비 5~6배 이상 빠르다.
2.4 가격 구조: Contributor 티어가 핵심
| 항목 | 기본 티어 | Contributor 티어 |
|---|---|---|
| 입력 | $1.25 / 1M | $0.10 / 1M |
| 캐시 입력 | $0.15 / 1M | $0.002 / 1M |
| 출력 | $4.25 / 1M | $0.20 / 1M |
Contributor 티어는 데이터 제공을 전제로 하며, t3dotgg 추산으로 지능 지수 작업당 비용이 $0.40에서 $0.02~0.03 수준으로 낮아져 DeepSeek V4 Flash, 경량 모델 수준과 맞먹는다. 다만 rate limit이 매우 낮아 병렬 서브에이전트를 쓰면 금방 걸린다.
2.5 실전 테스트 결과
- T3 아키텍처 개요: 30초 이내 응답.
- 이벤트 소싱 모델 감사: HTML 리포트를 빠르게 생성, 하지만 내용에 “slop”(쓸데없는 경로/중복 정보) 포함.
- Fable/DeepSeek 비교: 같은 프롬프트로 Muse는 1분 내, Fable은 4분 이상/유용한 결과 없음. 그러나 Fable이 Muse 결과를 감사하면 Muse보다 자신의 결과가 더 정확하다고 평가, DeepSeek은 반대로 Muse가 낫다고 평가.
- 피시 게임 리메이크: 2D 2분 30초, 3D 5분 이내 완성. Opus 5는 1시간 이상. 결과물은 애니메이션/그림자는 괜찮지만, 물고기 뒤로 헤엄, 마우스 상하 시야 불가, 충돌 처리 누락 등 심각한 버그.
- witchai.dev 디자인: 레이아웃은 나쁘지 않지만, 일부 템플릿 느낌/글 과다.
- T3 Code에 Muse Provider 통합: 서브에이전트를 활용해 조사하려 했으나, Muse가 스스로를 인식 못 하고 “anti-gravity” 같은 환각을 냄. Fable/Sonnet의 플랜 리뷰 후 Muse가 업데이트했으나 실제 구현은 설정에 provider 추가하지 않고 UI에만 추가되어 작동하지 않음. 비용은 $5.32 정도.
- GitHub PR 222개 감사: 5분 이내, 10센트(Contributor). mergeable 여부, clean/dirty merge, confidence score, 클릭 가능한 링크를 담은 리포트를 생성. t3dotgg가 가장 유용하다고 평가한 유즈케이스.
2.6 한계와 주의점
- 환각이 강하게 발생: 자기 자신(Muse Code)을 못 찾고, 관련 없는 “anti-gravity”로 빠짐.
- 복잡한 end-to-end 구현은 불안정: 실제 동작하는 코드로 연결하기 어려움.
- Contributor 티어 rate limit이 낮아서 병렬 서브에이전트 흐름에서 지속적으로 제한.
- UI/레이아웃 품질이 아직 어설픈 경우가 많음.
- 데이터 제공이 전제인 Contributor 티어를 사용하면 Meta가 내용을 볼 수 있다는 프라이버시 트레이드오프.
3. 인사이트
- Meta는 내부 대규모 코드베이스와 Mercurial 기반 워크플로우를 다룰 경험을 바탕으로, 서브에이전트 병렬화/장기 컨텍스트/auditable 로그 같은 “대규모 레포용” 기능을 내세운다.
- Muse Spark 1.2는 최고 성능 모델은 아니지만, 속도×가격 측면에서 경쟁력 있다. 특히 Contributor 티어는 데이터 교환이라는 명확한 조건 아래 거의 무료 수준.
- “똑똑하지만 완성도가 낮은” 모델의 전형: 복잡한 구현은 부족하지만, 신호 추출, PR 감사, 요약, 로그 분석 같은 “코드 주변 분석”에서는 높은 ROI.
- Anthropic의 Claude Code/Fable/OpenAI 모델과 비교하면 아직 병합할 수 있는 코드를 만들어내는 능력이 부족하다. 따라서 “기다려서 믿을 수 있는 결과를 얻는 것” vs “빠르고 싸게 여러 번 시도하는 것” 사이의 트레이드오프가 핵심.
- t3dotgg는 Muse Code CLI를 “Claude Code보다 덜 짜증나고 Google보다 훨씬 낫다”고 평가하면서도, 아직 Pi가 전체적으로 더 낫다고 언급. (Pi는 t3dotgg가 사용하는 개인 워크플로우/도구를 의미하는 것으로 보임.)
4. 실용적 적용 및 내 결론
- 적합한 작업: PR/이슈 감사, CHANGELOG/요약 생성, 코드베이스 빠른 탐색, 단순 리팩토링/문서화, 로그/메트릭에서 신호 찾기.
- 부적합한 작업: 민감한 비공개 코드, 복잡한 아키텍처 변경, end-to-end 기능 구현, 신뢰할 수 없는 코드의 자동 병합.
- 운영 팁: Contributor 티어로 실험할 때는 rate limit에 주의; 서브에이전트를 과도하게 병렬 실행하면 오히려 지연. 복잡한 작업은 Fable/Opus 등 신뢰 모델로 검증하는 “Muse로 뽑고, Fable로 검증” 워크플로우가 현실적.
- 결론: Muse Code는 Claude Code를 복제한 Meta의 실험적 CLI로, 엄청난 가격과 속도로 취미/실험용으로 강력하다. 하지만 일상적인 메인 코딩 에이전트로 쓰기에는 환각과 구현 완성도가 부족. 데이터 제공에 동의할 수 있다면, 빠른 시그널 추출용 도구로 가치 있게 사용할 수 있다.
5. 용어/원문 표기 보정
원문 자동자막에 음성 인식 오류가 있어 아래와 같이 보정함:
- “Grock” → Grok (xAI)
- “SpaceX” → xAI (미국 AI 연구소 랭킹 맥락상 SpaceX가 아닌 xAI를 의미)
- “Kimmy K3” → Kimi K3 (Moonshot)
- “56 Soul” → Sonnet 계열 (Anthropic의 Sonnet 모델군을 의미)
- “Mistro medium” → Mistral Medium
- “V4 flash” → DeepSeek V4 Flash
