Moonshot의 신작 Kimi K3(2.8조 파라미터)가 오픈 웨이트 모델 최초로 진짜 프론티어급에 도달했다는 평가다.
Deep SWE, Frontier SWE, 터미널 벤치 등 다수 코딩 벤치마크에서 GPT-5.6 Soul·Fable 5와 대등하거나 일부 앞선다.
특히 프론트엔드 UI 디자인과 3D 게임 개발에서 예상을 뛰어넘는 완성도를 보였다(T3 Code 사이드바 리디자인, Fish Slap 3D 포팅 등).
100만 토큰 컨텍스트 윈도우와 네이티브 비전 지원을 갖췄지만, 실제 구독 플랜은 전체 컨텍스트를 제공하지 않아 장시간 작업 시 한계에 부딪혔다.
FP8 기준 1.4TB 용량이라 개인 하드웨어로는 절대 구동 불가능하며, 권장 배포 환경은 H100 64개(약 260만 달러) 규모다.
가격은 입력 $3/백만, 출력 $15/백만으로 Soul과 비슷하지만, 토큰 사용량이 2배 가까이 많아 실질 비용 절감 효과는 제한적이다.
Artificial Analysis Intelligence Index 57점으로 역대 세 번째로 똑똑한 모델로 평가되며, 환각 방지 능력은 오픈 웨이트 모델 중 최고 수준이다.
GPU 커널 최적화·컴파일러 구축 등 머신러닝 인프라 작업에서도 프론티어급 성능을 보여, Anthropic이 의도적으로 숨겨온 능력이 오픈 웨이트로 풀렸다는 우려가 나온다.
거부 없이 심층 보안 감사를 수행할 만큼 강력해, 공격자가 악용할 가능성에 대한 안전성 우려도 제기됐다.
Moonshot은 아직 시스템 카드나 안전성 관련 문서를 전혀 공개하지 않은 상태다.
사용 경험(UX)은 아직 Fable/Soul에 못 미쳐, 응답 속도가 느리고(20 TPS) 불필요한 추론 낭비, 유저 아닌 서브에이전트에 응답하는 등 미완성 부분이 있다.
서브에이전트가 상위 to-do 리스트를 직접 체크하는 독특한 워크플로우 오케스트레이션 방식이 인상적이었다.
가중치는 2026-07-27 공개 예정이며, 그 전까지는 중국 기업 서버를 거치는 API/구독으로만 사용 가능해 민감 데이터 투입은 아직 권장되지 않는다.
구독은 $20/$40/$100/$200 티어로 나뉘며, 저자는 $40 티어를 30분 만에 소진하고 $200으로 업그레이드했다.
실사용 테스트에서 약 $63로 대규모 작업을 처리해, GPT 계열(일 $1,000)·Fable(일 $300~400) 대비 비용 효율이 매우 높았다.
이전 Kimi 모델들의 서드파티 호스팅가 인하 폭이 11~15% 수준이었던 전례로 볼 때, 가중치 공개 후에도 극단적으로 저렴해지진 않을 전망이다.
저자는 지금까지 본 오픈 웨이트 모델 중 이 정도로 프론티어에 근접한 건 처음이라며 강한 인상을 받았다고 평가했다.
Moonshot의 신작 Kimi K3(2.8조 파라미터)가 오픈 웨이트 모델 최초로 진짜 프론티어급에 도달했다는 평가다.
계층 1: 핵심 주장/결론
Kimi K3는 오픈 웨이트 모델 최초로 진짜 프론티어급에 도달했다. 지금까지 오픈 웨이트 모델은 Opus/Fable/Soul(GPT-5.6) 급을 따라잡지 못했는데, Kimi K3는 벤치마크 다수에서 이들과 대등하거나 일부 앞선다.
UI/프론트엔드 코딩과 3D/게임 개발에서 특히 인상적이다. T3 Code 사이드바 재디자인, macOS 리퀴드 글래스 스타일 재현, 3D 게임(Fish Slap) 포팅 등에서 기대 이상의 결과를 보였다.
가격은 저렴하지만 토큰 사용량이 많아 실제 비용 절감 효과는 제한적이다. 캐시 히트 30센트, 입력 $3/백만, 출력 $15/백만 — Soul 표준가와 비슷한 수준(소넷급 가격)이지만 토큰을 2배 가까이 써서 상쇄된다.
보안/안전 측면에서 심각한 우려가 있다. 오픈 웨이트인데도 보안 감사, GPU 커널 최적화 등 "위험할 수 있는" 작업을 거부 없이 수행하며, Moonshot은 아직 시스템 카드나 안전성 관련 문서를 전혀 공개하지 않았다.
사용 경험(UX)은 아직 Fable/Soul에 못 미친다. 반응 속도(20 TPS, 타사 대비 절반 이하), 불필요한 추론 낭비, 유저가 아닌 서브에이전트에게 응답하는 등 다듬어지지 않은 부분이 있다.
계층 2: 주요 논점/근거/사례
모델 스펙과 아키텍처
2.8조(2.8 trillion) 파라미터, Kimi Delta attention + attention residuals 아키텍처, 네이티브 비전 지원, 100만 토큰 컨텍스트 윈도우.
FP8 기준 약 1.4TB 용량 — 개인/로컬 환경에서 절대 구동 불가능한 크기. "이게 로컬 모델의 미래"라고 말하는 사람은 무시해도 된다고 언급.
MoE(Mixture of Experts) 방식으로 896개 전문가(expert) 중 16개만 활성화하는 sparse 구조 + stable latent MoE 프레임워크로 연산 비용을 억제.
학습 시 FP4로 가중치 저장, 실행 시 FP8로 활성화값 처리하는 트릭으로 메모리 효율과 단기 기억력을 동시에 확보.
전체 스케일링 효율이 2.5배 개선. 권장 배포 환경은 64개 이상의 가속기(H100 64개 기준 약 260만 달러 상당) — "매우 로컬 친화적"이라고 반어적으로 언급.
이전 모델 Kimi K2(1조 파라미터, 2025-07-11 출시) 대비 2.8배 규모 증가. DeepSeek V4 Pro(1.6조)보다도 크다.
가중치 공개 예정일은 2026-07-27. 그 전까지는 API로만 사용 가능하며, Moonshot이 중국 기업이라는 점에서 데이터 프라이버시 우려가 제기됨.
벤치마크 성능
Deep SWE: Soul 73, Fable 70, Kimi K3 67.5 — GPT-5.5/Opus-4.8/GLM-5.2보다는 앞섬.
Frontier SWE(머지 가능성 중심 벤치): Kimi K3가 Soul보다 10점 앞서는 등 Fable과 Soul 사이에 위치 — "코드가 더 세련되고 보기 좋다"는 평가.
터미널 벤치: Opus, Fable을 앞서고 Soul에 근소하게 뒤짐. Program bench: 거의 세계 최고 수준. SWE marathon: Opus-4.8을 제치고 1위.
일반 에이전트 평가(GDP val, job bench, spreadsheet bench): spreadsheet bench 1위 등 전반적 강세.
Browse comp(브라우저/컴퓨터 사용 능력): 업계 최고 수준이면서 Soul Max보다도 저렴 — 저자는 오프라인/로컬 실행이 가능해지면 프라이버시 문제 해결에 큰 의미가 있다고 강조.
Artificial Analysis 기준 "역대 세 번째로 똑똑한 모델"로 평가, Intelligence Index 57점 — Opus-4.8·GPT-5.5와 비슷, Fable 5·5.6 Soul보다 약간 낮음.
환각(hallucination) 측정 벤치인 AI Omniscient에서 오픈 웨이트 모델 중 최고 점수 — "모른다"고 답할 때 가산점을 주는 방식인데, 오히려 5.6 Soul 등은 모를 때도 지어내는 경향 때문에 점수가 깎임.
GPU 커널 최적화, 커스텀 컴파일러(Triton-like) 구축, 칩 설계 등 "머신러닝 인프라" 영역에서도 프론티어급 성능 — Anthropic/OpenAI가 의도적으로 숨겨온 능력이라 저자는 Anthropic이 이 릴리즈를 가장 두려워할 것이라 평가.
실사용 코딩 테스트 사례
저자의 구 코드베이스(ping.gg, Zoom형 콘텐츠 협업 앱)를 포팅하는 3시간+ 장기 작업에서 문단 하나 반 분량의 프롬프트만으로 122개 태스크를 컨텍스트 붕괴 없이 수행 — 오픈 웨이트 모델 중 이 정도 일관성은 처음 봤다고 언급.
컨텍스트 윈도우 문제: Kimi Code 구독은 실제로 100만 토큰 전체를 제공하지 않아, Claude Code 연동 시 더 작은 한도에 걸림 — 이 부분은 저자의 설정 실수로도 언급.
T3 Code 사이드바 다크 리디자인: 기존 회색조 대신 진짜 블랙 요청 → 기존 결과보다 나은 디자인 산출.
T3 Code 핵심 UI를 ChatGPT 스타일 참고 스크린샷 기반으로 재설계하는 작업을 OpenCode 바인딩으로 1시간 5분 만에 완료(중간에 브라우저 오픈 문제로 1회 개입).
보안 감사(Lakebed 클라우드 제품): Fable/Soul이면 거부했을 법한 심층 보안 감사를 거부 없이 수행 — 다수의 discovery 에이전트 생성 → 25개 검증 에이전트로 교차검증 → 종합 리포트까지 완주.
워크플로우 관리 방식이 독특함: 일반적으로 모델은 태스크를 쪼개는 워크플로우 하나만 쓰는데, Kimi K3는 여러 단계별 워크플로우를 만들고, 서브에이전트에게 상위 레벨 to-do 항목을 직접 체크할 권한까지 부여 — Fable도 Claude Code 안에서 이렇게는 못한다고 언급.
가격/구독 구조
API: 캐시 히트 $0.30/백만, 입력 $3/백만, 출력 $15/백만 — Soul 표준가와 동일 수준(Anthropic이 현재 한시적으로 $2/$10 할인 중이라 실질적으로는 Soul이 더 쌈).
구독: kimmi.com에서 $20/$40/$100/$200 티어. 저자는 $40 티어를 30분 만에 소진, $200으로 업그레이드 후에도 5시간 한도 50%, 주간 한도 10% 미만 사용.
실사용 비용 추정: 약 $63(구독+API 합산)로 상당한 작업량을 처리 — 저자가 GPT 계열에 일 $1,000, Fable에 일 $300~400 쓰는 것과 비교하면 매우 경제적.
이전 Kimi 모델들의 서드파티 호스팅 가격 인하 폭이 11~15% 수준이었다는 전례로 볼 때, 가중치 공개 후에도 극단적으로 저렴해지진 않을 것으로 예상.
계층 3: 구체적 발언/인용/데이터 포인트
"This model requires supercomputers to be used." — 개인 하드웨어로는 절대 구동 불가능함을 강조.
"I genuinely feel bad for our friends over at Hugging Face having to host this and deal [with] people downloading 2 plus terabytes of data to use it."
"Man, Anthropic has to be terrified of this release more than anybody." — GPU 커널 최적화 능력을 오픈 웨이트로 공개한 것에 대해.
"Moonshot themselves even said that the model still has a noticeable gap in user experience compared with Fable 5 and 5.6 Soul." — Moonshot이 스스로 인정한 UX 격차.
"The word safety does not appear on the page at all." — 공식 발표 페이지에 안전성 관련 언급이 전혀 없음을 지적.
"It ended with 'no new report here, just an idle status ping'... It was done. It had completed the work, but it was responding to the sub-agents and the ping, not to me, the user." — 유저가 아닌 서브에이전트/핑에 응답하는 이상 현상.
"It took a second to think about [whether TypeScript 'any' rule applies inside a markdown file]." — 추론 낭비 사례. 20 TPS(타사 대비 절반 이하)와 결합되어 체감 속도가 느림.
"For the $40 sub that I burned it upgraded... my estimates... is around $63 of usage." — 실사용 비용 데이터.
"I would not use either of these methods [subscription/API] for real important sensitive data at all yet. Wait till the weights are out." — 중국 기업 호스팅에 대한 프라이버시 경고.
Kimi K2 출시일: 2025-07-11, 1조 파라미터. Kimi K3: 2026-07-17 발표, 2.8조 파라미터. 가중치 공개 예정일: 2026-07-27.
권장 배포: "supernode configurations with 64 or more accelerators" — H100 64개 기준 약 $2.6M.
Artificial Analysis Intelligence Index: Kimi K3 57점, GDP val 1668점(이전 오픈 웨이트 최고 GLM 5.2는 1514점).
출력 토큰/태스크: Kimi K3 23k, Fable 5(가장 효율적) 그보다 낮음, DeepSeek V4 Pro/Flash는 각각 더 높고 45k까지 — Kimi K3가 K2 대비 21% 더 효율적.
계층 4: 실행 시사점/액션 아이템
당장 로컬 구동은 불가능 — 2.8TB(FP8 기준 1.4TB) 모델이므로 개인/팀 인프라로 셀프호스팅 계획을 세우지 말 것. 7월 27일 가중치 공개 이후에도 API/구독 사용이 현실적.
프론트엔드/UI 작업에 실험적으로 시도해볼 가치 있음 — 다크 테마/블랙 기반 리디자인, ChatGPT 스타일 벤치마킹 등에서 강점을 보였으므로, 디자인 반복 작업에 투입해볼 만하다.
민감 데이터는 아직 투입 금지 — 중국 기업 호스팅(kimmi.com/platform.kimmi.ai)이라는 점에서, 가중치 공개 전까지는 사내/개인 민감 데이터·코드 처리에 사용하지 않는 것이 안전.
비용 관리 시 구독 우선 고려 — API보다 $40 구독 티어로 먼저 체험하고, 사용량이 많다면 $200 티어로 업그레이드하는 방식이 합리적(저자도 API 단독 사용 시 실수로 $100 지출).
보안 측면에서 경계 필요 — 오픈 웨이트 + 거부 없는 보안/공격 관련 작업 수행 능력이 결합되면서, 공격자 쪽에서도 활용 가능성이 커짐. 조직의 위협 모델에 "오픈 웨이트 프론티어급 모델을 악용하는 공격자" 시나리오를 추가로 고려할 필요.
워크플로우/서브에이전트 오케스트레이션 실험 가치 — 서브에이전트가 상위 to-do를 직접 체크하는 독특한 협업 패턴은, 자체 에이전트 오케스트레이션 설계에 참고할 만한 아이디어.