URL: https://www.youtube.com/watch?v=nAhQs8Fd_9g 날짜: 2026-08-29 (수집일) 원본 발행일: 2026-08-26 채널: Peter Yang
메타데이터
- Video ID:
nAhQs8Fd_9g - 원문 제목: ChatGPT vs Claude vs Grok vs Gemini: The Best AI for 10 Use Cases (August 2026)
- 재생 시간: 26분 47초
- 비교 대상: ChatGPT, Claude, Grok, Gemini
- 핵심 비교 범위: 디자인, 일상 답변·성격, 글쓰기·편집, 계획 수립, 코딩, 브라우저·컴퓨터 사용, 음성 채팅, 이미지 생성, 비디오 생성, 개인 에이전트
- 메모: 모델과 제품명은 자막 표기를 따랐다. 자막에는
Claude Fable,Claude Fable 5,GPT So처럼 표기된 이름이 있으며, 해당 명칭을 임의로 교정하지 않았다.
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==ChatGPT·Claude·Grok·Gemini 중 절대적인 단일 승자는 없으며, 사용 사례별 강점과 도구·하네스(harness)의 완성도에 따라 최적의 선택이 달라진다.==
- Claude는 웹·앱·슬라이드·비디오 디자인과 복잡한 계획 수립에서 강점이 있다.
- ChatGPT는 일상 답변과 성격, 글쓰기·편집, 코딩, 브라우저 사용, 음성 채팅, 이미지 생성, 개인 에이전트에서 가장 폭넓은 승리를 거둔다.
- Gemini는 비디오 생성에서 가장 좋은 결과를 냈고, Grok은 앱·웹 프로토타이핑과 개인 에이전트의 유력한 경쟁자로 부상했다.
- 모델 자체의 지능만큼 브라우저 사용, 음성, 모바일 접속, 스레드·에이전트 관리, 플러그인 생태계를 묶는 하네스가 실제 생산성을 좌우한다.
실제 선택은 하나의 모델을 모든 일에 쓰는 방식보다 작업의 성격에 따라 나누는 방식이 합리적이다. 디자인과 장기 계획에는 Claude를, 실행 중심의 코딩·자동화와 대화에는 ChatGPT를, 영상 생성에는 Gemini를, 더 자유로운 프로토타이핑과 개인용 컴퓨터 에이전트에는 Grok을 고려할 수 있다. 다만 대부분의 사람에게는 월 20달러의 ChatGPT 하나만으로도 충분히 넓은 기능을 확보할 수 있다는 결론이다.
1. 디자인(Design): 웹사이트·앱·슬라이드·애니메이션 비디오
디자인의 0→1 결과물은 Grok이 시각적으로 앞섰지만, 다양한 산출물을 끝까지 만들고 수정하는 전체 경험에서는 Claude가 승자다.
1.1. 모바일 레시피 앱 프로토타입 비교
-
동일한 UX 프롬프트로 네 모델을 비교하다
- 상황: 캐나다에서 부모님을 방문한 Peter Yang이 부모님께 요리해 드리기 위해 간단한 레시피를 찾고 요리할 수 있는 모바일 앱을 만들기로 했다.
- 요구사항:
Discover recipe화면과View recipe화면 두 개를 만들고, 구현보다 사용자 경험(UX)에 집중하라고 요청했다.
-
ChatGPT의 결과
- 기본적인 프로토타입: 레시피를 둘러보고 항목을 누르면 재료와 조리 단계를 보는 흐름은 작동했다.
- 시각 자산의 부재: 이미지 생성(Image Generation)을 활용해 음식 이미지를 채우지 않은 점이 아쉬웠다. 전체적으로 기능과 시각적 완성도가 기본 수준에 머물렀다.
-
Claude Code의 결과
- 기능의 확장: 같은 프롬프트로 만든 앱에는 필터, 서빙(Servings) 정보, 조리 단계가 들어가 ChatGPT 프로토타입보다 기능이 많았다.
- 일관된 시각 언어와 한계: 화면은 보기 좋았지만 Claude에는 실질적인 이미지 생성 기능이 없었다. 제목 위에 헤더를 두고 특정 글꼴을 쓰며, 전체적으로 ‘Claude가 만든 것처럼’ 보이는 전형성이 강했다.
-
Grok의 결과
- 시각적 0→1 강점: 레이아웃이 명확하고 시각적으로 인상적인 프로토타입을 만들었다.
- 이미지와 내용의 연결: 이미지 생성 기능으로 빈 공간을 채웠으며 이미지가 레시피 텍스트와 실제로 대응했다.
Tomato butter pasta를 누르면 재료, 방법(Methodology), 작동하는 버튼이 나타났다. - 중간 판정: 이미지 생성과 좋은 레이아웃을 동시에 제공해 네 모델 중 가장 시각적으로 인상적인 결과를 냈다.
-
Gemini의 결과
- 이미지 생성 활용:
Nano Banana를 사용해 이미지를 채웠다. - 완성도 문제: 테두리와 정렬이 어긋나고 화면 곳곳에 텍스트가 흩어졌다. 레시피를 클릭하면 조금 더 정리된 화면이 나왔지만 기본 프로토타입의 문제는 남았다.
- 이미지 생성 활용:
1.2. Claude Design의 명확화 질문과 디자인 시스템
-
질문을 먼저 하는 설계 과정
- 동일 프롬프트 재사용: 앞서 사용한 모바일 레시피 앱 프롬프트를
Claude Design에 붙여 넣고 모바일 앱 디자인을 요청했다. - 명확화 질문(Clarifying Questions): 어떤 디자인 시스템을 기반으로 만들지, 누가 요리하는지,
Discover가 무엇을 의미하는지 먼저 물었다. - 구체화한 제약: 대상은 20분 안에 요리해야 하는 바쁜 사람으로 정했다. 발견 화면이 제공해야 할 선택지도 직접 골라 답했다.
- 동일 프롬프트 재사용: 앞서 사용한 모바일 레시피 앱 프롬프트를
-
질문 단계가 만드는 차이
- 의도 정리: 질문이 디자인 요구사항을 명확히 하므로 사용자가 원하는 방향을 먼저 정리할 수 있다.
- 지시 준수: 최종 결과는 ‘20분’, ‘바쁜 사람’, ‘최대한 빨리 요리’라는 조건을 반영했다. 다른 모델들이 이 단계를 거치지 않는 점이 의외라고 평가했다.
- 남은 단점: 결과 역시 Claude 특유의 스타일이 강했고, 이미지 모델에 투자하지 않아 빈 이미지 영역이 많았다. Unsplash 같은 외부 소스에서 이미지를 가져올 수는 있지만, 이미지가 없으면 디자인의 매력이 크게 떨어진다.
1.3. HTML 슬라이드 덱 디자인
-
AI로 만드는 슬라이드의 전제
- 작업 방식: PowerPoint나 Google Slides에서 수동으로 만드는 대신 HTML과 AI로 슬라이드 전체를 제작한다.
- 재료와 규칙: Peter Yang의
slide skill에 슬라이드 문구를 주고, 자신의 브랜드 가이드라인을 적용해 덱을 만들도록 했다.
-
ChatGPT와 Claude의 결과
- ChatGPT 덱:
Rockbot is the future of personal agents라는 제목, 간단한 다이어그램, Rockbot을 최대한 활용하는 6가지 방법을 담았다. 전반적으로 괜찮지만 지시하지 않은 임의의 원이 들어갔고, 다이어그램은 다소 단순했다. - Claude 덱: 같은 스타일 템플릿을 따르므로 기본 모습은 비슷했다. 다만 다이어그램에 별이 나타나는 애니메이션이 있고, 다음 슬라이드도 더 매력적이었다. ChatGPT에 있던 이상한 원은 사라졌고 아이콘 일부에 애니메이션 효과가 들어갔다.
- 선호: 문구가 충분하고
slide skill같은 기술을 적용하면 Claude가 아름다운 슬라이드 덱을 만들 수 있으므로 슬라이드는 늘 Claude를 사용한다.
- ChatGPT 덱:
1.4. Claude Fable의 비디오 제작·편집
-
텍스트 지시만으로 만드는 제품 출시 영상
- 도구: GitHub에서 무료로 제공되는
hyper frames skill을 Claude Fable에 적용했다. - 결과:
human review skill을 소개하는 제품 출시 영상 전체를 텍스트 지시만으로 만들었다. 화면이 스크롤되고 요소가 바뀌며, 정적인 슬라이드 덱이 아니라 실제 제품 출시 영상처럼 보였다.
- 도구: GitHub에서 무료로 제공되는
-
말하는 영상에 오버레이를 추가하다
- video intro skill: 직접 만든 스킬로 talking-head 영상에 자막과 애니메이션을 추가했다.
- 자동화된 시각 요소: 자막, 오버레이, Claude가 스스로 찾은 아이콘을 넣었고 확대·축소(Zoom) 같은 효과도 지원했다.
- 현실적인 평가: 전문 비디오 편집기를 당장 완전히 대체하지는 않지만, 영상에 애니메이션과 일러스트를 추가하는 데 실제 도움을 준다.
- 예상: AI 비디오 편집이 전문 편집자가 하는 일의 90%를 수행하기까지 약 3개월이면 될 것이라고 보았다. Claude로 영상을 편집하는 방법을 다루는 별도의 콘텐츠도 만들 예정이라고 밝혔다.
1.5. 디자인 사용 사례의 최종 판정
-
Claude의 종합 승리
- 웹사이트, 앱, 슬라이드, 비디오를 아우르는 전체 디자인에서는 Claude가 앞선다.
- Claude를 쓸 때는 전형적인 베이지색 배경과 빨간색 하이라이트가 나타나는 Claude 스타일을 피하라고 명시해야 한다.
-
Grok의 추격
- 특히 웹사이트와 앱의 초기 프로토타입에서는 Grok이 강력한 경쟁자다.
- 이미지 생성과 레이아웃을 한 번에 제공하는 능력이 Grok의 차별점이다.
2. 일상적인 답변과 성격(Personality)
일상적인 질문에서는 모델의 성격과 말투가 답의 사실성만큼 중요하며, 현재는 ChatGPT가 Claude를 추월했다.
2.1. Claude의 성격 변화와 ChatGPT의 반전
-
Claude에 대한 과거의 선호
- 불과 몇 달 전에는 Claude와 대화하는 것이 가까운 친구와 이야기하는 것처럼 느껴졌다.
- 당시 Claude의 개성이 가장 뛰어났고,
Opus 4.6이 성격 면에서 가장 좋은 Claude 모델이었다고 평가했다.
-
Claude Opus 5에 대한 불만
Opus 5는 지나치게 판단하는 듯한 느낌을 준다.Here's honest truth같은 Claude 특유의 말투, 이른바 ‘Claude-speak’를 너무 자주 사용한다.- 그 결과 솔직히 더 이상 Claude와 대화하는 것이 즐겁지 않다고 말했다.
-
ChatGPT의 개선
- ChatGPT는 과거의 가장 짜증 나는 버릇을 없앴다. 예전에는 모든 답변 끝에 “원하면 X도 할 수 있고, Y 질문에도 답할 수 있다”는 식의 문장을 붙였다.
- 이런 문장이 가짜 같고 성가셨지만, 약 6개월 전과 달리 지금은 사라졌다.
- Grok과 Gemini는 시연하지 않았지만, 두 모델은 답변이 다소 기계적이고 장황한 경향이 있다고 평가했다.
2.2. 사용자 지정 지침으로 기본 성격을 개선하다
-
출고 상태의 공통 문제
- 네 모델 모두 기본 설정만으로는 아주 뛰어난 성격을 보여주지 못한다.
- 지나치게 장황하고, 과도하게 공감하며, 사용자에게 아첨하려 하고,
AI slop단어를 많이 쓴다는 것이 공통된 문제다.
-
ChatGPT Personality 설정에 넣을 지침
- 솔직함과 사고: “Be candid and thoughtful. Tell Peter what he needs to hear instead of what you think he likes to hear.” 즉 Peter가 듣고 싶어 하는 말이 아니라 들어야 할 말을 하라고 지시한다.
- 문체 절제: 능동태를 쓰고, 완곡한 표현(Hedging), 군더더기(Padding), 과장된 주장(Grand Claims)을 최소화한다.
- 구체성과 간결함: 구체적이고 간결한 답변을 선호하며, 모든 단어가 제자리를 차지할 가치가 있도록 한다.
- AI 상투어 금지:
delve,foster,leverage같은 AI 상투어와 유사한 표현을 쓰지 않는다.
-
최종 판정
- 덜 판단적이고 대화가 더 흥미로워진 ChatGPT가 일상 답변과 성격의 승자다.
- 월 20달러 플랜에서 넉넉한 사용량 제한(Generous Rate Limits)을 제공하는 점도 선택 근거다.
3. 글쓰기와 편집(Writing & Editing)
사용자 선호 문체를 구체적으로 학습시키는 스킬을 붙이면 ChatGPT가 Claude보다 글쓰기와 편집에 적합하다.
3.1. Claude의 문체 퇴보와 ChatGPT의 우위
-
Claude의 ‘Claudism’
- 최근 몇 달 동안 Claude의 글쓰기 실력이 퇴보했다고 느꼈다.
the uncomfortable reality,this is X, not Y같은 불편한 현실·대조형 표현을 지나치게 사용한다.- 이런 반복적인 표현이 글을 부자연스럽게 만들고 작성자를 매우 거슬리게 한다.
-
ChatGPT의 문체 적합성
- ChatGPT는 Peter Yang이 선호하는 글쓰기 스타일을 훨씬 잘 따른다.
- 따라서 새 글을 처음부터 생성하는 경우뿐 아니라 초고를 편집하는 경우에도 ChatGPT를 선호한다.
3.2. 뉴스레터 스킬과 평가 체계
-
스타일 가이드 구축
- ChatGPT에서
newsletter skill을 사용해 블로그 초고를 편집한다. - 스킬 파일에는 AI에 제공한 여러 글쓰기 예시를 바탕으로 만든 Peter의 목소리와 어조(Voice & Tone) 스타일 가이드가 들어 있다.
- 구체적으로 어떤 방식으로 Peter의 문체를 유지해야 하는지 지시한다.
- ChatGPT에서
-
초고 편집과 자기 평가
- 스킬은 글을 처음부터 쓰기보다 이미 작성한 첫 초고를 편집하는 데 자주 사용한다.
- 편집 결과의 맨 아래에는 무엇을 바꾸었는지와 함께 목소리(Voice), 후크(Hook), 실질적 내용(Substance), 결말의 보상(Payoff)에 대한 자체 점수가 나온다.
- 이상하게도 점수는 늘 36~38점 정도에 머문다. 평가기가 제대로 작동하지 않을 가능성은 있지만, 스킬 지시를 따랐는지 확인하는 별도 평가(Evals)는 갖추고 있다.
-
AI slop 제거 스킬
- 뉴스레터 스킬은 Peter가 만든
no AI slop skill도 실행한다. - 이 스킬은 ChatGPT와 특히 최악의 가해자로 지목된 Claude에서 AI 특유의 허술하고 반복적인 패턴을 제거한다.
- GitHub에서 무료로 확인할 수 있고, 당시 5,000개가 넘는 스타를 받았다.
- 뉴스레터 스킬은 Peter가 만든
-
유료 리소스 안내
- 직접 만든 뉴스레터 스킬과 12개 이상의 수제 스킬을 쓰고 싶다면
behindthecraft.com의 멤버십을 확인하라고 안내한다. - 멤버십에는 개인 AI 시스템 설정 방법에 대한 전체 강좌와 비공개 커뮤니티에서 Peter와 1년 동안 소통할 수 있는 권한이 포함된다.
- 직접 만든 뉴스레터 스킬과 12개 이상의 수제 스킬을 쓰고 싶다면
4. 계획 수립(Planning)과 복잡한 의사결정
장기적인 판단과 계획을 깊이 검토하는 능력에서는 Claude Fable이 여전히 가장 똑똑하고 현명한 선택이다.
4.1. 계획 문서로 같은 질문을 던지다
-
실제 의사결정의 유형
- 어떤 유료 상품을 출시할지 결정한다.
- 어떤 프로젝트를 중단할지 판단한다.
- 향후 3개월 동안 무엇에 집중할지 정한다.
-
비교 방법
- ChatGPT와 Claude에 계획 문서를 읽게 하고, 민감한 정보는 공유하지 않은 상태에서 다음 3개월의 우선순위를 말해 달라고 했다.
- ChatGPT는 개인 AI 강좌를 구축하고, 한 분기 동안 활성화(Activation)와 갱신(Renewal) 개선에 투자하며, 다른 작업도 진행하라고 제안했다.
4.2. Claude Fable이 찾아낸 운영 병목
-
공통된 핵심 결론
- Claude도 “멤버십 출시를 성공적으로 진행하라(Make the membership launch work)”고 답했다.
- 이 부분은 ChatGPT의 결론과 거의 같았다.
-
차이를 만든 한 문장
- Claude는 “이번 주에 비디오 운영 격차를 해소하라(Close the video ops gap this week)”고 추가로 지적했다.
- 비용을 낮게 유지하면서 해결하라고 권했다.
-
실제 맥락과 실행안
- Peter의 영상 클립 제작과 팟캐스트 후반 작업을 돕던 관리자가 8월 19일 이후 더 이상 함께 일하지 않게 됐다.
- 따라서 후임 운영 담당자 또는 가상 비서(VA)를 찾아야 한다.
- Peter는 다른 사람에게 위임하기보다 직접 하거나 AI로 처리하는 일이 너무 많아지는 경향이 있는데, Claude Fable이 이 위임·운영 문제를 계획 문서에서 찾아냈다.
-
최종 판정과 향후 변수
- 한 가지 사례일 수 있다는 유보는 있지만, 복잡한 의사결정에 대해 Fable이 조금 더 똑똑하고 깊이 생각한 조언을 준다고 평가했다.
- 따라서 계획 수립의 승자는 Claude다.
- 새 모델
ChatGPT Astro가 출시되기 전까지는 이 판단을 유지할 것이라고 말했다.
5. 코딩(Coding)
비엔지니어가 AI로 제품을 끝까지 작동시키는 관점에서는 ChatGPT가 앞서지만, 실제 코드를 읽는 전문 엔지니어의 평가는 Grok일 수 있다.
5.1. 비엔지니어의 AI 코딩 방식
-
사용자 맥락
- Peter는 오픈소스 프로젝트와 개인용 앱을 몇 개 출시했지만 소프트웨어 엔지니어는 아니다.
- AI로 만들 때 코드를 전혀 보지 않는다고 말하며, 엔지니어에게는 신성모독처럼 들릴 수 있다고 농담했다.
-
역할 분담
- 장기적 사고와 구조화가 필요한 계획은 Claude Fable로 세운다.
- 실제 코딩과 반복적인 수정은 ChatGPT로 한다.
5.2. ChatGPT의 실행·브라우저 테스트 능력
-
끝까지 작동시키는 흐름
- 자막에
GPT So로 표기된 모델이 브라우저 사용(Browser Use)으로 테스트를 실행하고 버그를 수정하며 기능이 실제로 작동할 때까지 멈추지 않는다고 평가했다. human review skill을 만드는 대화에서 문제를 지적하면 AI가 버그 수정과 개선을 반복하고, 결국 제품이 작동하는 수준에 도달한다.
- 자막에
-
하네스와 컨텍스트 관리
- ChatGPT 하네스는 브라우저를 직접 사용해 제품을 테스트하고, 사용자가 곁에 없어도 결과를 개선한다.
- 긴 대화와 컨텍스트를 관리하는 능력도 ChatGPT가 낫다고 느꼈다.
- Claude를 쓸 때는 계속 컨텍스트를 압축(Compact)하라고 알려야 하지만, ChatGPT는 긴 대화를 이어가도 혼란이 적었다.
5.3. 전문 엔지니어 Kun의 반론
-
과도한 엔지니어링 문제
- 실제 엔지니어이며 L8 엔지니어였던 친구 Kun은 코드를 직접 읽기 때문에 GPT-4와 Opus가 제품을 지나치게 복잡하게 만든다고 본다.
- 기능을 해결하는 과정에서 불필요하게 큰 구조와 변경을 만들어낼 수 있다는 뜻이다.
-
Grok을 선호하는 이유
- Kun은 더 빠르게 변경하고 더 구체적인 수정만 하기 위해 Grok을 권한다.
- GPT나 Opus처럼 한 번에 50만 줄을 바꾸는 식의 과도한 변경을 피할 수 있다는 판단이다.
- 따라서 코드 품질을 직접 점검하는 전문 엔지니어라면 ChatGPT보다 Grok을 선호할 수 있다.
-
최종 판정
- Peter 자신의 사용 방식에서는 브라우저 테스트, 버그 수정, 긴 대화 관리가 가능한 ChatGPT에 코딩 상을 준다.
- 다만 개발자는 이 결론을 일반화하기 전에 전문 엔지니어의 다른 의견도 들어야 한다.
6. 브라우저·컴퓨터 사용(Browser & Computer Use)
API가 없거나 API 사용료를 내야 하는 웹사이트와 앱에 남아 있는 지식 작업을 자동화하는 능력은 가장 과소평가된 영역이며, ChatGPT가 크게 앞선다.
6.1. 이민 서류 패키지 자동화
-
웹 기반 지식 작업의 현실
- 정부 웹사이트에서는 여러 페이지를 이동하고 수많은 파일을 업로드해야 한다.
- API가 없거나 API를 쓰려면 돈을 내야 하는 사이트 안에 이런 지식 작업이 많이 남아 있다.
-
실제 사례
- OpenAI에서 직접 일하는 한 사람이 ChatGPT 브라우저 사용 기능으로 이민 서류 패키지를 준비했다.
- 최근 7년의 세금 기록, 은행 거래 내역, 각종 문서를 스크래핑해 단 몇 분 만에 패키지를 만들었다.
- Peter는 자신과 다른 사람들의 이민 패키지를 준비해 본 경험상 이 작업이 보통 몇 시간에서 며칠까지 걸린다고 설명했다.
-
안전상의 주의와 가치
- 미국 정부를 상대로 하는 업무인 만큼 GPT가 처리한 모든 내용을 사람이 반드시 검토해야 한다.
- 그럼에도 수작업 시간을 몇 시간 또는 며칠에서 몇 분으로 줄일 수 있다는 점은 매우 인상적이다.
6.2. 소셜 미디어 게시물의 다중 플랫폼 배포
-
초안 생성
- Peter는 최근 자신의
Marie Kondo Grok bot에 대해 X에 글을 올리고 이미지를 첨부했다. social post skill에 X에서 Grok Bot 튜토리얼의 원래 공지 게시물을 인용 트윗(Quote Tweet)하라고 지시했다.- AI가 초안을 만든 뒤 Peter가 직접 일부를 수정했다.
- Peter는 최근 자신의
-
한 번의 지시로 여러 채널에 게시
- 세 개의 플랫폼과 Substack에도 같은 게시물을 올리라고 요청하자 AI가 모두 게시했다.
- 평소라면 각 도구를 하나씩 열어야 하고, Typefully 같은 앱을 사용해도 클릭과 이동이 더 많이 필요하다.
-
플랫폼별 맥락을 이해하는 예
- X에서는 Grok Bot의 핸들인
@GrokBot을 태그해야 한다. - LinkedIn과 Threads에는 같은 핸들이 실제로 존재하지 않으므로 태그하면 안 된다.
- 단순한 예지만 플랫폼의 미묘한 차이를 처리하는 것이 브라우저 에이전트의 실용적인 강점이다.
- X에서는 Grok Bot의 핸들인
6.3. 브라우저 사용의 범용성 및 모델별 평가
-
적용 가능한 귀찮은 작업
- 온라인 양식 작성, 형편없는 정부 웹사이트 사용, 의료 웹사이트 탐색처럼 클릭이 많고 반복적인 작업에 유용하다.
- 농담 섞인 비밀 사례로, 직접 참석하지 않고도 브라우저 사용으로 회사 교육 영상을 시청하게 할 수 있다고 말했다.
-
모델별 판정
- ChatGPT가 브라우저 사용의 승자다.
- Claude에도 브라우저 사용 기능은 있지만 ChatGPT만큼 좋지 않다.
- Grok Bot은 전용 개인용 컴퓨터에서는 꽤 좋지만 웹 브라우저 사용은 상대적으로 약하다.
- Gemini의 브라우저 사용은 아직 개발 중인 단계라고 평가했다.
- 이 기능이 ChatGPT 데스크톱 앱을 좋아하는 가장 큰 이유일 수 있다고 덧붙였다.
7. 음성 채팅(Voice Chat)
ChatGPT의 데스크톱 음성 채팅은 여러 작업 스레드와 에이전트를 말로 조율하는 데 가장 앞서 있다.
7.1. 음성으로 여러 스레드를 오케스트레이션하다
-
실시간 음성 스레드의 역할
- ChatGPT 데스크톱 앱에서 라이브 음성 스레드를 열고, 다른 에이전트와 스레드를 조율한다.
- 화면에서 음성 자체는 들리지 않더라도, 말하는 내용이 텍스트로 생성되는 과정을 확인할 수 있다.
-
실제 지시 내용
- Personal OS에서 뉴스레터 스레드를 시작해 최근 게시물을 편집하라고 했다.
- Chief of Staff 스레드에서 미해결 항목이 있는지 후속 조치하라고 했다.
- Video Intro Skill 스레드에 남은 작업이 있는지도 확인하라고 했다.
7.2. 이름 기반 조율과 ‘게으름’의 생산성
-
스레드 오케스트레이션
- 음성으로 다른 세 스레드를 동시에 조율하려면 각 스레드 이름을 기억해야 한다.
- 그래서 화면의 모든 스레드에 이름이 붙어 있다.
- 상위 음성 스레드가 각 스레드를 살펴보고 작업을 시작하라는 지시를 전달한다.
- 실제로 새 뉴스레터 편집 스레드를 만들고 작업 시작 방법을 안내했으며 다른 스레드도 함께 조율했다.
-
사용 장면
- 산책 중이거나 침대에 누워 있어도 ChatGPT 음성에게 말해 다른 스레드가 일을 하게 할 수 있다.
- Peter는 특히 점심을 많이 먹은 뒤 오후에 이런 방식으로 작업을 맡긴다고 농담했다.
- 음성 채팅의 최종 승자는 큰 차이로 ChatGPT다.
8. 이미지 생성(Image Generation)
사용자의 기존 대화 맥락과 브랜드 지침을 활용하는 ChatGPT가 인포그래픽 생성에서 가장 안정적으로 지시를 따랐다.
8.1. 동일한 뉴스레터로 인포그래픽 만들기
-
테스트 자료
How we use computers is about to change forever라는 자신의 뉴스레터 글 전체를 복사했다.- Claude에는 이미지 생성 기능이 없어 ChatGPT, Grok, Gemini에만 전체 글을 붙여넣었다.
- “이 글을 위한 인포그래픽을 만들고 텍스트는 가볍고 깔끔하게 유지하라”고 요청했다.
-
Grok의 결과
- 클립아트 스타일의 그림을 사용했다.
- 전체 인포그래픽이 매우 기본적이고 기대에 못 미쳤다.
-
Gemini의 결과
- Grok보다 상세했고 다이어그램과 텍스트가 실제 내용에 맞았다.
- 그러나 텍스트를 적게 하라는 지시와 달리 글자가 지나치게 빽빽했다.
Nano Banana라는 이상한 요소도 들어갔다. Nano Banana로 만들라고 직접 지시했기 때문에 생긴 결과일 수 있어 이 부분은 자신의 책임일 수도 있다고 인정했다.
-
ChatGPT의 결과
- 과거 대화에서 브랜드 가이드라인과 해당 게시물에 대해 충분히 대화했기 때문에 테스트 조건이 조금 더 유리했다.
- 이미지가 여전히 다소 크지만, 원형 도형, 선호하는 색상, 원하는 일러스트 스타일을 브랜드 가이드라인에 맞춰 표현했다.
8.2. 최종 판정
- ChatGPT의 승리: 다른 두 모델보다 지시를 잘 따르고 기존 브랜드 맥락을 활용한다.
- Gemini의 잠재력: Nano Banana도 좋은 결과를 내며, 이미지 안의 텍스트 양을 줄이라고 올바르게 지시하면 ChatGPT와 비교할 만하다.
- Claude의 조건: 이 비교에서는 이미지 생성 기능이 없으므로 직접 경쟁에서 제외됐다.
9. 비디오 생성(Video Generation)
가족용 영상과 기발한 광고를 만드는 단일 사례에서는 Gemini가 Grok보다 자연스럽고 즐거운 결과를 냈다.
9.1. 일본식 라면 광고 테스트
-
테스트 설정
- 비디오를 생성할 수 있는 모델은 Grok과 Gemini뿐이므로 두 모델을 비교했다.
- 아이들과 함께하는 가족 활동으로, 가족 사진을 활용해 미친 듯이 재미있는 일본식 비디오 광고를 만드는 작업을 즐긴다고 설명했다.
- 자신의 이미지를 넣어 맛있는 라면을 광고하는 일본식 영상을 만들고, 최대한 기발하게 하며, 보이스오버(Voice-over)도 일본어로 하라고 요청했다.
-
Gemini의 결과
- 소리를 끄면 전체 감각을 다 확인하기 어렵지만, 소리를 켜면 훨씬 재미있었다.
- 이미 충분히 놀랍고 품질도 좋았다.
- 체면을 지키기 위해 공개적으로 공유하지는 않겠지만, Peter와 아이들을 확실히 웃게 만들었다.
-
Grok Imagine의 결과
- 얼굴 표정과 움직임을 지나치게 과장했다.
- 광고 속에서 자신이 뛰고 미친 듯이 흥분하는 모습이 너무 무섭고 무슨 일이 일어나는지 알 수 없을 정도라고 평가했다.
9.2. 자유도와 제한의 트레이드오프
- Gemini의 승리: 단일 사례에 근거한 판정이지만 가족 영상과 기발한 일본 광고에는 Gemini가 더 좋았다.
- Grok의 잠재적 강점: Grok은 생성할 수 있는 영상 유형에 걸린 제한이 더 적을 가능성이 있다.
- 다른 선택지: 중국 도구인
SeaArt처럼 사실상 제한이 없는 도구도 있다고 언급했다.
10. 개인 에이전트(Personal Agents)
개인 에이전트 경쟁은 모델의 벤치마크보다 좋아하는 앱 전반에서 일을 수행하게 만드는 도구와 하네스의 경쟁이며, 현재는 ChatGPT가 가장 견고하다.
10.1. ChatGPT 데스크톱 앱의 강점
-
하네스가 핵심인 이유
- 개인 에이전트는 좋아하는 여러 앱에서 작업을 처리해 주는 AI를 뜻한다.
- 승부는 모델 자체보다 하네스 또는 도구에 더 달려 있다.
-
ChatGPT를 기본 앱으로 쓰는 근거
- 앞서 확인한 브라우저 사용, 음성, 모바일 접속 기능이 동급 최고 수준이다.
- Codex와 ChatGPT, Chat과 Work 같은 여러 모드가 있고, 많은 스레드를 한곳에서 관리할 수 있다.
- 스레드와 모드가 많아 조금 압도될 수 있지만, 전체적으로 가장 견고하고 유연한 하네스라고 평가했다.
10.2. Claude Code와 Grok Bot의 비교
-
Claude Code
- Claude Code 하네스 자체는 상당히 훌륭하다.
- 그러나 브라우저 사용, 음성, 모바일 측면에서는 ChatGPT를 따라잡는 단계라고 보았다.
-
Grok Bot
- ChatGPT보다 훨씬 깔끔한 사용자 경험(UX)을 가진 새로운 플레이어다.
- Grok 에이전트마다 24시간 내내 살아 있을 수 있는 전용 클라우드 컴퓨터를 제공하는 점을 높이 평가했다.
- 전반적인 디자인은 잘 되어 있지만 유연성은 부족하다.
- 각 에이전트와 하나의 채팅 스레드가 아니라 여러 채팅 스레드에서 대화하고 싶은데, 현재는 에이전트당 하나의 스레드에 가까워 너무 제한적으로 느껴진다.
10.3. Gemini Spark와 플랫폼 선택
-
Spark
- 많은 사람이 모르지만 Gemini에도
Spark라는 개인 에이전트가 있다. - 디자인이 좋고 흥미로운 제품이며 Google Workspace와 잘 통합된다.
- 최근에는 서드파티 서비스 통합도 추가된 것으로 보인다.
- 많은 사람이 모르지만 Gemini에도
-
한계와 최종 판정
- ChatGPT가 이미 지원하는 복잡한 플러그인을 전부 지원하지는 않는다.
- 따라서 개인 에이전트의 최종 승자는 ChatGPT다.
- Grok Bot이 더 견고하고 유연해지면 언젠가 Grok으로 옮길 수 있다고 했다.
10.4. AI 생산성의 가장 중요한 전장
-
코딩보다 중요한 이유
- 개인 에이전트는 AI 생산성에서 가장 중요한 사용 사례일 수 있으며, 코딩보다도 중요하다고 평가했다.
- 어떤 제품이 개인 에이전트 경쟁에서 이기든 AI에 대한 소비자 관심의 ‘사자 몫(Lion’s Share)’을 차지하게 된다.
-
현재의 실용적인 선택
- ChatGPT 데스크톱 앱은 브라우저·음성·모바일과 여러 모드를 하나의 하네스로 묶는다.
- Grok Bot은 더 깔끔한 UX와 24/7 클라우드 컴퓨터라는 강점을 갖지만 현재는 유연성이 부족하다.
- Gemini Spark는 Workspace 중심 사용자에게 매력적이지만 플러그인 폭이 좁다.
주요 발언 모음
“오늘날에는 수많은 AI 도구와 모델이 존재하기 때문에 어떤 도구가 가장 좋은지는 사용 사례에 따라 달라진다.”
“순수하게 0에서 1까지의 결과만 놓고 보면 Grok이 이긴다.”
“웹사이트, 앱, 슬라이드, 비디오 디자인에서는 여전히 Claude가 승자다.”
“일상적인 답변과 성격의 승자는 ChatGPT다.”
“Peter가 듣고 싶어 할 것 같은 말이 아니라, 그가 들어야 할 말을 해라.”
“복잡한 결정에 조언을 줄 때 Fable이 조금 더 똑똑하고, 조금 더 깊이 생각한 것 같다.”
“코드를 읽는 전문 엔지니어라면 GPT와 Opus가 과도하게 엔지니어링한다고 판단할 수 있다.”
“브라우저 사용은 가장 과소평가된 범주일지도 모른다.”
“산책을 하거나 침대에 누워서 ChatGPT 음성에게 말하고 다른 스레드를 조율하게 할 수 있다.”
“개인 에이전트 경쟁은 모델보다는 하네스나 도구에 더 가깝다.”
“개인 에이전트 경쟁에서 누가 이기든 AI에 대한 소비자 관심의 사자 몫을 차지할 것이다.”
“대부분의 사람에게는 월 20달러로 ChatGPT의 모든 기능에 접근하는 것만으로도 충분히 좋은 조건이다.”
핵심 데이터 & 수치
- 10가지 사용 사례: 디자인, 일상 답변·성격, 글쓰기·편집, 계획, 코딩, 브라우저·컴퓨터 사용, 음성 채팅, 이미지 생성, 비디오 생성, 개인 에이전트를 비교했다.
- 월 20달러: ChatGPT 플랜의 가격과 관대한 사용량 제한이 일상 답변 및 최종 추천의 근거로 제시됐다.
- 20분: Claude Design에 레시피 앱의 대상 사용자를 ‘20분 안에 요리하려는 바쁜 사람’으로 구체화했다.
- 향후 3개월: 유료 상품, 중단할 프로젝트, 집중할 일을 결정하는 계획 수립 테스트의 시간 범위다.
- 8월 19일: Peter의 영상 클립·팟캐스트 후반 작업을 돕던 관리자가 더 이상 일하지 않게 된 시점이다.
- 7년: ChatGPT 브라우저 사용으로 이민 서류를 만들 때 수집한 세금 기록과 은행 자료의 기간이다.
- 몇 시간~며칠 대 몇 분: 이민 서류 패키지를 기존 수작업으로 준비하는 시간과 자동화 후의 시간을 비교한 수치다.
- 50만 줄: Kun이 GPT와 Opus의 과도한 변경·오버엔지니어링을 설명하며 든 코드 변경 규모다.
- 약 3개월: AI 비디오 편집이 전문 편집자 작업의 90%를 수행할 수 있게 될 것이라는 예상 기간이다.
- 90%: 위 예상에서 AI가 수행할 수 있다고 본 전문 영상 편집 업무의 비율이다.
- 5,000개 이상: Peter의
no AI slop skill이 GitHub에서 받은 스타 수다. - 12개 이상: behindthecraft.com 멤버십에서 뉴스레터 스킬과 함께 제공한다고 안내한 수제 스킬의 대략적인 수다.
- 1년: 멤버십 비공개 커뮤니티에서 Peter와 소통할 수 있는 기간이다.
- 24/7: Grok Bot이 에이전트마다 제공하는 전용 클라우드 컴퓨터의 상시 운영 특성이다.
- 26분 47초: yt-dlp로 확인한 원본 영상 재생 시간이다.
모델별 최종 선호 표
| 사용 사례 | 최종 선호 | 핵심 근거 | 대안·주의점 |
|---|---|---|---|
| 디자인 | Claude | 웹·앱·슬라이드·비디오의 전체 완성도, Claude Design의 명확화 질문 | Grok은 앱·웹의 0→1과 이미지에서 강함 |
| 일상 답변·성격 | ChatGPT | 덜 판단적이고 덜 가식적이며 관대한 사용량 제한 | 기본 설정은 여전히 장황하고 아첨이 많아 사용자 지침 필요 |
| 글쓰기·편집 | ChatGPT | 선호 문체 준수, 뉴스레터 스킬·평가 체계 | Claude의 Claudism과 AI 상투어 주의 |
| 계획 수립 | Claude Fable | 장기적 사고, 영상 운영 격차처럼 놓치기 쉬운 병목 발견 | ChatGPT Astro 출시 후 재평가 가능 |
| 코딩 | ChatGPT | 브라우저 테스트, 버그 수정, 긴 컨텍스트와 반복 작업 | 코드를 읽는 전문가는 Grok의 구체적 변경을 선호할 수 있음 |
| 브라우저·컴퓨터 사용 | ChatGPT | 정부·의료 사이트, 문서·다중 플랫폼 작업 자동화 | 결과를 반드시 사람과 검토해야 함 |
| 음성 채팅 | ChatGPT | 음성으로 여러 스레드와 에이전트 조율, 데스크톱·모바일 연계 | 스레드 이름을 기억해야 함 |
| 이미지 생성 | ChatGPT | 브랜드 맥락과 지시 준수, 브랜드 가이드라인 활용 | Gemini Nano Banana도 텍스트를 줄이면 경쟁력 있음 |
| 비디오 생성 | Gemini | 가족용 영상·일본식 광고의 자연스러움과 재미 | Grok은 제한이 적을 가능성이 있으나 결과가 과장되고 무서울 수 있음 |
| 개인 에이전트 | ChatGPT | 브라우저·음성·모바일·플러그인과 견고한 하네스 | Grok Bot은 깔끔한 UX·24/7 클라우드, Gemini Spark는 Workspace 연동 |
결론 및 시사점
- 현재 Peter Yang의 종합 승자는 ChatGPT다. ChatGPT와 Code Assistant의 출시 속도를 보면 선두를 쉽게 내주지 않을 가능성이 높다고 평가했다.
- Claude는 디자인과 기획에서 여전히 강력하다. 명확화 질문을 거쳐 의도를 구체화하고, 슬라이드·영상에서 높은 시각적 완성도를 내는 점이 차별점이다.
- ChatGPT는 일상 대화, 문체 편집, 브라우저 자동화, 음성 기반 오케스트레이션, 브랜드 맥락을 활용한 이미지 생성에서 폭넓게 앞선다.
- 코딩 결과는 사용자 유형에 따라 달라진다. 코드를 직접 보지 않는 사용자에게는 ChatGPT의 브라우저 테스트와 긴 대화 관리가 유리하지만, 코드를 읽는 전문 엔지니어는 Grok의 작고 구체적인 변경을 더 신뢰할 수 있다.
- Gemini는 비디오 생성에서 뚜렷한 승자다. 소리를 포함한 가족용 영상과 기발한 광고를 자연스럽고 재미있게 만들었으며 ChatGPT보다 사용법도 조금 단순하다.
- Grok은 웹·앱 프로토타이핑, 이미지 생성, Grok Bot 기반 개인 에이전트에서 강력한 경쟁자다. 특히 깔끔한 UX와 24시간 전용 클라우드 컴퓨터는 잠재력이 크지만, 현재는 에이전트별 스레드 구조가 제한적이다.
- 개인 에이전트는 코딩보다 중요한 AI 생산성 전장일 수 있다. 소비자가 여러 앱에서 실제 일을 위임하는 경험이 모델의 단일 답변 품질보다 장기적인 제품 충성도를 좌우한다.
- 실무자는 하나의 모델을 종교적으로 고르기보다 작업별로 조합하는 편이 합리적이다. Claude로 방향과 계획을 세우고 ChatGPT로 구현·자동화하며 Gemini와 Grok을 영상·프로토타이핑에 활용하는 방식이다.
- 대부분의 사람은 월 20달러 ChatGPT만으로도 브라우저, 음성, 모바일, 코딩, 이미지, 에이전트 기능을 폭넓게 사용할 수 있다.
- 모델의 기본 출력은 어느 회사 제품이든 장황함, 아첨, AI 상투어를 포함할 수 있다. 구체적인 문체 지침과 평가(Evals)를 직접 구축하는 능력이 모델 선택만큼 중요하다.
핵심 요약 (20줄)
ChatGPT·Claude·Grok·Gemini의 최적 선택은 절대적인 순위보다 사용 사례에 따라 달라진다. Claude는 웹사이트·앱·슬라이드·비디오를 아우르는 디자인 작업에서 가장 높은 전체 완성도를 보인다. Grok은 이미지 생성과 명확한 레이아웃을 결합한 모바일 레시피 앱 프로토타입으로 0→1 시각 결과를 앞세운다. Claude Design은 디자인 시스템과 대상 사용자를 먼저 묻는 명확화 질문으로 요구사항을 구체화한다. Claude의 슬라이드와 Claude Fable의 영상은 적절한 스킬과 문구를 주면 정적인 결과를 넘어선다. AI 비디오 편집은 약 3개월 안에 전문 편집자의 업무 90%를 수행할 가능성이 있다고 전망된다. ChatGPT는 덜 판단적이고 덜 가식적인 대화 성격 덕분에 일상 답변 분야에서 Claude를 추월했다. ChatGPT의 Personality 설정에는 솔직함, 능동태, 간결함, AI 상투어 금지 지침을 넣는 편이 좋다. ChatGPT는 Peter Yang의 선호 문체를 Claude보다 잘 따르므로 글쓰기와 편집의 승자다. 뉴스레터 스킬은 글쓰기 예시로 만든 스타일 가이드와 자체 평가를 이용해 초고를 편집한다. No AI slop 스킬은 반복적인 AI 문체를 제거하며 GitHub에서 5,000개 이상의 스타를 받았다. Claude Fable은 향후 3개월 계획에서 멤버십 출시뿐 아니라 영상 운영 공백까지 찾아냈다. ChatGPT는 브라우저 테스트와 긴 컨텍스트 관리 덕분에 비엔지니어의 코딩 실행에 적합하다. 전문 엔지니어 Kun은 GPT와 Opus의 과도한 변경을 피하려고 더 구체적인 Grok 수정을 선호한다. ChatGPT 브라우저 사용은 7년치 세금·은행 자료를 이민 서류로 정리하는 반복 업무를 단축한다. 정부·의료 사이트 자동화는 강력하지만 AI가 처리한 결과를 사람이 반드시 검토해야 한다. ChatGPT 음성은 뉴스레터·Chief of Staff·Video Intro Skill 등 여러 스레드를 말로 조율한다. 브랜드 가이드라인과 과거 대화 맥락을 활용하는 ChatGPT가 인포그래픽 생성에서 가장 안정적이다. Gemini는 자연스럽고 재미있는 가족용 일본식 라면 광고를 만들어 비디오 생성의 승자가 됐다. 현재 개인 에이전트의 종합 승자는 ChatGPT지만 Grok Bot과 Gemini Spark도 중요한 경쟁자로 성장하고 있다.
