URL: https://www.youtube.com/watch?v=GiaDdNvsadA
날짜: 2026-10-05 (처리일: 2026-10-07)
채널: Peter Yang
메타데이터
- 원문 제목: Build an AI Language Tutor You Can Talk To (6 Steps)
- 영상 ID: GiaDdNvsadA
- 업로드일: 2026-10-05
- 처리 기준일: 2026-10-07 (Asia/Seoul)
- 콘텐츠 유형: YouTube 영상 심층 다이제스트
- 주제: Gemini Live API와 생성형 AI 도구를 활용한 음성 언어 학습 웹 앱 제작
- 자막 기준: YouTube 자동 생성 영어 자막을 전체 검토해 한국어로 정리
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==음성 대화(Voice Conversation)를 중심으로 한 개인용 언어 학습 앱은 AI와 여섯 단계의 반복 작업만으로도 만들 수 있으며, 결과의 품질은 첫 버전보다 앱과 학습 콘텐츠를 얼마나 오래 테스트하고 개선하느냐에 달려 있다.==
- 아이디어를 AI와 대화하며 조사하고, 요구사항·사용자·핵심 화면을 먼저 명확히 한다.
- 명세(Specification)와 디자인 목업을 만든 뒤 AI 코딩 도구로 첫 버전을 생성한다.
- Gemini Live API, Nano Banana, Anti-Gravity, Claude Code, Human Review 같은 도구를 각 단계에 맞게 사용한다.
- 마이크, 화면 갱신, 응답 속도, 이미지, 수업 순서와 표현을 직접 테스트하며 반복 개선한다.
- 약 2~3시간이 걸린 제작 시간 중 2시간 이상은 구현 자체가 아니라 테스트와 반복 개선에 쓰였다.
Peter Yang은 일본 여행자를 위해 일본어 필수 문장 100개를 10개 수업으로 나누고, 각 수업에서 문장을 가르친 다음 실제 대화로 연습시키는 음성 튜터를 만들었다. 이 사례는 AI가 앱의 초안과 코드를 생성하는 것보다, 사용자의 실제 문제를 정의하고 학습 경험을 검증하며 콘텐츠를 고치는 과정이 제품 완성도를 좌우한다는 점을 보여준다.
1. 완성된 언어 튜터의 경험과 제품 구조
이 앱은 10개의 여행 일본어 수업과 음성 대화형 코치 Yuki를 결합해, 암기와 실전 연습을 하나의 흐름으로 만든다.
1.1. 홈 화면과 수업 화면
-
10개 수업의 진행 구조
- 메인 화면에는 여행에 필요한 문장을 다루는 10개 수업이 표시된다.
- 사용자는 각 수업을 펼쳐서 해당 장면을 표현한 귀여운 디오라마(diorama) 그래픽을 볼 수 있다.
- 원래 목표는 여행자에게 유용한 문장 100개를 10개 수업, 수업당 10개 문장으로 제공하는 것이다.
-
Yuki와의 음성 학습
- 첫 수업에서 Yuki는 “good morning”에 해당하는 일본어 인사 Ohayou gozaimasu를 가르친다.
- gozaimasu를 붙이면 표준 인사를 공손하게 만들 수 있고, 학습자는 코치의 발음을 들은 뒤 직접 따라 한다.
- 일본어의 모음은 항상 같은 소리를 낸다는 발음 규칙도 함께 알려준다.
- “yes”를 가장 쉽게 말하는 표현으로 한 음절인 Hi를 소개하고, 학습자가 다시 말하면 Yuki가 잘했다고 응답한다.
1.2. 한 수업의 두 단계
-
문장 학습 단계
- 코치는 수업에 포함된 문장 10개를 하나씩 가르친다.
- 각 말풍선은 일본어, Romaji, English를 함께 보여주는 형식으로 설계한다.
- 학습자는 말풍선을 눌러 각 문장을 들을 수도 있고, 음성으로 따라 할 수도 있다.
-
대화 연습 단계
- 문장 10개를 모두 학습한 뒤 코치는 학습자가 실제 상황에서 문장을 사용하도록 역할극(role-play)을 시작한다.
- 예시로 도쿄에서 하루를 보내며 호텔 직원이 Ohayou gozaimasu라고 인사하면 학습자가 같은 말로 답한다.
- 누군가 보도를 막고 있으면 학습자는 “I'm sorry”라고 공손하게 말하는 상황을 연습한다.
- 발표자는 자신의 일본어 발음이 완벽하지 않다고 인정하면서도, 이 흐름이 앱의 목적을 보여준다고 설명한다.
2. 6단계 제작 전략의 전체 지도
앱 제작은 아이디어 탐색, 명세·디자인, 첫 버전, 앱 개선, 수업 콘텐츠 개선, 출시의 여섯 단계로 진행된다.
2.1. AI를 제품 파트너로 사용하는 원칙
-
문제 정의를 먼저 맡기기
- 새 프로젝트를 시작할 때 AI를 참여시키면 사용자의 요청을 명확히 하고 문제를 풀며 결과물의 형태를 파악하는 데 도움을 받을 수 있다.
- 첫 대화에서 바로 코드를 만들게 하지 않고, 먼저 조사하고 세 가지 명확화 질문을 하도록 지시한다.
-
개인 문제를 위한 앱 만들기
- Gemini API 호출에는 비용이 들기 때문에 처음부터 대중에게 판매할 계획이 아니라 자신과 몇 명의 친구를 위한 앱으로 범위를 제한했다.
- 현대적인 AI 도구의 장점은 거대한 시장을 먼저 찾지 않아도 자신의 문제를 해결하는 유용한 개인용 애플리케이션을 만들 수 있다는 데 있다.
2.2. 구현에 사용한 Google 도구
-
대화와 음성
- 영상은 Google의 후원을 받았으며, 실시간 대화에는 Gemini Live APIs를 사용한다.
- 발표자는 Gemini Live API가 실시간 음성과 대화에 가장 적합한 선택이라고 설명하고 관련 비교 그래프를 보여준다.
- 각 말풍선을 눌러 문장을 들려주는 기능에도 Google의 음성·오디오 모델을 사용한다.
-
이미지와 제작 환경
- 장면 이미지와 디오라마 그래픽은 Gemini의 Nano Banana 모델로 생성한다.
- Google API를 잘 다루는 Google Anti-Gravity를 첫 앱 생성에 사용한다.
- 영상에서 함께 언급된 Clockwork도 앱 제작 도구 묶음의 일부로 사용한다.
3. 1단계 — AI와 아이디어를 조사하고 명확히 하기
AI에게 곧바로 구현을 지시하기보다 여행 목적, 화면, 학습 흐름, 사용자 범위를 함께 정리하면 뒤 단계의 설계가 구체화된다.
3.1. 최초 요청과 참조 앱
-
여행 목적을 제품 요구사항으로 바꾸기
- 발표자는 일본에 갈 예정이므로 여행자에게 정말 유용한 일본어 문장 100개를 가르치는 모바일 친화적(phone-friendly) 웹 앱을 요청했다.
- 앱은 10개 수업으로 구성하고 각 수업에 10개 문장을 넣도록 요구했다.
-
기존 앱의 스타일 재사용
- 발표자가 영화와 TV 프로그램을 고르는 앱 Taste Maker를 이전에 만들었고 그 스타일과 미학을 좋아했기 때문에 AI에게 외관과 분위기를 참고하게 했다.
- 핵심 화면은 10개 수업의 진행 상황을 보여주는 홈 화면, 텍스트 말풍선이 있는 수업 화면, 음성 통신을 켜는 버튼으로 정의했다.
-
모델 선택까지 명시하기
- 장면 이미지는 Nano Banana로 만들고, Gemini가 제공하는 가장 좋은 음성·오디오 모델을 사용하라고 요청했다.
- AI가 조사한 결과 Taste Maker의 화면 스타일을 참고할 수 있었고, Google이 사용할 수 있는 새로운 음성 모델을 출시했으며, 이미지에는 Nano Banana를 쓸 수 있다는 점을 확인했다.
3.2. 세 가지 명확화 질문과 결정
-
음성 통화는 어떤 모습이어야 하는가
- AI는 음성 대화의 형식을 물었고, 발표자는 먼저 문장 10개를 가르친 다음 역할극으로 연습하게 하겠다고 답했다.
- 따라서 음성 기능은 자유 대화부터 시작하는 것이 아니라 학습한 표현을 실제 맥락에 적용하는 단계로 배치됐다.
-
말풍선은 어떻게 표시할 것인가
- 각 말풍선에는 일본어 원문, Romaji, English를 함께 넣기로 했다.
- 이 형식은 일본어 문자를 아직 읽지 못해도 발음과 의미를 동시에 확인할 수 있게 한다.
-
누가 사용할 것인가
- Gemini API에는 호출 비용이 발생하므로 우선 발표자 자신과 몇 명의 친구만 사용하는 앱으로 결정했다.
- 수익화 요구를 제거하면서 실제 여행 준비라는 개인적 필요에 맞춰 제품 범위를 작게 유지했다.
4. 2단계 — 명세와 디자인을 함께 만들기
명세는 텍스트 요구사항만 나열하는 문서가 아니라, 제품 요구사항·기술 스택·API·핵심 화면을 함께 보여주는 실행 가능한 설계물이어야 한다.
4.1. Specification 스킬의 확장
-
PRD에서 화면 중심 명세로 발전
- 발표자가 처음 사용하던 스킬은 전형적인 관리자가 작성하는 제품 요구사항 문서(Product Requirements Document, PRD)를 만드는 데 초점을 뒀다.
- 디자이너가 없는 상황에서 결과물을 즉시 평가하려고, 이후에는 두세 개의 디자인 옵션과 핵심 화면 목업까지 생성하도록 스킬을 확장했다.
-
명세에 포함된 정보
- 휴대폰에서 앱이 어떻게 보이는지 보여주는 일반적인 화면 예시를 넣었다.
- 제품 요구사항, 사용할 기술 스택, 접근할 API를 함께 기록했다.
- 온보딩(onboarding), 여정(journey), 수업(lesson)의 데스크톱 디자인도 추가해 모바일과 데스크톱 양쪽을 검토할 수 있게 했다.
4.2. 목업을 통한 즉시 평가
-
화면이 제품 이해를 빠르게 만든다
- 발표자는 요구사항 목록만 읽는 것보다 화면 디자인이 앱의 목적을 즉시 이해하게 해주는 훨씬 나은 명세라고 평가했다.
- AI와의 대화에서 데스크톱 디자인과 온보딩 화면을 추가해 요구사항을 시각적으로 보완했다.
-
직접 수정 가능한 설계
- Human Review라는 오픈소스 도구를 실행해 spec.html 명세를 열고 피드백 패널을 사용했다.
- 예를 들어 “여행 전 발음 연습을 위한 관광 문장 100개를 10개 수업, 수업당 10개 문장으로 나누라”는 문장을 직접 입력해 명세를 수정했다.
- “phrases for Japan” 같은 내용을 직접 편집하거나, 텍스트와 상자를 선택해 “이 수업을 음식에 관한 내용으로 바꿔 달라”고 AI에 댓글을 남길 수 있다.
- 이 인터페이스는 Google Docs처럼 직접 편집하거나 댓글로 AI 에이전트에게 피드백을 보내는 방식이다.
4.3. 도구의 접근성과 한계
-
Human Review
- Human Review 스킬은 오픈소스이며 발표자의 GitHub 링크에서 받을 수 있다.
- 링크를 복사해 원하는 AI 도구에 붙여넣고 스킬을 설치해 달라고 요청하면 된다.
-
Spec 스킬
- Spec 스킬은 behindthecraft.com 포털에서 16개의 다른 스킬, AI 도구 할인, 개인용 AI 시스템 구축 강의와 함께 유료로 제공된다.
- 유료 콘텐츠이지만 발표자는 가치가 있다고 평가했다.
- 직접 스킬을 만들고 싶다면 AI에게 핵심 화면 두세 개, 제품 요구사항, 기술 스택을 오른쪽 패널에 작성하도록 요청할 수 있으며, 발표자의 결과만큼 세밀하지 않아도 좋은 출발점이 된다.
5. 3단계 — 첫 번째 앱 만들기
명세에 레이아웃과 요구사항이 준비되면 Google API에 익숙한 AI 코딩 도구에 전체 애플리케이션을 생성하도록 지시한다.
5.1. Anti-Gravity로 첫 버전 생성
-
명세에서 코드로 이동
- 발표자는 Google API에 가장 익숙하다고 판단한 Google Anti-Gravity로 도구를 바꿨다.
- 요청은 “명세를 보고 전체 애플리케이션을 만들어 달라”는 간단한 지시였고, Anti-Gravity는 첫 버전을 한 번에 생성했다.
-
API 키의 안전한 주입
- Google Voice API를 사용하려면 모든 기능이 작동하도록 Gemini API 키가 필요하다.
- aistudio.google.com의 API keys 섹션에서 새 키를 만든 뒤 키를 복사하되, AI 도구의 채팅창에 붙여넣지 않고 로컬 메모장에 임시로 보관한다.
- Anti-Gravity에는 환경변수 파일(ENV file)을 열어 API 키를 추가하라고 요청하고, 비밀 키가 저장되는 ENV 파일에 직접 입력한다.
- 채팅에 API 키를 쓰면 학습에 사용되거나 다른 곳으로 유출될 수 있으므로, 영상에 키를 삽입한 뒤에는 데이터 유출을 막기 위해 바로 삭제했다.
6. 4단계 — AI와 반복하며 앱을 개선하기
첫 생성본은 작동하는 출발점일 뿐이며, 브라우저와 실제 컴퓨터로 테스트해 발견한 문제를 AI에게 구체적으로 전달해야 품질이 올라간다.
6.1. 실제 환경에서 찾은 기능 문제
-
마이크 입력 문제
- 첫 번째 테스트에서 앱이 발표자의 목소리를 인식하지 못했다.
- 원인은 앱이 MacBook 내장 마이크를 사용하고 있었기 때문이며, 발표자는 별도로 연결한 특수 마이크로 전환해야 했다.
- Claude Code가 마이크 문제를 고치는 동안 음성을 듣고 프로그램이 제대로 작동하는지도 함께 확인했다.
-
학습 화면의 갱신과 응답 속도
- 학습 중 새 문장을 배워도 채팅 말풍선이 갱신되지 않고 모든 말풍선이 한꺼번에 표시되는 문제가 있었다.
- 한 번에 전부 보여주면 학습자가 어떤 문장을 방금 배웠는지 알기 어렵고 혼란스럽다.
- 응답 속도도 느리게 느껴졌으며, 발표자는 이런 문제를 피드백으로 전달해 AI가 수정하게 했다.
6.2. 이미지와 Yuki 캐릭터 개선
-
생성형 이미지로 교체
- 앱이 처음 사용한 이미지가 만족스럽지 않아 Anti-Gravity에 Nano Banana로 실제 장면 이미지를 생성해 교체하라고 요청했다.
- 발표자는 책상 위에 올려둘 수 있을 것 같은 귀엽고 입체적인 디오라마 스타일을 선호한다고 구체적으로 설명했다.
- 같은 스타일의 디오라마를 10개 수업 전체에 만들도록 요청했고, 최종 앱에는 각 장면에 맞는 디오라마가 들어갔다.
-
Yuki의 시각적 정체성
- 처음 생성된 Yuki 이미지는 주먹밥(rice ball)처럼 보여 캐릭터의 성별과 음성 이미지가 맞지 않았다.
- Yuki는 여성 목소리를 사용하므로 사람인 소녀로 다시 만들라고 요청했고, 결과를 만족스럽게 평가했다.
- Anti-Gravity는 수정된 Yuki 이미지를 통화 화면의 프로필 사진에도 적용했다.
-
개선에 걸린 시간
- 앱과 시각 요소를 반복 수정하는 데 약 30분이 걸렸다.
- 그 뒤 앱은 외관이 좋아지고 주요 기능이 작동하는 상태가 됐지만, 발표자는 언어 학습 앱에서 가장 중요한 것은 여전히 수업 자체의 품질이라고 강조했다.
7. 5단계 — 앱의 학습 콘텐츠 개선하기
기능이 작동하는 것만으로는 충분하지 않으며, 학습자가 여행에 바로 쓸 수 있는 순서와 수업 내용을 AI와 다시 설계해야 한다.
7.1. 10개 수업의 구성 논의
-
콘텐츠 설계를 별도 대화로 분리
- 발표자는 “여행을 준비하는 사람에게 회화 일본어 10개 수업을 가르친다면 어떤 수업이어야 하는가”를 AI와 논의했다.
- AI는 일상 표현에서 시작해 약국, 아픈 상황과 응급 상황까지 이어지는 수업 구성을 제안했다.
- 발표자는 여섯 번째와 일곱 번째 수업을 합치는 등 순서를 조정하도록 조언했다.
-
긍정적인 학습 흐름
- 문제나 응급 상황을 다룬 수업으로 학습을 끝내면 우울한 느낌이 들 수 있다고 판단했다.
- 따라서 부정적인 상황이 마지막에 오지 않도록 수업 순서를 다시 바꿨다.
- 콘텐츠를 검토하기 위해 프로젝트 안에 수업 내용 전용 채팅을 별도로 만들고, 다른 대화에서 나온 초기 지시사항과 새 제안을 그곳에서 이어갔다.
7.2. 학습자의 즉시 효용과 문자 학습의 범위
-
말하기를 먼저 가르치기
- 발표자는 사람들이 앱에서 가능한 한 빨리 도움을 얻기를 원했다.
- 그래서 일본어를 읽을 줄 알아야 말하고 대화할 수 있는지 물었고, AI는 일본어를 읽지 못해도 말하기와 대화를 시작할 수 있다고 답했다.
- 말풍선의 Japanese·Romaji·English 병기는 이 결정과 맞물려, 문자 학습을 선행 조건으로 만들지 않는다.
-
마크업 파일에서 수업 검토
- 모든 수업은 마크업 파일에 저장되며, 파일에는 수업의 작동 방식, 트레이너 스크립트, 학습할 구체적인 문장이 들어 있다.
- 파일을 확인하는 과정에서 Yuki가 소녀로 바뀐 뒤에도 트레이너 스크립트 일부가 여전히 주먹밥을 가리키는 오래된 내용으로 남아 있는 것을 발견했다.
- 발표자는 직접 수업을 들으며 일본어를 배우는 동시에 앱과 수업을 개선하는 방식을 택했다.
7.3. 품질을 가르는 반복
-
기능보다 수업의 실제 가치
- 좋은 앱과 대충 만든 앱의 차이는 앱 자체와 수업을 얼마나 세심하게 개선했는지에 달려 있다.
- 앱을 재미로 만드는 것이 아니라 실제로 일본어를 가르치는 것이 목적이므로, 모든 반복 작업은 학습 효과를 확인하는 방향이어야 한다.
-
외부 테스트
- AI와 함께 앱을 계속 개선하고 직접 테스트해야 한다.
- 가능하면 친구들에게도 사용을 부탁해 실제 사용자의 피드백을 받아야 한다.
8. 6단계 — Vercel에 출시하기
완성도가 충분히 올라간 앱은 호스팅 서비스에 배포해 실제 웹사이트에서 사용하고, 이후에도 기능과 수업을 계속 확장한다.
8.1. 배포 선택지와 실행
-
호스팅 서비스
- Google AI Studio에는 웹사이트 기능이 있어 그곳에서 앱을 호스팅할 수도 있다.
- 발표자는 프로젝트를 모두 Vercel에 두고 있으므로 이번 앱도 Vercel에 배포했다.
- Vercel을 AI 도구에 이미 연결해 둔 상태에서 “Deploy the app to Vercel”이라고 요청하자 배포가 시작됐다.
- 연결하지 않았다면 Vercel 계정을 만들 수 있고, 처음 배포하는 몇 개의 웹사이트는 무료이므로 호스팅 비용 없이 시작할 수 있다.
-
배포 중 문제 해결
- 배포 과정에서 오래된 라이브러리 때문에 문제가 발생했고, 발표자가 직접 그 문제를 해결했다.
- 그 밖에도 여러 사항을 수정한 뒤 앱은 실제 접속 가능한 링크에서 작동했다.
8.2. 비용을 고려한 접근 제한
-
비밀번호의 자동 추가
- 실제 사이트에 배포된 앱은 Gemini API를 호출할 때마다 소액의 비용이 발생한다.
- Anti-Gravity는 별도 요청을 하지 않았는데도 API 비용을 고려해 비밀번호를 추가했다.
- 발표자는 이런 접근 제한이 비용 통제에 도움이 된다고 설명했다.
-
배포 후 확장
- 현재 앱은 실제 웹사이트에서 실행되며, 이후 로그인 기능을 추가할 수 있다.
- 더 많은 수업과 다양한 학습 스타일을 추가하고, 다른 언어에 맞게 앱을 변형할 수 있다.
- 일본어 대신 이탈리아어를 배우고 싶다면 이탈리아 여행용 앱으로 바꾸고, Nano Banana로 해당 장소와 상황에 맞는 이미지를 새로 생성할 수 있다.
9. 반복 작업을 중심으로 한 제작 원칙
여섯 단계는 순차적인 체크리스트이면서, 실제 품질을 높이는 네 번째와 다섯 번째 단계가 길게 반복되는 개발 사이클이다.
9.1. 발표자가 제시한 여섯 단계
-
아이디어 탐색: AI와 대화하며 아이디어를 조사하고, 질문을 던지고, 해결책을 함께 발전시킨다.
-
명세와 디자인: 제품 요구사항뿐 아니라 핵심 화면과 디자인을 만든다. 가능하면 Spec 스킬과 무료 오픈소스 Human Review를 이용한다.
-
첫 버전 생성: 명세와 디자인을 AI에게 주고 전체 앱의 작동 가능한 초안을 만들게 한다.
-
앱 반복 개선: 브라우저와 실제 장치에서 직접 테스트하면서 기능, 마이크, 화면 갱신, 응답 속도, 이미지 같은 문제를 고친다.
-
콘텐츠 반복 개선: 학습 순서, 표현, 난이도, 대화 품질을 실제 학습 목표에 맞게 고친다.
-
출시: Google AI Studio, Vercel 또는 원하는 호스팅 서비스에 배포하고, 실제 사용과 추가 피드백을 통해 계속 발전시킨다.
9.2. 시간 배분이 알려주는 핵심
- 총 제작 시간: 발표자는 앱을 만드는 데 약 2~3시간이 걸렸다고 말했다.
- 반복 작업의 비중: 그중 2시간 이상은 AI가 첫 버전을 생성하는 시간이 아니라 앱을 개선하고 실제로 테스트하는 데 쓰였다.
- 완성도의 원천: AI의 최초 생성 능력보다 요구사항을 구체화하고, 결과를 관찰하고, 문제를 다시 지시하는 반복 루프가 좋은 결과를 만든다.
주요 발언 모음
“I think voice will soon become the primary way we interact with computers.”
“Don't create anything yet. First, do some research and ask me three clarifying questions.”
“The point of this app is to actually teach you Japanese. Not just make an app for fun.”
“What separates a hacky app from something good is just how much attention you put into improving the lessons and the app itself.”
“Step four is where the real work happens: iterating with the AI to improve the app.”
“I think it took me about 2–3 hours to build this app. But two of the three hours are actually iterating with the AI to improve it and actually testing it.”
“Voice will become the default way we interact with AI in the not-too-distant future.”
핵심 데이터 & 수치
- 6단계: 아이디어 탐색 → 명세·디자인 → 첫 버전 → 앱 개선 → 콘텐츠 개선 → 출시의 제작 순서다.
- 10개 수업: 앱의 전체 학습 과정은 10개 수업으로 구성된다.
- 100개 문장: 여행자에게 유용한 일본어 표현 100개를 수업당 10개씩 배치하는 초기 목표다.
- 수업당 10개 문장: 각 수업은 문장 학습 후 해당 표현을 쓰는 대화 연습으로 이어진다.
- 약 30분: 앱 기능과 디오라마·Yuki 이미지를 반복 개선하는 데 걸린 시간이다.
- 약 2~3시간: 아이디어부터 실제 배포까지 앱을 만든 전체 시간이다.
- 2시간 이상: 전체 제작 시간 중 테스트와 앱·콘텐츠 반복 개선에 사용된 시간이다.
- 3개 질문: AI가 구현 전에 음성 통화 형식, 말풍선 형식, 사용자 범위를 물었다.
- 2~3개 핵심 화면: 발표자가 명세·디자인 스킬에서 생성하도록 한 화면 수다.
결론 및 시사점
- 음성 인터페이스는 컴퓨터와 AI를 사용하는 기본 방식이 될 가능성이 있으므로, 텍스트 입력만이 아니라 실시간 대화 경험을 제품 설계의 중심에 둘 수 있다.
- AI에게 코드를 쓰게 하기 전에 사용자·문제·학습 흐름·핵심 화면을 조사하고 명세로 고정하면 첫 생성본의 방향이 선명해진다.
- 완성된 디자인 목업은 요구사항 문서보다 제품의 목적과 누락된 화면을 빠르게 드러내며, 디자이너가 없어도 AI와 함께 평가할 수 있게 한다.
- API 키는 채팅에 직접 붙여넣지 말고 로컬 환경변수 파일에 안전하게 주입해야 하며, 영상처럼 공개 과정에서 노출된 키는 즉시 폐기해야 한다.
- 첫 버전이 한 번에 생성돼도 마이크, 음성 인식, 상태 갱신, 응답 속도, 이미지 품질 같은 실제 사용 문제는 테스트해야 발견할 수 있다.
- 언어 학습 앱의 핵심 경쟁력은 화면의 귀여움보다 학습자가 실제로 말할 수 있게 만드는 수업 순서와 문장 품질이다.
- 콘텐츠 전용 대화와 마크업 파일을 분리하면 앱 코드와 학습 내용을 각각 검토하고 수정하기 쉽다.
- 학습자가 원하는 즉시 효용을 제공하려면 일본어 문자 읽기를 말하기의 선행 조건으로 강제하지 않고, 원문·Romaji·번역을 병렬로 제공할 수 있다.
- 개인의 여행 문제를 해결하는 작은 앱은 수익화와 대규모 사용자 지원을 뒤로 미루고 실제 필요에 집중하게 해준다.
- AI가 앱을 생성하는 시간보다 사람이 테스트하고 피드백을 주며 다시 개선하는 시간이 훨씬 중요하므로, 제작 계획에 반복 검증을 넉넉히 포함해야 한다.
핵심 요약 (20줄)
음성 대화가 컴퓨터와 AI를 사용하는 기본 인터페이스가 될 가능성이 커지고 있다.
Peter Yang은 일본 여행자를 위한 대화형 일본어 튜터 웹 앱을 만들었다.
앱은 여행에 유용한 일본어 문장 100개를 10개 수업으로 나누는 구조다.
각 수업은 문장 10개를 가르친 뒤 역할극 대화로 연습하게 한다.
Yuki라는 음성 코치는 일본어, Romaji, English를 함께 보여주며 학습을 돕는다.
첫 단계에서는 AI가 코드를 쓰기 전에 문제를 조사하고 세 가지 질문을 하게 했다.
기존 앱 Taste Maker의 스타일을 참고해 새 앱의 시각적 방향을 정했다.
음성 통화는 먼저 표현을 가르치고 나서 실제 상황에서 사용하게 설계했다.
명세에는 제품 요구사항, 기술 스택, API, 모바일·데스크톱 핵심 화면을 함께 넣었다.
Human Review는 명세를 Google Docs처럼 직접 편집하고 AI에게 댓글로 피드백을 보내게 한다.
Google Anti-Gravity는 준비된 명세를 바탕으로 첫 앱 버전을 한 번에 생성했다.
Gemini API 키는 채팅에 붙여넣지 않고 ENV 파일에 직접 입력해야 한다.
Claude Code는 브라우저와 컴퓨터를 이용해 마이크와 음성 인식 문제를 찾는 데 사용됐다.
모든 말풍선이 한꺼번에 표시되는 문제와 느린 응답 속도도 테스트로 발견했다.
Nano Banana는 10개 수업의 디오라마 장면과 Yuki의 캐릭터 이미지를 생성했다.
수업 콘텐츠는 일상 표현부터 약국과 응급 상황까지 AI와 논의하며 다시 구성했다.
학습자가 일본어를 읽지 못해도 대화할 수 있도록 말하기를 먼저 제공하는 방향을 택했다.
발표자는 수업 마크업 파일을 직접 보고 오래된 Yuki 설명 같은 콘텐츠 오류를 수정했다.
앱은 Vercel에 배포됐고 Gemini API 비용을 관리하기 위해 비밀번호도 추가됐다.
약 2~3시간의 제작 시간 중 2시간 이상이 앱과 콘텐츠를 테스트하고 반복 개선하는 데 쓰였다.
📁 Obsidian: Study/YouTube다이제스트/2026-10-07-D2_interview-GiaDdNvsadA.md
