URL: https://www.youtube.com/watch?v=12fSRB3OY6U
날짜: 2026-09-27
채널: chester_roh (AI Frontier Korea)
📌 핵심 질문 / 이 글이 다루는 핵심 논점
==코드·이미지·영상·음악을 서로 연결해 창작하는 프론티어 모델이 등장하면서, 인간의 창의성이 마지막 독점 영역이 아니라 새로운 탐색 공간이 되고 있다.== 이제 중요한 질문은 AI가 무엇을 할 수 있느냐를 넘어, 무엇을 만들 가치가 있는지, 무엇을 보게 될지, 그리고 이 변화를 주도하는 프론티어 기업에 어떤 책임을 요구할지다.
- Claude Opus 5.5와 GPT-6 Sol이 불과 약 두 시간 차이로 공개될 만큼 모델 출시와 성능 개선의 주기가 압축되고 있다.
- Opus 5.5는 복잡한 도구나 별도 에셋 없이 JavaScript·Python·Web Audio·PCM 코드만으로 모션 그래픽, 화풍 재현, 게임, 사운드와 상호작용 서사를 구현한다.
- 창작 능력은 단순한 프롬프트 반응이 아니라 사전학습으로 축적한 영역 지식, 후속학습과 대리 보상, 영역 간 표상과 휴리스틱이 결합한 결과일 가능성이 있다.
- 누구나 만들 수 있는 시대에는 제작 난이도보다 취향, 의도, 인간적 맥락, 경쟁과 놀이의 서사가 콘텐츠의 선택 이유가 될 수 있다.
모델이 코더를 대체한다는 단순한 이야기는 현상을 충분히 설명하지 못한다. 코딩은 목적이 아니라 계산과 소프트웨어가 가능하게 하는 연결을 만드는 수단이었고, 그 수단의 비용이 급격히 낮아지면서 사람은 코더에서 메이커로 이동한다. 다만 무엇이 가능한지 알기 위한 개념어와 역사, 충분한 시행착오는 여전히 필요하다. 새로운 지능이 만든 도구를 다시 이용해 무엇을 탐색할지는 인간이 계속 결정해야 한다.
1. 70일 주기로 압축되는 프론티어 모델 경제
모델을 따라가는 일 자체가 감당해야 할 정보량과 속도의 문제가 되었으며, 모델 발표가 기술 뉴스가 아니라 인간의 역할과 사회적 의무에 대한 철학적 논쟁을 촉발하고 있다.
1.1. 벤치마크보다 빠른 출시 주기
-
모델 발표가 기본값으로 거대한 향상을 약속하는 단계
- 이번 주에는 GPT-6 Sol, Xiaomi MiMo, Claude Opus 5.5가 잇따라 공개됐다. MiMo 논문은 기술적으로도 상당한 내용을 담았다고 평가된다.
- 모델이 나올 때마다 거대한 능력 향상을 기대하는 일이 당연해졌고, AI가 인간을 지배할지, 개발 속도를 늦춰야 할지, 프론티어 랩을 프론티어 코퍼레이션으로 보아 어떤 의무를 부과할지 같은 질문이 기술적 논의를 덮고 있다.
-
70일짜리 모델 세대와 무너지는 비교 기간
- Opus 5가 나온 뒤 약 60일 만에 Opus 5.5가 나왔으며, 대략적인 세대 주기는 70일에 가까워졌다.
- 1년 동안 유지되는 벤치마크를 비교하려 해도 벤치마크 자체가 바뀌고 사라진다. Humanity's Last Exam(HLE)은 아직 남아 있지만 데이터 오염의 문제를 안고 있고, GPT-6 Sol도 조사 시점과 발표 시점이 어긋날 만큼 평가표가 빠르게 갱신된다.
1.2. RL, 가격 인하, 그리고 계산 자원 운영
-
촘촘해지는 강화학습(RL)
- 사라진 벤치마크가 있다는 것은 새 벤치마크가 많이 생겼다는 뜻이기도 하다. 완전한 일반화라기보다는 특정 능력을 겨냥한 강화학습 환경을 촘촘히 만들고, 그 환경에 학습을 밀어 넣어 성능 간격을 채우는 추세가 관찰된다.
- 이 방식은 아직 모든 영역에 자동으로 일반화되지 않는다. 그러나 RL 환경을 만들 수 있고 보상을 정의할 수 있는 영역에서는 성능 상승이 지속될 가능성이 있다.
-
상위 모델이 중간 추론 옵션으로 내려오는 현상
- 1년 전 Opus 4.1은 입력 15달러·출력 75달러 수준이었지만, Opus 5.5는 입력 4달러·출력 20달러로 내려왔다. GPT-6 Sol도 비교 가능한 상위 등급에서 절반 수준의 가격으로 경쟁한다.
- 예전에는 리서치 리포트와 Astra 작업에 high나 xhigh가 필요했지만, 이제는 medium에서도 상당한 결과가 나온다. 토큰 단가가 내려간 데 더해 medium이 필요한 토큰 수 자체도 줄여 체감 비용이 더 낮아졌다.
-
토큰은 항공권과 호텔에 가까운 재화
- 재고는 남겨 두었다가 나중에 팔 수 있지만, 특정 시간에 쓸 수 있는 컴퓨팅 토큰은 시간이 지나면 되팔 수 없다. 따라서 항공권이나 호텔처럼 해당 시간의 수요를 최대한 채우는 동적 가격 책정이 필요하다.
- Opus와 Sol이 경쟁하고 오픈소스·온프레미스까지 대안으로 들어오면 각 회사는 정해진 수요를 놓치지 않기 위해 가격과 사용량을 조정한다. 상위 옵션을 별도 가격으로 남겨 두면서 medium을 넓게 공급하는 전략도 이 경쟁의 일부다.
-
모델보다 팜(farm) 운영이 경쟁력이 되는 구조
- 같은 서버 팜에서도 medium을 쓰던 작업이 xhigh로 올라가거나 context length가 바뀌면 다른 팜으로 재배치해야 한다. 한 팜이 처리할 수 있는 동시 작업 수와 옵션별 자원 소모를 최적화해야 한다.
- 모델이 상향 평준화되면 가치의 중심은 모델 이름만이 아니라 요청을 어느 자원에 언제 배치할지, 얼마나 안정적으로 긴 작업을 수행할지 결정하는 엔지니어링으로 이동한다.
1.3. 특화 학습과 RSI의 불편한 속도
-
일반 지능과 특화 훈련의 경계
- 최근의 성능 향상은 모든 문제를 한 번에 일반화했다기보다, 벤치마크를 촘촘하게 채우듯 특화 훈련이 촘촘해진 결과처럼 보인다.
- RSI(recursive self-improvement)를 버튼처럼 생각하면 안 된다. 버튼을 누르면 감사(audit)를 끝내기도 전에 새로운 결과물이 출시될 수 있다는 위험이 있기 때문이다.
-
주당 10% 향상의 체감
- 프론티어 모델이 하나 나올 때마다 체감상 일주일에 10%씩 좋아지는 듯한 압축된 속도가 나타난다.
- 봄부터 여름 끝까지 숨 가쁘게 달려왔고, 남은 세 달은 더 빠를 수 있다. 따라서 현재 벤치마크가 다음 해 같은 시점까지 얼마나 살아남을지도 예측하기 어렵다.
2. 인간의 마지막 영역으로 여겨진 창의성
실리콘밸리와 할리우드의 이동은 일자리가 없어지는 문제와 새로운 창작 기회가 열리는 문제를 동시에 제기한다.
2.1. 할리우드에서 실리콘밸리로 이동하는 창작
-
Jeffrey Katzenberg의 역사적 비유
- DreamWorks 창업자이자 전 CEO이고 Disney와도 일했던 Jeffrey Katzenberg는 실리콘밸리(북쪽)와 할리우드(남쪽)의 이동을 기술 변화의 역사로 설명한다.
- 기술이 이동할 때 기존 직업은 실제로 사라지지만, 그 과정에서 싸운 사람들이 이후의 권리와 보호를 확보하는 데 기여했다. 따라서 지금 필요한 것은 변화를 막연히 부정하는 일이 아니라 이동 과정에서의 권리를 준비하는 일이다.
-
AI for Creativity라는 표현의 등장
- AI for Math, AI for Science처럼 기능별로 AI를 붙이던 말과 달리 AI for Creativity는 인간과 컴퓨터의 차이를 창의성으로 설명해 왔던 전제를 직접 건드린다.
- Katzenberg는 모든 답을 아는 것은 아니지만 창작의 기회가 다시 확장될 것은 확신하며, 이 시기를 어떻게 지날지는 선택의 문제라고 말한다. 오랜 창작 산업 경험에서 나온 낙관이지만, 이동에 따르는 권리 투쟁의 필요성도 함께 담겨 있다.
2.2. AI 영상은 이미 소비되고 있다
-
AI 쇼츠 드라마의 현실성
- AI로 만든 쇼츠 드라마는 화면을 보면 생성물이라는 사실이 드러나지만, 못 봐줄 수준은 아니다. 실제 카메라 촬영으로는 만들기 어려운 세계관과 연출을 보여 주기 때문에 계속 보게 되는 힘이 있다.
- 30년 지기 아티스트가 이를 보고 “이게 우리의 끝인가요?”라고 묻는 시대가 되었고, 누군가는 이를 AlphaGo moment에 비유한다. 반면 Katzenberg의 대답은 “절대 아니죠”에 가깝다.
-
Phenaki가 보여 준 언덕 오르기
- 2022년 11월 Google 계열 연구에서 Phenaki라는 autoregressive 비디오 생성 모델에 우주인 탐험 장면을 텍스트로 지시하자 영상이 생성됐다. 당시 품질은 사람들이 웃을 정도였지만, 귀엽게 느껴진다는 반응은 개선 가능한 신호였다.
- 당시에는 텍스트 투 비디오로 완전히 제작한 주요 TV 프로그램을 보려면 약 2년이 걸릴 것이라는 예측이 나왔다. 실제 발전은 그 예상보다 복잡하게 전개됐고, 2025년 전후로 AI 영상이 빠르게 대중 소비 영역에 들어왔다.
-
조회수와 플랫폼 규제의 긴장
- YouTube에는 〈신비한 건축사전〉처럼 AI 생성 영상을 사람들이 즐겨 보는 채널이 있고, 고품질부터 저품질까지 다양한 생성물이 높은 조회수를 얻는다. 시각적 자연스러움이 부족해도 특정 욕구를 만족시키면 소비된다.
- YouTube는 정보를 전달하기 위해 촬영이나 CG 대신 AI를 사용한 채널은 남겨 두면서, 귀여운 고양이가 인사하는 식으로 정보 없이 생성물 자체만 반복하는 채널은 차단했다. 단기 조회수보다 플랫폼 전체의 장기 건강을 고려한 구분으로 해석할 수 있다.
-
만족감과 창의적 의미는 다르다
- 생성 영상이 만족감을 주는지는 조회수로 이미 확인된다. 사람들이 클릭하고 계속 보는 이유가 있기 때문이다.
- 그러나 정보를 전달하는 수단을 넘어 창의성을 가진 영상 자체가 의미를 갖는지는 아직 열려 있다. 그 단계가 곧 올 수 있다는 전망과, 아직 인간의 의도·맥락·정념이 필요한 영역이라는 판단이 함께 존재한다.
3. 코드만으로 확장되는 창작 능력
Opus 5.5의 인상적인 점은 이미지를 잘 생성하는 별도 모델을 호출하는 것이 아니라, 언어 모델이 코드·수학·사운드·상호작용을 한 흐름으로 묶어 산출물을 완성한다는 데 있다.
3.1. 텍스트에서 코드와 모션 그래픽으로
-
LLM이 모든 영역의 접착제가 된 배경
- 2022년에는 이미지·비디오 모델과 LLM이 서로 다른 영역에 있었다. 이미지와 비디오에만 투자가 계속됐다면 발전에 2~3년이 더 걸렸을 수 있다.
- ChatGPT 등장 이후 약 4년 동안 자원이 LLM으로 집중됐고, 언어 모델이 충분히 강해지자 이미지·영상·사운드·게임을 코드로 연결하는 일반 인터페이스가 되었다.
-
JavaScript로 만든 모션 그래픽
- Opus 5.5 공개 직후 Kevin Ngo가 공유한 데모들은 복잡한 프롬프트가 아니라 모델에게 “무엇을 좋아하니?”라고 묻는 식의 대화에서 출발했는데도 고유한 미감을 가진 결과를 만들었다.
- After Effects를 오래 다뤄야 하는 모션 그래픽을 JavaScript만으로 만들고, 소리와 상호작용까지 코드로 구성했다. 애니메이션의 꽃이 음악의 박자에 맞춰 떨어지는 장면은 영상 효과와 사운드를 함께 생성했기에 가능한, ‘이상하게 만족스러운’ 동기화였다.
-
코드가 회화의 붓질을 재현하다
- 약 7,500줄의 Python 코드로 특정 화가의 화풍에 맞는 붓질을 구현했다. 이는 단순히 이미지를 그리는 것이 아니라 붓의 질감과 회화 방식을 수학적 절차로 번역한 결과다.
- 화가의 스타일을 모사하려면 회화에 대한 표상과 시각적 이해가 필요하다. 모델의 심상과 실행 가능한 코드 사이를 중개하는 라이브러리와 절차가 만들어졌다는 점이 핵심이다.
3.2. 게임·교육·인터랙션의 통합
-
3D와 게임을 하루 단위로 제작
- Opus와 Astra를 함께 사용해 Dark Souls 보스전의 감각을 재현한 게임이 만들어졌고, 최초의 계산기인 Antikythera 유물을 찾는 스쿠버 다이버 게임은 링크에 접속해 바로 플레이할 수 있는 형태로 완성됐다.
- 대규모 에셋 제작팀 없이도 픽셀·복셀·리깅을 대화로 연쇄 변환할 수 있다. “픽셀로 만들고, 마법을 추가하고, 복셀로 바꾸고, 리깅해 줘”라는 짧은 지시만으로 여러 버전이 이어졌다.
-
충실도가 높은 대화형 학습 영상
- Andrej Karpathy가 〈반지의 제왕〉 서사로 공부할 내용을 이야기화한 실험을 소개했고, 뒤이어 더 높은 충실도의 대화형 교육 영상이 등장했다.
- Ethan Mollick의 재귀(recursion) 설명 영상은 3Blue1Brown만큼 정교하지는 않지만 개념을 이해하도록 설계된 상호작용형 시각화다. JavaScript로 그래픽을 만들고 음성은 ElevenLabs를 이용하며, Remotion과 Claude Design의 접근을 한 단계 밀어붙인 형태다.
-
아이와 만든 2시간짜리 JRPG
- 마을에서 출발해 옆 맵으로 모험하는 작은 개념증명은 약 20분, 초기 생성 전체는 약 30분에 시작됐다. 완주 가능한 게임이 될 것이라고 처음부터 예상한 것은 아니었다.
- 아이와 함께 아이디어를 주고받으며 하루 정도 작업한 결과, 서사·반전·보스·엔딩을 갖춘 약 2시간 플레이 타임의 JRPG가 만들어졌다. 비행기에서 할 게임을 한 시간 넘게 찾는 대신, 곧 자기 취향에 맞는 게임을 바로 생성하는 쪽으로 소비 습관이 바뀔 수 있다.
-
에셋 없이 코드로만 만든 세계
- 픽셀, 스프라이트, 배경, 음악을 이미지 생성 모델의 에셋으로 가져오지 않고 모두 코드로 그렸다. Claude는 이미지를 별도로 생성해 텍스처를 import하는 대신 실행 가능한 코드 안에서 표현을 만들었다.
- 코드로 그리는 방식은 아직 사실적 표현에서 diffusion 모델보다 약할 수 있지만, 특정 스타일에 토큰과 작업을 집중하면 높은 충실도를 얻는다. 앞으로 코드 기반 생성이 사실성의 영역까지 확장될지가 중요한 관찰 지점이다.
3.3. PCM 합성과 서사를 가진 사운드
-
소리를 듣지 못하는 모델의 사운드 표상
- PCM(Pulse Code Modulation)을 JavaScript와 NumPy로 합성해 음악과 효과음을 만들었고, 새소리도 코드로 생성했다. 코드만으로 상당한 음악적 결과를 내는 것은 내부에 소리의 표상이 없으면 어렵다는 추론을 낳는다.
- formant 기반 자음·모음 합성으로 노래와 민요의 메기고 받기, 돌림노래를 구성했다. 주성부에 부성부가 합창으로 응답하는 구조까지 만들 수 있었다.
-
상호작용하는 기승전결
- 음악은 단순한 반복음이 아니라 중간에 멈춤을 두고 클라이맥스를 설계한다. 사용자가 화면을 클릭하면 요소가 날아가는 등 그래픽과 소리가 상호작용하며 엔딩까지 이어진다.
- Iannis Xenakis의 그래픽 악보를 키워드로 주자 시각적 악보와 소리 합성을 연결했다. 특정 예술가와 기법을 짧은 키워드로 호출하고, 그 미감을 서사와 실행 가능한 장면으로 옮기는 능력이 나타난다.
-
표상과 취향의 도약
- 모델은 자신을 그리거나 무엇인가를 만들라는 요청에 개연성 있는 이야기 구조와 어울리는 픽셀 아트·3D 그래픽을 선택한다. 충실도가 완벽하지 않아도 그래픽·사운드·서사의 일관성을 함께 조율한다.
- 두 줄짜리 프롬프트로 만든 모션 그래픽은 TTF 폰트, 바닐라 JavaScript, Web Audio만 사용해 텍스트 효과와 장면 전환을 구현했다. 이런 결과는 단순한 문법 암기보다 해당 작업을 가능하게 하는 훈련과 취향의 대리 신호가 존재한다는 점을 시사한다.
4. 창의성은 어떻게 학습되는가
정답을 검증할 수 있는 수학 문제와 달리 음악·모션 그래픽·디자인에는 단일 정답이 없다. 따라서 높은 수준의 창작 능력이 나타난 학습 경로는 아직 공개된 설명만으로 확정할 수 없다.
4.1. 검증 가능한 보상에서 취향의 대리 보상으로
-
verifiable reward의 한계
- 수학처럼 정답을 자동으로 판정할 수 있는 문제는 보상을 주며 hill climbing하기 쉽다. 하지만 오디오의 아름다움, 장면 전환의 타이밍, 화풍의 설득력은 객관적 정답 하나로 평가하기 어렵다.
- 그럼에도 Opus 5.5가 이런 결과를 낸다면, 프론트엔드 디자인 연구처럼 코드로 표현된 산출물에 대한 대리 지표(proxy)가 이미 존재하고 이를 이용해 취향에 가까운 방향으로 최적화했을 가능성이 있다.
-
pre-training과 post-training의 결합
- 후속학습만으로는 장르의 역사, 도구 사용법, 작가별 문법, 사운드 합성의 원리를 충분히 만들기 어렵다. 사전학습에서 폭넓은 문화·기술 자료와 영역별 작업 궤적이 들어가고 후속학습이 그 공간을 정제했을 가능성이 크다.
- 이 추정은 단정이 아니라 관찰에 기반한 가설이다. 어떤 평가 함수를 사용했는지, 실제로 사람의 취향을 얼마나 직접 학습했는지는 공개 정보만으로 알 수 없다.
4.2. Astra의 로봇 제어와 전문가 궤적
-
연속 제어를 코드 정책으로 바꾸다
- 로봇은 언어가 아니라 연속적인 행동 값을 출력해야 하므로 기존 VLA(vision-language-action) 계열은 diffusion과 비슷한 방식을 많이 사용했다.
- Astra는 로봇을 제어하는 policy 코드를 생성해 실행하는 접근으로 좋은 결과를 냈다고 알려졌다. 이는 코드로 이미지·사운드를 만들던 방식과 구조적으로 닮아 있다.
-
데이터와 실패율의 현실
- Gemini Robotics 2처럼 사전학습 단계에 로봇 데이터를 넣어 둔 모델은 로봇 작업을 잘할 가능성이 높다. GPT-6 Astra도 로봇 데이터가 multimodal 학습에 섞였을 수 있다.
- 그러나 사전학습 데이터만으로는 일정 수준 이상의 안정성을 얻기 어렵고, Astra도 실패 없이 모든 작업을 수행하는 것은 아니다. 전문가의 작업 궤적과 대규모 데이터셋, reward model 비슷한 신호가 추가됐을 가능성이 있다.
4.3. 영역을 잇는 모델의 궤적
-
인간의 창의성과 같은 전이
- 인간은 한 영역의 전문 지식을 새로운 영역에 옮겨 두 영역을 연결하고, 그 사이에서 새로운 분야를 만든다. 수학과 물리, 예술과 공학, 음악과 코드가 만나는 지점이 그런 발전의 궤적이었다.
- 코딩 천재인 모델에 예술을 학습시키면 두 표상 사이에서 의도하지 않은 기능이 나타날 수 있다. 인간이 특정 기능을 직접 가르치지 않았어도 임계점을 넘은 모델이 스스로 조합을 수행할 가능성은 설명하기 어렵고, 그래서 흥미롭고도 두렵다.
-
탐색 공간을 잘라 내는 휴리스틱
- 1+1을 생각하는 동안 우주의 근원을 생각해 보라고 하면 모델은 두 일을 오갔다고 대답한다. 실제 내부 사고가 무엇이었는지는 알 수 없지만, 모델이 인간처럼 표면 요청 뒤에 다른 탐색을 수행하는 것처럼 보이는 현상은 반복된다.
- 수학의 돌파구와 창작의 결과를 탐색 공간 문제로 보면, 모델은 갈 수 없는 영역을 빠르게 버리는 Ansatz와 취향 기반 휴리스틱을 점점 획득하는 듯하다. 정답을 찾기보다 갈 만한 조합을 고르는 감각이 창작 능력의 핵심일 수 있다.
5. 코드 아티스트에서 메이커로
창작 도구의 비용이 내려가면 정체성 자체가 흔들린다. 코딩을 직업적 정체성으로 삼은 사람에게는 위협이지만, 코딩을 목적이 아니라 연결의 수단으로 본 사람에게는 오히려 목적에 가까워지는 변화다.
5.1. Kyle McDonald·Zach Lieberman·Alexander Chen의 서로 다른 반응
-
Kyle McDonald의 정체성 갱신
- Kyle McDonald는 15년 동안 소개란에 “코드로 작업하는 아티스트”라고 써 왔지만 Opus 5.5를 사용한 뒤 단순히 “아티스트”로 바꿨다고 했다.
- 코드를 직접 쓰는 일이 자신의 창작자 정체성에서 차지하던 비중이 줄어들고, 코드 바깥의 의도와 결과가 다시 중심이 된다는 선언으로 읽을 수 있다.
-
Zach Lieberman의 연결 중심 관점
- Zach Lieberman은 정반대 감정을 느낀다고 했다. 코딩 자체가 목적이었던 적은 없고, 계산과 소프트웨어가 가능하게 하는 여러 종류의 연결이 늘 중요했다는 것이다.
- 따라서 코딩이 자동화되어도 자신이 탐구하던 연결은 더 절실해질 수 있다. 도구를 잃는 것이 아니라 불필요한 마찰이 줄어드는 해석이다.
-
Alexander Chen의 지속되는 탐구
- Google Creative Lab의 Alexander Chen은 평생 숫자·패턴·복잡계를 탐구하는 일을 좋아해 왔고, 이제 코딩을 하지 않더라도 그 탐구를 이어 가는 일이 어느 때보다 기대된다고 했다.
- 이 반응들은 한 방향의 정답이 아니라 진자 운동에 가깝다. 어떤 날은 Kyle의 해방감에 공감하고, 어떤 날은 Zach의 상실감에 가까워지며, 때로는 둘 사이의 복잡한 중간 지대에 머문다.
5.2. 속도를 늦출 권리와 무한한 인재 사고실험
-
Terence Tao가 제기한 감속
- 밀레니엄 문제 해결 직후 Terence Tao는 수학이 이렇게 가속해야 할 이유가 없고, 속도가 미쳤으며, 천천히 갈 필요가 있다고 말했다. 흥분한 직후의 발언일 수 있지만 속도를 늦출 이성적 이유를 찾자는 문제 제기다.
- 그의 블로그에는 수학자·철학자·커뮤니티 구성원이 참여하는 공론장이 이어진다. 수학 내용을 전부 이해하지 못하더라도 그들이 어떤 톤으로 변화와 속도를 논하는지 읽는 일은 관점을 형성하는 데 도움이 된다.
-
에이전트가 무한히 많은 세계
- 아인슈타인도 혼자 상대성 이론을 만든 것이 아니라 동료들과 편지를 주고받으며 생각의 토큰과 피드백을 교환했다. 오늘날 에이전트끼리 소통하는 구조와 닮은 협업이다.
- 르네상스, 산업혁명, 19~20세기 물리·화학의 부흥에는 수백·수천 명의 인재 집단이 있었다. 모든 영역에 그런 인재가 무한히 투입된다고 가정하면 생산·발견·교육·권력의 구조가 지금과 달라져야 한다.
5.3. 코더가 아니라 메이커가 되기 위한 조건
-
DHH와 Mario Zechner의 대비
- Ruby on Rails를 만든 DHH는 더 이상 코딩하지 않으며 다른 사람들도 그래야 한다는 강한 메시지를 냈다. 코더의 역할을 메이커로 넘어가는 과도기의 잔재로 본 셈이다.
- Pi 에이전트를 만드는 Mario Zechner 쪽은 코드를 완전히 놓아서는 안 된다고 신중하게 반박한다. 코드의 구조를 이해해야 결과물을 통제할 수 있고, 전부 맡기면 오류와 의도를 감당하기 어렵다는 주장이다.
-
다음 세대의 라이트 엔지니어링
- 모델 산출물의 품질이 올라가고 시도 비용이 내려가면 다음 세대는 Python 함수·클래스·for loop를 이해하지 않아도 시행착오를 반복하며 결과물에 도달할 수 있다. “이렇게 하면 이렇게 된다”는 경험적 로직을 체화하는 경로가 기존 학습을 대체할 수 있다.
- 그러나 이해의 필요성이 완전히 사라지는 것은 아니다. 만들고 싶은 결과를 정의하고 잘못된 출력을 판별하고 방향을 바꾸려면 적어도 시스템이 무엇을 할 수 있는지와 한계를 알아야 한다.
6. 교육, 생산성, 그리고 ‘무엇을 만들 것인가’
AI를 잘 쓰는 데 결정적인 격차는 모델 접근권보다 가능한 영역을 미리 조사하고 끝까지 밀어붙이는 태도에서 생긴다.
6.1. 상방을 열어 주는 교육
-
현재 가능한 것의 지도를 먼저 그리기
- 4주 동안 디자인 수업을 진행하며 학생들은 흥미로운 결과물을 만들었지만, 상방을 열어 주는 과정이 특히 중요했다. Astra가 등장했을 때 무엇이 가능해졌는지 조사하고 직접 실험해야 모방과 응용이 시작된다.
- 최고 성능 모델을 손에 쥐고도 가능한 범위를 모르면 평소 하던 방식만 반복한다. 모델의 잠재력을 발견하는 탐색 자체가 교육과 창작의 선행 단계다.
-
브레이크를 너무 일찍 밟지 않기
- “해줘”라는 지시만 반복해서는 넘지 못하는 구간이 있다. 몰입해 여러 번 고치고 밀어붙여야 새로운 수준에 도달하는 작업이 여전히 존재한다.
- 목표를 쉽게 낮추거나 모델이 못 할 것이라고 먼저 결론내리지 않는 태도가 필요하다. 가능한 최대치를 확인한 뒤 실패 원인을 좁혀 가는 방식이 상방을 만든다.
6.2. 용어와 역사가 만드는 인출 가능성
-
개념을 몰라서 시도하지 못하는 문제
- PCM·formant·Three.js·MediaPipe 같은 용어를 모르면 모델에게 해당 도구와 기법을 요청할 수 없다. 기초 원리를 완전히 이해하지 않더라도 용어를 알고 있어야 가능성의 문을 열 수 있다.
- 전문가는 주요 창작자와 역사를 알고 개념어를 인출한다. 초보자는 “해줘”만으로 도달할 수 없는 영역이 있다는 점을 학습 과정에서 놓치기 쉽다.
-
시간이 사라지지는 않지만 지렛대가 커진다
- 진심으로 마음먹고 시행착오를 반복해 머릿속에 작업 데이터가 쌓이는 데는 여전히 시간과 노력이 든다.
- 충분히 쌓인 뒤에는 AI라는 지렛대가 강하게 작동한다. 결과물을 보고 “내가 한 것 같지 않다”는 느낌이 들 정도로 산출물의 크기와 속도가 개인의 직접 노동을 넘어선다.
6.3. 조직 생산성의 갈림길
-
AI의 문제가 아니라 사용자의 문제
- AI가 극적으로 일을 해 주는데도 회사 생산성이 오르지 않는 이유는 모든 사람이 그 변화를 받아들여 작업 방식을 바꾸지는 않기 때문이다.
- 가능한 것을 먼저 알아채고 강하게 받아들인 사람들이 모인 조직에서는 변화가 연속적으로 일어난다. 반대로 변화를 받아들이지 않기로 결정한 조직은 최고 성능의 시연을 눈앞에서 보아도 바뀌지 않는다.
-
결국 확산되지만 시점은 다르다
- 주변 사람을 1~2년 관찰하면 처음에는 AI를 덜 쓰던 사람도 결국 많이 쓰는 방향으로 이동하는 경우가 많다.
- 시대 변화는 사람마다 다른 시점에 도착하지만 결국 넓게 퍼진다. 따라서 조직과 개인의 핵심 과제는 도착 자체를 논박하는 것이 아니라 언제 실험을 시작해 학습 곡선을 선점할지 정하는 일이다.
6.4. 모두 만들 수 있을 때 무엇을 만들 것인가
-
콘텐츠의 가치가 사람에게 있는가, 내용에 있는가
- 지금의 대화를 AI가 모두 생성해도 내용 때문에 보는 사람은 계속 시청할 수 있다. 반대로 특정 인간의 실제 말과 존재를 보고 싶은 사람은 당사자의 콘텐츠를 찾을 것이다.
- 미술·음악·정보·영상이 모두 양질로 대량 생성되면 제작자 이름, 실제 경험, 인간적 관계, 내용의 독창성 중 무엇이 선택을 만드는지 다시 정의해야 한다.
-
제작보다 선택과 취향의 시대
- 무엇이든 만들 수 있다는 사실은 무언가를 만들 이유를 자동으로 제공하지 않는다. 만들지 않을 것을 고르고, 누구에게 어떤 감정을 일으킬지 설계하는 취향이 희소해진다.
- 사람들은 앞으로 결과물의 완성도뿐 아니라 왜 이 결과물을 보게 되었는지, 실제 경험에서 비롯된 것인지, 인간의 의도와 관계가 있는지에 따라 콘텐츠를 구분할 가능성이 높다.
7. 스포츠, 인간의 정념, 그리고 시뮬레이션의 감동
지능 노동이 자동화될수록 인간은 인간끼리의 경쟁과 놀이, 해석과 정념에 더 많은 가치를 부여할 수 있다.
7.1. 호모 루덴스의 시대
- 스포츠가 보여 주는 인간 경쟁의 가치
- 100m를 자동차로 달리면 인간보다 빠르다는 사실은 당연하지만, 인간끼리 규칙을 정한 100m 경기는 경쟁과 드라마 때문에 사람을 열광시킨다.
- 기계가 지적인 일을 대신할수록 인간은 인간끼리의 경쟁·스토리·감동을 즐기는 호모 루덴스(Homo Ludens)의 시대로 이동할 수 있다. 이 관점에서는 모델의 세부 원리보다 이미 닥친 미래를 받아들이고 스포츠와 엔터테인먼트의 형식을 재설계하는 일이 중요해진다.
7.2. 음악의 기초 문법과 인간적 해석
-
프로 연주자가 주는 정념
- 프로 피아니스트의 연주를 보면 단순히 악보의 선율을 재생하는 것이 아니라 개인의 해석과 의도를 담은 인간의 정념이 느껴진다.
- 코드로 만든 음악은 기초 문법과 구조를 빠르게 획득했지만 아직 인간 연주의 재미와 밀도에는 미치지 못한다. 얼마나 남았는지는 알 수 없지만, 기본 문법을 이미 배웠다는 점이 중요하다.
-
시뮬레이션된 정념도 감동을 주는가
- 인간이 맑은 눈으로 무언가에 미쳐 도전하고 실패하며 해내는 서사까지 단 한 번의 지시로 생성할 수 있을지는 열린 문제다.
- 실제가 아닌 영상으로 프로 피아니스트의 몰입을 보면서도 감동할 수 있다면, 인간의 정념을 분간할 수 없을 정도로 시뮬레이션한 콘텐츠도 동일한 감정을 일으킬 수 있다. 답은 그런 작품이 실제로 등장했을 때 경험으로 확인하게 된다.
8. 프론티어 랩에서 프론티어 컴퍼니로
창의성에서 시작한 수평적 확장이 법무·재무·생명공학으로 이어지면서 AI 기업은 연구실이 아니라 여러 산업을 직접 운영하는 회사가 되고 있다.
8.1. Anthropic의 wet lab과 생명공학 신호
-
CRISPR 유사 도구 발견의 과장과 의미
- Anthropic이 wet lab을 운영해 CRISPR 가위와 비슷한 것을 찾아냈다는 소식에 전문가들은 이미 하던 일이고 새롭지 않다며 비판했다.
- 그러나 중요한 것은 결과의 즉시성보다 신호가 발생했다는 사실이다. 당장 획기적이지 않아도 AI 기업이 생명공학 실험에 자본과 모델을 투입하기 시작했다는 뜻이다.
-
2년 예측과 4년의 현실
- 생명공학이 약 2년 안에 정복될 것이라는 전망이 있었지만 실제 체감 시간은 4년에 가까웠다. 연구 현장의 반발은 기존 생명공학이 이미 수행하던 일을 새로운 포장으로 내놓았다는 데서 나온다.
- 그렇더라도 지금은 시작 단계다. 중요한 변화는 첫 결과가 완벽해서가 아니라 돈과 인력이 계속 투입되고, 모델이 실험·기록·도구 호출을 반복하는 구조가 만들어졌다는 데 있다.
8.2. 수평적·수직적 확장과 사회적 책임
-
모델 플레이어에서 산업 인프라로
- 초기에는 모델을 대화하는 도구로 제공했지만, 이후 tool call·memory·Word·PowerPoint 같은 기능을 붙이며 옆으로 확장했다.
- 수평 확장이 끝난 뒤에는 법무·재무·생명공학·과학으로 종적 확장이 진행된다. 이제 기업은 모델을 파는 회사가 아니라 여러 산업의 문제를 직접 푸는 프론티어 컴퍼니가 된다.
-
“무엇이 남는가”라는 질문
- OpenAI와 Anthropic이 영역을 위아래와 좌우로 모두 확장하면 다른 기업과 개인에게 남는 공간이 무엇인지 묻게 된다.
- 내부에서 “우리가 모든 것을 다 하게 될 것이고 인류를 책임져야 한다”는 자조가 나올 정도라면, 연구 성과뿐 아니라 권력 집중·안전·공공성·책임의 범위를 외부에서 요구해야 한다.
9. 샌프란시스코의 다음 이벤트와 관점의 지연
변화가 너무 빨라 소식보다 관점을 먼저 준비해야 하지만, 관점을 만들기 전에 다음 도약이 찾아오는 상황이다.
9.1. Tech Week와 현장 관찰
- 수백 개 행사로 분산된 Tech Week
- 샌프란시스코에는 EO House라는 스타트업 콘텐츠 채널의 해커하우스가 있고, 영상 관련 스타트업을 시작한 사람들은 다음 주 Tech Week에서 수백 개 행사를 분야별로 찾아다닐 예정이다.
- 하나의 거대한 컨퍼런스가 아니라 도시 곳곳에서 각자 관심 분야의 행사를 고르는 구조다. 영상 생성과 프론티어 랩의 접근을 현장에서 따라가고, 행사 이후에도 약 한 달 동안 커피챗과 현장 대화를 이어갈 수 있다.
9.2. DevDay, 전천후 에이전트, 자율주행
-
소비자 애플리케이션의 궁극적 게이트웨이
- 9월 29일부터 진행되는 DevDay에서는 무엇이 나올지 알 수 없지만, Muse 에이전트처럼 쓸 만한 전천후 비서가 등장할 기대가 있다.
- 사용자가 검색하고, 물건을 사고, 글을 읽으러 직접 이동하는 대신 비서에게 “해 줘, 가져와, 사 와”라고 말하는 구조가 되면 소비자 산업의 게이트웨이가 에이전트로 이동한다.
-
도파민 출시와 현실 세계의 AI
- 9월 초 Fable, Astra, GPT-6 Sol에 이어 한 달에 여러 차례 거대한 발표가 이어져 변화가 재미있으면서도 버겁다. 짧은 간격으로 새 모델을 따라가는 일 자체를 견뎌야 한다.
- Tesla가 10월 1일 Roadster와 다른 무언가를 발표한다는 소문이 있고, 샌프란시스코 거리에서는 Waymo와 Zoox의 사람이 타지 않은 차가 이미 자연스럽게 다닌다. 실험실이 아니라 현실에 들어온 AI의 다음 사례가 될 수 있다.
9.3. 관점을 만드는 인식론적 행위
-
소식보다 관점이 중요해지는 단계
- 모델 발표를 나열하는 것보다 그 소식에 대해 어떤 관점을 만들어 두었는지가 중요하다. 그러나 모델이 너무 빨리 바뀌어 관점이 형성되기도 전에 전제가 바뀐다.
- 실리콘밸리의 소수 기업이 행동을 취하면 나머지는 반응하며 관점을 잡는 수동적인 상태에 놓인다. 영향이 너무 커서 역사에서 그대로 빌려올 틀이 부족하고, 기존의 틈새 전략만으로는 충분하지 않다.
-
테트리스와 epistemic action
- 테트리스 블록은 머릿속으로만 예측할 수 없고 직접 돌려 봐야 맞는 위치를 알 수 있다. 인식론적 행위(epistemic action)는 예측을 위해 먼저 행동해 보는 과정이다.
- 거대한 미래를 완벽히 예측하지 못하더라도 개인과 작은 조직은 직접 만들고, 실행하고, 실패시키며 자신의 탐색 공간을 좁혀야 한다. 현재의 정답을 기다리기보다 작은 실험으로 다음 관점을 만들어야 한다.
주요 발언 모음
“창작의 기회가 다시 한번 확장되리라 확신한다. 그래서 우리가 이 시기를 어떻게 지나갈지는 선택의 문제다.”
“코딩 자체가 목적이었던 적은 없었다. 중요한 건 언제나 계산과 소프트웨어가 가능하게 해주는 여러 종류의 연결이었다.”
“현재 AI로 어디까지 가능한지 조사하자.”
“가끔은 브레이크를 너무 일찍 잡지 말아야 된다.”
“이거는 AI의 문제가 아닌 거죠. 그걸 쓰는 사람들의 문제인 거죠.”
“무엇이든 다 만들 수 있다면, 그때 우리는 무엇을 만들어야 될까?”
“AI는 이런 거 못 해에서 AI는 모든 걸 다 할 수 있어로 오는 데 얼마나 짧은 시간이 걸렸습니까?”
핵심 데이터 & 수치
- 발행 간격: Opus 5와 Opus 5.5 사이가 약 60일이며, 프론티어 모델 세대의 체감 주기는 약 70일이다.
- 가격 하락: Opus 4.1은 입력 15달러·출력 75달러였으나 Opus 5.5는 입력 4달러·출력 20달러 수준으로 내려왔다.
- 벤치마크: 1년 동안 살아남는 평가가 드물고 HLE도 데이터 오염 문제를 안고 있다.
- 향상 속도: 프론티어 모델이 나올 때마다 체감상 일주일에 10%씩 개선되는 압축된 속도가 언급된다.
- 화풍 재현: 특정 화가의 붓질을 약 7,500줄의 Python 코드로 구현했다.
- JRPG 제작: 서사·반전·보스·엔딩을 포함하고 약 2시간 플레이 가능한 게임을 하루 정도에 만들었다.
- 초기 게임 PoC: 작은 마을과 인접 맵을 생성하는 데 약 20분, 초기 생성 전체에 약 30분이 걸렸다.
- 오디오 방식: PCM(Pulse Code Modulation), formant, JavaScript, NumPy, Web Audio로 음악·효과음·음성 구조를 합성했다.
- 학습 기간: 디자인 수업은 약 4주 진행됐고, AI 기능을 실험하고 상방을 여는 과정이 핵심이었다.
- 현장 일정: DevDay는 9월 29일부터, Tesla의 발표 예고는 10월 1일로 언급됐다.
결론 및 시사점
- 프론티어 모델의 경쟁은 모델 점수만이 아니라 가격, 추론 옵션, 컴퓨팅 팜 배치, 오픈소스와 온프레미스까지 포함하는 운영 경쟁이 됐다.
- 창의성은 더 이상 AI가 못 하는 마지막 영역으로 안전하게 남아 있지 않으며, 코드·시각·음향·상호작용·서사를 연결하는 탐색 공간으로 이동했다.
- 결과를 만드는 비용은 급락하지만 무엇을 만들지 정하는 취향과 인간적 맥락은 자동으로 공급되지 않는다.
- 가능한 최대치를 조사하고 직접 실험하며, 브레이크를 너무 일찍 밟지 않는 사람이 AI의 지렛대를 더 크게 활용한다.
- 개념어와 역사를 아는 능력은 프롬프트 장식이 아니라 숨은 도구와 창작 전통을 인출하는 인터페이스다.
- 모델의 창작 능력이 어떤 보상으로 학습됐는지는 아직 추정의 영역이지만, 영역 지식과 표상을 연결하는 능력이 임계점을 넘고 있다는 신호는 분명하다.
- 프론티어 기업은 AI 모델 공급자를 넘어 법무·재무·생명공학·과학을 수행하는 회사가 되고 있으므로 권력과 책임에 대한 공적 감시가 필요하다.
- 콘텐츠가 넘칠수록 사람들은 완성도보다 실제 경험, 관계, 의도, 경쟁, 놀이와 같은 인간적 이유를 찾아 콘텐츠를 선택할 수 있다.
- 인간의 스포츠·연주·도전 서사가 언제까지 자동 생성물과 구별되는지는 실제로 구별하기 어려운 작품이 등장한 뒤에야 알 수 있다.
- 거대한 변화를 완벽히 해석할 때까지 기다리지 말고, 테트리스 블록을 돌려 보듯 작은 epistemic action을 반복해 자신만의 관점을 만들어야 한다.
핵심 요약 (20줄)
프론티어 모델은 약 70일 주기로 세대가 바뀌며 벤치마크의 유효기간보다 빠르게 발전하고 있다. Opus 5.5는 Opus 4.1보다 입력·출력 가격이 크게 낮아졌고 medium 옵션만으로도 높은 성능을 낸다. 토큰은 시간이 지나면 팔 수 없는 항공권과 같아서 모델 회사는 컴퓨팅 팜과 가격을 동적으로 최적화한다. 최근의 성능 향상은 모든 능력의 일반화보다 특정 벤치마크와 작업을 겨냥한 촘촘한 강화학습에 가깝다. AI for Creativity라는 표현은 창의성을 인간만의 마지막 영역으로 보던 전제를 직접 흔든다. AI 쇼츠 드라마는 생성물임을 드러내면서도 실제 촬영으로 만들기 어려운 세계관과 연출 때문에 소비되고 있다. YouTube는 정보를 전달하는 AI 영상은 남기고 정보 없는 생성물 반복 채널은 장기적 해악을 이유로 차단했다. Opus 5.5는 JavaScript만으로 음악과 박자가 맞는 모션 그래픽을 만들고 상호작용까지 구현한다. 약 7,500줄의 Python 코드는 특정 화가의 붓질과 화풍을 수학적 절차로 재현한다. Dark Souls풍 보스전, Antikythera 유물 탐험, 재귀 교육 영상 같은 게임과 학습 콘텐츠가 코드로 생성된다. 서사와 반전을 갖춘 약 2시간짜리 JRPG가 픽셀·스프라이트·음악을 별도 에셋 없이 하루 만에 만들어졌다. PCM과 formant 합성은 코드만으로 효과음과 민요식 합창, 기승전결과 상호작용을 갖춘 음악을 가능하게 한다. 이 능력은 사전학습의 영역 표상과 후속학습의 대리 보상이 결합한 결과일 가능성이 있지만 학습 방식은 확정되지 않았다. Astra의 코드 기반 로봇 정책은 코드·이미지·행동을 하나의 생성 문제로 연결하는 방향을 보여 준다. 코드 아티스트들은 코딩을 정체성으로 볼지 연결을 위한 수단으로 볼지에 따라 서로 다른 감정과 선택을 보인다. AI를 잘 쓰려면 현재 가능한 상방을 조사하고, 용어와 역사를 익히고, 브레이크를 너무 일찍 밟지 않아야 한다. AI 도입에 따른 조직 생산성의 차이는 모델보다 변화를 받아들이고 시행착오를 반복하는 사람들의 태도에서 커진다. 모든 것을 만들 수 있게 되면 무엇을 만들지와 사람들이 왜 그것을 볼지가 제작 기술보다 중요해진다. 기계가 지적 노동을 맡을수록 인간의 경쟁·놀이·스포츠와 실제 정념이 콘텐츠의 가치가 될 수 있다. 변화의 정답을 기다리기보다 테트리스 블록을 돌려 보듯 작은 실험을 반복하는 epistemic action이 새로운 관점을 만든다.
