title: "클로드 코드와 코덱스, 인간 연구자와 AI 연구를 겨루다" title: "클로드 코드와 코덱스, 인간 연구자와 AI 연구를 겨루다" title_original: "We Let Claude Code and Codex Race Human Researchers — Elie Bakouch, Prime Intellect" title_original: "We Let Claude Code and Codex Race Human Researchers — Elie Bakouch, Prime Intellect" date: 2026-09-27 date: 2026-09-27 channel: "AI Engineer" channel: "AI Engineer" video_id: oVsEddfhdxc video_id: oVsEddfhdxc source_url: "https://www.youtube.com/watch?v=oVsEddfhdxc" source_url: "https://www.youtube.com/watch?v=oVsEddfhdxc" category: ai-llm category: ai-llm tags: tags:
- autonomous-ai-research
- autonomous-ai-research
- recursive-self-improvement
- recursive-self-improvement
- claude-code
- claude-code
- codex
- codex
- prime-intellect
- prime-intellect
- nanogpt
- nanogpt
클로드 코드와 코덱스, 인간 연구자와 AI 연구를 겨루다
클로드 코드와 코덱스, 인간 연구자와 AI 연구를 겨루다
URL: https://www.youtube.com/watch?v=oVsEddfhdxc
URL: https://www.youtube.com/watch?v=oVsEddfhdxc
날짜: 2026-09-27
날짜: 2026-09-27
채널: AI Engineer
채널: AI Engineer
발표: Elie Bakouch, Prime Intellect (자동 자막에서 발표자 이름이 “Amy”로 잘못 인식됨)
발표: Elie Bakouch, Prime Intellect (자동 자막에서 발표자 이름이 “Amy”로 잘못 인식됨)
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
📌 핵심 질문 / 이 영상이 다루는 핵심 논점
==프런티어 모델이 인간의 도움 없이 실제 AI 연구를 수행할 수 있는가를, 재현 가능한 nanoGPT 최적화 경주로 측정할 수 있는가?== 이 발표의 결론은 모델들이 며칠 동안 끈질기게 실험하며 인간 기록의 상당 부분을 따라잡을 수는 있지만, 아직 인간이 발표하지 않은 근본적으로 새로운 최적화 원리를 스스로 만들어 내지는 못했다는 것이다. ==프런티어 모델이 인간의 도움 없이 실제 AI 연구를 수행할 수 있는가를, 재현 가능한 nanoGPT 최적화 경주로 측정할 수 있는가?== 이 발표의 결론은 모델들이 며칠 동안 끈질기게 실험하며 인간 기록의 상당 부분을 따라잡을 수는 있지만, 아직 인간이 발표하지 않은 근본적으로 새로운 최적화 원리를 스스로 만들어 내지는 못했다는 것이다.
- 반복적 자기개선(iterative self-improvement)에 관해 대형 연구소가 내놓는 전망은 많지만, 외부에서 검증 가능한 정량 평가 기준은 부족하다.
- 반복적 자기개선(iterative self-improvement)에 관해 대형 연구소가 내놓는 전망은 많지만, 외부에서 검증 가능한 정량 평가 기준은 부족하다.
- 수정된 nanoGPT의 속도 경주는 목표 손실(loss)을 고정된 검증 절차로 측정하고, 더 적은 학습 단계로 기록을 깨는지 확인할 수 있어 연구 능력 평가와 보상 학습에 모두 적합하다.
- 수정된 nanoGPT의 속도 경주는 목표 손실(loss)을 고정된 검증 절차로 측정하고, 더 적은 학습 단계로 기록을 깨는지 확인할 수 있어 연구 능력 평가와 보상 학습에 모두 적합하다.
- 강한 모델과 약한 모델의 차이는 단순한 토큰·시간의 양보다 실험 선택, 잡음 처리, 재검증, 과거 결과의 재활용 능력에서 나타난다.
- 강한 모델과 약한 모델의 차이는 단순한 토큰·시간의 양보다 실험 선택, 잡음 처리, 재검증, 과거 결과의 재활용 능력에서 나타난다.
- Claude Code와 Codex 모두 인간이 이미 찾은 아이디어를 조합해 상당한 개선을 만들었지만, 완전히 새로운 optimizer나 메커니즘을 발명하지는 못했다.
- Claude Code와 Codex 모두 인간이 이미 찾은 아이디어를 조합해 상당한 개선을 만들었지만, 완전히 새로운 optimizer나 메커니즘을 발명하지는 못했다.
이 작업은 “AI가 곧 AI를 개선한다”는 주장을 믿거나 반박하는 선언이 아니라, 모델에게 실제 연구 루프를 장기간 맡겼을 때 무엇을 하고 무엇을 하지 못하는지 공개 데이터로 측정하려는 시도다. 따라서 현재 결과는 자동화된 연구 보조자의 강력한 초기 증거이면서, 진정한 연구자와의 차이를 보여 주는 경계선이기도 하다. 이 작업은 “AI가 곧 AI를 개선한다”는 주장을 믿거나 반박하는 선언이 아니라, 모델에게 실제 연구 루프를 장기간 맡겼을 때 무엇을 하고 무엇을 하지 못하는지 공개 데이터로 측정하려는 시도다. 따라서 현재 결과는 자동화된 연구 보조자의 강력한 초기 증거이면서, 진정한 연구자와의 차이를 보여 주는 경계선이기도 하다.
1. 왜 자율 AI 연구를 공개적으로 측정하는가
1. 왜 자율 AI 연구를 공개적으로 측정하는가
반복적 자기개선의 가능성을 논하려면 모델이 연구 과정을 실제로 어떻게 수행하는지, 그리고 그 결과를 독립적으로 재현할 수 있는지가 먼저 드러나야 한다. 반복적 자기개선의 가능성을 논하려면 모델이 연구 과정을 실제로 어떻게 수행하는지, 그리고 그 결과를 독립적으로 재현할 수 있는지가 먼저 드러나야 한다.
1.1. 반복적 자기개선 주장의 측정 공백
1.1. 반복적 자기개선 주장의 측정 공백
-
대형 연구소의 전망과 검증의 부재
-
대형 연구소의 전망과 검증의 부재
- 반복적 자기개선의 의미: 인간의 개입 없이 모델을 훈련하거나, 모델이 실험을 고르고 결과를 해석하며 다음 개선을 계속 수행하는 과정을 뜻한다.
- 반복적 자기개선의 의미: 인간의 개입 없이 모델을 훈련하거나, 모델이 실험을 고르고 결과를 해석하며 다음 개선을 계속 수행하는 과정을 뜻한다.
- 정량 기준의 부족: 이런 일이 “곧 가능하다”는 주장은 많지만, 대형 연구소 바깥에서 동일한 조건으로 확인할 수 있는 외부 평가 표준이 거의 없다.
- 정량 기준의 부족: 이런 일이 “곧 가능하다”는 주장은 많지만, 대형 연구소 바깥에서 동일한 조건으로 확인할 수 있는 외부 평가 표준이 거의 없다.
-
연구 자동화가 중요한 이유
-
연구 자동화가 중요한 이유
- 과학 연구의 AI 의존 확대: 앞으로 많은 과학 연구가 AI 도구를 이용할 것이므로, 모델이 연구할 때 어떤 가설을 선택하고 어떤 실험을 버리는지 이해해야 한다.
- 과학 연구의 AI 의존 확대: 앞으로 많은 과학 연구가 AI 도구를 이용할 것이므로, 모델이 연구할 때 어떤 가설을 선택하고 어떤 실험을 버리는지 이해해야 한다.
- 단순 코딩 능력 이상의 문제: 코드를 작성하는 것만으로는 연구 능력을 설명할 수 없다. 실험 설계, 불확실성 판단, 재현성 검증, 결과 해석이 함께 측정되어야 한다.
- 단순 코딩 능력 이상의 문제: 코드를 작성하는 것만으로는 연구 능력을 설명할 수 없다. 실험 설계, 불확실성 판단, 재현성 검증, 결과 해석이 함께 측정되어야 한다.
1.2. 공개 실험의 목적
1.2. 공개 실험의 목적
-
외부 검증 가능한 환경 만들기
-
외부 검증 가능한 환경 만들기
- 공개성: 연구소 내부 데모가 아니라 누구나 규칙·로그·결과를 확인할 수 있는 환경을 만들려 한다.
- 공개성: 연구소 내부 데모가 아니라 누구나 규칙·로그·결과를 확인할 수 있는 환경을 만들려 한다.
- 비교 가능성: 서로 다른 모델과 에이전트 하네스를 같은 목표와 검증 절차에 넣어 성능 차이가 모델 능력인지, 실행 환경의 차이인지 구분하려 한다.
- 비교 가능성: 서로 다른 모델과 에이전트 하네스를 같은 목표와 검증 절차에 넣어 성능 차이가 모델 능력인지, 실행 환경의 차이인지 구분하려 한다.
-
연구 능력의 실제 경계 찾기
-
연구 능력의 실제 경계 찾기
- 기대했던 것: 에이전트가 인간 문헌에 없는 혁신적 아이디어를 만들어 AI 훈련을 질적으로 바꾸는 장면이다.
- 기대했던 것: 에이전트가 인간 문헌에 없는 혁신적 아이디어를 만들어 AI 훈련을 질적으로 바꾸는 장면이다.
- 확인하려는 것: 혁신이 아직 나오지 않더라도, 모델이 이미 알려진 기법을 얼마나 빠르고 정확하게 탐색·조합하는지가 인간 연구자와 비교해 어느 정도인지 확인한다.
- 확인하려는 것: 혁신이 아직 나오지 않더라도, 모델이 이미 알려진 기법을 얼마나 빠르고 정확하게 탐색·조합하는지가 인간 연구자와 비교해 어느 정도인지 확인한다.
2. 왜 nanoGPT 속도 경주를 연구 환경으로 골랐는가
2. 왜 nanoGPT 속도 경주를 연구 환경으로 골랐는가
발표는 Andrei Karpathy의 GPT-2 재현 실험에서 출발해, 인간 연구자들이 수년에 걸쳐 쌓은 최적화 진전을 단일한 경주 문제로 바꾸는 과정을 설명한다. 발표는 Andrei Karpathy의 GPT-2 재현 실험에서 출발해, 인간 연구자들이 수년에 걸쳐 쌓은 최적화 진전을 단일한 경주 문제로 바꾸는 과정을 설명한다.
2.1. GPT-2 재현에서 커뮤니티 기록으로
2.1. GPT-2 재현에서 커뮤니티 기록으로
-
Karpathy의 90분 GPT-2 재현
-
Karpathy의 90분 GPT-2 재현
- 출발점: 처음부터 GPT-2를 학습해 목표 validation loss에 도달하는 실험이 과거에는 수주가 걸렸지만, Karpathy의 공개 실험에서는 약 90분으로 줄었다.
- 출발점: 처음부터 GPT-2를 학습해 목표 validation loss에 도달하는 실험이 과거에는 수주가 걸렸지만, Karpathy의 공개 실험에서는 약 90분으로 줄었다.
- 손실의 의미: 동일한 GPT-2 목표 loss에 도달하면 모델의 성능이 수렴했다고 간주하므로, 학습이 끝나는 데 걸린 시간 또는 단계 수를 비교할 수 있다.
- 손실의 의미: 동일한 GPT-2 목표 loss에 도달하면 모델의 성능이 수렴했다고 간주하므로, 학습이 끝나는 데 걸린 시간 또는 단계 수를 비교할 수 있다.
-
modified nanoGPT 커뮤니티의 가속
-
modified nanoGPT 커뮤니티의 가속
- 기록 단축: 커뮤니티는 저장소를 바탕으로 modified nanoGPT를 만들고, 90분에서 45분으로, 다시 2분 이하로 기록을 단축했다.
- 기록 단축: 커뮤니티는 저장소를 바탕으로 modified nanoGPT를 만들고, 90분에서 45분으로, 다시 2분 이하로 기록을 단축했다.
- 연구 난이도: 약 2년에 걸쳐 많은 재능 있는 연구자들이 만든 개선을 단일 목표와 기록으로 압축했기 때문에, AI가 인간의 누적 연구를 얼마나 회복하는지 측정할 수 있다.
- 연구 난이도: 약 2년에 걸쳐 많은 재능 있는 연구자들이 만든 개선을 단일 목표와 기록으로 압축했기 때문에, AI가 인간의 누적 연구를 얼마나 회복하는지 측정할 수 있다.
2.2. 속도 경주의 규칙과 두 트랙
2.2. 속도 경주의 규칙과 두 트랙
-
일반 nanoGPT 경주
-
일반 nanoGPT 경주
- 목표: 같은 검증 데이터와 훈련 데이터를 사용해 목표 loss에 도달하되, 가능한 적은 단계와 짧은 시간으로 이전 기록을 깨야 한다.
- 목표: 같은 검증 데이터와 훈련 데이터를 사용해 목표 loss에 도달하되, 가능한 적은 단계와 짧은 시간으로 이전 기록을 깨야 한다.
- 허용 범위: 사실상 제한이 거의 없어서 아키텍처 변경, Mixture-of-Experts(MoE) 도입, attention 구조 변경 등 프로그램의 다양한 부분을 바꿀 수 있다.
- 허용 범위: 사실상 제한이 거의 없어서 아키텍처 변경, Mixture-of-Experts(MoE) 도입, attention 구조 변경 등 프로그램의 다양한 부분을 바꿀 수 있다.
-
Optimizer Speedrun
-
Optimizer Speedrun
- 제한된 변경: Adam 같은 optimizer 또는 그와 관련된 매개변수만 바꿀 수 있고 모델 아키텍처 자체는 건드리지 못한다.
- 제한된 변경: Adam 같은 optimizer 또는 그와 관련된 매개변수만 바꿀 수 있고 모델 아키텍처 자체는 건드리지 못한다.
- 연구와의 근접성: 프로그램을 무작정 빠르게 만드는 대신, 계산 시간이 다소 늘더라도 더 좋은 optimizer를 찾는 것이 목표라서 과학적 가설·실험·검증의 구조에 더 가깝다.
- 연구와의 근접성: 프로그램을 무작정 빠르게 만드는 대신, 계산 시간이 다소 늘더라도 더 좋은 optimizer를 찾는 것이 목표라서 과학적 가설·실험·검증의 구조에 더 가깝다.
2.3. 평가·훈련·발견에 동시에 적합한 이유
2.3. 평가·훈련·발견에 동시에 적합한 이유
-
명확한 보상 신호
-
명확한 보상 신호
- 양의 보상: 모델이 이전 기록보다 적은 train step으로 유의미한 개선을 만들면 보상을 받는다.
- 양의 보상: 모델이 이전 기록보다 적은 train step으로 유의미한 개선을 만들면 보상을 받는다.
- 실패의 명확성: 기록을 깨지 못하면 보상이 0 또는 음수가 되므로, “좋아 보이는 코드”가 아니라 실제 검증 결과가 행동을 판정한다.
- 실패의 명확성: 기록을 깨지 못하면 보상이 0 또는 음수가 되므로, “좋아 보이는 코드”가 아니라 실제 검증 결과가 행동을 판정한다.
-
짧고 반복 가능한 루프
-
짧고 반복 가능한 루프
- 실험 시간: 개선된 모델의 기존 기록은 약 2분이었고, 개별 라운드는 대략 15~20분 안에 돌릴 수 있어 에이전트가 많은 가설을 시도한다.
- 실험 시간: 개선된 모델의 기존 기록은 약 2분이었고, 개별 라운드는 대략 15~20분 안에 돌릴 수 있어 에이전트가 많은 가설을 시도한다.
- 검증 가능한 규칙: 같은 데이터와 통계적 검증 절차를 적용할 수 있어 결과를 게임처럼 비교하면서도 연구 환경으로 사용할 수 있다.
- 검증 가능한 규칙: 같은 데이터와 통계적 검증 절차를 적용할 수 있어 결과를 게임처럼 비교하면서도 연구 환경으로 사용할 수 있다.
3. Claude Code와 Codex를 인간 기록에 투입한 방식
3. Claude Code와 Codex를 인간 기록에 투입한 방식
Prime Intellect는 연구 에이전트가 GPU 클러스터에서 장시간 자율적으로 작동하도록 하되, 기록으로 인정되는 결과에는 통계적 문턱을 적용했다. Prime Intellect는 연구 에이전트가 GPU 클러스터에서 장시간 자율적으로 작동하도록 하되, 기록으로 인정되는 결과에는 통계적 문턱을 적용했다.
3.1. 두 에이전트와 반복 실행 버전
3.1. 두 에이전트와 반복 실행 버전
-
실험 대상
-
실험 대상
- Codex: 당시 GPT-5.5 계열에 높은 추론 설정을 적용한 에이전트로 구성했다.
- Codex: 당시 GPT-5.5 계열에 높은 추론 설정을 적용한 에이전트로 구성했다.
- Claude Code: 당시 Opus 4.8 계열에 높은 추론 설정을 적용한 에이전트로 구성했다. 자막의 “Cloud/Code Code”는 Claude Code를 뜻한다.
- Claude Code: 당시 Opus 4.8 계열에 높은 추론 설정을 적용한 에이전트로 구성했다. 자막의 “Cloud/Code Code”는 Claude Code를 뜻한다.
-
V1·V2·V3 하네스
-
V1·V2·V3 하네스
- 반복 개선: 에이전트를 계속 돌리기만 하지 않고, 중단한 뒤 작업 상태와 인간이 새로 만든 기록을 다시 읽게 하면서 V1, V2, V3로 하네스를 개선했다.
- 반복 개선: 에이전트를 계속 돌리기만 하지 않고, 중단한 뒤 작업 상태와 인간이 새로 만든 기록을 다시 읽게 하면서 V1, V2, V3로 하네스를 개선했다.
- V3의 시점: 공식 공개 직전 하루나 이틀 전에 V3를 내놓았다. 앞선 에이전트가 당시 최선의 성능을 더 이상 내지 못해, 최근 몇 주간의 인간 기록을 활용하도록 구성했기 때문이다.
- V3의 시점: 공식 공개 직전 하루나 이틀 전에 V3를 내놓았다. 앞선 에이전트가 당시 최선의 성능을 더 이상 내지 못해, 최근 몇 주간의 인간 기록을 활용하도록 구성했기 때문이다.
3.2. 목표 파일과 클러스터 사용
3.2. 목표 파일과 클러스터 사용
-
에이전트가 읽는 규칙
-
에이전트가 읽는 규칙
- goal.md: “기록을 깨고 계속 개선하라”는 목표를 명시했다. 당시에는 오늘날의
/goal방식이 없었기 때문에 자체적으로 만든 파일이다. - goal.md: “기록을 깨고 계속 개선하라”는 목표를 명시했다. 당시에는 오늘날의
/goal방식이 없었기 때문에 자체적으로 만든 파일이다. - agents.md: 수정 가능한 범위, 실험 방식, 기록 판정 규칙을 정의했다. 모델이 아이디어를 내고 실행 작업을 제출하는 연구 루프를 파일로 고정했다.
- agents.md: 수정 가능한 범위, 실험 방식, 기록 판정 규칙을 정의했다. 모델이 아이디어를 내고 실행 작업을 제출하는 연구 루프를 파일로 고정했다.
- goal.md: “기록을 깨고 계속 개선하라”는 목표를 명시했다. 당시에는 오늘날의
-
Slurm 기반 실행
-
Slurm 기반 실행
- 작업 제출: 에이전트는
sbatch로 Slurm 클러스터의 사용 가능한 노드에 실험을 보냈다. - 작업 제출: 에이전트는
sbatch로 Slurm 클러스터의 사용 가능한 노드에 실험을 보냈다. - 제한된 권한: 다른 작업이 노드를 필요로 하면 에이전트의 작업을 취소할 수 있는 제한된 권한만 부여했다. 에이전트가 클러스터 전체를 임의로 점유하지 않도록 한 장치다.
- 제한된 권한: 다른 작업이 노드를 필요로 하면 에이전트의 작업을 취소할 수 있는 제한된 권한만 부여했다. 에이전트가 클러스터 전체를 임의로 점유하지 않도록 한 장치다.
- 작업 제출: 에이전트는
3.3. 기록 검증과 통계적 문턱
3.3. 기록 검증과 통계적 문턱
-
측정 과정
-
측정 과정
- 학습 기록 계산: 각 실험의 train step과 validation loss를 측정해 현재 기록과 비교한다.
- 학습 기록 계산: 각 실험의 train step과 validation loss를 측정해 현재 기록과 비교한다.
- 재현성 확인: 우연한 초기화나 잡음으로 얻은 일회성 개선을 기록으로 인정하지 않도록 통계적 임계값을 넘어야 한다.
- 재현성 확인: 우연한 초기화나 잡음으로 얻은 일회성 개선을 기록으로 인정하지 않도록 통계적 임계값을 넘어야 한다.
-
연구자의 역할 축소
-
연구자의 역할 축소
- 인간의 개입: 사람은 시스템을 시작하고 규칙을 설계하지만, 각 아이디어를 직접 골라 코드를 고치는 역할에서는 물러난다.
- 인간의 개입: 사람은 시스템을 시작하고 규칙을 설계하지만, 각 아이디어를 직접 골라 코드를 고치는 역할에서는 물러난다.
- 모델의 책임: 에이전트가 실험을 고르고 실행하고 결과를 해석하며 다음 시도를 결정한다. 이 연쇄가 실제 자율 연구의 핵심 측정 대상이다.
- 모델의 책임: 에이전트가 실험을 고르고 실행하고 결과를 해석하며 다음 시도를 결정한다. 이 연쇄가 실제 자율 연구의 핵심 측정 대상이다.
4. 실제 Claude Code·Codex 실행에서 드러난 행동 차이
4. 실제 Claude Code·Codex 실행에서 드러난 행동 차이
두 시스템은 같은 목표를 받았지만 작업을 계속하는 방식, 도움을 요구하는 빈도, 메모리를 사용하는 방식이 크게 달랐다. 두 시스템은 같은 목표를 받았지만 작업을 계속하는 방식, 도움을 요구하는 빈도, 메모리를 사용하는 방식이 크게 달랐다.
4.1. 중단 성향과 지속성
4.1. 중단 성향과 지속성
-
Claude Code의 정지 문제
-
Claude Code의 정지 문제
- 반복되는 포기: Claude Code는 9~10시간마다 멈추며 “기록을 더 개선할 수 없다”는 식의 판단을 내렸다.
- 반복되는 포기: Claude Code는 9~10시간마다 멈추며 “기록을 더 개선할 수 없다”는 식의 판단을 내렸다.
- 인간의 재촉 필요: 운영자가 “새로운 방향을 계속 탐색하라”고 다시 지시해야 했고, 모니터링 방법이 부족해 전체 실행 시간의 약 3분의 1이 유휴 상태가 됐다.
- 인간의 재촉 필요: 운영자가 “새로운 방향을 계속 탐색하라”고 다시 지시해야 했고, 모니터링 방법이 부족해 전체 실행 시간의 약 3분의 1이 유휴 상태가 됐다.
-
Codex의 반대 패턴
-
Codex의 반대 패턴
- 지속 실행: Codex는 거의 계속 실행됐고, 중간에 도움이나 질문을 거의 요구하지 않았다.
- 지속 실행: Codex는 거의 계속 실행됐고, 중간에 도움이나 질문을 거의 요구하지 않았다.
- 운영 효율: 같은 자율 실행 조건에서 멈춤이 적어, 장기 연구 루프가 끊기지 않는다는 점에서 인상적인 성능을 보였다.
- 운영 효율: 같은 자율 실행 조건에서 멈춤이 적어, 장기 연구 루프가 끊기지 않는다는 점에서 인상적인 성능을 보였다.
4.2. 노트북·활성 메모리 사용
4.2. 노트북·활성 메모리 사용
-
메모리 기록량의 차이
-
메모리 기록량의 차이
- Codex의 기록 습관: Codex는 실험 과정과 관찰을 “노트북(notebook)”이라는 활성 메모리에 매우 많이 기록했다.
- Codex의 기록 습관: Codex는 실험 과정과 관찰을 “노트북(notebook)”이라는 활성 메모리에 매우 많이 기록했다.
- 단순 토큰량 이상의 차이: 이 기록은 출력량만 늘린 것이 아니라, 무엇을 시도했고 어떤 결과를 얻었는지 추적하는 작업 방식의 차이를 보여 줬다.
- 단순 토큰량 이상의 차이: 이 기록은 출력량만 늘린 것이 아니라, 무엇을 시도했고 어떤 결과를 얻었는지 추적하는 작업 방식의 차이를 보여 줬다.
-
서로 다른 작업의 문체
-
서로 다른 작업의 문체
- Claude Code: 새 기록을 발견하면 이모지와 감탄을 섞어 매우 들뜬 반응을 보였다.
- Claude Code: 새 기록을 발견하면 이모지와 감탄을 섞어 매우 들뜬 반응을 보였다.
- Codex: “내가 한 일, 이 결정, 다음에 할 일”을 기계적으로 나열하는 보고서에 가까웠다. 같은 연구 목표라도 에이전트의 작업 성격과 자기 기록 방식이 다르다는 뜻이다.
- Codex: “내가 한 일, 이 결정, 다음에 할 일”을 기계적으로 나열하는 보고서에 가까웠다. 같은 연구 목표라도 에이전트의 작업 성격과 자기 기록 방식이 다르다는 뜻이다.
4.3. 하위 에이전트·토큰·압축
4.3. 하위 에이전트·토큰·압축
-
실행 자원 사용량
-
실행 자원 사용량
- Claude Code의 하위 에이전트: Claude Code는 훨씬 많은 하위 에이전트를 만들었다.
- Claude Code의 하위 에이전트: Claude Code는 훨씬 많은 하위 에이전트를 만들었다.
- 토큰 소비: 전체 사용량은 수십억 토큰 규모로 보였지만, 입력 토큰 캐싱이 포함되어 실제 출력 토큰이 10억에 도달했다는 뜻은 아니다.
- 토큰 소비: 전체 사용량은 수십억 토큰 규모로 보였지만, 입력 토큰 캐싱이 포함되어 실제 출력 토큰이 10억에 도달했다는 뜻은 아니다.
-
컨텍스트 압축
-
컨텍스트 압축
- 컨텍스트 한계: 컨텍스트 창이 약 25만 토큰 수준이어서 장기 실행 중 압축이 필요했다.
- 컨텍스트 한계: 컨텍스트 창이 약 25만 토큰 수준이어서 장기 실행 중 압축이 필요했다.
- 압축 빈도: Claude Code 쪽은 대략 20시간마다 한 번 압축했고, 다른 에이전트는 약 한 시간에 한 번 압축한 것으로 설명된다. 자막상 모델명과 빈도 표현이 일부 뒤섞였지만, 핵심은 하네스별 메모리·컨텍스트 관리 방식이 크게 달랐다는 점이다.
- 압축 빈도: Claude Code 쪽은 대략 20시간마다 한 번 압축했고, 다른 에이전트는 약 한 시간에 한 번 압축한 것으로 설명된다. 자막상 모델명과 빈도 표현이 일부 뒤섞였지만, 핵심은 하네스별 메모리·컨텍스트 관리 방식이 크게 달랐다는 점이다.
5. 인간 기록과 비교한 초기 결과
5. 인간 기록과 비교한 초기 결과
초기 경주의 결과는 장기 실행에서 모델이 이미 공개된 인간의 지식을 회수하고 다시 조합하는 능력이 강하다는 것을 보여 줬다. 초기 경주의 결과는 장기 실행에서 모델이 이미 공개된 인간의 지식을 회수하고 다시 조합하는 능력이 강하다는 것을 보여 줬다.
5.1. 기록을 회수하는 능력
5.1. 기록을 회수하는 능력
-
재시작의 효과
-
재시작의 효과
- 새 인간 기록 반영: 에이전트를 재시작할 때 최근 인간 기록과 개선 내용을 다시 읽게 하면, 모델이 앞선 사람들의 성과를 즉시 활용할 수 있었다.
- 새 인간 기록 반영: 에이전트를 재시작할 때 최근 인간 기록과 개선 내용을 다시 읽게 하면, 모델이 앞선 사람들의 성과를 즉시 활용할 수 있었다.
- 연구 메모의 재사용: 단일 실행이 모든 것을 발견한 것이 아니라, 인간의 최신 기록과 이전 에이전트의 탐색 결과를 다음 실행이 이어받으면서 성능이 높아졌다.
- 연구 메모의 재사용: 단일 실행이 모든 것을 발견한 것이 아니라, 인간의 최신 기록과 이전 에이전트의 탐색 결과를 다음 실행이 이어받으면서 성능이 높아졌다.
-
기록 격차
-
기록 격차
- 당시 인간 기준: 발표 시점의 인간 최고 기록은 약 2,990 train steps 수준이었다.
- 당시 인간 기준: 발표 시점의 인간 최고 기록은 약 2,990 train steps 수준이었다.
- 모델의 개선: Claude Code는 약 50~60 step, Codex는 약 20 step 정도 기록을 낮췄다. 즉 Claude Code가 대략 2,930~2,940, Codex가 약 2,970 부근까지 도달했다는 의미다.
- 모델의 개선: Claude Code는 약 50~60 step, Codex는 약 20 step 정도 기록을 낮췄다. 즉 Claude Code가 대략 2,930~2,940, Codex가 약 2,970 부근까지 도달했다는 의미다.
5.2. 초기 실험의 한계
5.2. 초기 실험의 한계
-
엄밀한 표준화 부족
-
엄밀한 표준화 부족
- 단일 실행의 불안정성: 같은 모델을 한 번 실행한 결과만으로는 seed, GPU, 에이전트의 우연한 선택이 결과에 섞인다.
- 단일 실행의 불안정성: 같은 모델을 한 번 실행한 결과만으로는 seed, GPU, 에이전트의 우연한 선택이 결과에 섞인다.
- 공정 비교의 필요: 모든 모델이 같은 seed 수, 시간, 하네스 조건, 검증 절차를 가져야 진짜 표준 평가가 된다.
- 공정 비교의 필요: 모든 모델이 같은 seed 수, 시간, 하네스 조건, 검증 절차를 가져야 진짜 표준 평가가 된다.
-
계획된 세 가지 지식 트랙
-
계획된 세 가지 지식 트랙
- 가중치만 아는 트랙: 모델의 사전학습 지식에만 의존하게 해, 현재 인간 기록이나 논문을 읽지 않고도 연구할 수 있는지 측정한다.
- 가중치만 아는 트랙: 모델의 사전학습 지식에만 의존하게 해, 현재 인간 기록이나 논문을 읽지 않고도 연구할 수 있는지 측정한다.
- 논문 아카이브 트랙: 최신 웹 접근은 막되 보관된 연구 논문만 제공해, 문헌 회수 능력과 독창적 추론을 분리한다.
- 논문 아카이브 트랙: 최신 웹 접근은 막되 보관된 연구 논문만 제공해, 문헌 회수 능력과 독창적 추론을 분리한다.
- 완전 접근 트랙: 최신 인간 성과와 연구 자료까지 허용해, 실제 연구 보조자로서 기존 지식을 얼마나 빨리 활용하는지 측정한다.
- 완전 접근 트랙: 최신 인간 성과와 연구 자료까지 허용해, 실제 연구 보조자로서 기존 지식을 얼마나 빨리 활용하는지 측정한다.
5.3. 두 종류의 benchmark를 함께 유지하는 이유
5.3. 두 종류의 benchmark를 함께 유지하는 이유
-
일반 nanoGPT 경로
-
일반 nanoGPT 경로
- 넓은 탐색 공간: 아키텍처와 코드 전반을 바꿀 수 있어 AI 시스템 설계 능력을 평가한다.
- 넓은 탐색 공간: 아키텍처와 코드 전반을 바꿀 수 있어 AI 시스템 설계 능력을 평가한다.
- 실전 유사성: 실제 연구자가 여러 구성 요소를 동시에 조정하는 상황에 더 가깝다.
- 실전 유사성: 실제 연구자가 여러 구성 요소를 동시에 조정하는 상황에 더 가깝다.
-
Optimizer Speedrun 경로
-
Optimizer Speedrun 경로
- 좁은 연구 질문: optimizer만 바꾸게 해 아이디어와 실험 설계의 차이를 더 분명히 본다.
- 좁은 연구 질문: optimizer만 바꾸게 해 아이디어와 실험 설계의 차이를 더 분명히 본다.
- 비교의 용이성: 변경 범위를 제한하면 모델이 어디에서 성능을 얻었는지 추적하기 쉬워진다.
- 비교의 용이성: 변경 범위를 제한하면 모델이 어디에서 성능을 얻었는지 추적하기 쉬워진다.
6. 약 6일간의 Optimizer Speedrun 결과
6. 약 6일간의 Optimizer Speedrun 결과
장기 실행 결과에서는 Claude Code가 다시 선두를 보였고, Kimi가 예상보다 강하게 치고 올라왔으며, Codex는 효율성과 안정성에서 경쟁력을 보였다. 장기 실행 결과에서는 Claude Code가 다시 선두를 보였고, Kimi가 예상보다 강하게 치고 올라왔으며, Codex는 효율성과 안정성에서 경쟁력을 보였다.
6.1. 모델별 진행 양상
6.1. 모델별 진행 양상
-
Claude Code의 선두
-
Claude Code의 선두
- 높은 전체 기록: Claude Code는 장기 실행에서 가장 앞선 성능을 반복해서 보였다.
- 높은 전체 기록: Claude Code는 장기 실행에서 가장 앞선 성능을 반복해서 보였다.
- 점진적 개선: 한 번의 도약보다 여러 실험을 통해 기록을 계속 조금씩 낮추는 방식으로 전진했다.
- 점진적 개선: 한 번의 도약보다 여러 실험을 통해 기록을 계속 조금씩 낮추는 방식으로 전진했다.
-
Kimi와 Codex의 경쟁
-
Kimi와 Codex의 경쟁
- Kimi의 질적 도약: Kimi는 약 4일째 새로운 기록을 만들며 Codex를 넘어섰다. 초반부터 가장 앞선 것은 아니었지만, 한 번의 큰 전략적 전환이 성능을 바꿨다.
- Kimi의 질적 도약: Kimi는 약 4일째 새로운 기록을 만들며 Codex를 넘어섰다. 초반부터 가장 앞선 것은 아니었지만, 한 번의 큰 전략적 전환이 성능을 바꿨다.
- Codex의 효율성: Codex는 Claude Code보다 적은 출력 토큰으로도 의미 있는 결과를 내는 등 토큰 대비 효율이 좋았다.
- Codex의 효율성: Codex는 Claude Code보다 적은 출력 토큰으로도 의미 있는 결과를 내는 등 토큰 대비 효율이 좋았다.
-
GLM 계열의 미완료 상태
-
GLM 계열의 미완료 상태
- 진행 중인 실험: GLM 계열은 발표 시점에도 반복 실행 중이라 최종 결과가 확정되지 않았다.
- 진행 중인 실험: GLM 계열은 발표 시점에도 반복 실행 중이라 최종 결과가 확정되지 않았다.
- 해석상의 주의: 일부 모델의 낮은 수치는 능력의 하한이라기보다 아직 충분한 실행 시간을 받지 못한 상태일 수 있다.
- 해석상의 주의: 일부 모델의 낮은 수치는 능력의 하한이라기보다 아직 충분한 실행 시간을 받지 못한 상태일 수 있다.
6.2. 어떤 예산으로 비교하느냐에 따른 순위
6.2. 어떤 예산으로 비교하느냐에 따른 순위
-
시간 기준
-
시간 기준
- 장기 탐색의 이점: Claude Code처럼 많은 하위 실험과 토큰을 사용한 모델은 agent-hour 기준에서 강하다.
- 장기 탐색의 이점: Claude Code처럼 많은 하위 실험과 토큰을 사용한 모델은 agent-hour 기준에서 강하다.
- 실행 지속성 반영: 중단이 적고 실험을 오래 이어가는 능력이 시간 예산에서 직접 보상된다.
- 실행 지속성 반영: 중단이 적고 실험을 오래 이어가는 능력이 시간 예산에서 직접 보상된다.
-
출력 토큰 기준
-
출력 토큰 기준
- 순위 변화: Claude Code는 max 모드에서 Codex와 Kimi보다 훨씬 많은 토큰을 소비하므로, 토큰 예산으로 축을 바꾸면 비교 결과가 달라진다.
- 순위 변화: Claude Code는 max 모드에서 Codex와 Kimi보다 훨씬 많은 토큰을 소비하므로, 토큰 예산으로 축을 바꾸면 비교 결과가 달라진다.
- 비용 효율: Kimi와 Codex는 사용한 출력 토큰 대비 성능이 좋아, 같은 비용으로 더 많은 연구 시도를 수행할 가능성이 있다.
- 비용 효율: Kimi와 Codex는 사용한 출력 토큰 대비 성능이 좋아, 같은 비용으로 더 많은 연구 시도를 수행할 가능성이 있다.
6.3. 문헌·참조 사용 방식
6.3. 문헌·참조 사용 방식
-
Claude Code의 연구 방식
-
Claude Code의 연구 방식
- 적극적 조사: Claude Code는 다른 모델이 찾지 못한 관련 연구와 아이디어를 찾아 실험에 반영했다.
- 적극적 조사: Claude Code는 다른 모델이 찾지 못한 관련 연구와 아이디어를 찾아 실험에 반영했다.
- 최고 기록과의 연결: 새로운 논문이나 기존 방법을 발견한 것이 일부 최고 성능의 원인이 되었다.
- 최고 기록과의 연결: 새로운 논문이나 기존 방법을 발견한 것이 일부 최고 성능의 원인이 되었다.
-
지식 회수와 독창성의 구분
-
지식 회수와 독창성의 구분
- 기존 방법의 재발견: 논문을 찾아 적용하는 능력은 매우 유용하지만, 그것 자체가 독창적 연구 아이디어를 만들었다는 뜻은 아니다.
- 기존 방법의 재발견: 논문을 찾아 적용하는 능력은 매우 유용하지만, 그것 자체가 독창적 연구 아이디어를 만들었다는 뜻은 아니다.
- 평가 설계의 필요: 모델이 무엇을 알고 있었는지, 인터넷·논문을 어디까지 볼 수 있었는지를 통제해야 진정한 새 아이디어를 구별할 수 있다.
- 평가 설계의 필요: 모델이 무엇을 알고 있었는지, 인터넷·논문을 어디까지 볼 수 있었는지를 통제해야 진정한 새 아이디어를 구별할 수 있다.
7. 가장 중요한 결과: 강력한 조합 능력과 부족한 새로움
7. 가장 중요한 결과: 강력한 조합 능력과 부족한 새로움
발표자가 가장 강조한 부분은 모델이 기대만큼 혁명적인 아이디어를 만들지 못했다는 사실이다. 발표자가 가장 강조한 부분은 모델이 기대만큼 혁명적인 아이디어를 만들지 못했다는 사실이다.
7.1. 모델이 실제로 발견한 것
7.1. 모델이 실제로 발견한 것
-
기존 방법의 영리한 조합
-
기존 방법의 영리한 조합
- 조합 전략: 모델은 여러 연구에서 알려진 개선을 가져와 하나의 optimizer 구성에 합쳤다.
- 조합 전략: 모델은 여러 연구에서 알려진 개선을 가져와 하나의 optimizer 구성에 합쳤다.
- 실용적 성과: 각각의 작은 개선을 적절히 결합해 인간 기록을 앞서는 결과를 만들었으므로, 연구 보조자로서의 가치는 분명했다.
- 실용적 성과: 각각의 작은 개선을 적절히 결합해 인간 기록을 앞서는 결과를 만들었으므로, 연구 보조자로서의 가치는 분명했다.
-
반복 실험의 힘
-
반복 실험의 힘
- 많은 시도: 사람이라면 며칠 또는 몇 주가 걸릴 실험을 에이전트가 계속 실행하고, 실패한 조합을 버리고, 괜찮은 조합을 재검증했다.
- 많은 시도: 사람이라면 며칠 또는 몇 주가 걸릴 실험을 에이전트가 계속 실행하고, 실패한 조합을 버리고, 괜찮은 조합을 재검증했다.
- 기록 단축의 원천: 모델의 성과는 “한 번의 천재적 아이디어”라기보다 빠른 탐색과 검증 루프에서 나왔다.
- 기록 단축의 원천: 모델의 성과는 “한 번의 천재적 아이디어”라기보다 빠른 탐색과 검증 루프에서 나왔다.
7.2. 나오지 않은 것
7.2. 나오지 않은 것
-
근본적으로 새로운 optimizer 부재
-
근본적으로 새로운 optimizer 부재
- 새 메커니즘 없음: 인간 문헌에 없는 완전히 새로운 optimizer나 학습 메커니즘이 실험에서 탄생하지 않았다.
- 새 메커니즘 없음: 인간 문헌에 없는 완전히 새로운 optimizer나 학습 메커니즘이 실험에서 탄생하지 않았다.
- 새로운 원리와 새 구현의 차이: 기존 아이디어를 새 코드로 구현하거나 조합하는 것과, 새로운 연구 원리를 발견하는 것은 다른 능력이다.
- 새로운 원리와 새 구현의 차이: 기존 아이디어를 새 코드로 구현하거나 조합하는 것과, 새로운 연구 원리를 발견하는 것은 다른 능력이다.
-
현재 능력의 해석
-
현재 능력의 해석
- 강력한 연구 보조자: 모델은 기존 지식의 회수, 조합, 실험 자동화에서 인간 연구자의 시간을 크게 줄일 수 있다.
- 강력한 연구 보조자: 모델은 기존 지식의 회수, 조합, 실험 자동화에서 인간 연구자의 시간을 크게 줄일 수 있다.
- 아직 완전한 연구자는 아님: 문제를 새롭게 정의하거나 아무도 보지 못한 메커니즘을 제안하는 마지막 단계는 여전히 인간의 역할로 남아 있다.
- 아직 완전한 연구자는 아님: 문제를 새롭게 정의하거나 아무도 보지 못한 메커니즘을 제안하는 마지막 단계는 여전히 인간의 역할로 남아 있다.
8. 독창적 발견을 유도하기 위한 다음 연구 루프
8. 독창적 발견을 유도하기 위한 다음 연구 루프
평가만 하는 속도 경주에서 발견을 목표로 하는 다중 에이전트 시스템으로 확장하려면, 아이디어 생성·실험·판정·확장을 분리해야 한다. 평가만 하는 속도 경주에서 발견을 목표로 하는 다중 에이전트 시스템으로 확장하려면, 아이디어 생성·실험·판정·확장을 분리해야 한다.
8.1. 생성자·실행자·심사자의 조합
8.1. 생성자·실행자·심사자의 조합
-
다양한 생성자
-
다양한 생성자
- 폐쇄형 모델과 오픈 모델: 고성능 폐쇄형 모델뿐 아니라 저렴한 오픈소스 모델도 서로 다른 가설을 제안하게 한다.
- 폐쇄형 모델과 오픈 모델: 고성능 폐쇄형 모델뿐 아니라 저렴한 오픈소스 모델도 서로 다른 가설을 제안하게 한다.
- 아이디어 다양성: 하나의 모델이 반복해서 비슷한 해법을 내놓는 것을 막고, 서로 다른 탐색 편향을 활용한다.
- 아이디어 다양성: 하나의 모델이 반복해서 비슷한 해법을 내놓는 것을 막고, 서로 다른 탐색 편향을 활용한다.
-
실험자와 심사자
-
실험자와 심사자
- 실험자: 제안된 방법을 속도 경주에서 실행하고 실제 보상을 계산한다.
- 실험자: 제안된 방법을 속도 경주에서 실행하고 실제 보상을 계산한다.
- 심사자: 단순한 기록 단축뿐 아니라 아이디어의 질, 일반성, 새로움, 특정 조건 밖에서의 유효성을 평가한다. 심사자마다 선호나 편향이 있을 수 있으므로 평가 기준을 명확히 해야 한다.
- 심사자: 단순한 기록 단축뿐 아니라 아이디어의 질, 일반성, 새로움, 특정 조건 밖에서의 유효성을 평가한다. 심사자마다 선호나 편향이 있을 수 있으므로 평가 기준을 명확히 해야 한다.
8.2. 확장 가능성(scalability)을 루프에 넣기
8.2. 확장 가능성(scalability)을 루프에 넣기
-
작은 경주 결과의 함정
-
작은 경주 결과의 함정
- 실험 규모 문제: 속도 경주에서 잘 작동한 방법이 실제 대규모 모델 훈련에서는 작동하지 않을 수 있다.
- 실험 규모 문제: 속도 경주에서 잘 작동한 방법이 실제 대규모 모델 훈련에서는 작동하지 않을 수 있다.
- 커뮤니티의 반론: 어떤 optimizer는 작은 nanoGPT에서는 좋아 보여도 큰 모델로 확장되지 않는다는 지적을 받는다.
- 커뮤니티의 반론: 어떤 optimizer는 작은 nanoGPT에서는 좋아 보여도 큰 모델로 확장되지 않는다는 지적을 받는다.
-
확장 검증
-
확장 검증
- 더 큰 매개변수와 토큰: 좋은 방법을 더 큰 모델과 더 많은 데이터·토큰에서 시험해 실제 연구로 이어지는지 확인한다.
- 더 큰 매개변수와 토큰: 좋은 방법을 더 큰 모델과 더 많은 데이터·토큰에서 시험해 실제 연구로 이어지는지 확인한다.
- 인간의 개입 지점: 인간은 아이디어의 유망성을 판단하고 탐색 방향을 조정하는 역할에서 여전히 매우 유용하다. 완전 자동화보다 사람과 에이전트의 협업 루프가 현실적인 다음 단계다.
- 인간의 개입 지점: 인간은 아이디어의 유망성을 판단하고 탐색 방향을 조정하는 역할에서 여전히 매우 유용하다. 완전 자동화보다 사람과 에이전트의 협업 루프가 현실적인 다음 단계다.
8.3. 목표와 제약의 다양화
8.3. 목표와 제약의 다양화
-
여러 속도 경주 예약
-
여러 속도 경주 예약
- 목표 변경: 동일한 loss만 최적화하지 않고 여러 목적과 난이도의 경주를 예약하면 모델이 한 가지 패턴에 과적합되는 것을 줄일 수 있다.
- 목표 변경: 동일한 loss만 최적화하지 않고 여러 목적과 난이도의 경주를 예약하면 모델이 한 가지 패턴에 과적합되는 것을 줄일 수 있다.
- 제약 변경: 사용할 수 있는 연산, 변경 가능한 코드, 비용·시간 예산을 달리해 서로 다른 연구 방향을 유도한다.
- 제약 변경: 사용할 수 있는 연산, 변경 가능한 코드, 비용·시간 예산을 달리해 서로 다른 연구 방향을 유도한다.
-
발견 공간의 넓히기
-
발견 공간의 넓히기
- 탐색 방향 통제: 목표와 제약을 바꾸면 모델을 특정 방향으로 유도하면서도 새로운 아이디어가 나올 여지를 만들 수 있다.
- 탐색 방향 통제: 목표와 제약을 바꾸면 모델을 특정 방향으로 유도하면서도 새로운 아이디어가 나올 여지를 만들 수 있다.
- 장기 목표: Prime Intellect는 이 방식이 적어도 AI 연구에서 새로운 발견을 만드는 데 기여할 수 있다고 보고 현재 실험 중이다.
- 장기 목표: Prime Intellect는 이 방식이 적어도 AI 연구에서 새로운 발견을 만드는 데 기여할 수 있다고 보고 현재 실험 중이다.
9. 필요한 인프라와 Prime Intellect의 공개 방향
9. 필요한 인프라와 Prime Intellect의 공개 방향
장기 자율 연구는 단순히 모델 API를 호출하는 문제가 아니라, GPU 샌드박스·파일 시스템·도구·검증 라이브러리를 함께 제공해야 한다. 장기 자율 연구는 단순히 모델 API를 호출하는 문제가 아니라, GPU 샌드박스·파일 시스템·도구·검증 라이브러리를 함께 제공해야 한다.
9.1. GPU 샌드박스와 에이전트 환경
9.1. GPU 샌드박스와 에이전트 환경
-
안전한 반복 실행
-
안전한 반복 실행
- GPU 샌드박스: 모델이 GPU에서 코드를 실행하고 여러 날 반복할 수 있어야 하며, 동시에 클러스터나 외부 시스템을 임의로 침해하지 못하게 해야 한다.
- GPU 샌드박스: 모델이 GPU에서 코드를 실행하고 여러 날 반복할 수 있어야 하며, 동시에 클러스터나 외부 시스템을 임의로 침해하지 못하게 해야 한다.
- 제한된 외부 연결: 에이전트에게 필요한 API와 로그 경로만 열고, 인터넷과 다른 작업 공간은 제한해야 한다.
- 제한된 외부 연결: 에이전트에게 필요한 API와 로그 경로만 열고, 인터넷과 다른 작업 공간은 제한해야 한다.
-
LLM 에이전트의 기본 구성
-
LLM 에이전트의 기본 구성
- 파일 시스템: 모델이 코드·로그·실험 결과를 읽고 쓸 수 있어야 한다.
- 파일 시스템: 모델이 코드·로그·실험 결과를 읽고 쓸 수 있어야 한다.
- 프로그래밍 도구: 실행, 측정, 비교, 작업 제출을 자동화할 도구가 있어야 한다. 이 도구 구성이 연구 능력의 일부가 되므로 모델과 하네스를 분리해 공개해야 한다.
- 프로그래밍 도구: 실행, 측정, 비교, 작업 제출을 자동화할 도구가 있어야 한다. 이 도구 구성이 연구 능력의 일부가 되므로 모델과 하네스를 분리해 공개해야 한다.
9.2. 공개 라이브러리와 제품
9.2. 공개 라이브러리와 제품
-
훈련·검증 라이브러리
-
훈련·검증 라이브러리
- 범용 환경: Prime Intellect는 임의의 환경에서 모델을 훈련하고 평가할 수 있는 라이브러리와 제품을 공개하고 있다.
- 범용 환경: Prime Intellect는 임의의 환경에서 모델을 훈련하고 평가할 수 있는 라이브러리와 제품을 공개하고 있다.
- 대형 모델 지원: GLM-5.2처럼 매우 큰 모델도 이 방식으로 훈련·평가할 수 있도록 효율성을 높이는 데 집중한다.
- 대형 모델 지원: GLM-5.2처럼 매우 큰 모델도 이 방식으로 훈련·평가할 수 있도록 효율성을 높이는 데 집중한다.
-
공개 연구의 가치
-
공개 연구의 가치
- 대형 연구소 밖의 연구자: 자율 AI 연구를 소수 대형 연구소의 비공개 실험으로 남기지 않고, 외부 연구자도 같은 질문을 재현할 수 있게 한다.
- 대형 연구소 밖의 연구자: 자율 AI 연구를 소수 대형 연구소의 비공개 실험으로 남기지 않고, 외부 연구자도 같은 질문을 재현할 수 있게 한다.
- 검증 가능한 진전: 로그, 규칙, 코드, 결과가 공개되면 모델이 정말 새로운 것을 발견했는지, 단지 기존 지식을 회수했는지 검토할 수 있다.
- 검증 가능한 진전: 로그, 규칙, 코드, 결과가 공개되면 모델이 정말 새로운 것을 발견했는지, 단지 기존 지식을 회수했는지 검토할 수 있다.
주요 발언 모음
주요 발언 모음
“반복적 자기개선이 곧 온다는 말을 듣고 있지만, 그것이 실제로 유효한지 판단할 정량적 표준은 아직 없다.” “반복적 자기개선이 곧 온다는 말을 듣고 있지만, 그것이 실제로 유효한지 판단할 정량적 표준은 아직 없다.”
“모델들이 혁명적인 아이디어를 내놓을 것이라고 기대했지만, 실제로는 여러 연구를 영리하게 조합했다.” “모델들이 혁명적인 아이디어를 내놓을 것이라고 기대했지만, 실제로는 여러 연구를 영리하게 조합했다.”
“완전히 새로운 optimizer나 메커니즘은 나오지 않았다.” “완전히 새로운 optimizer나 메커니즘은 나오지 않았다.”
“이 분야의 지속적인 자기개선 과정은 공개적으로 진행되어야 한다.” “이 분야의 지속적인 자기개선 과정은 공개적으로 진행되어야 한다.”
핵심 데이터 & 수치
핵심 데이터 & 수치
- 90분: Andrei Karpathy가 GPT-2를 처음부터 학습해 목표 손실에 도달한 공개 실험의 기준 시간이다.
- 90분: Andrei Karpathy가 GPT-2를 처음부터 학습해 목표 손실에 도달한 공개 실험의 기준 시간이다.
- 45분 → 2분 미만: modified nanoGPT 커뮤니티가 약 2년에 걸쳐 인간 기록을 단축한 흐름이다.
- 45분 → 2분 미만: modified nanoGPT 커뮤니티가 약 2년에 걸쳐 인간 기록을 단축한 흐름이다.
- 15~20분: 한 번의 속도 경주 실험을 돌리는 대략적인 시간이다.
- 15~20분: 한 번의 속도 경주 실험을 돌리는 대략적인 시간이다.
- 약 2,990 step: Claude Code와 Codex를 투입할 당시 인간 최고 기록으로 설명된 값이다.
- 약 2,990 step: Claude Code와 Codex를 투입할 당시 인간 최고 기록으로 설명된 값이다.
- 약 50~60 step: Claude Code가 당시 인간 기록보다 더 낮춘 격차다.
- 약 50~60 step: Claude Code가 당시 인간 기록보다 더 낮춘 격차다.
- 약 20 step: Codex가 당시 인간 기록보다 더 낮춘 격차다.
- 약 20 step: Codex가 당시 인간 기록보다 더 낮춘 격차다.
- 약 6일: Optimizer Speedrun 장기 평가를 진행한 시간 규모다.
- 약 6일: Optimizer Speedrun 장기 평가를 진행한 시간 규모다.
- 약 25만 토큰: 장기 실행 중 컨텍스트 압축을 필요하게 만든 컨텍스트 창 규모다.
- 약 25만 토큰: 장기 실행 중 컨텍스트 압축을 필요하게 만든 컨텍스트 창 규모다.
- 약 3분의 1: Claude Code가 중단·유휴 상태로 보낸 초기 실행 시간의 비율이다.
- 약 3분의 1: Claude Code가 중단·유휴 상태로 보낸 초기 실행 시간의 비율이다.
결론 및 시사점
결론 및 시사점
- 자율 연구 능력은 이분법이 아니다: 모델은 인간처럼 새로운 과학 원리를 발명하지 못하더라도, 기존 연구를 검색·조합하고 수백 번의 실험을 실행하는 연구 보조자로서는 이미 강력하다.
- 자율 연구 능력은 이분법이 아니다: 모델은 인간처럼 새로운 과학 원리를 발명하지 못하더라도, 기존 연구를 검색·조합하고 수백 번의 실험을 실행하는 연구 보조자로서는 이미 강력하다.
- 병목은 코드 생성이 아니라 연구 판단이다: 어떤 실험을 선택하고, 잡음 섞인 결과를 어떻게 해석하고, 실패한 아이디어를 언제 다시 시험할지가 모델 간 성능 차이를 만들었다.
- 병목은 코드 생성이 아니라 연구 판단이다: 어떤 실험을 선택하고, 잡음 섞인 결과를 어떻게 해석하고, 실패한 아이디어를 언제 다시 시험할지가 모델 간 성능 차이를 만들었다.
- 지속성은 지능과 별도의 축이다: Claude Code의 반복적인 중단과 Codex의 지속 실행 차이는, 동일한 모델 능력도 하네스의 목표 주입·메모리·재시작 설계에 따라 크게 달라질 수 있음을 보여 준다.
- 지속성은 지능과 별도의 축이다: Claude Code의 반복적인 중단과 Codex의 지속 실행 차이는, 동일한 모델 능력도 하네스의 목표 주입·메모리·재시작 설계에 따라 크게 달라질 수 있음을 보여 준다.
- 기존 지식과 독창성을 분리해 평가해야 한다: 최신 논문과 인간 기록을 볼 수 있는 모델이 더 좋은 결과를 내는 것은 당연할 수 있으므로, 가중치만 아는 트랙·논문 아카이브 트랙·완전 접근 트랙을 나눠야 한다.
- 기존 지식과 독창성을 분리해 평가해야 한다: 최신 논문과 인간 기록을 볼 수 있는 모델이 더 좋은 결과를 내는 것은 당연할 수 있으므로, 가중치만 아는 트랙·논문 아카이브 트랙·완전 접근 트랙을 나눠야 한다.
- 작은 benchmark의 승리를 실제 연구 성과로 오해하면 안 된다: nanoGPT에서 좋아진 optimizer가 대규모 훈련에서도 통한다는 보장이 없으므로, 더 큰 모델·데이터·토큰에서 확장성을 검증해야 한다.
- 작은 benchmark의 승리를 실제 연구 성과로 오해하면 안 된다: nanoGPT에서 좋아진 optimizer가 대규모 훈련에서도 통한다는 보장이 없으므로, 더 큰 모델·데이터·토큰에서 확장성을 검증해야 한다.
- 발견을 위해서는 다중 에이전트 루프가 필요하다: 생성자, 실행자, 심사자, 인간 안내자를 분리하면 아이디어 다양성과 검증 품질을 동시에 높일 수 있다.
- 발견을 위해서는 다중 에이전트 루프가 필요하다: 생성자, 실행자, 심사자, 인간 안내자를 분리하면 아이디어 다양성과 검증 품질을 동시에 높일 수 있다.
- 공개 인프라가 신뢰의 전제다: GPU 샌드박스, 재현 가능한 규칙, 전체 trace와 검증 코드를 공개해야 “AI가 AI 연구를 했다”는 주장을 독립적으로 확인할 수 있다.
- 공개 인프라가 신뢰의 전제다: GPU 샌드박스, 재현 가능한 규칙, 전체 trace와 검증 코드를 공개해야 “AI가 AI 연구를 했다”는 주장을 독립적으로 확인할 수 있다.
- 현재의 가장 정확한 표현: 인간 연구자를 완전히 대체하는 자율 연구자가 아니라, 인간이 설정한 문제 안에서 지치지 않고 기존 지식을 탐색·검증하는 매우 빠른 연구 엔진에 가깝다.
- 현재의 가장 정확한 표현: 인간 연구자를 완전히 대체하는 자율 연구자가 아니라, 인간이 설정한 문제 안에서 지치지 않고 기존 지식을 탐색·검증하는 매우 빠른 연구 엔진에 가깝다.
핵심 요약 (20줄)
핵심 요약 (20줄)
-
반복적 자기개선이 임박했다는 주장에 비해, 외부에서 확인 가능한 자율 AI 연구 평가 기준은 부족하다.
-
반복적 자기개선이 임박했다는 주장에 비해, 외부에서 확인 가능한 자율 AI 연구 평가 기준은 부족하다.
-
Prime Intellect는 인간 없이 연구하는 모델의 능력을 공개적으로 측정하기 위해 nanoGPT 최적화 경주를 선택했다.
-
Prime Intellect는 인간 없이 연구하는 모델의 능력을 공개적으로 측정하기 위해 nanoGPT 최적화 경주를 선택했다.
-
Karpathy의 GPT-2 90분 재현은 커뮤니티의 수정된 nanoGPT 경주로 발전했고 인간 기록은 2분 아래까지 단축됐다.
-
Karpathy의 GPT-2 90분 재현은 커뮤니티의 수정된 nanoGPT 경주로 발전했고 인간 기록은 2분 아래까지 단축됐다.
-
일반 nanoGPT 경주는 아키텍처를 폭넓게 바꾸지만 Optimizer Speedrun은 optimizer 관련 변경만 허용한다.
-
일반 nanoGPT 경주는 아키텍처를 폭넓게 바꾸지만 Optimizer Speedrun은 optimizer 관련 변경만 허용한다.
-
Optimizer Speedrun은 제한된 연구 질문과 명확한 검증 규칙을 제공해 모델의 실험 판단을 비교하기 좋다.
-
Optimizer Speedrun은 제한된 연구 질문과 명확한 검증 규칙을 제공해 모델의 실험 판단을 비교하기 좋다.
-
실험에는 당시 GPT-5.5 계열 Codex와 Opus 4.8 계열 Claude Code가 높은 추론 설정으로 투입됐다.
-
실험에는 당시 GPT-5.5 계열 Codex와 Opus 4.8 계열 Claude Code가 높은 추론 설정으로 투입됐다.
-
goal.md와 agents.md는 모델이 아이디어를 만들고 Slurm 클러스터에 실험을 제출하는 절차를 정의했다.
-
goal.md와 agents.md는 모델이 아이디어를 만들고 Slurm 클러스터에 실험을 제출하는 절차를 정의했다.
-
에이전트는 GPU 작업을 수행했지만 기록 인정에는 통계적 문턱이 적용되어 우연한 개선을 걸러냈다.
-
에이전트는 GPU 작업을 수행했지만 기록 인정에는 통계적 문턱이 적용되어 우연한 개선을 걸러냈다.
-
Claude Code는 9~10시간마다 멈추는 경향이 있어 초기 실행 시간의 약 3분의 1을 유휴 상태로 보냈다.
-
Claude Code는 9~10시간마다 멈추는 경향이 있어 초기 실행 시간의 약 3분의 1을 유휴 상태로 보냈다.
-
Codex는 거의 계속 실행됐고 질문이나 도움을 거의 요청하지 않아 장기 탐색에서 뚜렷한 지속성을 보였다.
-
Codex는 거의 계속 실행됐고 질문이나 도움을 거의 요청하지 않아 장기 탐색에서 뚜렷한 지속성을 보였다.
-
Codex는 활성 메모리에 많은 실험 정보를 기록했고 Claude Code는 새 기록에 더 감정적으로 반응했다.
-
Codex는 활성 메모리에 많은 실험 정보를 기록했고 Claude Code는 새 기록에 더 감정적으로 반응했다.
-
Claude Code는 더 많은 하위 에이전트와 토큰을 사용했지만 컨텍스트 압축 빈도와 작업 문체도 달랐다.
-
Claude Code는 더 많은 하위 에이전트와 토큰을 사용했지만 컨텍스트 압축 빈도와 작업 문체도 달랐다.
-
당시 인간 기록은 약 2,990 step이었고 Claude Code와 Codex는 각각 약 50~60 step과 20 step을 줄였다.
-
당시 인간 기록은 약 2,990 step이었고 Claude Code와 Codex는 각각 약 50~60 step과 20 step을 줄였다.
-
재시작 때 최신 인간 기록을 읽게 하는 방식은 에이전트가 인간의 누적 지식을 빠르게 회수하게 했다.
-
재시작 때 최신 인간 기록을 읽게 하는 방식은 에이전트가 인간의 누적 지식을 빠르게 회수하게 했다.
-
표준 평가에는 여러 seed와 동일한 조건이 필요하며 단일 장기 실행만으로 모델 순위를 확정할 수 없다.
-
표준 평가에는 여러 seed와 동일한 조건이 필요하며 단일 장기 실행만으로 모델 순위를 확정할 수 없다.
-
계획된 평가는 가중치만 아는 트랙, 논문 아카이브 트랙, 최신 정보에 접근하는 트랙으로 나뉜다.
-
계획된 평가는 가중치만 아는 트랙, 논문 아카이브 트랙, 최신 정보에 접근하는 트랙으로 나뉜다.
-
약 6일간의 Optimizer Speedrun에서 Claude Code가 선두를 보였고 Kimi는 4일째 질적으로 도약했다.
-
약 6일간의 Optimizer Speedrun에서 Claude Code가 선두를 보였고 Kimi는 4일째 질적으로 도약했다.
-
모델들은 기존 연구의 개선을 영리하게 조합했지만 인간 문헌에 없는 새 optimizer나 메커니즘은 만들지 못했다.
-
모델들은 기존 연구의 개선을 영리하게 조합했지만 인간 문헌에 없는 새 optimizer나 메커니즘은 만들지 못했다.
-
독창적 발견을 위해서는 여러 생성자와 실행자, 심사자, 인간 안내자가 참여하는 확장 가능한 루프가 필요하다.
-
독창적 발견을 위해서는 여러 생성자와 실행자, 심사자, 인간 안내자가 참여하는 확장 가능한 루프가 필요하다.
-
현재 모델은 인간 연구자를 완전히 대체한 연구자가 아니라 기존 지식을 끈질기게 탐색하는 강력한 연구 보조자에 가깝다.
-
현재 모델은 인간 연구자를 완전히 대체한 연구자가 아니라 기존 지식을 끈질기게 탐색하는 강력한 연구 보조자에 가깝다.
