원문 제목: AI-Generated Code Is Already Competing With Human Code — Daksh Gupta, Greptile
URL: https://www.youtube.com/watch?v=474j-n1Ltxc
영상 ID: 474j-n1Ltxc
채널: AI Engineer (aiDotEngineer)
발행일: 2026-09-27
처리일: 2026-09-28 (Asia/Seoul)
발표자: Daksh Gupta, Greptile 공동 창업자
📌 핵심 질문 / AI가 만든 PR은 실제 기업에서도 인간이 만든 PR과 경쟁할 수 있는가
==대규모 엔터프라이즈의 실제 Pull Request 데이터를 보면, 완전히 또는 대부분 AI가 생성한 PR이 이미 전체의 약 4분의 1을 차지하며 인간이 만든 PR과 품질 면에서 대체로 대등하다.==
- Greptile은 한 달에 100만 건이 넘는 Pull Request를 검토하고 수천 개 기업의 실제 코드 변경 데이터를 축적한다.
- GitHub 작성자, PR 설명의 공동 작성자 표기, 브랜치 이름 접두사라는 여러 신호를 조합하면 AI 생성 또는 AI 주도 PR을 추정할 수 있다.
- 되돌리기(revert) 비율, Greptile이 발견한 P0·P1·P2 문제, 병합까지 필요한 리뷰 라운드에서 인간과 AI 사이에 큰 품질 격차가 나타나지 않았다.
- 품질의 평균치는 비슷하지만 Claude, Devin 같은 에이전트는 SQL injection이나 off-by-one error처럼 서로 다른 실패 패턴을 보인다.
- 코드 생성량이 급증한 환경에서는 수동 코드 리뷰와 테스트만으로는 검증량을 따라가기 어려우므로, 사용자 계약과 작성자의 의도를 검증하는 자율적인 다중 에이전트 검증이 필요하다.
AI 코딩의 중심은 단순한 탭 자동완성에서 여러 파일을 동시에 편집하는 기능으로, 다시 작업 전체를 수행해 Pull Request를 만드는 자율형 에이전트로 빠르게 이동했다. 2025년 12월의 모델 발전 이후 실제 고객을 보유한 대기업에서도 AI 주도 PR이 확산되고 있으며, 핵심 과제는 사람이 코드를 작성했는지 판별하는 일이 아니라 코드가 사용자 계약을 지키고 미래의 위반 가능성을 높이지 않으며 작성자의 의도를 충족하는지 검증하는 일로 바뀌었다.
1. AI 코딩은 자동완성에서 완전 자율형 에이전트로 이동했다
AI 코딩의 발전은 코드 한 줄을 제안하는 보조 기능에서 전체 변경을 계획하고 실행하며 PR을 제출하는 작업 주체로의 전환이다.
1.1. 2022~2024년: 코드 제안과 다중 파일 편집
-
GPT-3.5가 프로그래밍에 강한 첫 모델로 받아들여졌다
- 등장 시점: GPT-3.5는 2022년에 출시됐고, Daksh Gupta가 프로그래밍을 실제로 잘한다고 느낀 첫 모델이었다.
- 당시의 사용 방식: AI 코딩의 주된 패러다임은 Code Completion과 Tab Completion이었다.
- 대표 제품: Cursor의 탭 자동완성과 GitHub Copilot의 코드 자동완성이 당시 가장 흥미로운 발전으로 꼽혔다.
-
2024년에 AI가 여러 파일을 동시에 수정하기 시작했다
- 기능의 변화: AI는 더 이상 현재 편집 중인 한 파일의 다음 코드를 제안하는 데 머물지 않고, 하나의 작업을 위해 여러 파일을 동시에 편집할 수 있게 됐다.
- Cursor의 선도: Cursor가 Multi-file Editing을 처음으로 제대로 구현했고, 이후 여러 제품이 같은 방향을 따랐다.
- 개발 단위의 확장: 변경 단위가 한 줄이나 한 함수에서 여러 파일로 넓어지면서 AI가 코드베이스 구조를 따라가야 하는 수준이 높아졌다.
1.2. 2025년 이후: 작업을 받아 PR을 만드는 자율성
-
자율형 코딩 에이전트가 작업의 주체가 됐다
- 입력 방식: 개발자가 에이전트에게 작업을 부여하면 에이전트가 작업을 스스로 수행한다.
- 출력 범위: 에이전트는 여러 파일을 수정하는 데서 멈추지 않고 전체 Pull Request를 한 번에 생성한다.
- 의미: AI 코딩이 편집기 안의 보조 기능에서 소프트웨어 개발 워크플로의 한 단계를 독립적으로 담당하는 방식으로 바뀌었다.
-
2025년 12월이 자율성의 분수령이 됐다
- 모델 출시의 영향: 2025년 12월 새로운 모델들이 나오면서 코딩 에이전트가 처음으로 실질적인 완전 자율성을 보였다.
- 커뮤니티의 사례: 소셜 미디어에는 에이전트가 하루에 100개의 PR을 열었다는 사례가 퍼졌다.
- 극단적인 운영 방식: 일부 사용자는 에이전트를 주기적으로 다시 실행하기 위해 깨어 있으려고 Polyphasic Sleep까지 실험했다.
- 회의적인 출발점: 에이전트 이전부터 프로그래밍하던 개발자에게는 이런 사례가 실제 고객을 가진 상업용 코드베이스에서도 가능한지 의문이었다.
2. 대기업의 실제 PR 데이터에서 AI 생성 코드의 확산을 측정했다
Greptile의 고객·검토 데이터는 개인 프로젝트가 아니라 실제 사용자가 있는 제품의 개발 현장에서 AI 코딩이 어떻게 쓰이는지 보여주는 관측 기반이다.
2.1. 엔터프라이즈 코드베이스를 대상으로 한 검증 질문
-
검증 대상은 실제 고객을 가진 기업이었다
- 고객 사례: Greptile은 Nvidia, Coinbase, Scale, Datadog, American Express와 협업한다.
- 검증의 범위: 이런 기업에서 완전 자율형 코딩 에이전트가 실제로 사용되는지, 사용된다면 실무 코딩에 유용한지 확인하는 것이 목적이었다.
- 질문의 초점: 고객이 없는 독립 개발자나 초기 스타트업의 실험이 아니라 상업적으로 중요한 코드베이스에서 AI PR이 작동하는지를 물었다.
-
Greptile의 검토 데이터가 분석 기반이 됐다
- 규모: Greptile은 매달 100만 건이 넘는 Pull Request를 검토한다.
- 기업 수: 데이터는 수천 개 기업에서 수집되며, 대부분 엔터프라이즈이거나 실제 고객을 가진 진지한 제품을 운영한다.
- 분석 관점: Daksh Gupta는 자신을 아마추어 데이터 과학자라고 표현하면서도, 대규모 PR 코퍼스에서 AI 코드의 확산과 품질을 직접 측정했다.
2.2. AI가 생성한 PR을 찾아내는 세 가지 신호
-
GitHub commit author 필드는 신호가 약했다
- 초기 접근: GitHub의 모든 commit에는 author field가 있으므로 Codex, Claude, Cursor가 작성자로 표시되는 PR을 먼저 찾았다.
- 관찰 결과: 해당 제품들이 author로 표시된 PR은 전체의 1% 미만이었다.
- 해석의 한계: 실제로 AI가 생성한 코드가 1%뿐이라고 보기에는 직관과 맞지 않았으므로, 이 필드만으로는 AI 사용을 크게 과소평가한다고 판단했다.
-
PR 설명의 공동 작성자 표기가 추가 신호가 됐다
- 표기 방식: Claude, Codex 등의 제품은 PR description footer에
co-authored by claude,co-authored by cursor같은 문구를 남기는 경우가 있다. - 추정 대상: 이런 표기는 PR 전체 또는 상당 부분이 AI로 생성됐을 가능성을 보여주는 보조 지표가 된다.
- 주의점: 표기가 없다고 AI가 사용되지 않았다는 뜻은 아니므로, 단일 신호가 아니라 다른 신호와 함께 사용해야 한다.
- 표기 방식: Claude, Codex 등의 제품은 PR description footer에
-
브랜치 이름 접두사가 세 번째 신호가 됐다
- Codex의 동작: Codex는 자신이 만든 브랜치에 특정한 이름을 붙인다.
- 합리적 가정: 에이전트가 브랜치 이름과 PR 설명까지 작성했다면, 해당 PR이 대부분 AI에 의해 생성됐을 가능성이 높다고 볼 수 있다.
- 종합 방식: author field, PR footer, branch name prefix를 조합해 완전히 또는 대부분 AI가 생성한 PR을 추정했다.
2.3. AI 주도 PR은 이미 전체의 약 25%에 달한다
-
현재의 관측치
- 비중: Greptile이 어느 한 달에 검토하는 PR 중 약 4분의 1이 완전히 또는 적어도 대부분 AI로 생성된 것으로 추정됐다.
- 용어의 의미: 이 수치는 모든 코드가 AI로만 작성됐다는 뜻이 아니라, 여러 메타데이터 신호에서 PR의 핵심 작업이 AI에 의해 생성됐다는 뜻이다.
- 실무적 의미: AI 주도 코딩은 개인의 실험 단계를 넘어 실제 기업 개발 흐름의 상당한 비중을 차지한다.
-
지난 12개월의 증가 속도
- 출발점: 전년도 초에는 완전히 AI로 생성됐다는 증거가 있는 PR이 1% 미만이었다.
- 증가 추세: 이후 AI 주도 PR 비중은 모델 성능 향상과 함께 매우 빠르게 증가했다.
- 확산 양상: 특정 모델 출시 시점마다 계단식으로 급증하는 모습보다, 경제 전반에 지속적이고 빠르게 확산되는 모습에 가까웠다.
3. AI 생성 PR과 인간 PR의 품질을 세 가지 지표로 비교했다
품질을 단일한 감상으로 판단하지 않고 되돌리기, 자동 코드 리뷰의 심각도, 병합까지의 반복 횟수로 나눠 비교했다.
3.1. Revert Rate는 인간과 AI 사이에 큰 차이를 보이지 않았다
-
PR 되돌리기를 품질의 대리 지표로 삼았다
- 가정: 병합된 PR이 나중에 revert됐다면 해당 변경이 상당히 문제가 있었을 가능성이 높다.
- 측정 방법: GitHub는 되돌리기 PR의 브랜치 이름에
revert-와 PR 번호·이름을 붙이므로, 이 패턴을 통해 원래 PR이 되돌려진 비율을 추적했다. - 장점과 한계: 관측하기 쉬운 운영 지표라는 장점이 있지만, 모든 결함이 revert로 이어지는 것은 아니므로 품질 전체를 대표하지는 않는다.
-
관측된 되돌리기 비율
- Codex: 약 1,000개의 PR 중 1개가 되돌려졌다.
- Devin: 약 1,000개의 PR 중 3.5개가 되돌려졌다.
- 인간: 약 1,000개의 PR 중 2.5개가 되돌려져 Codex와 Devin 사이에 위치했다.
- 결론: 연구 데이터에서 인간과 에이전트의 revert rate에는 큰 차이가 나타나지 않았다.
-
PR 크기 차이로 결과를 설명하기 어려웠다
- 초기 반론: 인간은 복잡하고 위험한 작업을 맡고 에이전트는 단순하고 범위가 좁은 작업을 맡으므로, 에이전트 PR의 낮은 revert rate가 작업 난이도 차이 때문일 수 있다는 의문이 있었다.
- 추가 측정: 인간 PR과 에이전트 PR의 평균 크기, 그리고 크기와 revert 여부의 관계를 비교했다.
- 관찰 결과: 되돌려진 인간 PR의 크기와 되돌려진 에이전트 PR의 크기 사이에는 상관관계가 거의 없었다.
- 해석: PR 크기만으로 인간 PR의 품질이 에이전트 PR보다 높다고 주장할 강한 근거가 확인되지 않았다.
3.2. Greptile의 P0·P1·P2 검토 결과도 대체로 대등했다
-
자동 리뷰에서 발견된 문제의 심각도를 추적했다
- Greptile의 역할: Greptile은 변경 사항을 검토하며 P0, P1, P2 수준의 문제를 찾는다.
- 품질 가정: 특정 방식으로 생성된 코드에서 Greptile이 더 많은 문제를 찾으면 그 코드가 더 나쁠 가능성이 높다고 보았다.
- 측정 대상: 인간 PR과 에이전트 PR에서 P0·P1·P2가 발생하는 빈도를 비교했다.
-
에이전트 네 개 중 세 개가 P0 비율에서 인간보다 낮았다
- P0 결과: 테스트한 네 에이전트 중 세 에이전트는 인간 PR보다 P0 문제를 적게 생성했다.
- P1·P2 결과: P1과 P2에서도 전체적으로 비슷한 패턴이 관찰됐다.
- 전체 결론: 이 데이터에서 인간이 만든 PR과 에이전트가 만든 PR의 품질은 대체로 대등했다.
3.3. 병합까지 필요한 리뷰 라운드도 비슷했다
-
반복 횟수를 품질 지표로 삼았다
- Greptile의 일반적 사용 방식: Greptile이 PR에 남긴 코멘트를 에이전트가 읽고, 문제를 수정한 뒤 PR 브랜치에 새 commit을 만드는 방식이 가장 흔하다.
- 품질 가정: PR 품질이 높다면 병합 전에 필요한 리뷰·수정 라운드가 더 적을 것이라고 가정했다.
- 측정 범위: PR이 열린 시점부터 병합된 시점까지의 review round 수를 추적했다.
-
관측된 평균 리뷰 라운드
- Devin: 병합까지 평균 2.1회의 리뷰 라운드가 필요했다.
- Codex: 병합까지 평균 2.45회의 리뷰 라운드가 필요했다.
- 인간: 인간 PR은 두 에이전트 수치의 중간 정도였다.
- 결론: 인간 PR과 AI PR이 병합 준비 상태에 도달하기까지의 반복 횟수에는 통계적으로 큰 차이가 없었다.
4. 평균 품질보다 에이전트별 실패 방식의 차이가 중요하다
AI와 인간의 평균 품질이 비슷하다는 결과는 모든 에이전트가 같은 방식으로 실패한다는 뜻이 아니며, 실제 운영에서는 에이전트별 취약 패턴을 파악해야 한다.
4.1. 수백만 개의 코드 리뷰 코멘트에서 실패 패턴을 추출했다
-
정량 지표에서 질적 차이로 분석을 확장했다
- 새로운 질문: 에이전트 PR이 인간 PR보다 나쁘다는 증거가 없다면, 에이전트와 인간이 실패하는 방식 자체가 다른지 확인할 필요가 있다.
- 데이터 규모: Greptile은 PR 하나당 평균 약 4개의 코멘트를 남기며, 지난 몇 달 동안 수백만 개의 코멘트가 축적됐다.
- 분석 방식: 코드 리뷰 코멘트에서 특정 구문과 단어를 검색해 오류 유형별 발생 빈도를 비교했다.
-
비교 대상이 된 오류 유형
- SQL Injection: 입력 검증과 쿼리 구성에서 발생하는 보안 취약점이 특정 생성 방식에서 얼마나 자주 지적되는지 비교했다.
- N+1 Query: 데이터 접근이 반복되어 성능 문제를 일으키는 패턴이 각 에이전트의 코드에서 얼마나 나타나는지 살폈다.
- Off-by-one Error: 반복문이나 인덱스 경계에서 한 칸 어긋나는 오류의 발생 경향도 비교했다.
4.2. 1x 인간 기준선에서 에이전트별 편차가 크게 나타났다
-
차트의 읽는 법
- 기준선: 각 오류 유형에서 인간 코드가 해당 문제를 만들 확률을 1x로 놓았다.
- 상대 비교: 1x보다 크면 인간보다 해당 오류를 자주 만들고, 1x보다 작으면 인간보다 덜 만든다는 뜻이다.
- 핵심 관찰: 에이전트의 전체 품질 평균은 비슷해도 오류의 종류별 분포는 상당히 달랐다.
-
Claude와 Devin의 구체적 실패 모드
- Claude의 SQL Injection: Claude는 인간보다 SQL injection 오류를 만들 가능성이 약 1.5배 높았다.
- Devin의 Off-by-one Error: Devin은 인간보다 off-by-one 오류를 만들 가능성이 약 절반으로 낮았다.
- 운영적 의미: 에이전트를 일괄적으로 좋은 모델 또는 나쁜 모델로 평가하기보다, 작업의 위험 유형과 에이전트의 실패 프로필을 맞춰야 한다.
5. PR 생산량의 폭증은 코드 검증 방식을 다시 설계하게 만든다
AI가 새로운 아이디어가 나오는 속도만큼 PR을 생산하면, 기존의 사람 중심 검토 체계는 처리량과 검증 깊이를 동시에 유지하기 어렵다.
5.1. 개발자별 PR 생산량은 이미 큰 편차를 보인다
-
Greptile 사용자의 실제 생산량
- 관측 범위: Greptile은 매주 수만 명의 엔지니어가 코드를 검토하는 데 사용한다.
- 중앙값 사용자: 중앙값 사용자는 한 달에 50개의 PR을 작성하며, 근무일 기준 하루 2개가 조금 넘는 속도다.
- 90백분위 사용자: P90 사용자는 한 달에 500개의 PR을 작성한다.
- 99백분위 사용자: P99 사용자는 한 달에 수천 개의 PR을 작성한다.
-
한계 사용자의 생산 속도는 아이디어 생성 속도에 접근한다
- 분포의 의미: 중앙값과 P90 사이에도 10배의 차이가 있어 개발자별 자동화 활용 수준이 크게 다르다.
- 아이디어와 구현의 결합: 상위 생산자는 새로운 아이디어가 떠오르는 속도에 맞춰 PR을 만들 수 있다.
- 검증 병목: 코드를 쓰는 속도가 빨라질수록 리뷰·테스트·QA가 새로운 병목이 되며, 기존의 수동 절차만으로는 같은 비율로 확장하기 어렵다.
5.2. 자동화의 목표를 QA 대체가 아니라 코드 정확성 검증으로 재정의했다
-
기존 자동화의 프레임을 벗어났다
- 일반적인 접근: QA 자동화, 테스트 자동화, 코드 리뷰 자동화를 각각 구현하려고 한다.
- Greptile의 질문: 정확성이 매우 중요한 엔터프라이즈 환경에서 누구나 한 달에 수백 개의 PR을 안전하게 병합하려면 무엇이 필요한지 처음부터 물었다.
- 검증 구간: 코드가 PR로 표현된 순간부터 병합되고 안전하게 배포되는 순간까지의 전체 경로를 검증 대상으로 삼았다.
-
코드 병합 전에 답해야 할 세 가지 질문
- 사용자 계약 위반 여부: 이 변경 사항이 애플리케이션의 User Contract를 위반하는가?
- 미래 위반 가능성: 이 변경 사항이 앞으로 사용자 계약을 위반할 가능성을 높이는가?
- 작성자 의도 충족 여부: PR 작성자가 설명한 의도를 실제 코드가 충족하는가?
-
세 질문은 기능·회귀·의도 검증을 함께 묶는다
- 현재 동작: 사용자 계약 위반 여부는 지금 당장 발생하는 버그와 기능 회귀를 찾는다.
- 미래의 위험: 미래 위반 가능성은 이번 변경이 기술 부채나 취약한 구조를 만들어 다음 변경의 실패 가능성을 높이는지 본다.
- 요구사항의 충실성: 작성자 의도 검증은 테스트가 통과하더라도 실제 요청을 잘못 구현한 PR을 걸러낸다.
5.3. 샌드박스와 브라우저 에이전트가 자율 검증을 구성한다
-
코드베이스의 실행 맥락을 재현한다
- Sandbox 실행: 에이전트가 변경된 코드를 격리된 환경에서 실행한다.
- 의존성 설치: 코드베이스에 필요한 dependencies를 설치해 정적 분석만으로 놓칠 수 있는 실행 문제를 확인한다.
- 입력 모킹: 실제 서비스에서 들어올 수 있는 입력을 mock해 여러 경로의 동작을 시험한다.
- 브라우저 상호작용: Browser Agent가 로컬 호스트를 띄우고 클릭하며 사용자 관점의 오류를 찾는다.
-
검증 에이전트의 역할은 서로 보완된다
- 코드베이스 맥락 분석: 변경된 파일뿐 아니라 관련 파일까지 살펴 사용자 계약과의 충돌을 추론한다.
- 실행 기반 탐색: 로컬 환경을 만들고 의존성·입력·브라우저 흐름을 실제로 실행해 코드가 고장 났는지 확인한다.
- 높은 병합 확신: 이 조합은 발생 가능한 문제의 상당 부분을 발견해 안전한 병합에 대한 높은 수준의 confidence를 제공한다.
5.4. 사람 없는 병합이 전체 PR의 약 20%까지 늘어났다
- 현재의 자동 병합 수준
- 비중: Greptile이 검토하는 전체 PR 중 거의 5분의 1이 사람의 코드 리뷰나 사람의 테스트 없이 병합된다.
- 조건: 사람의 개입이 없다는 사실 자체가 목표가 아니라, 충분한 검증과 고품질 코드라는 guardrail 안에서 자동 병합이 이뤄지는 것이 조건이다.
- 방향: Greptile은 높은 품질을 유지하면서 이 비중을 계속 높이려 한다.
주요 발언 모음
“AI 코딩 분야의 사람이라면 새로운 모델이 나온 작년 12월이 AI 코딩 역사에서 일종의 분수령이었다는 것을 안다.”
“사람이 만든 PR과 에이전트가 만든 PR의 품질은 이 데이터에 따르면 대체로 대등했다.”
“에이전트가 만드는 실패의 종류와 사람이 만드는 실패의 종류가 다를 수 있다.”
“누구나 한 달에 수백 개의 PR을 병합할 수 있으려면, 코드가 정확해야 하는 엔터프라이즈 환경에서 무엇이 필요할까?”
“변경 사항이 사용자 계약을 위반하는가, 미래의 위반 가능성을 높이는가, 그리고 작성자가 설명한 의도를 충족하는가라는 세 질문에 답해야 한다.”
“샌드박스에서 코드를 실행하고 의존성을 설치하며 입력을 모킹하고 브라우저 에이전트를 실행하면 발생 가능한 문제 대부분을 발견할 수 있다.”
핵심 데이터 & 수치
- 월간 검토량: Greptile은 한 달에 100만 건이 넘는 PR을 검토한다.
- 기업 범위: 데이터는 수천 개 기업에서 수집되며 실제 고객을 가진 제품 조직이 중심이다.
- AI 주도 PR 비중: author field, PR footer, branch prefix를 합친 추정으로 어느 한 달 전체 PR의 약 25%가 완전히 또는 대부분 AI 생성이다.
- 과거 비중: 전년도 초에는 완전히 AI 생성됐다는 증거가 있는 PR이 1% 미만이었다.
- Revert Rate: Codex는 약 1,000건당 1건, 인간은 약 1,000건당 2.5건, Devin은 약 1,000건당 3.5건이 되돌려졌다.
- 리뷰 라운드: Devin PR은 병합까지 평균 2.1회, Codex PR은 평균 2.45회의 리뷰 라운드가 필요했고 인간 PR은 그 중간이었다.
- 코드 리뷰 오류: 테스트한 네 에이전트 중 세 에이전트는 인간보다 P0 문제 비율이 낮았고 P1·P2에서도 큰 열세가 없었다.
- 실패 모드: Claude는 인간보다 SQL injection 오류 가능성이 1.5배 높았고 Devin은 off-by-one 오류 가능성이 인간의 절반 정도였다.
- 개발자 생산량 중앙값: Greptile 중앙값 사용자는 월 50개 PR을 작성한다.
- 개발자 생산량 P90: 90백분위 사용자는 월 500개 PR을 작성한다.
- 개발자 생산량 P99: 99백분위 사용자는 월 수천 개 PR을 작성한다.
- 사람 없는 병합: Greptile이 검토하는 PR 중 거의 5분의 1이 사람의 리뷰나 테스트 없이 병합된다.
결론 및 시사점
- AI 생성 코드는 더 이상 장난감이 아니다: 실제 고객과 복잡한 상업용 코드베이스를 가진 기업에서 AI 주도 PR이 빠르게 늘고 있으며, 관측 데이터상 인간 PR과 평균 품질이 대등하다.
- 생성 여부보다 검증 가능성이 중요하다: AI가 만들었는지 인간이 만들었는지를 판별하는 일보다 사용자 계약, 미래의 회귀 위험, 작성자의 의도를 충족하는지를 검증하는 일이 더 직접적인 품질 기준이다.
- 평균치만으로 에이전트를 선택하면 안 된다: Claude의 SQL injection 취약성, Devin의 off-by-one 특성처럼 에이전트마다 실패 모드가 다르므로 보안·성능·경계값 위험에 맞춘 평가가 필요하다.
- PR 처리량은 검증 아키텍처를 압박한다: 월 50개에서 수천 개까지 PR 생산량이 분포하는 상황에서 수동 리뷰만으로는 상위 생산자의 개발 속도를 감당하기 어렵다.
- 실행 가능한 검증 환경이 핵심이다: 코드베이스 전체 맥락 분석, sandbox 실행, dependency 설치, mock 입력, browser agent 상호작용을 결합해야 정적 코드 리뷰 이상의 확신을 얻을 수 있다.
- 자율 병합에는 guardrail이 필수다: 사람 없는 병합 비중을 높이는 목표는 검증 품질이 보장될 때만 의미가 있으며, 자동화율 자체를 품질의 대체 지표로 삼아서는 안 된다.
- 개발 조직의 역할이 재편된다: 에이전트가 구현과 초안 PR을 담당할수록 인간 엔지니어는 사용자 계약을 정의하고 위험 기준을 설정하며 에이전트별 실패 패턴을 감독하는 역할에 집중하게 된다.
핵심 요약 (20줄)
- Greptile 공동 창업자 Daksh Gupta는 완전 자율형 코딩 에이전트가 실제 엔터프라이즈 코드베이스에서 경쟁력을 갖췄는지 검증했다.
- GPT-3.5의 코드 자동완성은 2022년 AI 코딩의 출발점이었고 Cursor와 Copilot이 대표적인 사용 방식을 만들었다.
- Cursor는 2024년 여러 파일을 동시에 수정하는 Multi-file Editing을 대중화했다.
- 2025년 자율형 에이전트는 작업 설명만으로 전체 Pull Request를 생성하기 시작했다.
- 2025년 12월 새 모델 출시는 코딩 에이전트가 진정한 자율성을 얻은 분수령으로 평가됐다.
- 실제 고객을 보유한 Nvidia, Coinbase, Scale, Datadog, American Express 등이 Greptile의 관측 범위에 포함됐다.
- Greptile은 매달 100만 건이 넘는 PR을 검토하며 수천 개 기업의 개발 데이터를 축적한다.
- GitHub author field만 보면 AI 생성 PR이 1% 미만이지만 PR footer와 branch prefix를 더하면 규모가 크게 달라진다.
- 여러 신호를 종합한 결과 전체 PR의 약 4분의 1이 완전히 또는 대부분 AI로 생성됐다.
- 전년도 초 AI 생성 증거가 있는 PR은 1% 미만이었으므로 AI 주도 개발은 매우 빠르게 확산됐다.
- Codex의 revert rate는 약 1,000건당 1건으로 인간과 Devin의 수치와 큰 차이가 없었다.
- PR 크기와 revert rate를 함께 비교해도 인간 PR이 에이전트 PR보다 낫다는 강한 증거는 나타나지 않았다.
- 테스트한 네 에이전트 중 세 에이전트는 인간보다 P0 문제를 적게 만들었고 P1·P2에서도 대체로 대등했다.
- Devin PR은 평균 2.1회, Codex PR은 평균 2.45회의 리뷰 라운드 후 병합됐고 인간 PR은 그 사이에 위치했다.
- 평균 품질은 비슷하지만 에이전트마다 어떤 오류를 만드는지는 상당히 달랐다.
- Claude는 인간보다 SQL injection 오류를 만들 가능성이 약 1.5배 높았다.
- Devin은 인간보다 off-by-one 오류를 만들 가능성이 절반 정도 낮았다.
- Greptile 중앙값 사용자는 월 50개, P90 사용자는 500개, P99 사용자는 수천 개의 PR을 작성한다.
- 자율 검증은 사용자 계약 위반, 미래 위반 가능성 증가, 작성자 의도 충족이라는 세 질문에 답해야 한다.
- Sandbox, dependency 설치, mock 입력, browser agent를 결합한 검증 덕분에 전체 PR의 거의 5분의 1이 사람의 리뷰나 테스트 없이 병합된다.
📁 /Users/flowkater/Obsidian/flowkater/flowkater/Study/YouTube다이제스트/2026-09-28-aiDotEngineer-474j-n1Ltxc.md
