코드 생성 741% 증가, 출시는 30%뿐…병목은 리뷰다
AI 에이전트가 코드 작성 속도를 거의 8배 끌어올렸지만 실제 출시된 소프트웨어는 3분의 1만 늘었다. Arize AI의 Laurie Voss는 "더 열심히 리뷰하자"는 해법이 수학적으로 불가능하다고 말하며, 업계가 실제로 무엇을 시도하고 있는지를 증거 위주로 짚는다.
- 741% 대 30% — 10만 명 이상의 GitHub 개발자를 추적한 연구에서 자율 에이전트를 켠 개발자는 코드량이 741% 늘었지만 실제 출시된 소프트웨어는 30%만 증가했고, 연구진은 리뷰가 병목이라고 단언했다.
- 대규모 마이그레이션 사례 — Stripe는 Anthropic의 Claude 발표 자료에서 5000만 줄짜리 Ruby 코드베이스를 하루 만에 마이그레이션했다고 밝혔고, Bun은 100만 줄 이상의 Zig 코드를 6일 만에 Rust로 포팅했다.
- 400줄의 벽 — 20년 전 Cisco의 연구(10개월, 2500건 리뷰, 320만 줄)에 따르면 리뷰어는 한 번에 400줄 이상을 읽으면, 시간당 450줄 이상 리뷰하면 결함 발견 효율이 급격히 떨어지며, 이 속도로는 1만 줄짜리 에이전트 PR 하나를 제대로 리뷰하는 데 3~4일이 걸린다.
- OpenAI의 무인 리뷰 실험 — OpenAI는 2월 사람이 직접 작성한 코드가 전혀 없는 내부 제품을 공개했는데, 완전히 빈 저장소에서 시작해 5개월 만에 약 100만 줄, 1500건의 머지된 PR을 3명의 엔지니어만으로 만들었고 사람의 리뷰는 필수가 아니었다.
- METR의 머지 가능성 검증 — METR이 오픈소스 메인테이너 4명에게 SWE-bench를 통과한 PR을 다시 보게 하자 실제로 머지할 만한 것은 절반 정도에 불과했고, 실패 이유는 정확성이 아니라 코드 품질과 테스트 밖의 숨은 파손이었다.
- FrontierCode 격차 — Cognition의 FrontierCode 벤치마크에서 Claude(Opus 모델 계열로 추정되는 'Fable')는 SWE-bench Pro에서 88%를 받았지만 머지 가능성을 재는 FrontierCode 최고난도에서는 29%에 그쳤고, GPT-5.5는 같은 테스트에서 6% 미만을 기록했다.
- 벤치마크가 곧 학습 신호 — 투자자 Sarah Guo는 컴파일러와 테스트 스위트처럼 값싸게 검증 가능한 것은 그대로 모델 학습 신호가 되어왔다며, 진짜 머지 가능성 벤치마크가 만들어지는 순간 그것 역시 즉시 프런티어 모델의 학습 신호가 될 것이라고 썼다.
- GitHub·Cursor의 프로덕션 리뷰 — GitHub Copilot 리뷰어는 이미 6000만 건의 리뷰를 수행해 GitHub 전체 코드 리뷰의 5건 중 1건 이상을 차지하며, Cursor는 리뷰 패스를 8번 반복하고 순서를 섞어 재검토하는 방식으로 거짓 양성을 걸러냈다.
- 의심을 기본값으로 — 베이징대 연구팀이 여러 번 리뷰를 돌려 합의된 것만 남기는 방식으로 리뷰 품질을 최대 44% 높였고, Cursor는 모델이 코드를 보고 '괜찮아 보이니 넘기자'고 판단하는 습성을 고치기 위해 기본적으로 코드를 믿지 말라고 지시해야 했다.
- 사람 없는 두 실험 — Anthropic의 Nicholas Carlini는 에이전트 16개로 약 2000세션에 걸쳐 사람의 개입 없이 Rust로 C 컴파일러를 만들어 Linux 커널을 컴파일하는 데 성공했지만, 테스트 하네스 자체는 사람이 작성했다.
- Bun의 1만3044개 unsafe 블록 — Bun이 에이전트로 6일 만에 포팅한 100만 줄 규모 Rust 코드에는 unsafe 블록이 13,044개 있었는데, 비슷한 규모의 사람이 작성한 Rust 코드베이스에는 보통 약 74개뿐이었다.
- 자동 리뷰어도 속는다 — Anthropic의 자동 보안 리뷰어는 README에서 프롬프트 인젝션 공격에 대비돼 있지 않다고 밝혔고, 3월 연구에서는 악성 코드를 무해한 커밋 메시지로 포장했을 때 자동 리뷰 에이전트는 88%의 시도에서 속았지만 사람 리뷰어는 35%만 속았다.
- Dexter Horthy의 번복 — 6개월간 코드 리뷰를 하지 말라고 주장했던 Dexter Horthy는 3월 무대에서 '내가 틀렸다, 코드를 읽어 달라'며 리뷰 없이 운영했다가 시스템 일부를 뜯어내 교체해야 했다고 고백했다.
그가 한 말
자율 에이전트를 사용한 개발자들은 코드를 741% 더 많이 작성했지만, 실제로 출시된 소프트웨어는 30%밖에 늘지 않았다the developers who turned on autonomous agents wrote 741% more code but only 30% more software shipped1분 30초

리뷰어는 한 번에 400줄 이상을 읽으려 하면 결함을 효과적으로 찾아내지 못하고, 효율이 절벽처럼 떨어진다reviewers stop finding defects effectively if they try to read more than 400 lines of code in one sitting and their effectiveness completely falls off a cliff3분 38초

더 이상 코딩 에이전트에게 프롬프트를 주는 게 아니라, 에이전트에게 프롬프트를 주는 루프 자체를 설계해야 한다you shouldn't be prompting coding coding agents anymore. You should be designing the loops that prompt your agents4분 44초

내가 틀렸다. 제발 코드를 읽어라. 우리는 6개월 동안 코드를 읽지 않으려 했는데 결과가 좋지 않았다. 시스템의 큰 부분을 뜯어내고 교체해야 했다.I was wrong. Please please read the code. We tried not reading the code for like six months. It did not end well. We had to rip out and replace large parts of that system.18분 46초

이해관계 · Laurie Voss는 Arize AI의 Head of Developer Relations로, 발표 중 "레거시 Arize 홍보는 하지 않겠다"고 밝혔지만 프로덕션 모니터링의 중요성을 강조하며 자사 영역(AI 관측성)과 연결되는 주장을 폈다.
덧붙임 — 여기에 하나 덧붙이면, 발표 전체를 관통하는 결론은 '사람을 없애는 것'이 아니라 '사람이 코드 한 줄 한 줄을 보는 조종사에서 리뷰 시스템·기준·벤치마크를 설계하는 관제사로 올라간다'는 것이다. 다만 그 상위 시스템도 결국 사람이 만들고 검증해야 한다는 역설은 이번 발표에서 완전히 해소되지 않았다.
오늘 밤 해볼 수 있는 한 가지
지금 쓰고 있는 PR 리뷰 체크리스트를 꺼내 '머지 가능하다'고 판단하는 기준(정확성 외에 범위·유지보수성·회귀 위험 등)을 글로 적어보고, 그중 테스트로 자동 검증 가능한 항목이 몇 개인지 세어본다.