"RL은 딱 1비트만 배운다"…그런데 왜 모델은 똑똑해졌나
OpenAI 출신 John Schulman, Zyphra의 Beren Millidge, Baseten의 Charlie O'Neill이 재귀적 자기개선(RSI)이 얼마나 가까운지를 놓고 97분간 토론했다. 이들은 RL 스케일링이 이미 작동 중이라는 데는 동의하면서도, AI 연구 자동화(ASI급)까지는 2~10년으로 추정치가 갈렸고, "일반 화이트칼라 원격근무자" 수준은 오히려 그보다 빨리 온다고 봤다.
- 2036 시나리오 — 세 사람 모두 2036년에도 초지능이 세상을 바꾸지 못했다면 그 이유는 정치적 규제이지 기술적 정체는 아닐 가능성이 크다고 봤다.
- 체스 Elo 비유 — Beren Millidge는 1980년대 이후 체스 봇의 Elo가 선형으로 증가하다 인간 범위를 넘는 순간 극적인 불연속이 발생했다는 점을 AI 능력 상승의 비유로 들었다.
- RL 환경의 한계 — 목표가 명확한 '오토리서치'식 RL과 달리, 패러다임 전환을 요구하는 개방형 과학은 AI도 목표를 정의하지 못해 훨씬 어렵다고 지적했다.
- Kaplan 스케일링 법칙 사례 — Beren은 AI가 Kaplan 스케일링 법칙의 어닐링 미반영 오류를 진작 짚어냈다면 1~2년의 연구 지연을 줄였을 것이라고 말했다.
- 증류(distillation)가 독점 저지 — John Schulman은 RL로 학습된 행동은 비트 수가 적어 쉽게 증류되기 때문에, 증류가 모델 제공사 집중을 막는 핵심 힘이라고 설명했다.
- 중국 라우터 서비스 데이터 — 중국 기업들은 미국 프론티어 모델 접속을 대행하는 라우터·프록시 서비스의 코딩 프롬프트 데이터를 수집·판매해 증류에 활용하고 있다고 지적됐다.
- Sonnet 5 vs GLM/Kimi 역설 — Anthropic이 RL 환경과 로짓 증류 접근권을 모두 가졌는데도 Sonnet 5·Opus 5가 GLM-5.3, Kimi K3보다 못하다는 관찰이 나왔고, 이는 실배포 데이터가 어려운 RL 환경보다 더 중요할 수 있음을 시사한다는 해석이 제기됐다.
- RSI는 '누적적' 과제 — Charlie O'Neill은 RSI가 attention·MoE·GRPO처럼 한 번 발견하면 계속 쌓이는 누적적 과제인 반면, 로펌 파랄리걸 업무 같은 실세계 과제는 계속 재학습해야 하는 비정상 분포라 훨씬 어렵다고 구분했다.
- 모델의 표본 효율 격차 — 모델이 태어나서 성인이 될 때까지 인간이 보는 데이터 대비 학습 시작부터 종료까지 보는 데이터가 100만 배가량 적을 수 있다는 추정이 제시됐다.
- 온라인 RL 실사례: Composer — Cursor의 Composer는 사용자가 탭을 누르는지 여부로 5시간마다 새 모델을 배포하고, CursorBench 성능이 떨어지면 그 버전을 버리는 방식의 REINFORCE 온라인 학습을 실제로 운영하고 있다.
- 데이터 vs 아키텍처 기여도 — 2019년부터의 학습 레시피와 데이터셋을 교차 실험한 결과 데이터 개선이 약 12.0배, 아키텍처 개선이 약 3.7배의 컴퓨트 효율 향상을 설명했다.
- RL이 통했던 이유 — Beren은 RL 성공의 상당 부분이 중간학습(mid-training)에서 이미 최종 체크포인트의 80%까지 도달해 놓았고, RL은 그 위에서 정책을 미세 조정할 뿐이라고 설명했다.
- 타임라인 예측 편차 — 화이트칼라 원격근무 대체형 AI는 1~3년, AI 연구 자동화로 10배 생산성 향상은 2년, 모든 인지노동에서 인간 전문가를 압도하는 ASI급은 3~10년으로 세 사람의 예측이 크게 갈렸다.
그가 한 말
하지만 그 스케일링 법칙을 계속 유지하기 위해서는 아주 많은 불연속적 혁신들이 필요했다. LLM에서도 똑같은 일이 일어났다.But there were so many discrete discontinuities and innovations that had to happen to keep that scaling law going. The same thing has happened with LLMs.3분 12초
만약 그렇지 않다면, 우리는 아마 점근선에 도달하게 될 것이다.If not, we're probably going to hit this asymptotic curve.3분 50초
인간이 태어나서 성인이 될 때까지 보는 데이터량과 모델이 처음부터 학습을 마칠 때까지 보는 데이터량을 비교하면, 모델은 인간보다 아마도 백만 배는 뒤처져 있을 것이다.They're plausibly a millionfold behind humans in terms of how much data a human sees from birth to adulthood versus how much a model sees from cold start to finishing training.46분 12초
모델이 사람보다 훨씬 많은 코드를 작성할 수 있다고 해도, 그것이 생산성을 100배로 만들어주지는 않는다.Even if the model can write way more code than a person, it doesn't make you 100X more productive.2분 6초
덧붙임 — 여기에 하나 덧붙이면, 세 사람이 공통으로 짚은 병목은 결국 표본 효율과 망각이다. RL은 모델을 조금씩만 바꾸기 때문에 파국적 망각은 피하지만 딱 그만큼만 개선되고, 지식을 통째로 넣으려면 결국 새 베이스 모델을 처음부터 다시 학습해야 한다는 것이 이들의 결론이다.
오늘 밤 해볼 수 있는 한 가지
오늘 밤, 최근 쓰던 코딩 에이전트에게 같은 프로젝트에서 반복적으로 저지르는 실수 패턴을 물어보고, 그 실수를 걸러내는 간단한 체크리스트를 직접 만들어 다음 세션 프롬프트에 넣어보라 — 이것이 대화에서 말한 '버그를 환경으로 바꾸는' 과정의 축소판이다.