500B 오픈 모델 Beam, GB300 6,000장 몇 주로 사전학습
Reflection AI의 Misha Laskin은 첫 오픈웨이트 모델 Beam을 내놓으며, 프런티어 따라잡기가 생각보다 자본 효율적이고 RL에는 더 많은 연산이 들어갔다고 말한다. 토큰 수요는 이미 오픈이 7:3으로 앞섰고, 기업은 임대에서 소유로 옮겨 간다고 본다. 안전 논쟁에서도 폐쇄가 안전하다는 통념을 뒤집어 개방이 기본값이라고 주장한다.
- 12개월 스프린트 — 지난 12개월간 약 30명에서 300명 규모로 커졌고, 사전학습·미드트레이닝·RL 팀을 모두 꾸려 첫 모델 Beam을 냈다.
- 모든 게 어렵다 — 가장 어려운 것 하나를 꼽는 대신 인재·데이터·컴퓨트·인프라 등 30가지를 다 맞혀야 한다고 말했다.
- RL에서 직접 학습으로 — 창업 약 2년 반 전에는 오픈 모델 위에 RL을 얹으려 했지만, 좋은 오픈 모델이 모두 중국산이 되자 RL이 잘 돌려면 사전학습이 필요하다는 점까지 겹쳐 직접 만들기로 했다.
- 추격 비용 — 프런티어 추격 비용은 18개월 전 수억 달러, 6개월 전 수십억 달러, 내년엔 수백억 달러 규모로 세대마다 연산이 약 4배씩 늘어난다고 봤다.
- 연산 효율 — 사람 연구자만 일하면 연산 효율이 연 7배 개선되지만, 모델이 스스로 개선을 돕는 RL 쪽은 30배 수준이고 속도는 4배 이상 빠르다고 했다.
- Beam 학습 규모 — Beam은 총 500B 파라미터에 활성 23B이며, 사전학습에 GB300 6,000장을 몇 주 썼고 RL에는 GB300 1만 장 이상을 4주 썼다.
- RL은 안 멈춘다 — RL 곡선은 계속 오르기만 해서 이제는 학습 가능 여부가 아니라 얼마를 투입하느냐의 경제 문제라고 단언했다.
- 추론 효율 — Beam은 같은 능력대 모델보다 3~4배 효율적이고, 더 큰 모델과 비교하면 약 10배 효율적이라고 했다.
- 수익 모델 — 토큰 구매는 스택 전체를 임대하는 것이고, 기업은 클러스터 관리·추론 소프트웨어·하니스를 함께 받아 소유로 옮겨 간다고 설명했다.
- 오픈 토큰 역전 — OpenRouter나 Vercel 같은 게이트웨이에서 6개월 만에 폐쇄:오픈이 7:3에서 오픈:폐쇄 7:3으로 뒤집혔다고 했다.
- 기업 도입 경로 — 기업은 파인튜닝보다 오픈 모델 둘레에 하니스를 맞춘 커스텀 시스템으로 시작하며, 폐쇄 모델에 연 1억 달러 이상 쓸 때 전환을 고민한다고 봤다.
- 중국 오픈 모델 — 중국 오픈 생태계는 서구 기업에 선물이지만, 이들은 폐쇄 모델을 산업 규모로 증류하고 국가 지원을 받으며 오픈 모델은 인프라로 들어가는 트로이 목마라고 했다.
- 안전 논쟁 — 1990년대 강력한 암호화가 공개돼 사이버보안 분야가 생겼듯 개방이 기본값이며, 수백 명 안전 연구자로는 취약점의 롱테일을 다 못 덮는다고 주장했다.
- 연구 인력 규모 — AlphaGo는 약 10명이 했고 지금 큰 프로젝트는 수백 명 규모이며, 3,000명은 도움이 안 되고 100명 안팎에서 정상 상태가 될 것이라고 봤다.
그가 한 말
500B 파라미터(활성 23B)인 Beam을 학습하는 데 GB300 6,000개를 몇 주 동안 돌렸지만, 인프라 효율화로 지금은 약 12일, 어쩌면 더 짧게도 가능하다.to train beam which is a 500 billion parameter model total 23B active it was 6,000 uh GB300's we ran it I think for for a few weeks but now you know like with infrastructure efficiencies we can do it in about 12 days maybe less12분 14초

Beam은 같은 성능 등급의 모델보다 3~4배 효율적이고, 더 큰 모델과 비교하면 효율 차이가 10배 정도까지 난다.So beam tends to be three to four times more efficient than uh models of the same you know capability class and uh much more efficient when it comes to even you know there are models that are larger out there uh where you know where the efficiency gains are then end up being something like 10x.20분 13초

6개월 전엔 오픈라우터나 버셀 같은 게이트웨이에서 클로즈드가 다수였는데, 클로즈드:오픈 70:30이던 것이 거의 정확히 오픈:클로즈드 70:30으로 뒤집혔다.it was majority closed uh minority open when you go to any gateway like open router or versell and it's flipped almost exactly from 7030 closed open to 7030 open close.25분 7초

우리가 만나는 대부분의 기업이 오픈 모델을 고려하는 시점은 클로즈드 모델로 상당한 워크로드를 키운 뒤다.most the enterprise we talk to are considering now is uh by the time they've ramped up some significant workloads with closed models29분 5초

이해관계 · Misha Laskin은 오픈웨이트 모델 Beam을 만든 Reflection AI의 공동창업자이자 CEO로, 이 모델과 배포 서비스를 기업·국가에 판매한다.
덧붙임 — 여기에 하나 덧붙이면, 오픈 토큰 7:3 역전과 중국산 증류 같은 핵심 수치는 판매자 본인의 진술이라 독립 검증이 필요하다. Beam의 3~4배 추론 효율 주장도 기술 보고서가 나와야 검증할 수 있다.
오늘 밤 해볼 수 있는 한 가지
지금 쓰는 폐쇄 모델 에이전트 작업 하나를 골라 같은 프롬프트와 하니스로 오픈웨이트 모델에도 돌려 보세요. 성공률, 소요 시간, 토큰 수를 표로 비교하면 소유로 옮길 만한지 가늠할 수 있습니다.