특집

Llama 4는 공개 벤치마크만 좋았다, VALS가 밝힌 성능 괴리

원본 · Inside the Race to Measure Frontier Intelligence
a16z · Rayan Krishnan · VALS · 2026-09-09 업로드 · 39분

한국어·English

공개 벤치마크는 모델이 시험 자체에 최적화되면서 이미 신뢰를 잃었다. VALS 창업자 Rayan Krishnan은 Meta의 Llama 4 사례를 들어 자체 보고 점수와 독립 평가 사이의 간극을 드러내고, 왜 제3자 평가 기관이 금융 감사·신용평가사처럼 필수 인프라가 되어야 하는지 설명한다.

  • VALS 창립 배경 — 2024년 초 팀은 공개 벤치마크가 모델 진전을 측정하기에 불충분하다고 판단해 VALS를 시작했다
  • Llama 4 사례 — Meta의 Llama 4는 VALS의 비공개 held-out 벤치마크에서는 저조했지만 문항과 채점기준이 공개된 주요 퍼블릭 벤치마크에서는 뛰어난 성능을 보였다
  • 역사적 유사 사례 — 신용평가사·감사법인처럼 새로운 조 단위 산업이 생길 때마다 독립 검증 그룹이 필요해진다는 것이 Krishnan의 주장이다
  • 6시간 사전 테스트 — 모델 출시 몇 시간 전, 초기에는 공동창업자 Lynx와 밤샘 작업으로 결과를 냈고 지금은 분산 인프라와 내부 시스템 'Steve'로 자동화했다
  • 평가의 모호함 — '로펌의 어소시에이트와 파트너의 차이' 같은 애매한 기준을 명시적으로 만들어야 하는 것이 평가의 핵심 과제라고 말했다
  • 이해상충 경계 — VALS는 창립 초기부터 랩에 학습 데이터를 판매하지 않기로 결정했으며, 이는 Enron식 감사-컨설팅 이해상충을 피하기 위함이라고 설명했다
  • 재귀적 자기개선 지수 — RSI(recursive self-improvement) 잠재력을 랩마다 비교할 공통 언어가 없어 사전학습·후처리·하네스 엔지니어링 등 과정별 프록시 지표를 만들어 벤치마크를 구성했다
  • 벤치마크 폐기 원칙 — VALS는 '항상 더 높은 봉우리(always a higher peak)'라는 비공식 모토 아래 포화된 벤치마크를 지속적으로 폐기하고 새로 만든다
  • 토큰 지출이 급여를 넘는 사례 — 포춘10 기업 한 곳은 엔지니어당 하루 100달러였던 Claude Code 예산을 최근 300달러로 늘려, 거의 직원 급여와 맞먹는 만큼의 토큰을 쓰고 있다
  • VALS 내부 실험 — 한 달간 무제한 코딩 도구 실험에서 엔지니어 한 명이 하루 60억 토큰을 쓴 날도 있었고, 한 달 토큰 비용이 약 150만 달러로 같은 기간 직원 급여의 10배에 달했다
  • ValSmith 출시 — 기업이 자사 GitHub 코드베이스로 내부 코딩 벤치마크를 만들 수 있는 제품이며, VALS는 이를 통해 Cognition의 Devon 같은 도구가 토큰 효율이 높다는 것을 발견했다
  • 정책과 검증 — 정부는 무엇이 두려운지(생물해킹·사이버해킹) 알지만 모델이 실제로 그것을 할 수 있는지 검증하는 것은 정부보다 제3자 평가기관이 더 적합하다고 Ben Horowitz는 말했다
  • 국제 공조 비유 — Krishnan은 냉전기 핵무기 사찰의 '신뢰하되 검증하라(trust but verify)' 원칙을 들어, AI 리스크 검증에도 평가라는 공통 언어와 상호 사찰 메커니즘이 필요하다고 말했다

그가 한 말

그건 좀 재앙적이었어요. 그리고 흥미롭게도 저희가 발견한 건, 저희의 비공개 홀드아웃 벤치마크에서는 모델이 실제로 저조한 성능을 보였지만, 질문과 채점 기준이 오픈소스로 공개된 주요 공개 벤치마크에서는 놀라운 능력을 보여주고 있었다는 거예요.That was a bit of a disaster. And and interestingly what we saw is that on our heldout private benchmarks the model is actually underperforming but on all of the the major public benchmarks where that the questions and rubrics are actually open source um it was it was showing incredible capability.2분 39초
Rayan Krishnan 발표 화면 · Inside the Race to Measure Frontier Intelligence 2분 39초
Rayan Krishnan 발표 화면 · 2분 39초 · a16z
저희 엔지니어 상당수가 하루에 10억에서 20억 토큰을 쓰고 있었어요. 최고치를 찍은 날에는 한 명의 엔지니어가 60억 토큰을 썼던 것 같아요.we had a lot of engineers spending between 1 to two billion tokens a day. I think peak day was one engineer spending six billion.22분 50초
Rayan Krishnan 발표 화면 · Inside the Race to Measure Frontier Intelligence 22분 50초
Rayan Krishnan 발표 화면 · 22분 50초 · a16z
그 달에 저희는 대략 150만 달러어치의 토큰을 쓴 걸로 나왔어요. 그런데 실제로 그 달 직원 급여보다 토큰 지출이 10배나 더 많았어요.it looked like in that month we spent roughly $1.5 million worth of tokens. This is free, by the way. I No, don't want um but it was actually 10x more we were spending in tokens than employee salary for that month.23분 6초
솔직한 답은, 이게 원래 애매하고 분산되어 있던 평가 방식들을 명시적으로 만들도록 강제하고 있다는 거예요. 예를 들어 로펌에서 어소시에이트와 파트너의 진짜 차이가 무엇인지 같은 것들요.I think the honest answer is that it's forcing a lot of the um more fuzzy or distributed forms of eval to be made explicit like what what is really the distinction between an associate and a partner at a law firm.5분 58초
Rayan Krishnan 발표 화면 · Inside the Race to Measure Frontier Intelligence 5분 58초
Rayan Krishnan 발표 화면 · 5분 58초 · a16z
직원 급여 1배 토큰 지출 10배
월간 토큰 지출 vs 직원 급여 — Rayan Krishnan이 VALS 사내 토큰 맥싱 실험에서 한 달간 약 150만 달러의 토큰을 소비했으며 이는 같은 기간 직원 급여의 10배였다고 밝힘

이해관계 · 발화자 Rayan Krishnan은 자신이 창업한 평가 기업 VALS와 그 제품 ValSmith을 직접 소개하고 있다.

덧붙임 — 여기에 하나 덧붙이면, 평가 기관의 신뢰는 결국 '학습 데이터를 팔지 않는다'는 이해상충 회피 원칙에 달려 있다는 점이 흥미롭다. 감사업계의 Enron 사태처럼 평가와 컨설팅을 동시에 하는 순간 벤치마크는 '돈 내면 통과'로 변질될 위험이 있다.</note_ko> </invoke>

오늘 밤 해볼 수 있는 한 가지
자신이 최근 쓴 코딩 에이전트나 LLM API의 한 달 토큰 사용량을 대략 계산해 보고, 그 비용이 같은 작업을 사람이 했을 때 드는 인건비의 몇 배인지 직접 나눠보라.