특집

3~4달러 파이프라인, VLM 대신 RF-DETR을 훈련시키다

원본 · Skill issue: stop deploying vision language models, use them with Skills — Merve Noyan, Hugging Face
AI Engineer · Merve Noyan · Hugging Face · 2026-09-23 업로드 · 19분

한국어·English

Hugging Face의 Merve Noyan은 비전 언어 모델(VLM)로 책까지 썼지만, 정작 개발자들에게는 VLM을 직접 배포하지 말라고 말한다. 토스터에서 40fps를 내는 작은 디텍터가 실시간성이 없는 VLM보다 항상 더 나은 성능을 낸다는 것이다. 그는 라벨 없는 이미지만 있어도 코딩 에이전트가 VLM으로 라벨링하고 두 개의 소형 VLM이 심사한 뒤 RF-DETR을 훈련시키는 툴킷을 공개했다.

  • 실시간의 배신 — VLM으로는 토스터에서 30~40fps 실시간 처리를 절대 얻을 수 없고, RF-DETR이 항상 VLM을 능가한다
  • 라이선스 함정 — YOLO는 AGPL 3.0 라이선스인데도 모르고 무단 배포하는 개발자가 있다고 지적했다
  • 툴킷 이름과 영감 — Web Vision이라는 툴킷을 만들었고, SAM 3.1을 Gemma 4에 도구로 준 Mazar의 게시물에서 영감을 받았다
  • 모델 선정 기준 — 라이선스는 Apache 2.0·MIT·비상업용이어야 하고 성능은 벤치마크로, 나머지는 '바이브'로 고른다
  • 파이프라인 구조 — Qwen 3.5 9B로 라벨링하고 Gemma 4 E4B(8B)와 LFM 2.5VL(약 2B) 두 심사 모델을 거쳐 RF-DETR medium/large를 훈련한다
  • 머지 방식 — 점수를 매기게 하는 방식은 심사 모델 크기가 다르면 전혀 작동하지 않아 합의(consensus)가 아닌 최소 동의(minimum agreement)로 판정을 병합했다
  • 비용 — 전체 파이프라인을 한 번 돌리는 데 3~4달러가 든다
  • 도로 표지판 실험 — 정답 라벨과 비교했을 때 mAP@50이 양호하게 나왔다
  • 문서 파싱 실험 — 훈련된 모델이 라벨링에 쓰인 Qwen이 놓친 서명(signature)을 오히려 찾아냈다
  • 심사자 불균형 — LFM이 Gemma보다 훨씬 많이 거부해서, 둘 다 동의한 것만 남기는 합의 방식을 쓰면 예제가 너무 적게 남았을 것이다
  • 프롬프트 승인 — 코딩 에이전트가 생성한 심사 프롬프트는 결국 사람이 직접 확인하고 승인해야 한다
  • 코딩 에이전트의 한계 — Opus 4.6 같은 좋은 에이전트도 교통 표지판을 좌우 반전시키거나 신호등 색을 지터링해 데이터셋을 망가뜨렸다
  • 모델 도구함 — 6억 파라미터 Apache 2.0 모델 Falcon Perception이 SAM과 달리 '파란 차 옆 주황 차 옆 빨간 차' 같은 개방형 참조 분할을 해낸다

그가 한 말

그건 항상 여러분의 비전 언어 모델을 능가할 겁니다. 오늘 그걸 증명해 보이겠습니다.it will always outperform your vision language model and I'm going to prove it today.1분 23초
Merve Noyan 발표 화면 · Skill issue: stop deploying vision language models, use them 1분 23초
Merve Noyan 발표 화면 · 1분 23초 · AI Engineer
비전 언어 모델을 라벨러로 쓰고, 비전 언어 모델을 심판으로 써서 원하는 모델을 학습시킬 수 있습니다.You can actually use a vision language model as a labeler and the vision language models as judge and then train what you want.3분 58초
Merve Noyan 발표 화면 · Skill issue: stop deploying vision language models, use them 3분 58초
Merve Noyan 발표 화면 · 3분 58초 · AI Engineer
저는 판정을 합의(consensus)가 아니라 최소 동의(minimum agreement) 기준으로 병합합니다. 왜 그렇게 했는지는 나중에 설명하겠습니다.I merge the judge verdicts over minimum agreement and not consensus which I will come to why I did that that way7분 29초
Merve Noyan 발표 화면 · Skill issue: stop deploying vision language models, use them 7분 29초
Merve Noyan 발표 화면 · 7분 29초 · AI Engineer
LFM은 많이 거부하는 경향이 있습니다. 그래서 합의를 취할 수 없었죠. LFM과 Gemma가 둘 다 제거하기로 동의한 걸 다 없앴다면, 남는 예시가 매우 적었을 겁니다.LFM tends to reject a lot. That's why I couldn't take the consensus because if I were to if I were to eliminate everything that both LFM and Gemma agreed to remove, um I would left with very very little number of examples11분 26초
Merve Noyan 발표 화면 · Skill issue: stop deploying vision language models, use them 11분 26초
Merve Noyan 발표 화면 · 11분 26초 · AI Engineer

이해관계 · 발화자는 Hugging Face 소속으로, 자사의 Hugging Face Jobs·Inference Providers 인프라와 자신이 만든 툴킷을 사례로 제시했다.

덧붙임 — 여기에 하나 덧붙이면, 이 파이프라인의 핵심은 '완전 자동화'가 아니라 '사람이 승인하는 지점을 최소화'하는 것이다. 라벨 설명 프롬프트 승인과 증강 정책 확인처럼 사람이 반드시 봐야 하는 지점이 여전히 남아있다는 점이 오히려 이 발표의 가장 정직한 대목이다.

오늘 밤 해볼 수 있는 한 가지
오늘 밤 Hugging Face의 vision 저장소에서 Merve Noyan의 web vision 툴킷과 모델 도구함 목록을 열어보고, 손에 있는 라벨 없는 이미지 폴더 하나를 Qwen 3.5 9B 라벨링 단계에 넣어 3~4달러 예산으로 RF-DETR 훈련까지 한 번 돌려본다.