GPU 한 장이 초당 임베딩 50만 토큰, API보다 수백 배 싸다
Superlinked의 Daniel Svonava는 소형 오픈소스 모델이 특정 과제에서는 이미 프론티어급이라고 말한다. 문제는 모델이 아니라 이런 소형 모델을 수십, 수백 개 동시에 서빙하는 인프라이며, 그는 상위에서 내려찍는 라우터 방식 자체가 병목이라고 지적한다.
- 소형 모델 정의 — 2~3세대 전 Nvidia GPU 한 장에 통째로 올라가는 모델을 소형 모델로 정의한다
- 품질 통념 반박 — 특정 과제에서는 소형 모델이 프론티어 수준이거나 그 이상의 성능을 낸다
- 벤치마크 근거 — Qwen 3 27B가 GPT 5.1과 비슷한 성능대에 있고 프론티어는 수확 체감, 소형 모델은 계속 따라잡는 중이다
- 워크로드 분해 — 27B 모델 하나로 모든 걸 프롬프팅하지 말고 과제별로 최적 모델을 골라야 한다
- 실제 사례 — 계약서 검토 에이전트 하나가 서로 다른 9개 모델을 돌린다
- 과제 특화 우위 — 베트남어 영수증 OCR은 그 데이터를 가장 많이 본 모델이 이긴다
- Bedrock 한계 — AWS Bedrock의 모델 카탈로그는 종류가 제한적이고 최신 대비 2~3년 뒤처졌으며 파인튜닝 산출물도 소유할 수 없다
- 서빙 도구 문제 — vLLM, SGLang 같은 오픈소스 서빙 도구는 특정 모델·하드웨어 조합에 맞춰 튜닝돼 있지 않아 도입 자체가 연구 프로젝트가 된다
- 라우터 병목 — 소형 모델 다수 요청 환경에서 상위 하달식 라우터는 GPU 활용률을 20~30%에서 정체시킨다
- LoRA 마찰 — 매일 밤 만든 파인튜닝이나 LoRA 10개를 서빙 스택에 올리는 요청이 AI 엔지니어와 인프라 엔지니어 간 대화를 계속 필요하게 만든다
- Superlinked 구조 — Apache 2.0으로 공개한 시스템은 게이트웨이가 요청을 완전히 파싱하지 않고 메타데이터만 붙여 공유 큐에 넣고 워커가 직접 배치를 구성한다
- 처리량 개선 — 중앙집중식 큐잉 전환만으로 클러스터 처리량이 두 배가 됐다
- 런타임 추상화 — Rust 사이드카가 PyTorch, Kendall, SGLang 세 런타임 위에서 약 50개 어댑터를 통일된 인터페이스로 다룬다
- 실측 성능 — RTX Pro 6000 한 장에서 임베딩 모델이 초당 최대 수십만 토큰, 낮게는 수십 밀리초 지연을 낸다
- 비용 비교 — 관리형 임베딩 API는 비용이 수십~수백 배 더 들고 지연도 수백 밀리초에 달한다
- LoRA 실증 사례 — 학습에 80센트가 든 LoRA가 독일어 법률 텍스트 검색 품질을 18% 끌어올렸다
그가 한 말
지속적인 부하 상태에서 GPU 활용률을 20~30% 이상으로 끌어올리기가 매우 어렵습니다. 문제는 그 라우팅 병목 때문에 배치 크기가 제대로 맞춰지지 않는다는 것입니다.it's very hard to get your GPU utilization beyond 20 30% under constant load and the problem is that those batches are just not correctly sized basically because you that routing bottleneck.8분 21초
기본적으로 조직 속도를 죽이는 주범은 바로 '대화'입니다. 이상적으로는 인프라 엔지니어와 AI 엔지니어가 서로 대화하지 않고도 각자 일상 업무를 할 수 있어야 합니다.basically that's like the main killer in organizational uh velocity is talking right like ideally you would want the infrastructure engineers to do their job and you would want to those AI engineers to do their job and they don't have to talk to operate on the day-to-day mode.9분 13초
지금 OpenAI 임베딩 API를 호출하고 있다고 상상해 보세요. 대신 GPU 한 대만 있으면 초당 50만 토큰을 밀어넣어 벡터를 뽑아낼 수 있습니다.imagine you are sitting there now like hitting your text embedding tree on open AAI API instead you could be like having one GPU and push half a million tokens per second into that thing and get the vectors out right19분 55초
그 결과물 중 하나는 훈련 비용이 80센트에 불과했던 LoRA로, 독일 법률 텍스트 검색 품질을 개념 증명 수준에서 18% 향상시켰습니다.one of the outputs of that was a Laura that took 80 cents to train and it improved 18 it improved quality of retrieval on German legalist STEX as a proof of concept by 18%.23분 59초
이해관계 · 발화자 Daniel Svonava는 발표에서 소개한 오픈소스 추론 클러스터를 개발한 Superlinked의 소속이며, 발표 말미에 해당 GitHub 저장소에 스타를 눌러달라고 요청했다.
덧붙임 — 여기에 하나 덧붙이면, "모델이 병목이 아니라 서빙이 병목"이라는 진단은 오픈소스 AI가 2024년부터 계속 "아직 안 왔다"고 여겨진 이유를 설명한다. 결국 Bedrock 같은 관리형 카탈로그가 사실상 오픈소스 AI의 대리 경험이 돼버린 현실과 맞닿아 있다.
오늘 밤 해볼 수 있는 한 가지
Hugging Face에서 자신의 언어·도메인에 특화된 소형 OCR이나 임베딩 모델을 하나 찾아, 로컬 GPU나 Colab에서 텍스트 임베딩 API 대신 직접 돌려 지연시간과 비용을 비교해본다.