에이전트 요청 입력의 80~90%는 재계산할 필요가 없다
CoreWeave의 추론 플랫폼 책임자 Sitanshu Gupta는 에이전트형 요청에서 입력 토큰의 80~90%가 직전 요청과 동일하다고 말한다. 이 사실 하나가 캐시된 토큰 가격이 신규 토큰보다 훨씬 싼 이유이자, CoreWeave가 서버리스와 전용 인프라를 하나의 플랫폼으로 묶어 설계한 이유라는 것이다.
- 소비 모델 1: 서버리스 — 고객은 하드웨어나 클러스터 오케스트레이션을 신경 쓸 필요 없이 API·UI로 들어와 토큰당 요금을 낸다.
- 노이지 네이버 대응 — 트래픽 프로파일을 아는 고객을 위해 별도로 용량을 떼어주는 'provisioned throughput'을 제공하며 이 역시 토큰당 과금이다.
- 소비 모델 2: 전용(dedicated) — 전용 서비스는 GPU 시간당 과금이며, 모델 배포와 성능 최적화 책임은 고객에게 있고 프라이빗 게이트웨이 뒤에서 운영된다.
- 워크로드 4형태 — 에이전트·챗·음성/영상·배치 네 가지 워크로드 형태를 시간 축에서 테트리스처럼 맞춰 인프라를 활용한다.
- 에이전트 vs 챗 — 둘 다 입력은 길고 출력은 짧지만, 에이전트는 턴 사이에 사람이 읽는 시간이 없어 지연 예산이 매우 작다.
- 배치 워크로드 — 일부 고객은 SLA가 초·분 단위가 아니라 10~12시간 단위로 느슨해, 아무 때나 처리해달라고 요청한다.
- 낮/밤 스케줄링 — 같은 전용 GPU 용량을 낮에는 실시간 트래픽에, 저녁부터 밤까지는 배치 큐 처리로 스케줄에 따라 전환한다.
- 라우터 우선순위 — 라우터는 서로 다른 존·리전에 흩어진 이기종 GPU 사이에서 KV 캐시 지역성을 1순위, 최소 부하를 2순위로 두고 라우팅한다.
- 프리필 비용 — 프리필은 연산 집약적이라 매우 비싸며, 그래서 캐시된 입력 토큰 가격이 신규 토큰보다 훨씬 낮게 책정된다.
- PD 분리 선택권 — 프리필-디코드 분리(disaggregation)를 할지 말지는 모든 유스케이스에 저렴한 선택이 아니므로 고객·플랫폼이 선택하도록 한다.
- KV 캐시 오프로드 — 챗 턴 사이 대기시간 동안 캐시를 완전히 폐기하지 않고 고대역폭 스토리지로 오프로드하며, 사내 기법 외에 LMCache와 Mooncake를 참고한다.
- 성능 레버 — 양자화는 NVFP4로, 그리고 고객 데이터로 비동기 학습한 스펙큘레이터(speculators)를 배포해 출력 처리량을 크게 높인다.
- 벤치마크 성과 — Artificial Analysis 기준 Kimi 2.6/2.7에서 상위권에 올랐고, OpenRouter 실사용 트래픽 기준으로는 Fireworks에 근접한 속도를 보였다.
그가 한 말
입력 시퀀스 길이의 대부분, 회사나 고객에 따라 다르지만 80~90%는 여러 요청에서 동일합니다. 그러니 프리필을 다시 계산할 이유가 없습니다. 프리필은 연산량이 극도로 많고 비싸기 때문에, 캐시를 많이 맞출수록 그만큼 비용을 아낄 수 있습니다.bulk of the input sequence length about 80 to 90% depending on which company it is depending on the customers 80 to 90% of it is the same for various different requests. So there is no point in going in and recomputing the prefill or redoing the prefill for that prefill is supercomputebound very expensive that's why as much as you can hit the cache more you can save7분 27초
멀티테넌트 고객을 위해서는 별도의 배포가 있습니다. 여기서 라우터가 특히 중요한데, 라우터는 KV 캐시를 인지하는 라우팅 결정을 내리는 역할을 하기 때문입니다.For the multi-end customers, there are separate deployments. Router over here specifically uh the the router is very important since um the router is responsible for making KV cache aware routing choices.6분 57초
저희가 일반적으로 취하는 우선순위는 먼저 KV 캐시 지역성이고, 그 다음이 최소 부하로의 폴백입니다.the priority order that we typically take is uh first KV cache locality and then the least loaded fallback.9분 49초
프리필-디코드 분리는 모든 유형의 유스케이스에 저렴한 방식은 아닙니다.prefilled decode disagregation is not uh cheap for every type of use case.8분 18초
이해관계 · 발화자는 CoreWeave의 추론 플랫폼 책임자로, 본인이 설계·운영하는 CoreWeave의 서비스를 설명하는 발표다.
덧붙임 — 여기에 하나 덧붙이면, 캐시 적중률이 곧 마진율이 되는 구조라 라우터의 KV 캐시 지역성 우선순위 설계가 사실상 CoreWeave 가격 경쟁력의 핵심 레버로 보인다. 배치 워크로드를 야간에 같은 GPU로 돌리는 스케줄링은 유휴 자원 문제를 데이터센터 운영이 아니라 API 설계로 푸는 접근이라 눈여겨볼 만하다.
오늘 밤 해볼 수 있는 한 가지
본인이 쓰는 LLM API의 가격표에서 캐시 입력 토큰과 신규 입력 토큰의 가격 차이를 직접 찾아보고, 반복되는 시스템 프롬프트나 컨텍스트를 캐시 가능한 구조로 바꿔 실제 비용이 얼마나 줄어드는지 계산해본다.