특집

Vercel, 에이전트 3번 뒤집고 나서야 eval 2배 달성

원본 · How We Solved Agent Building — Andrew Qu, Vercel
AI Engineer · Andrew Qu · Vercel · 2026-09-14 업로드 · 18분

한국어·English

Vercel의 데이터 사이언스 에이전트는 신뢰받는 첫 사용자들에게 형편없다는 평가를 받았다. eval 30%를 통과했다고 자신했던 팀에게는 뼈아픈 반응이었다. 이후 파일 시스템 도구만 남기고 나머지를 걷어내자 eval 점수가 두 배로 뛰었다.

  • 시작 질문 — Andrew Qu는 마케팅, 세일즈, 파이낸스, 리걸에 직무에서 가장 싫은 일이 뭔지 물었고, 가장 설득력 있는 답은 데이터팀에서 나왔다.
  • 데이터팀 문제 — 고객이나 제품에 대한 질문이 들어올 때마다 데이터 사이언티스트가 하던 일을 멈추고 쿼리를 짜야 했다.
  • 버전1 메가프롬프트 — Snowflake 스키마를 통째로 시스템 프롬프트에 붙여넣고 모델이 생성한 SQL을 직접 복사해 실행해봤다.
  • 버전2 체인 에이전트 — D0라는 이름으로 planning, execution, reporting을 맡는 좁게 스코프된 에이전트들을 체인으로 연결했다.
  • 버전3 단일 에이전트 — 결국 하나의 에이전트가 max steps 100으로 자기 상태를 스스로 관리하는 구조로 바꿨다.
  • 신뢰 사용자 반응 — eval 30%를 통과해 잘하고 있다고 믿었지만 첫 신뢰 사용자들에게 넘겼을 때 반응은 형편없다는 것이었다.
  • Claude Code 충격 — Opus 4.5와 Claude Code가 나오자 기존에 손수 만든 에이전트보다 막힘없이 답을 냈고, 팀은 이를 거의 AGI처럼 느꼈다.
  • 진짜 unlock — 비결은 정교한 툴셋이 아니라 list file, read file, run bash라는 최소한의 파일 시스템 툴이었다.
  • eval 2배 — 샌드박스에 시맨틱 레이어를 통째로 넣고 파일 시스템 방식으로 재구축하자 eval 점수가 두 배가 됐다.
  • 블로그 반응 — 이 내용을 정리한 블로그 글이 올라간 그 주 vercel.com 트래픽의 70%를 차지했다.
  • 스킬 축적 — 매일 들어오는 수천 건의 쿼리를 반복 작업으로 증류해 현재 약 100개의 스킬을 쌓아두고 있다.
  • Eve 출시 — 2주 전 공개한 Eve는 Next.js처럼 skills, tools, channels 폴더를 컨벤션대로 작성하면 에이전트가 되는 프레임워크다.
  • 성과 지표 — 현재 Vercel 사내에는 마케팅 리트로부터 계약서 첫 검토, 데이터 쿼리까지 PMF를 낸 에이전트가 약 20개 있다.

그가 한 말

솔직히 말하면 스노우플레이크 스키마 덤프를 받아서 질문과 함께 시스템 프롬프트에 붙여넣었고, SQL이 생성되면 그걸 복사해서 제가 직접 실행했습니다.Honestly, I asked them for a dump of of the snowflake schema. I pasted it into a system prompt with a question and then when it generated SQL I actually copy and pasted that in and just ran it myself.3분 38초
Andrew Qu 발표 화면 · How We Solved Agent Building — Andrew Qu, Vercel 3분 38초
Andrew Qu 발표 화면 · 3분 38초 · AI Engineer
이 실험으로 오늘날의 모델이 그렇게 좋지는 않지만, 주변 맥락을 좀 더 잘 설계하면 될 수도 있겠다는 약간의 확신을 얻었습니다.And I would say this gave us a little bit of confidence that you know models today aren't that good but maybe we can harness engineer or make the context around it a little better3분 57초
Andrew Qu 발표 화면 · How We Solved Agent Building — Andrew Qu, Vercel 3분 57초
Andrew Qu 발표 화면 · 3분 57초 · AI Engineer
몇몇 사람들 손에 쥐어줬는데 즉각적인 반응은 형편없다는 것이었습니다. 우리는 잘하고 있다고 생각했고, eval의 30%를 맞추고 있다고 여겼지만, 실제로 나올 질문들은 예상하지 못했습니다.So, we got to a few people's hands and the immediate response was it was awful. You know, we thought we were cooking. We thought this was, you know, nailing 30% of our evals, but we couldn't have anticipated some of the questions that were being asked.7분 2초
Andrew Qu 발표 화면 · How We Solved Agent Building — Andrew Qu, Vercel 7분 2초
Andrew Qu 발표 화면 · 7분 2초 · AI Engineer
핵심 돌파구는 그냥 파일 시스템이었다는 걸 깨달았습니다. 우리는 파일 목록 조회, 파일 읽기, bash 실행이라는 아주 최소한의 툴 세트만 있었습니다.we realized that the big unlock was that it was just a file system. You know, we we had a very minimal set of tools, list file, read file, run bash7분 57초
Andrew Qu 발표 화면 · How We Solved Agent Building — Andrew Qu, Vercel 7분 57초
Andrew Qu 발표 화면 · 7분 57초 · AI Engineer
단일 메가 에이전트 30% 파일시스템 기반 재구축 60%
D0 에이전트 eval 점수 변화 — Andrew Qu가 발표 중 언급한 D0 에이전트의 eval 점수 변화(30%에서 약 두 배로 상승)

이해관계 · 발화자는 Vercel의 Chief of Software로, 이 글에서 소개한 Eve 프레임워크와 AI SDK, Sandbox 등 Vercel 자사 제품을 홍보하고 있다.

덧붙임 — 여기에 하나 덧붙이면, 이 사례가 흥미로운 건 정교한 멀티에이전트 체인을 다 만들어본 뒤에야 그냥 파일 시스템이 답이었다는 결론에 도달했다는 점이다. 처음부터 Claude Code식 구조를 썼다면 그 시행착오 자체가 없었을 수도 있다.

오늘 밤 해볼 수 있는 한 가지
자신이 만든 에이전트의 툴셋을 열어보고, list file, read file, run bash 세 가지만으로 같은 작업을 처리할 수 있는지 30분간 테스트해보라.