특집

스킬 파일 한계, 1년 새 200개에서 2000개로 10배 늘었다

원본 · How long can your skills be before your agent forgets what you told it? — Laurie Voss, Arize AI
AI Engineer · Laurie Voss · Arize AI · 2026-09-09 업로드 · 22분

한국어·English

1년 전 프런티어 모델은 지시문 200~300개를 넘기면 지시를 놓치기 시작했다. Arize AI의 Laurie Voss가 같은 벤치마크를 최신 모델에 다시 돌려보니 500단어짜리 테스트는 모두 100% 만점을 받아 무용지물이 됐고, 10,000단어까지 늘려서야 겨우 한계를 다시 찾을 수 있었다. 다만 모델이 실패하는 방식은 예전보다 훨씬 알아채기 어려워졌다.

  • 발단 — Dexter Horthy가 다른 발표 중 지나가듯 언급한 '에이전트는 지시문 약 200개까지만 따라간다'는 2025년 수치를 듣고 Voss가 직접 검증에 나섰다.
  • IFScale 벤치마크 — 모델에게 특정 단어를 정확히 포함한 비즈니스 리포트를 쓰게 하고, 실제로 몇 개의 단어가 등장했는지 세어 정확도(accuracy)와 지시 개수(n)만으로 측정하는 단순한 테스트다.
  • 1년 전 재현 — 원 논문의 10개 모델 중 API로 여전히 접근 가능한 GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro 세 개만 재현했더니 500개 규칙에서 30~50%를 놓쳐 원 논문 결과가 그대로 재현됐다.
  • 모델 단종 — 연구를 발표한 지 몇 주 만에 세 모델 중 하나가 이미 단종됐다.
  • 현재 프런티어 테스트 — GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro, Deepseek V4 Pro에 같은 500단어 테스트를 돌리자 전부 즉시 100% 정확도를 기록해 벤치마크가 무력화됐다.
  • 벤치마크 확장 — 500단어에서 1,000, 2,000을 거쳐 10,000단어까지 어휘를 늘린 끝에야 모델들이 무너지는 지점을 다시 찾을 수 있었다.
  • 새 한계선 — 경계선은 이제 대략 지시문 2,000개 근처이며, 최고 모델은 5,000개까지도 버텨 12개월 만에 약 10배 향상됐다.
  • Deepseek의 실패 — Deepseek V4는 750개 규칙부터 조용히 잊기 시작해 2,000개에서는 절반 가까이 지시를 누락하는, 가장 예측 가능한 방식으로 실패한다.
  • Claude의 실패 — Claude Opus 4.7은 무작위로 섞인 단어 조합이 안전 분류기를 건드리면 API 단계에서 아예 요청을 거부해버린다.
  • Gemini의 실패 — Gemini 3.1 Pro는 5,000개까지 매우 견고하지만 그 이후에는 사고 토큰을 지시 확인에 전부 써버려 답변할 여력이 남지 않는다.
  • GPT-5.5의 실패 — GPT-5.5는 99% 정확도로 5,000개까지 최고 성적을 내지만, 리포트를 5,000단어쯤 쓰다가 '이 요청은 말이 안 된다'며 정중히 작성을 멈춰버린다.
  • 비용 — 7개 모델에 걸쳐 2,300회 호출을 돌린 전체 실험 비용은 29달러였다.
  • 과제 전환 — 모델이 규칙을 지키는지는 이제 문제가 아니고, 실제로 지켰는지 확인하는 검증(verification) 문제가 남았으며 이는 프롬프트가 아니라 매번 출력을 점검하는 eval로만 풀린다고 Voss는 말한다.

그가 한 말

에이전트는 약 200개 정도의 지침까지는 따를 수 있고, 그 이후부터 지침을 잊어버리기 시작한다an agent can follow up to about 200 instructions uh before it starts forgetting those instructions0분 53초
그래서 GPT 5.5, Claude Opus 4.7을 돌렸다. 4.8은 이 테스트를 실행한 지 일주일 뒤에 나왔기 때문이다so I ran GPT 5.5, Claude Opus 4.7 because 4.8 came out a week after I ran this test.5분 55초
같은 프롬프트, 같은 단어, 모든 걸 똑같이 줬다. 그런데 곧바로 문제가 생겼는데, 모델들이 다 만점을 받아버린 것이다. 모두 이 테스트에서 즉시 100%를 기록했다I gave them the same prompt, the same words, the same everything. And I immediately ran into a problem, which is that they aced it. They all scored 100% immediately on this test.6분 3초
1년 전에는 대략 200~300개 규칙 근처에서 프런티어 모델들이 무너지기 시작했다. 그건 정말 낮은 한계다a year ago somewhere around 200 to 300 rules frontier models started falling apart. That is a really low ceiling.5분 36초
1년 전 프런티어 모델 250개 현재 일반 모델 2000개 현재 최고 모델(GPT 5000개
지침 준수 한계선 변화 — Laurie Voss가 IFScale 벤치마크를 재현·확장해 발표한 결과
Deepseek V4 750개 Claude Opus 300개 Gemini 3.1 P 5000개 GPT 5.5 5000개
모델별 실패 시작 지점 — Laurie Voss가 발표에서 언급한 각 모델의 지침 붕괴 시작 구간

이해관계 · Laurie Voss는 AI 애플리케이션 평가(eval) 도구를 만드는 Arize AI의 개발자 관계 책임자다.

덧붙임 — 여기에 하나 덧붙이면, 모델이 200개에서 2,000개로 견딜 수 있는 지시문 수가 늘었다고 해서 '더 똑똑해졌다'고 보기는 어렵다. Voss 스스로도 이건 지시문을 정확히 되뱉는 능력의 향상일 뿐, 지시문끼리 충돌할 때 올바르게 추론하는 능력과는 별개라고 선을 긋는다. 압축 문제가 사라진 자리에 검증 문제가 새로 들어왔다는 점이 이 발표의 진짜 결론이다.

오늘 밤 해볼 수 있는 한 가지
지금 쓰고 있는 스킬 파일이나 시스템 프롬프트의 지시문 개수를 세어보고, 사용 중인 모델(Claude, GPT, Gemini 등)에 실제로 전체 지시를 다 따르고 있는지 출력 끝까지 읽어 확인해보라.