특집

긴 컨텍스트 정확도 2.6%→45.4%, RLM은 토큰 대신 변수로 푼다

원본 · It’s Tokens All The Way Down: How RLMs are Different — Kevin Madura, AlixPartners
AI Engineer · Kevin Madura · AlixPartners · 2026-09-09 업로드 · 21분

한국어·English

AlixPartners의 Kevin Madura는 RLM(recursive language model)이 컨텍스트를 토큰 뭉치가 아니라 REPL 속 변수로 다루면서 기존 RAG·툴콜·에이전트 방식을 뒤집는다고 말한다. 3만 토큰에 흩어진 숫자 12개를 더하는 것처럼 모델이 원래 잘 못하던 일도, 코드로 짜서 풀게 하면 답이 달라진다는 것이다.

  • RLM 정의 — RLM은 컨텍스트를 자신이 상징적으로 상호작용할 수 있는 객체로 다루며, 보통 그 환경은 Python 리플이다.
  • 차이점 1: 환경 — 툴콜은 JSON이나 문자열을 다른 프로그램에 보내 해석시키지만, RLM은 심볼릭 환경 안에서 직접 상호작용한다.
  • 차이점 2: 재귀 위임 — RLM은 자기 자신을 포함한 다른 LM에 특정 파라미터로 위임할 수 있어 문제를 재귀적으로 분해한다.
  • 기원 — Alex의 어드바이저 Omar가 DSP 등을 활용해 임의 길이 입력을 요약하고 목차를 뽑아내는 개념을 처음 제시한 트윗이 RLM의 초기 발상이다.
  • 벤치마크 — BrowseComp 등에서 RLM(파란 선)은 GPT-5에 BM25 툴콜을 붙인 방식(보라색)보다 더 저렴하면서도 성능이 좋다.
  • 컨텍스트 로트 — 컨텍스트 창이 일정 수준 이상 차면 성능이 떨어지는 '덤 존' 문제를, RLM은 서브 모델에 하위 작업을 위임해 메인 컨텍스트가 빨리 차지 않게 해 우회한다.
  • RAG·에이전트와 비교 — RAG는 컨텍스트 창을 채우기만 하고, 에이전트·툴콜·코덱은 로직·실행·결과가 느슨하게 결합돼 같은 문제에 부딪힌다.
  • Anthropic Workflows — Anthropic이 최근 공개한 workflows는 중간 결과를 스크립트 변수로 저장하며, CIS 콘퍼런스에서 RLM 논문이 이 구현의 핵심 동인으로 언급됐다.
  • 성능 도약 — 롱 체인오브소트 벤치마크에서 정확도가 2.6%에서 45.4%로 뛰었고, 코드로 깔끔히 환원되는 논리 퍼즐·체스·화학 문제에서 가장 크게 개선됐다.
  • 코호트 분석 사례 — 세 개의 데이터프레임을 입력하면 RLM이 자신의 리플에서 주피터 노트북처럼 직접 데이터프레임과 상호작용하며 스스로 언제 멈추고 최종 답을 제출할지 결정한다.
  • 오픈소스 구현체 — DSPI, AX, PredictRLM, FastRLM 등이 RLM을 서로 다른 수준으로 구현하고 있으며, PredictRLM은 스프레드시트·PDF 같은 지식노동에 특화됐다.
  • 인보이스 사례 — 200페이지짜리 인보이스나 계약서도 청킹·임베딩 전략 없이 RLM이 통째로 처리해 하나의 통합 인벤토리를 만든다.
  • 보안 리포트 사례 — OWASP의 취약 웹앱을 대상으로 50만 줄 코드베이스를 훑어 보안 리포트를 생성하는 데 필요한 코드는 몇 줄에 불과했다.

그가 한 말

그래서 이 임의의 예시에서, 3만 토큰에 흩어져 있는 12개의 숫자를 더하는 경우, LLM이 그걸 혼자 힘으로 알아내서 답을 주는 것은 정규식 같은 걸 작성해서 하는 것만큼 잘 되지 않을 때가 많습니다.so in this random example, summing 12 numbers that are buried across 30,000 tokens, the LLM trying to figure all that out by itself and give you the answer isn't always going to work as well as something that you can write reg x4 or something similar.9분 47초
9분 47초 발표 화면
Kevin Madura 발표 화면 · 9분 47초 · AI Engineer
이건 LLM이 실제 콘텐츠와 상호작용하는 방식에 있어 의미 있게 다른 방식입니다.it's it's a meaningfully different way of of the LLM interacting with the uh the actual content itself.6분 37초
6분 37초 발표 화면
Kevin Madura 발표 화면 · 6분 37초 · AI Engineer
그래서 어떻게 의미 있게 다른지 보면, RAG는 물론 그냥 컨텍스트 윈도우를 꾹꾹 채워 넣는 겁니다.So in terms of how it's meaningfully different, rag of course you kind of just stuff the context window.5분 58초
5분 58초 발표 화면
Kevin Madura 발표 화면 · 5분 58초 · AI Engineer
여기서 워크플로우의 중간 결과가 스크립트 변수, 즉 컨텍스트 안의 변수로 존재하는 걸 볼 수 있습니다.You can see here the intermediate results for workflows live in script variables i.e. a variable in the context.7분 15초
기존 방식 2.6% RLM 45.4%
긴 사고 체인 벤치마크 정확도 — Raymond의 롱 체인 오브 소트 벤치마크 성능 테스트 결과, Kevin Madura 발표 인용.

이해관계 · 발화자는 AlixPartners 소속 컨설턴트로, RLM 생태계(DSPI, PredictRLM 등)와 자신이 언급한 프로젝트들에 직접적 이해관계는 명시하지 않았으나 해당 접근법의 지지자로서 발표했다.

덧붙임 — 여기에 하나 덧붙이면, 이 발표가 강조하는 건 결국 '컨텍스트 엔지니어링을 덜 해도 되는 세상'이라는 점이다. 다만 모델이 아직 RLM 방식에 맞춰 사후학습되지 않았다는 발화자의 마지막 언급은, 지금의 성능 도약이 본격적인 시작 단계일 뿐임을 시사한다.

오늘 밤 해볼 수 있는 한 가지
오늘 밤 30분 안에, 표 형태 데이터(스프레드시트나 로그 파일 몇 개)를 Python REPL에 올려두고 LLM에게 직접 코드를 짜서 데이터프레임을 탐색·집계하게 시켜본 뒤, 같은 작업을 프롬프트에 통째로 붙여넣어 처리한 결과와 정확도·비용을 비교해본다.