특집

로봇 전용 AI 대신 범용 LLM이 로봇을 조종한다

원본 · Robot-Use Agents: Why General-Purpose Models May Win in Robotics
Y Combinator · Waddle Labs, RoboCurve 창업자 · Y Combinator Decoded · 2026-09-26 업로드 · 30분

한국어·English

Waddle Labs와 RoboCurve 창업자들은 로봇 전용 모델을 따로 훈련하는 대신, 코딩과 컴퓨터 사용 데이터로 훈련된 범용 모델이 로봇을 더 잘 조종한다고 말한다. 이들은 Astra라는 모델을 이용해 캡 열기, 블록을 그릇에 담기 같은 작업을 로봇팔이 수행하는 데모로 최근 화제가 됐고, MIT 교수 Philip Isola의 "로봇 사용 에이전트" 에세이에도 인용됐다.

  • RT2의 한계 — RT2는 언어 모델을 미세조정해 영어 대신 엔드이펙터 좌표를 출력하도록 만든 초기 VLA였다
  • 비트의 교훈 — 로봇 전용 데이터로 훈련하는 대신 코딩·웹 데이터를 쏟아부은 범용 LLM이 더 나은 로봇 제어 모델이 된다는 것이 핵심 주장이다
  • 코드 as 정책 — 2022년 말 Google DeepMind의 code-as-policies 논문은 pick up, move to pose 같은 파이썬 함수 목록만 주면 코딩 에이전트가 원샷으로 복잡한 로봇 작업을 조합해냈다
  • Voyager의 교훈 — Voyager는 파이썬 내장 도구로 새 도구를 즉석에서 만들어내는 코딩 에이전트의 전형을 보여줬다
  • ICL의 한계 — 실험 결과 in-context learning은 20~30개, 많아야 40개 예시에서 성능이 포화되고 그 이상 넣어도 개선되지 않는다
  • 컨텍스트 길이 한계 — 모델이 10만 토큰으로 훈련됐다면 실제 유효 컨텍스트는 그 절반 수준이며 이를 넘기면 오히려 성능이 떨어진다
  • 하네스의 역할 — Watdle Harness는 반복 작업엔 Astra를 매번 호출하는 대신 컴파일된 스킬을 호출해 속도와 예외 처리를 개선한다
  • 지연시간 개선 속도 — 프런티어급 LLM의 지연시간은 한 달에 약 2배씩 개선되고 있어 연말까지 실시간 제어가 가능할 수 있다
  • 플라톤적 표현 가설 — 매우 강력한 언어 모델과 매우 강력한 로봇 모델은 결국 유사한 세계 표현으로 수렴한다는 가설이 두 회사의 세계관 중심에 있다
  • 컴퓨터 사용 데이터의 역할 — Blender에서 CAD 객체를 돌리는 식의 컴퓨터 사용 데이터가 로봇 제어에 필요한 공간 추론 능력을 길러준다
  • 범용 로봇 2년 전망 — 프런티어 랩과 로봇 기업들 사이에는 2년 내 또는 그보다 빨리 자연어 지시만으로 유능한 10대 수준의 손 작업을 해내는 범용 로봇이 나올 것이라는 공감대가 있다
  • 스킬 압축 필요성 — Dream Coder처럼 수면 단계에서 스킬 라이브러리를 더 압축된 표현으로 리팩터링하는 방식이 필요할 것이라는 전망이 나왔다

그가 한 말

결국 비터 레슨에 관한 이야기라고 생각해요. 에이전트나 AI 모델에 더 많은 자율성을 주고 족쇄를 풀어주고 더 많은 자원을 주면, 우리가 파인튜닝으로 하려던 일들을 실제로 많이 해낼 수 있습니다.I feel like at the end of the day, it's a lot about the bit of less, right? If you give the agent or if you give the AI model more autonomy and you if you unshackle it a bit more and give it more resources, it can actually do a lot of things that we fine-tuned it to do.3분 55초
Waddle Labs, RoboCurve 창업자 발표 화면 · Robot-Use Agents: Why General-Purpose Models May Win in Robo 3분 55초
Waddle Labs, RoboCurve 창업자 발표 화면 · 3분 55초 · Y Combinator
지금 이 모델들이 좋아진 한 가지는, 코드를 훨씬 더 잘 쓴다는 겁니다. 그래서 이제 복잡한 정책을 코드로 작성할 수 있어요.one one kind of data is now these models can uh well, I mean they they write code much better. So, now they can uh write complex policies as code.6분 3초
Waddle Labs, RoboCurve 창업자 발표 화면 · Robot-Use Agents: Why General-Purpose Models May Win in Robo 6분 3초
Waddle Labs, RoboCurve 창업자 발표 화면 · 6분 3초 · Y Combinator
RT2 이후로 모델들이 훨씬 나아진 몇 가지가 있습니다.There's a few things that models have got much better at since RT2.5분 52초
Waddle Labs, RoboCurve 창업자 발표 화면 · Robot-Use Agents: Why General-Purpose Models May Win in Robo 5분 52초
Waddle Labs, RoboCurve 창업자 발표 화면 · 5분 52초 · Y Combinator
저희가 발견한 건, 안정화된 LLM들의 지연 시간이 한 달에 약 2배씩 개선되고 있다는 겁니다.So, one thing that we saw is that for stable class LLMs, their latency is improving by around 2x per month.17분 24초
Waddle Labs, RoboCurve 창업자 발표 화면 · Robot-Use Agents: Why General-Purpose Models May Win in Robo 17분 24초
Waddle Labs, RoboCurve 창업자 발표 화면 · 17분 24초 · Y Combinator

이해관계 · 발화자들은 로봇 제어 LLM 하네스를 만드는 Waddle Labs와 물리적 AI 평가 서비스를 파는 RoboCurve의 창업자다.

덧붙임 — 여기에 하나 덧붙이면, 이 논리의 바탕에는 "컴퓨터 사용 인터페이스를 애초에 물리 세계를 흉내 내 설계했기 때문에 그 데이터가 다시 물리 세계 제어에 쓰인다"는 역설적 순환이 있다. 로봇 전용 데이터 수집 경쟁보다 범용 모델의 데이터 다양성 확보 경쟁이 로보틱스의 승부처가 될 수 있다는 뜻이다.

오늘 밤 해볼 수 있는 한 가지
Philip Isola의 "로봇 사용 에이전트" 에세이와 code-as-policies 원문(2022)을 찾아 읽고, 자신이 다루는 에이전트 작업 중 하나를 "액션 직접 출력" 대신 "파이썬 함수 목록 제공 후 코드 작성"으로 바꿔보면 결과가 어떻게 달라지는지 비교해본다.