로봇 전용 AI 대신 범용 LLM이 로봇을 조종한다
Waddle Labs와 RoboCurve 창업자들은 로봇 전용 모델을 따로 훈련하는 대신, 코딩과 컴퓨터 사용 데이터로 훈련된 범용 모델이 로봇을 더 잘 조종한다고 말한다. 이들은 Astra라는 모델을 이용해 캡 열기, 블록을 그릇에 담기 같은 작업을 로봇팔이 수행하는 데모로 최근 화제가 됐고, MIT 교수 Philip Isola의 "로봇 사용 에이전트" 에세이에도 인용됐다.
- RT2의 한계 — RT2는 언어 모델을 미세조정해 영어 대신 엔드이펙터 좌표를 출력하도록 만든 초기 VLA였다
- 비트의 교훈 — 로봇 전용 데이터로 훈련하는 대신 코딩·웹 데이터를 쏟아부은 범용 LLM이 더 나은 로봇 제어 모델이 된다는 것이 핵심 주장이다
- 코드 as 정책 — 2022년 말 Google DeepMind의 code-as-policies 논문은 pick up, move to pose 같은 파이썬 함수 목록만 주면 코딩 에이전트가 원샷으로 복잡한 로봇 작업을 조합해냈다
- Voyager의 교훈 — Voyager는 파이썬 내장 도구로 새 도구를 즉석에서 만들어내는 코딩 에이전트의 전형을 보여줬다
- ICL의 한계 — 실험 결과 in-context learning은 20~30개, 많아야 40개 예시에서 성능이 포화되고 그 이상 넣어도 개선되지 않는다
- 컨텍스트 길이 한계 — 모델이 10만 토큰으로 훈련됐다면 실제 유효 컨텍스트는 그 절반 수준이며 이를 넘기면 오히려 성능이 떨어진다
- 하네스의 역할 — Watdle Harness는 반복 작업엔 Astra를 매번 호출하는 대신 컴파일된 스킬을 호출해 속도와 예외 처리를 개선한다
- 지연시간 개선 속도 — 프런티어급 LLM의 지연시간은 한 달에 약 2배씩 개선되고 있어 연말까지 실시간 제어가 가능할 수 있다
- 플라톤적 표현 가설 — 매우 강력한 언어 모델과 매우 강력한 로봇 모델은 결국 유사한 세계 표현으로 수렴한다는 가설이 두 회사의 세계관 중심에 있다
- 컴퓨터 사용 데이터의 역할 — Blender에서 CAD 객체를 돌리는 식의 컴퓨터 사용 데이터가 로봇 제어에 필요한 공간 추론 능력을 길러준다
- 범용 로봇 2년 전망 — 프런티어 랩과 로봇 기업들 사이에는 2년 내 또는 그보다 빨리 자연어 지시만으로 유능한 10대 수준의 손 작업을 해내는 범용 로봇이 나올 것이라는 공감대가 있다
- 스킬 압축 필요성 — Dream Coder처럼 수면 단계에서 스킬 라이브러리를 더 압축된 표현으로 리팩터링하는 방식이 필요할 것이라는 전망이 나왔다
그가 한 말
결국 비터 레슨에 관한 이야기라고 생각해요. 에이전트나 AI 모델에 더 많은 자율성을 주고 족쇄를 풀어주고 더 많은 자원을 주면, 우리가 파인튜닝으로 하려던 일들을 실제로 많이 해낼 수 있습니다.I feel like at the end of the day, it's a lot about the bit of less, right? If you give the agent or if you give the AI model more autonomy and you if you unshackle it a bit more and give it more resources, it can actually do a lot of things that we fine-tuned it to do.3분 55초

지금 이 모델들이 좋아진 한 가지는, 코드를 훨씬 더 잘 쓴다는 겁니다. 그래서 이제 복잡한 정책을 코드로 작성할 수 있어요.one one kind of data is now these models can uh well, I mean they they write code much better. So, now they can uh write complex policies as code.6분 3초

RT2 이후로 모델들이 훨씬 나아진 몇 가지가 있습니다.There's a few things that models have got much better at since RT2.5분 52초

저희가 발견한 건, 안정화된 LLM들의 지연 시간이 한 달에 약 2배씩 개선되고 있다는 겁니다.So, one thing that we saw is that for stable class LLMs, their latency is improving by around 2x per month.17분 24초

이해관계 · 발화자들은 로봇 제어 LLM 하네스를 만드는 Waddle Labs와 물리적 AI 평가 서비스를 파는 RoboCurve의 창업자다.
덧붙임 — 여기에 하나 덧붙이면, 이 논리의 바탕에는 "컴퓨터 사용 인터페이스를 애초에 물리 세계를 흉내 내 설계했기 때문에 그 데이터가 다시 물리 세계 제어에 쓰인다"는 역설적 순환이 있다. 로봇 전용 데이터 수집 경쟁보다 범용 모델의 데이터 다양성 확보 경쟁이 로보틱스의 승부처가 될 수 있다는 뜻이다.
오늘 밤 해볼 수 있는 한 가지
Philip Isola의 "로봇 사용 에이전트" 에세이와 code-as-policies 원문(2022)을 찾아 읽고, 자신이 다루는 에이전트 작업 중 하나를 "액션 직접 출력" 대신 "파이썬 함수 목록 제공 후 코드 작성"으로 바꿔보면 결과가 어떻게 달라지는지 비교해본다.