VLA의 정의
시각-언어-행동(Vision-Language-Action, VLA) 모델은 카메라 영상과 자연어 지시를 받아 로봇 행동을 직접 출력하는 모델입니다. 인터넷 규모로 사전학습한 시각-언어 모델(VLM)의 지식을 로봇 제어에 그대로 끌어오는 것이 목적입니다.
VLA가 사용하는 Transformer, 시각-언어 모델, VLA 이전의 로봇 학습, 확산·flow matching 생성 모델은 VLA 선행 연구에서 따로 다룹니다. 이 시리즈는 RT-1 이후의 VLA 논문을 계보 순서대로 다룹니다. 대규모 실로봇 데이터로 Transformer 정책을 학습한 RT-1에서 출발해, 행동을 텍스트 토큰으로 바꿔 VLM에 넣은 RT-2, 여러 로봇의 데이터를 합친 Open X-Embodiment, 누구나 내려받아 쓸 수 있는 OpenVLA, 연속 행동을 flow matching으로 뽑는 π0 계열로 이어집니다.
계보의 분기점
앞선 모델이 남긴 한계가 다음 논문의 과제가 됐습니다.
- 처음 보는 물체와 지시에 약하다 → VLM을 로봇 데이터와 함께 미세조정한 RT-2
- 데이터가 로봇 한 종류에 묶여 있다 → 22종 로봇 데이터를 합친 Open X-Embodiment
- 모델과 가중치가 공개되지 않았다 → 공개 7B 모델 OpenVLA
- 토큰 단위 행동은 느리고 거칠다 → flow matching 행동 전문가를 붙인 π0
- 토큰 방식 자체를 버려야 하나 → 행동 압축으로 토큰 방식을 되살린 FAST
- 실험실 밖에서는 실패한다 → 이종 데이터 공동학습의 π0.5
- 미세조정 비용이 크다 → 병렬 디코딩과 행동 청킹의 OpenVLA-OFT
- 느린 추론과 빠른 제어가 충돌한다 → 이중 시스템 구조의 GR00T N1
- 공간 추론이 약하다 → 체화 추론을 강화한 Gemini Robotics
읽는 순서
Transformer나 VLM이 낯설다면 VLA 선행 연구 1–9편을 먼저 읽고, 이 시리즈 5편 π0 직전에 선행 연구 10–13편(확산 모델·flow matching·action chunking)을 읽는 순서를 권합니다.
이 시리즈 안에서는 1편 RT-1부터 읽습니다. RT-2 이후의 모델은 대부분 RT-1이 정한 문제 설정, 곧 영상과 지시를 받아 이산화한 행동을 내는 구조를 어디서 바꿨는지로 자기 위치를 설명합니다.
각 글은 논문 원본 그림을 그대로 싣고, 수치는 원문 값을 그대로 옮겼습니다.