시리즈의 범위
VLA 모델은 네 분야의 연구 결과를 결합한 모델입니다. 텍스트를 토큰 단위로 생성하는 Transformer 언어 모델, 이미지를 토큰열로 바꿔 언어와 함께 처리하는 시각-언어 모델, 언어 지시를 받아 사람의 시연을 따라 하도록 학습한 로봇 정책, 연속적인 행동 값을 생성하는 확산·flow matching 모델입니다.
이 시리즈는 네 분야의 출발점 논문을 한 편씩 다룹니다. VLA 계보의 논문은 대부분 이 논문들의 구조나 학습 방법을 가져와 결합하므로, 먼저 읽어 두면 VLA 논문의 설계 선택을 따라가기 쉽습니다.
VLA와의 연결
- Transformer와 LLM (1–2편) → VLA 모델의 기본 구조. RT-2가 행동을 텍스트 토큰처럼 출력하는 방식은 LLM의 다음 토큰 예측을 그대로 쓴 것입니다.
- 이미지와 언어의 결합 (3–5편) → 영상 입력 처리. OpenVLA와 π0는 LLaVA식 VLM 구조에 행동 출력을 추가한 모델입니다.
- VLA 이전의 로봇 학습 (6–9편) → 과제 설정과 평가 방식. RT-1은 BC-Z의 과제 설정을 이어받고, SayCan의 장기 과제 구성에서 평가됩니다.
- 연속 행동 생성 (10–13편) → 행동 출력 방식. π0의 flow matching 행동 전문가와 action chunking이 이 연구들에서 나왔습니다.
읽는 순서
1편부터 9편까지 읽고 VLA 계보의 RT-1과 RT-2로 넘어가는 순서를 권합니다. 10편부터 13편은 연속 행동을 다루는 VLA 계보 5편 π0 직전에 읽어도 충분합니다.
각 글은 논문 원본 그림을 그대로 싣고, 수치는 원문 값을 그대로 옮깁니다.