VLA 계보 - 전체 목차2편

논문해석 - RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

들어가며

RT-1 논문해석은 로봇 13대가 17개월 동안 모은 시연을 트랜스포머 하나에 넣으면, 사무실 주방의 수백 가지 지시를 한 정책이 소화할 수 있다는 것을 보였습니다. 대신 그 정책이 아는 세상은 로봇 데이터가 담은 범위를 벗어나지 못했습니다. 처음 보는 물체나 배경, 로봇 데이터에 한 번도 나오지 않은 단어가 들어오면 성능이 급격히 떨어졌습니다.

웹에서 학습한 거대 언어 모델과 시각-언어 모델(Vision-Language Model, VLM)은 반대 상황에 있었습니다. 수십억 장의 이미지와 문장을 보며 "딸기는 과일이다", "테일러 스위프트는 이렇게 생겼다" 같은 지식은 넘치게 갖췄지만, 로봇 팔을 몇 센티미터 움직이라는 저수준 명령은 낼 줄 몰랐습니다.

RT-2는 두 세계를 모델 하나로 합칩니다. 로봇 행동을 숫자 문자열로 바꿔 VLM이 대답하듯 출력하게 만들고, 웹 데이터와 로봇 데이터를 한 배치에 섞어 함께 미세조정합니다. 새 파라미터는 하나도 추가하지 않습니다. 논문은 이런 모델 부류에 시각-언어-행동 모델(Vision-Language-Action, VLA) 이라는 이름을 붙였고, 이후 계보 전체가 이 이름을 씁니다.

📄 RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control — Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar 외 (저자 알파벳순) / Google DeepMind, CoRL 2023

프로젝트 페이지는 robotics-transformer2.github.io이고, arxiv 식별자는 2307.15818입니다.

초록 요약

인터넷 규모로 학습한 시각-언어 모델을 로봇의 종단간(end-to-end) 제어에 그대로 넣으면 일반화가 좋아지고 의미 추론 능력까지 따라오는지를 묻는 논문입니다. 방법은 단순합니다. 자연어 대답과 로봇 행동을 같은 형식에 담기 위해 행동을 텍스트 토큰으로 표현하고, 그 토큰을 자연어 토큰과 똑같이 학습 데이터에 넣습니다. 그런 다음 최신 VLM을 로봇 궤적 데이터와 시각 질의응답(Visual Question Answering, VQA) 같은 웹 과제에 공동 미세조정(co-fine-tuning) 합니다.

약 6천 번의 실로봇 평가에서 이렇게 만든 정책은 처음 보는 물체에 훨씬 잘 일반화했습니다. 로봇 데이터에 없던 명령, 이를테면 물건을 특정 숫자나 아이콘 위에 놓으라는 지시도 알아듣고, 가장 작은 물건이나 다른 물건에 가장 가까운 물건을 집는 초보적인 추론도 해냈습니다. 사고 사슬(chain-of-thought) 추론을 덧붙이면 즉석 망치로 쓸 물건(돌)이나 피곤한 사람에게 맞는 음료(에너지 드링크)를 고르는 여러 단계의 의미 추론까지 가능해졌습니다.

그림 1 — RT-2 개요

그림 1 — 로봇 행동을 또 하나의 언어로 보고 텍스트 토큰으로 바꿔 웹 데이터와 함께 학습합니다.

추론할 때는 모델이 낸 텍스트 토큰을 다시 로봇 행동으로 풀어 폐루프(closed-loop) 제어를 돌립니다. VLM의 백본(backbone)과 사전학습 결과를 정책 학습에 그대로 쓰기 때문에, VLM이 가진 일반화와 의미 이해, 추론 능력 일부가 로봇 제어로 넘어옵니다.


1. 문제 — 웹 지식과 저수준 제어의 단절

로봇이 웹 모델만큼의 상식을 갖추려면 로봇 상호작용 데이터를 수백만 건 모으는 방법이 있습니다. 하지만 가장 강력한 VLM은 웹에서 수십억 개의 토큰과 이미지를 보고 학습했고, 로봇 데이터가 가까운 시일 안에 그 규모를 따라잡기는 어렵습니다.

그렇다고 VLM을 로봇에 바로 쓰기도 어렵습니다. VLM은 의미와 라벨, 텍스트 프롬프트를 다루는데, 로봇에 필요한 것은 말단장치(end-effector)의 직교좌표 명령 같은 저수준 행동이기 때문입니다. 그래서 기존 연구는 대부분 VLM과 언어 모델을 상위 계획에만 썼습니다. 명령을 해석해 "집기", "놓기" 같은 기본 동작으로 쪼개는 상태 기계 역할입니다. 실제로 팔을 움직이는 하위 제어기는 따로 있었고, 그 제어기는 웹 모델의 지식을 학습 과정에서 전혀 받지 못했습니다.

사전학습을 로봇에 넣는 기존 방식 비교

방식대표 연구사전학습이 들어가는 자리한계
시각 표현 사전학습R3M, VC-1카메라 영상 부호기 초기화언어·의미 지식은 들어오지 않음
언어 모델을 지시 부호기로BC-Z, RT-1지시문 임베딩이미지와 언어의 결합 지식이 없음
언어·시각-언어 모델을 상위 계획기로SayCan, PaLM-E과제 분해하위 제어기는 웹 지식을 못 받음
VLM을 인식 모듈로CLIPort, MOO물체 위치 지정 등2D 행동 공간 제한, 정책 구조에 강한 가정
새 구조를 처음부터 설계Gato없음 (새로 학습)이미 투입된 VLM 사전학습 비용을 재활용하지 못함
RT-2모델 전체 가중치새 파라미터 없이 언어와 행동이 가중치를 완전히 공유

RT-2는 거대 사전학습 VLM을 저수준 로봇 제어에 직접 통합하려 합니다. 행동 전용 층을 따로 붙이지 않고, 보정된 카메라나 2D 행동 공간 같은 제약도 두지 않으며, 언어를 생성하는 VLM의 출력 공간 하나에 행동까지 담는 설계입니다.


2. 전체 구조 — 이미지와 지시에서 행동 문자열까지

세부로 들어가기 전에 처리 흐름을 한 번에 봅니다.

모델 구조는 기존 VLM과 똑같습니다. 달라진 것은 데이터 형식과 학습 레시피, 그리고 로봇 과제일 때 출력 어휘를 제한하는 규칙뿐입니다. 아래에서 차례로 뜯어봅니다.


3. 백본으로 쓴 시각-언어 모델 두 종

RT-2가 올라탄 VLM은 이미지 한 장 이상을 받아 토큰 시퀀스를 내는 모델입니다. 원래 그 토큰은 자연어 문장이고, 이미지 구성을 설명하거나 개별 물체와 물체 사이 관계를 묻는 질문에 답합니다. 이렇게 넓은 과제를 소화하려면 모델도 크고 데이터도 웹 규모여야 합니다.

논문은 공개된 두 VLM을 VLA로 바꿨고, 각각 RT-2-PaLI-X, RT-2-PaLM-E라고 부릅니다.

항목RT-2-PaLI-XRT-2-PaLM-E
크기5B, 55B12B
시각 부호기ViT-22BViT-4B
언어 백본32B · 50층 부호기-복호기(encoder-decoder), UL2 유사복호기 전용(decoder-only) 언어 모델
입력 처리이미지 토큰을 투영층에 통과시켜 텍스트와 함께 처리이미지·센서 등 연속 입력을 언어 토큰 공간으로 투영
원래 사전학습 성격주로 시각 중심수학 계산 등 언어 비중이 큰 혼합
행동 토큰 할당1000 이하 정수에 고유 토큰이 있어 그대로 사용가장 드물게 쓰는 토큰 256개를 덮어씀

크기 제거 실험은 RT-2-PaLI-X로만 합니다. PaLM-E는 조합 가능한 PaLM과 ViT 크기가 정해져 있어 크기를 자유롭게 바꾸기 어렵기 때문입니다. 시뮬레이션 벤치마크인 Language-Table에는 더 작은 PaLI-3B(ViT-G/14 2B + UL2-3B)를 씁니다.

그림 2 — RT-2가 보인 능력 예시

그림 2 — 추론, 기호 이해, 사람 인식이 필요한 실제 상황에서 RT-2가 일반화하는 장면입니다.


4. 행동의 텍스트 토큰화

VLM이 로봇을 조종하려면 행동을 출력하도록 학습해야 합니다. RT-2는 가장 직접적인 길을 택합니다. 행동을 모델 출력의 토큰으로 표현하고, 언어 토큰과 똑같이 취급합니다.

행동 공간과 이산화

행동 부호화는 RT-1이 제안한 이산화를 그대로 따릅니다.

차원내용표현
종료에피소드 종료 명령 (정책이 성공을 알릴 때 발생)이산값
위치 변위 ×3말단장치 x, y, z 이동량256구간 균등 이산화
회전 변위 ×3말단장치 회전 변화량256구간 균등 이산화
집게집게 벌림 정도256구간 균등 이산화

연속 차원 7개는 각각 256개 구간으로 균등하게 나뉩니다. 그러면 로봇 행동 하나가 구간 번호 정수 8개로 표현됩니다. 학습 목표는 이 정수를 공백으로 이어 붙인 문자열 하나입니다.

terminate  Δpos_x  Δpos_y  Δpos_z  Δrot_x  Δrot_y  Δrot_z  gripper_extension

실제 문자열은 "1 128 124 136 121 158 111 255" 같은 형태입니다. 논문 3.2절의 예시 "1 128 91 241 5 101 127" 은 정수가 7개뿐이라 한 자리가 빠져 있습니다. 여기 실은 8개짜리는 논문 4.4절 사고 사슬 예시의 행동 부분입니다.

토큰 할당 방식

정수를 VLM의 기존 어휘에 연결하려면 행동 토큰으로 쓸 토큰 256개를 확보해야 합니다. 어떤 토큰을 고를지는 VLM마다 토큰화 방식이 달라서 모델별로 정합니다. PaLI-X는 1000까지의 정수마다 고유 토큰이 있으므로 구간 번호를 해당 정수 토큰에 그대로 붙입니다. PaLM-E는 숫자를 그렇게 편리하게 표현하지 않으므로, 가장 적게 쓰이는 토큰 256개를 덮어써서 행동 어휘로 씁니다.

기존 토큰의 의미를 행동으로 덮어쓰는 학습은 기호 조정(symbol tuning) 의 한 형태입니다. VLM에서 이미 잘 작동한다고 알려진 방식입니다.

입력 형식과 출력 제약

로봇 데이터는 표준 VQA 형식으로 바꿉니다. 입력은 로봇 카메라 영상과 "Q: what action should the robot take to [task instruction]? A:" 형태의 질문이고, 정답은 행동을 나타내는 숫자 문자열(PaLM-E라면 드문 토큰 문자열)입니다.

일반 VLM과 달리 RT-2는 실로봇에서 실행 가능한 유효한 행동 토큰만 내야 합니다. 그래서 로봇 행동 과제로 프롬프트가 들어오면 복호화할 때 유효한 행동 토큰 안에서만 표본을 뽑습니다. 일반 시각-언어 과제에서는 자연어 토큰 전체를 그대로 쓸 수 있습니다.


5. 공동 미세조정

학습 레시피에서 로봇 성능을 끌어올린 핵심은 로봇 데이터만으로 미세조정하지 않고 원래의 웹 데이터와 함께 미세조정한 것입니다. 로봇 행동만 보는 대신 웹 데이터의 추상적인 시각 개념까지 계속 보기 때문에 정책이 더 잘 일반화합니다. 저자들은 원래 데이터를 곁에 두면 VLM 학습 때 익힌 개념을 잊지 않는다고 해석합니다.

데이터 구성

웹 데이터는 PaLI와 PaLM-E 논문의 혼합을 그대로 가져왔습니다. 대부분은 WebLI로, 109개 언어에 걸친 약 10B개의 이미지-텍스트 쌍을 교차 모달 유사도 상위 10%로 걸러 1B개 학습 예시로 만든 데이터입니다. 캡션과 VQA 데이터셋도 여럿 들어갑니다. RT-2-PaLI-X를 공동 미세조정할 때는 Episodic WebLI를 쓰지 않았습니다.

로봇 데이터는 RT-1의 데이터셋입니다. 이동형 조작 로봇으로 모은 시연이고, 각 시연에는 "집기", "물체 근처로 옮기기", "세워 놓기", "넘어뜨리기", "서랍 열기", "서랍 닫기", "용기에 넣기", "용기에서 꺼내 조리대에 놓기" 같은 기술 가운데 하나에 해당하는 자연어 지시가 붙어 있습니다. 지시는 기술을 나타내는 동사("pick", "open", "place into")와 조작 대상 명사("7up can", "drawer", "napkin")로 이루어집니다.

배치마다 로봇 데이터의 표본 가중치를 높여 비율을 맞춥니다.

모델학습 혼합에서 로봇 데이터 비율
RT-2-PaLI-X약 50%
RT-2-PaLM-E약 66%

학습 설정

두 모델 모두 다음 토큰 예측을 목적 함수로 씁니다. 로봇 학습 관점에서는 이것이 곧 행동 복제(behavior cloning) 손실입니다. 학습률 일정과 정규화 등 나머지 조절값은 원래 PaLI-X와 PaLM-E 논문 설정을 따릅니다.

모델학습률배치 크기경사 걸음 수
RT-2-PaLI-X-55B1e-3204880K
RT-2-PaLI-X-5B1e-32048270K
RT-2-PaLM-E-12B4e-45121M
RT-2-PaLI-3B (Language-Table)1e-3128300K

6. 실시간 추론 — 클라우드에서 돌리는 55B 정책

현대 VLM은 수백억에서 수천억 파라미터에 이릅니다. 이 논문에서 가장 큰 모델은 55B로, 저자들이 아는 한 폐루프 로봇 제어에 직접 쓰인 모델 가운데 한 자릿수 이상 차이로 가장 큽니다. 실시간 제어에 흔히 쓰는 데스크톱급 기계나 로봇 탑재 GPU로는 돌릴 수 없습니다.

그래서 RT-2 모델을 여러 TPU로 구성한 클라우드 서비스에 올리고, 로봇이 네트워크로 질의하는 방식을 씁니다. 같은 서비스 하나로 여러 로봇을 동시에 돌릴 수도 있습니다.

모델제어 주파수
RT-2-PaLI-X-55B1–3 Hz
RT-2-PaLI-X-5B약 5 Hz

7. 실험

실험은 네 가지 질문에 답합니다. 본 과제에서의 성능과 새 물체·배경·환경으로의 일반화, 창발 능력의 존재와 크기, 파라미터 수와 설계 선택에 따른 일반화 변화, 그리고 사고 사슬 추론의 가능성입니다. 평가 궤적은 약 6,000개이고, 따로 적지 않으면 4장의 행동 공간을 쓰는 7자유도 이동형 조작기로 실험합니다.

7.1 기준선

모든 기준선은 RT-2와 완전히 같은 로봇 데이터를 씁니다.

기준선무엇을 대표하나구성
RT-1VLM 사전학습 없는 최신 정책35M 파라미터 트랜스포머
VC-1로봇용 사전학습 시각 표현VC-1 ViT-L 표현 + Universal Sentence Encoder 언어 임베딩 → TokenLearner → RT-1 복호기, VC-1 가중치도 함께 학습
R3M사람 활동 영상(Ego4D)으로 학습한 표현R3M ResNet50 이미지 토큰, 나머지는 VC-1과 같은 절차
MOOVLM을 별도 인식 모듈로 쓰는 방식VLM이 대상 물체를 색칠한 픽셀 하나로 표시 → RT-1 백본 입력

VC-1은 가중치를 고정했을 때보다 풀어서 학습했을 때 결과가 훨씬 좋아 풀어서 학습했습니다. MOO는 VLM이 인식은 도와도 그 표현이 정책 학습에 쓰이지는 않는 경우를 대표합니다.

7.2 전반 성능과 일반화

그림 3 — 일반화 평가 시나리오 예시

그림 3 — 처음 보는 물체·배경·환경을 쉬운 경우와 어려운 경우로 나눈 평가 장면입니다.

본 과제(seen tasks)는 RT-1과 같은 지시 묶음으로 200개가 넘습니다. 물체 집기 36개, 넘어뜨리기 35개, 세워 놓기 35개, 옮기기 48개, 서랍 열고 닫기 18개, 서랍에서 꺼내거나 넣기 36개입니다. "분포 안" 평가라고 해도 물체 배치, 시간대, 로봇 위치는 계속 바뀌므로 현실적인 변동에 대한 일반화가 필요합니다.

일반화 평가는 처음 보는 물체, 배경, 환경으로 나누고 각각 쉬운 경우와 어려운 경우를 둡니다. 어려운 물체는 잡기 까다롭거나 독특한 장난감 같은 것이고, 어려운 배경은 더 다양한 배경에 새 물체까지 섞은 경우입니다. 환경은 부엌 싱크대가 쉬운 쪽, 모니터와 주변기기가 놓인 사무실 책상이 어려운 쪽입니다. 주로 집어-놓기 기술을 다루는 280개 넘는 과제로 구성됩니다. 각 지시는 평가 묶음 크기에 따라 1~5회 실행했습니다.

그림 4 — 전반 성능 비교

그림 4 — 본 과제와 세 가지 일반화 축에서 RT-2 두 모델과 기준선의 성공률입니다.

모델본 과제물체 쉬움물체 어려움배경 쉬움배경 어려움환경 쉬움환경 어려움미지 평균
R3M4532141390212
VC-16334101330010
RT-1923143719261432
MOO755848384119335
RT-2-PaLI-X-55B9170629648633562
RT-2-PaLM-E-12B9384767571363362

단위는 성공률(%)입니다.

본 과제에서는 RT-2와 RT-1이 비슷하고 나머지 기준선은 더 낮습니다. 차이는 일반화 평가에서 벌어집니다. RT-2 두 모델의 평균은 비슷하며, 다음 순위인 RT-1과 MOO보다 2배, 나머지 기준선보다 6배 높습니다. VLA의 강점이 웹 사전학습에서 넘어온 시각·의미 개념에 있다는 해석입니다.

두 RT-2의 성격은 조금 다릅니다. PaLM-E 쪽은 어려운 일반화에서 더 낫고 쉬운 경우에서는 뒤져, 결과적으로 평균이 같아졌습니다. 참고로 PaLM-E-12B의 원래 사전학습 혼합에는 상위 VQA 계획 과제용 로봇 이미지가 들어 있어 일반화 장면과 비슷할 수 있습니다. 다만 그 예시 어디에도 이 실험에서 평가하는 저수준 행동은 없습니다.

7.3 공개 벤치마크 — Language-Table

공개 기준선과 환경으로도 비교하기 위해 Language-Table 시뮬레이션을 씁니다. 더 작은 PaLI 3B를 이 도메인의 VQA를 포함한 여러 예측 과제에 공동 미세조정합니다.

  • 두 연속 프레임과 지시로 행동 예측
  • 프레임으로 지시 예측
  • 프레임으로 로봇 팔 위치 예측
  • 두 프레임 사이 시간 걸음 수 예측
  • 프레임과 지시로 과제 성공 여부 예측

행동은 "X Y" 형식의 텍스트로 부호화합니다. X와 Y는 {-10, -9, …, +9, +10} 범위의 정수이고, 말단장치의 2D 직교좌표 델타 목표점을 뜻합니다. 모델이 작아 다른 기준선과 비슷한 5 Hz로 추론합니다.

모델Language-Table 성공률
BC-Zero72 ± 3
RT-174 ± 13
LAVA77 ± 4
RT-2-PaLI-3B90 ± 10

다른 로봇, 다른 시뮬레이션 환경에서도 VLM 사전학습과 큰 PaLI 모델의 표현력이 도움이 된다는 결과입니다.

그림 7 — Language-Table 실환경 분포 밖 행동

그림 7 — 표와 같은 RT-2-PaLI-3B 저장본이 실제 Language-Table 환경에서 처음 보는 물체를 밀어냅니다.

7.4 창발 능력

로봇 데이터에 없는 능력이 웹 지식 전이만으로 생기는지를 봅니다. 논문은 이를 창발 능력(emergent capabilities) 이라 부릅니다. 새로운 로봇 동작이 생기리라고는 기대하지 않았습니다. 대신 관계와 명사 같은 의미·시각 개념은 로봇 데이터에 없어도 전이되리라고 봤습니다.

정성 평가에서 RT-2-PaLI-X는 장면 맥락 속의 의미 이해와 기초 추론을 보였습니다. "딸기를 맞는 그릇에 넣어"는 딸기와 그릇이 무엇인지 알 뿐 아니라, 딸기가 비슷한 과일끼리 있어야 한다는 맥락까지 읽어야 풀립니다. "테이블에서 떨어지려는 가방을 집어"에서는 가방 두 개 중 위태롭게 놓인 쪽을 가려냈습니다. 이 상호작용은 전부 로봇 데이터에 한 번도 나오지 않은 것입니다.

그림 10 — 창발 능력 평가 장면

그림 10 — (a) 추론 (b) 기호 이해 (c) 사람 인식 세 범주의 평가 장면 일부입니다.

정량 평가는 앞 실험의 상위 기준선인 RT-1, VC-1과 RT-2 두 모델을 비교합니다. 분산을 줄이려고 네 모델을 똑같은 조건에서 차례로 돌리는 A/B 시험 방식을 썼고, 지시마다 5회씩 실행했습니다.

범주세부지시 예시
기호 이해Symbol 1move coke can near X, move coke can near 3
Symbol 2move apple to tree, move apple to matching card
Symbol 3push coke can on top of heart, place coke can above star
추론Mathmove banana near the sum of two plus one
Logosmove cup to google, move cup to a search engine
Nutritionget me a healthy snack, pick up a salty snack
Color / Multilingualmove apple to cup with same color, mueve la manzana al vaso verde
사람 인식Celebritiesmove coke can to taylor swift
CelebAmove coke can to person with glasses

그림 8(a) — 창발 능력 정량 비교

그림 8(a) — 기호 이해·추론·사람 인식에서 RT-2 두 모델과 기준선의 성공률입니다.

모델Symbol 1Symbol 2Symbol 3기호 평균MathLogosNutritionColor/Multi추론 평균CelebritiesCelebA인식 평균전체 평균
VC-1725011082013102071311
RT-127200165032281620202017
RT-2-PaLI-X-55B93609382255248584653535360
RT-2-PaLM-E-12B67202036355644354333534340

단위는 성공률(%)입니다.

모든 범주에서 VLA가 기준선을 크게 앞서고, 가장 좋은 RT-2-PaLI-X는 다음 순위인 RT-1의 3배가 넘는 평균 성공률을 냈습니다. 추가 로봇 시연 없이 얻은 결과입니다.

기호 이해, 추론, 사람 인식 평균은 큰 PaLI-X 모델이 높지만, 수학 추론만큼은 작은 PaLM-E 모델이 25 대 35로 앞섭니다. 저자들은 원인을 사전학습 혼합에서 찾습니다. PaLM-E는 수학 계산에 강한 혼합으로 학습했고, PaLI-X는 주로 시각 중심으로 사전학습했습니다.

7.5 모델 크기와 학습 방식의 효과

크기를 바꾸기 쉬운 RT-2-PaLI-X로 5B와 55B 두 크기, 세 가지 학습 방식을 비교합니다. 일반화가 관심사라 본 과제 평가는 뺐습니다.

  • 처음부터 학습 — VLM 사전학습 가중치를 전혀 쓰지 않음
  • 미세조정 — 사전학습 모델을 로봇 행동 데이터만으로 조정
  • 공동 미세조정 — 원래 VLM 학습 데이터와 로봇 데이터를 함께 사용 (이 논문의 기본 방식)

그림 8(b) — 크기와 학습 방식 제거 실험

그림 8(b) — RT-2-PaLI-X의 파라미터 수와 학습 방식이 일반화에 미치는 영향입니다.

크기학습 방식물체 쉬움물체 어려움배경 쉬움배경 어려움환경 쉬움환경 어려움평균
5B처음부터 학습010460009
5B미세조정24387950362342
5B공동 미세조정60386729442444
55B미세조정60627538571952
55B공동 미세조정70629648633562

단위는 성공률(%)입니다.

55B 공동 미세조정 행의 평균은 논문 표 8에 63으로 인쇄돼 있습니다. 여섯 값의 평균은 62.3이고 같은 모델을 실은 표 6도 62라서, 여기서는 62로 적었습니다. 나머지 행은 여섯 값의 평균을 반올림한 값과 인쇄 값이 모두 일치합니다.

거대 모델을 처음부터 학습하면 5B에서도 평균 9%까지 떨어집니다. 이 결과를 보고 55B를 처음부터 학습하는 평가는 아예 건너뛰었습니다. 다음으로 크기와 무관하게 공동 미세조정이 로봇 데이터만 쓴 미세조정보다 일반화가 좋습니다. 마지막으로 모델이 클수록 일반화가 좋아집니다. 정리하면 순서는 공동 미세조정 > 미세조정 > 처음부터 학습이고, 크기는 그 위에서 한 번 더 성능을 올립니다.

7.6 사고 사슬 추론

언어 모델의 사고 사슬 프롬프팅에서 착안해, RT-2-PaLM-E 변형을 수백 번의 경사 걸음만 추가로 미세조정합니다. 데이터에 "Plan" 단계를 넣어, 로봇이 할 행동의 목적을 자연어로 먼저 적고 그 뒤에 행동 토큰을 내게 합니다.

Instruction: I'm hungry. Plan: pick rxbar chocolate. Action: 1 128 124 136 121 158 111 255.

이 증강은 시각 추론을 담은 VQA 데이터와 행동을 생성하는 조작 데이터를 잇는 다리 역할을 합니다. 자연어로 먼저 계획을 적을 자리가 생기자 RT-2는 더 복잡한 명령에 답했습니다. 언어 모델이나 VLM을 계획기로 쓰는 방식과 저수준 정책을 VLA 모델 하나 안에서 합칠 수 있다는 초기 증거입니다.

그림 12 — 사고 사슬 추론 실행 예시

그림 12 — RT-2-PaLM-E가 계획 문장과 행동을 함께 생성하며 과제를 수행하는 장면입니다.

본문 그림 9도 같은 사고 사슬 실행 장면을 보여 줍니다. 즉석 망치로 쓸 물건으로 돌을 고르거나, 피곤한 사람에게 에너지 드링크를 건네는 예시가 여기에 해당합니다.


8. 실패 사례

그림 11 — Language-Table 실패 사례

그림 11 — 지시는 알아들었지만 처음 보는 물체의 동역학을 다루지 못해 실패하는 장면입니다.

Language-Table 실환경에서 두드러진 실패는 처음 보는 물체 동역학입니다. 모델은 지시를 제대로 이해하고 올바른 물체로 이동하지만, 학습 환경에 있던 작은 블록과 전혀 다른 물체의 움직임을 제어하지 못합니다. 펜은 그냥 테이블 밖으로 굴러가고, 바나나는 로봇이 닿는 지점과 무게중심이 멀리 떨어져 있습니다. 미는 동작의 동역학은 원래 예측과 제어가 어렵기로 유명합니다. 저자들은 다양한 환경과 물체, 특히 다양한 밀기 동역학을 담은 데이터로 규모를 키우면 개선될 수 있다고 봅니다.

실세계 조작에서도 현재 데이터 구성과 학습 방식으로는 다음이 약했습니다.

  • 손잡이처럼 물체의 특정 부위를 잡기
  • 수건으로 닦기, 도구 사용처럼 로봇 데이터에 없던 새 동작
  • 수건 개기 같은 정교하고 정밀한 동작
  • 여러 겹의 간접 추론이 필요한 긴 추론

9. 저자가 밝힌 한계

첫째, 웹 사전학습이 의미·시각 개념의 일반화는 끌어올려도 새로운 동작을 익히게 하지는 않습니다. 물리 기술은 여전히 로봇 데이터에 담긴 기술 분포 안에 갇혀 있고, 모델은 그 기술을 새로운 방식으로 쓰는 법만 배웁니다. 저자들은 기술 축의 데이터 다양성이 부족한 탓으로 보고, 사람 영상 같은 새로운 수집 방식으로 새 기술을 얻는 방향을 제안합니다.

둘째, 계산 비용이 큽니다. 거대 VLA를 실시간으로 돌리는 것은 보였지만, 고주파 제어가 필요한 환경에서는 실시간 추론이 큰 병목이 될 수 있습니다. 양자화(quantization)와 증류(distillation)로 더 빠르게, 더 싼 하드웨어에서 돌리는 연구가 필요합니다.

셋째, RT-2를 만들 수 있는 VLM이 적습니다. 저자들은 LLaVA 같은 공개 모델이 더 늘어나고, 비공개 모델도 미세조정 API를 열기를 기대합니다. VLA를 만드는 데 필요한 조건은 그것으로 충분하기 때문입니다.


10. 정리 — 계보에서의 위치

  • 행동을 텍스트 토큰으로 바꿔, 새 파라미터 없이 기존 VLM 출력 공간 하나에 언어와 행동을 담았습니다.
  • 공동 미세조정으로 웹 개념을 잊지 않은 채 로봇 행동을 익혀, 처음 보는 물체·배경·환경의 평균 성공률을 RT-1의 32%에서 62%로 올렸습니다.
  • 로봇 데이터에 없던 기호·추론·사람 인식 명령을 알아듣는 창발 능력을 정량으로 측정했습니다.
  • 계획과 행동을 한 모델에서 생성하는 사고 사슬 VLA의 가능성을 처음 보였습니다.

RT-1과의 비교

항목RT-1RT-2
파라미터35M5B · 12B · 55B
사전학습영상 부호기와 지시 임베딩 수준VLM 전체 가중치
행동 출력256구간 이산 토큰같은 이산화를 VLM 텍스트 토큰으로
학습 데이터로봇 시연로봇 시연 + 웹 VQA·캡션 (공동 미세조정)
미지 조건 평균 성공률32%62%
추론 위치로봇 쪽여러 TPU의 클라우드 (1–5 Hz)

동시에 RT-2가 남긴 한계 목록이 다음 세대의 과제가 됐습니다. 로봇 데이터가 구글 로봇 한 종의 사무실 주방 시연에 묶여 있다는 점은 여러 기관의 로봇 데이터를 모으는 Open X-Embodiment로 이어집니다. 모델과 가중치가 공개되지 않았고 백본 VLM도 비공개라는 점은 공개 VLA인 OpenVLA가 받습니다. 256구간 이산 토큰과 1–3 Hz 추론으로는 정교하고 빠른 동작이 어렵다는 점은 연속 행동을 흐름 정합(flow matching)으로 내는 π0이 정면으로 다룹니다.