VLA 선행 연구 - 전체 목차9편

논문해석 - PaLM-E: An Embodied Multimodal Language Model

들어가며

8편 Gato는 게임·대화·로봇 제어를 Transformer 하나로 처리했습니다. PaLM-E 논문은 자신을 Gato와 비교하면서, 서로 다른 과제를 함께 학습해 각 과제의 성능이 올라가는 효과를 보인 점을 차이로 듭니다. 한편 7편 SayCan은 사전학습된 대형 언어 모델(Large Language Model, LLM)에게 로봇의 다음 기술을 고르게 했는데, 이때 LLM이 받는 입력은 텍스트뿐이었습니다. 물체가 어디에 어떻게 놓여 있는지는 LLM이 직접 보지 못했고, 별도의 가치 함수가 "지금 이 기술을 실행할 수 있는가"를 점수로 알려 주었습니다.

PaLM-E 는 이 입력 문제를 모델 안에서 풉니다. 카메라 이미지, 물체 상태 벡터, 3D 장면 표현 같은 연속적인 관측을 부호기로 벡터열로 바꾼 뒤, 사전학습된 언어 모델 PaLM의 단어 임베딩 공간에 텍스트 토큰과 섞어 넣습니다. 이렇게 만든 입력을 논문은 멀티모달 문장(multi-modal sentence) 이라고 부릅니다. 출력은 여전히 텍스트이고, 로봇 과제에서는 그 텍스트가 하위 정책이 실행할 다음 기술 지시가 됩니다. 이름의 E는 체화(Embodied)를 뜻합니다.

📄 PaLM-E: An Embodied Multimodal Language Model — Danny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch, Aakanksha Chowdhery, Brian Ichter, Ayzaan Wahid, Jonathan Tompson, Quan Vuong, Tianhe Yu, Wenlong Huang, Yevgen Chebotar, Pierre Sermanet, Daniel Duckworth, Sergey Levine, Vincent Vanhoucke, Karol Hausman, Marc Toussaint, Klaus Greff, Andy Zeng, Igor Mordatch, Pete Florence / Robotics at Google·TU Berlin·Google Research, 2023-03-06 arxiv 공개

프로젝트 페이지는 palm-e.github.io이고, 실제 로봇 실행 영상이 올라와 있습니다. arxiv 식별자는 2303.03378이고, 이 글은 v1을 기준으로 합니다.

초록 요약

대형 언어 모델은 복잡한 작업을 해내지만, 로봇처럼 실제 세계에서 추론하려면 단어와 실제 지각을 연결하는 그라운딩(grounding) 이 필요합니다. 저자들은 실제 세계의 연속적인 센서 입력을 언어 모델에 직접 넣는 체화 언어 모델(embodied language model)을 제안합니다. 입력은 시각 정보, 연속적인 상태 추정값, 텍스트 부호화가 섞인 멀티모달 문장입니다. 이 부호화를 사전학습된 LLM과 함께 종단간(end-to-end)으로 학습하고, 순차적인 로봇 조작 계획, 시각 질의응답(Visual Question Answering, VQA), 캡션 생성을 포함한 여러 체화 과제에 적용합니다.

평가 결과 PaLM-E 한 모델이 여러 관측 방식과 여러 로봇 몸체(embodiment)의 체화 추론 과제를 풀고, 인터넷 규모의 언어·시각·시각-언어 데이터를 함께 학습하면 로봇 과제 성능이 올라가는 양의 전이(positive transfer) 를 보입니다. 가장 큰 모델인 PaLM-E-562B는 5620억 파라미터이고, 로봇 과제로 학습했음에도 OK-VQA에서 당시 최고 성능을 내며, 모델이 클수록 언어 능력을 더 많이 유지합니다.

그림 1 — PaLM-E 개요

그림 1 — 이미지·3D 표현·상태(초록·파랑)를 텍스트 토큰(주황) 사이에 넣어 LLM이 처리하는 멀티모달 문장입니다.

그림 왼쪽은 PaLM-E가 다루는 세 부류의 과제입니다. 로봇 계획과 조작 같은 체화 추론, VQA와 캡션 같은 시각-언어 과제, 그리고 일반 언어 과제입니다. 오른쪽은 입력 형식으로, 관측에서 나온 벡터와 텍스트 토큰이 한 줄의 입력열에 섞여 들어갑니다.


1. 문제 — 텍스트만 받는 LLM과 로봇 과제

그라운딩 문제

LLM은 대화, 단계별 추론, 수학 문제 풀이, 코드 작성에서 강한 추론 능력을 보입니다. 하지만 텍스트만으로 학습한 표현이 실제 물리 세계와 어느 정도 관련되더라도, 카메라나 센서가 주는 실제 관측과 연결되지 않으면 컴퓨터 비전과 로봇의 여러 과제를 풀 수 없습니다.

SayCan은 LLM의 출력을 학습된 로봇 정책과 행동 가능성(affordance) 함수에 연결해 결정을 내렸습니다. 그러나 LLM 자체는 텍스트만 입력받았으므로, 장면의 기하학적 배치가 중요한 과제에는 정보가 부족했습니다. 저자들은 또 VQA와 캡션 같은 일반 과제로 학습한 당시 최신 시각-언어 모델(VLM)이 로봇 추론 과제를 바로 풀지 못한다는 것도 실험으로 보입니다.

기존 연구와의 차이

연구 흐름대표 연구PaLM-E와의 차이
일반 시각-언어 모델Flamingo, FrozenFlamingo는 문맥 이미지 하나에 주의를 거는 구조를 추가함. PaLM-E는 이미지를 문장 안 아무 위치에나 여러 장 넣음. Frozen은 고정된 LLM을 통해 시각 부호기만 학습했고, PaLM-E는 이 설계를 다른 입력 방식까지 넓혀 VQAv2에서 Frozen보다 45% 이상 높음
행동을 직접 출력하는 모델BC-Z, RT-1, VIMA, Interactive Language언어는 과제 지정에 쓰임. PaLM-E는 상위 지시를 텍스트로 생성하므로 자기 예측을 다시 조건으로 삼고, 파라미터에 담긴 세계 지식을 직접 씀
범용 다중 몸체 에이전트GatoPaLM-E처럼 여러 몸체를 다루는 범용 에이전트. 논문은 Gato와 달리 PaLM-E가 여러 영역을 함께 학습해 성능이 오르는 전이를 보였다고 설명함
LLM을 이용한 로봇 계획SayCan, Inner Monologue, Code as Policies, LID, (SL)³대부분 LLM을 그대로 쓰고 보조 모델로 그라운딩함. PaLM-E는 보조 모델 없이 계획을 직접 생성하도록 학습함

논문의 기여

기여내용
범용 체화 의사결정 모델멀티모달 LLM 학습에 체화 데이터를 섞어 여러 몸체를 다루는 전이 학습 에이전트를 만듦
체화 추론과 VLM의 양립기존 VLM은 zero-shot으로 체화 추론을 못 풀지만, 체화 추론도 잘하는 범용 VLM을 학습할 수 있음을 보임
새 구조 아이디어신경 장면 표현(neural scene representation) 입력과 개체 지칭(entity referral) 토큰
시각-언어 성능PaLM-E가 일반 시각-언어 과제에서도 경쟁력 있는 성능을 냄
규모와 망각언어 모델이 클수록 멀티모달 미세조정 중 언어 능력의 파국적 망각(catastrophic forgetting)이 줄어듦

2. 모델 구조 — 멀티모달 문장

PaLM-E의 구조는 사전학습된 복호기 전용(decoder-only) LLM에 관측 부호기를 연결한 형태입니다. 관측을 언어 토큰 임베딩과 같은 차원의 벡터열로 바꿔, 언어 토큰과 같은 방식으로 LLM에 넣습니다.

복호기 전용 LLM

복호기 전용 LLM은 토큰열 w1:L=(w1,,wL)w_{1:L}=(w_1,\dots,w_L)의 확률을 앞 토큰들이 주어졌을 때 다음 토큰의 조건부 확률의 곱으로 계산합니다. 2편 GPT-3과 같은 형식입니다.

p(w1:L)=l=1LpLM(wlw1:l1)p(w_{1:L}) = \prod_{l=1}^{L} p_{\mathrm{LM}}(w_l \mid w_{1:l-1})

앞부분 w1:nw_{1:n}을 프롬프트(prefix)로 주면 모델은 구조를 바꾸지 않고 그 뒤를 이어 생성합니다.

p(wn+1:Lw1:n)=l=n+1LpLM(wlw1:l1)p(w_{n+1:L} \mid w_{1:n}) = \prod_{l=n+1}^{L} p_{\mathrm{LM}}(w_l \mid w_{1:l-1})

LLM 내부에서 각 토큰 wiw_i는 임베딩 행렬 γ\gamma를 거쳐 kk차원 벡터 xi=γ(wi)Rkx_i=\gamma(w_i)\in\mathbb{R}^k가 됩니다. PaLM의 어휘 크기는 W=256,000|\mathcal{W}|=256{,}000입니다.

연속 관측의 주입

멀티모달 문장은 이 이산 토큰 단계를 건너뜁니다. 관측 공간 O\mathcal{O}의 관측을 qq개의 kk차원 벡터열로 바꾸는 부호기 ϕ:OXq\phi:\mathcal{O}\rightarrow\mathcal{X}^q를 학습하고, 그 벡터들을 텍스트 토큰 임베딩 사이에 끼워 넣습니다. 입력열의 ii번째 벡터는 텍스트 토큰이면 단어 임베딩에서, 관측 자리이면 부호기에서 나옵니다.

xi={γ(wi)i가 텍스트 토큰일 때ϕj(Oj)ii가 관측 Oj에 해당할 때x_i = \begin{cases} \gamma(w_i) & i\text{가 텍스트 토큰일 때} \\ \phi_j(O_j)_i & i\text{가 관측 } O_j\text{에 해당할 때} \end{cases}

관측 하나는 보통 여러 개의 벡터가 됩니다. 입력 예시는 Q: What happened between <img_1> and <img_2>? 같은 형태이고, <img_i> 자리에 이미지 ii의 임베딩 벡터들이 들어갑니다. 서로 다른 부호기를 문장의 다른 위치에 섞어 쓸 수 있고, 관측 벡터는 LLM의 기존 위치 부호화를 그대로 씁니다. PaLI 같은 다른 VLM이 관측 임베딩을 고정된 위치에 넣는 것과 달리, PaLM-E는 주변 텍스트 사이 원하는 위치에 넣습니다.

로봇 제어 루프 안의 PaLM-E

PaLM-E의 출력은 항상 텍스트입니다. 이 텍스트를 로봇 몸체에 연결하는 방식은 과제에 따라 둘로 나뉩니다.

  • 텍스트만으로 끝나는 과제 — 체화 질의응답이나 장면 설명은 모델 출력이 곧 답입니다.
  • 계획·제어 과제 — PaLM-E가 낸 텍스트가 하위 명령의 조건이 됩니다. 저자들은 작은 기술 어휘를 실행하는 하위 정책이 이미 있다고 가정하고, PaLM-E의 계획은 이 기술들의 순서가 되어야 합니다. 어떤 기술을 쓸 수 있는지는 학습 데이터와 프롬프트로만 판단하고, 출력을 제한하거나 거르는 장치는 따로 두지 않습니다.

하위 정책은 언어 조건 정책이지만 긴 과제나 복잡한 지시는 풀지 못합니다. 그래서 PaLM-E를 제어 루프 안에 넣습니다. PaLM-E가 결정을 내리면 로봇이 하위 정책으로 실행하고, 그 결과로 생긴 새 관측을 보고 PaLM-E가 필요하면 계획을 다시 세웁니다. 논문은 이 구조에서 PaLM-E를 하위 정책의 순서를 정하고 제어하는 상위 정책(high-level policy) 으로 설명합니다. 하위 정책은 선행 연구(Interactive Language, RT-1)의 방법을 수정 없이 씁니다.


3. 입력 부호기 — 상태 벡터, ViT, 물체 중심 표현

부호기 ϕ\phi는 관측 종류마다 다르게 설계합니다. 장면 전체를 하나로 표현하는 부호기와, 장면을 물체 단위 토큰으로 나누는 물체 중심(object-centric) 부호기를 함께 비교합니다.

부호기입력구조특징
상태 추정 벡터물체의 자세·크기·색 등을 담은 벡터 sRSs\in\mathbb{R}^SMLP ϕstate\phi_{\mathrm{state}}가 언어 임베딩 공간으로 변환가장 단순한 입력
ViT-4B이미지이미지 분류로 사전학습된 40억 파라미터 ViT(PaLI에서 사용한 모델) + 학습되는 아핀 변환 ψ\psiViT 임베딩 차원 k~\tilde{k}가 LLM 차원 kk와 달라 ψ\psi로 맞춤
ViT-22B이미지이미지 분류로 사전학습된 220억 파라미터 ViT + ψ\psi큰 PaLM-E 모델에 사용
ViT + TL이미지ViT에 TokenLearner를 붙여 처음부터 종단간 학습사전학습 없음
물체 중심 ViT이미지 + 정답 물체 마스크 MjM_j물체 jj마다 ϕViT(MjI)\phi_{\mathrm{ViT}}(M_j\circ I)로 따로 부호화정답 분할 정보 필요
OSRT여러 시점 이미지 I1:vI_{1:v}물체 슬롯 ojo_j를 MLP ψ\psi로 물체마다 mm개 임베딩으로 변환정답 분할 없이 물체를 비지도로 찾음, 3D 인식

물체 중심 표현을 쓰는 이유

언어는 처음부터 의미 있는 단위(단어)와 관계로 구조화돼 있지만, 이미지는 그렇지 않습니다. ViT가 의미를 담더라도 그 표현은 물체 목록이 아니라 격자 모양의 패치 특징입니다. 기호로 사전학습된 LLM에 연결하기에도, 물리적인 물체와 상호작용해야 하는 체화 추론에도 불리합니다. 그래서 이미지를 먼저 물체별로 나눈 뒤 LLM에 넣는 부호기를 함께 실험합니다.

OSRT

OSRT(Object Scene Representation Transformer) 는 물체에 대한 외부 정보 없이, 구조에 들어간 귀납적 편향으로 물체를 비지도 방식으로 찾습니다. SRT를 바탕으로 해당 환경 데이터에서 새 시점 영상 합성(novel view synthesis) 과제로 학습해 3D 중심의 신경 장면 표현을 얻습니다. 장면 표현은 물체 슬롯 oj=ϕˉOSRT(I1:v)jRkˉo_j=\bar{\phi}_{\mathrm{OSRT}}(I_{1:v})_j\in\mathbb{R}^{\bar{k}}로 이루어지고, 슬롯 하나가 MLP ψ\psi를 거쳐 mm개의 임베딩이 됩니다.

개체 지칭

로봇 계획에서는 PaLM-E가 생성한 계획 안에서 특정 물체를 가리킬 수 있어야 합니다. 대부분의 실험에서는 "빨간 물체"처럼 고유한 속성으로 충분하지만, 같은 색 블록이 여러 개 있는 경우처럼 짧은 말로 구별하기 어려운 장면도 있습니다. OSRT 같은 물체 중심 표현에서는 입력 프롬프트에서 각 물체의 토큰에 이름을 붙입니다.

Object 1 is <obj_1>. … Object j is <obj_j>.

이렇게 하면 PaLM-E가 출력 문장에서 obj_j 형태의 특수 토큰으로 물체를 가리킬 수 있습니다. 이 경우 하위 정책도 같은 토큰을 이해한다고 가정합니다.


4. 학습 방식 — 모델 조합, LLM 고정, 공동 학습

데이터 형식과 손실

학습 데이터의 각 예시 ii는 연속 관측 uiu_iI1:uiiI^i_{1:u_i}, 텍스트 w1:Liiw^i_{1:L_i}, 인덱스 nin_i로 이루어집니다. 복호기 전용 모델이지만 텍스트는 nin_i까지의 프롬프트 부분(멀티모달 문장)과 그 뒤의 예측 목표(텍스트 토큰만)로 나뉩니다. 손실은 프롬프트가 아닌 토큰 wni+1:Liiw^i_{n_i+1:L_i}에 대한 교차 엔트로피 평균입니다. 텍스트 안의 특수 토큰 자리를 부호기의 임베딩 벡터로 바꿔 멀티모달 문장을 만듭니다.

모델 조합

LLM은 사전학습된 PaLM 8B, 62B, 540B를 씁니다.

모델 이름LLM시각 부호기
PaLM-E-12BPaLM 8BViT-4B
PaLM-E-84BPaLM 62BViT-22B
PaLM-E-562BPaLM 540BViT-22B

LLM 고정과 전체 학습

대부분의 구조는 부호기 ϕ~\tilde{\phi}, 투영기 ψ\psi, LLM pLMp_{\mathrm{LM}}의 세 부분입니다. 세 부분을 모두 학습할 수도 있지만, LLM은 적절한 프롬프트만 주어지면 강한 추론 능력을 보이므로 LLM을 고정하고 입력 부호기만 학습하는 방식도 실험합니다. 이때 부호기는 고정된 LLM이 관측을 반영하도록 임베딩을 만들어야 하고, 로봇 몸체가 할 수 있는 동작에 대한 정보도 전달해야 합니다. 논문은 이를 입력에 따라 달라지는 소프트 프롬프트(soft prompt)의 한 형태로 설명합니다. OSRT를 쓸 때는 슬롯 표현까지 고정하고 OSRT와 LLM을 잇는 작은 투영기 ψ\psi만 학습합니다.

전체 혼합 데이터

여러 과제를 함께 학습하는 효과를 보기 위해 "전체 혼합(full mixture)" 데이터를 씁니다. 대부분이 인터넷 규모의 시각-언어 데이터이고, 표본 추출 빈도를 조정해 체화 데이터는 전체의 8.9%만 차지합니다.

전체 혼합의 데이터셋표본 추출 빈도%
WebLI10052.4
VQ²A2513.1
VQG105.2
CC3M2513.1
Object Aware105.2
OKVQA10.5
VQAv210.5
COCO10.5
Wikipedia 텍스트10.5
(로봇) 이동형 조작기, 실제63.1
(로봇) Language-Table, 시뮬레이션·실제84.2
(로봇) TAMP, 시뮬레이션31.6

표 6 — 전체 혼합 데이터의 표본 추출 빈도와 비율입니다.

로봇 데이터 세 줄의 비율을 더하면 3.1 + 4.2 + 1.6 = 8.9%로 본문 값과 같습니다.


5. 실험 개요 — 세 로봇 환경과 전이

첫 번째 실험군은 3절의 여러 입력 표현을 성능·일반화·데이터 효율 측면에서 비교합니다. 두 번째 실험군은 사전학습된 ViT와 PaLM으로 원본 이미지를 받는 주 모델 하나를 대상으로, 여러 데이터셋·과제·로봇 몸체를 섞어 학습한 단일 모델이 모든 과제에서 높은 성능을 내는지 봅니다. 저자들은 과제와 몸체가 달라도 섞어 학습하면 개별 과제 성능이 오르는지, 곧 전이가 일어나는지를 중심으로 결과를 분석합니다.

그림 3 — PaLM-E의 전이 학습 요약

그림 3 — 세 로봇 영역 모두에서 PaLM·ViT 사전학습과 전체 혼합 학습이 해당 영역 데이터만 쓴 경우보다 성능이 높습니다.

비교 대상은 로봇 데이터로 학습하지 않은 당시 최신 VLM인 PaLI와, 정답 행동 가능성 함수(oracle affordance)를 제공한 SayCan입니다.

환경로봇 과제추론에 필요한 정보실제 로봇 폐루프 실행
TAMP (과제·동작 계획)물체 잡기와 쌓기. 가능한 계획의 조합이 많고 실행 불가능한 결정 순서가 많음물체 자세와 세밀한 기하 배치아니오 (시뮬레이션)
Language-Table여러 물체를 탁자 위에서 미는 조작. 물체가 여럿이고 언어 표현이 다양하며 밀기 동역학이 복잡함물체 자세와 세밀한 기하 배치
이동형 조작SayCan과 비슷한 주방 과제. 서랍에서 물건 찾기, 집기, 사람에게 가져가기장면 이해, 실행 가능성, 실패 여부

모든 환경에서 계획 과제와 VQA 과제를 함께 다룹니다. 이동형 조작과 Language-Table에서는 PaLM-E가 제어 루프 안에서 실제로 계획을 실행하고, 외부 방해나 하위 정책 실패가 생기면 계획을 조정해야 합니다.


6. TAMP 환경

과제 구성

TAMP(Task and Motion Planning) 학습 장면에는 크기·색·초기 자세가 다른 정육면체 물체가 3–5개 있습니다. 계획 과제의 데이터는 Driess et al. (2020)의 계획기로 만들고, 하위 정책도 같은 방법으로 얻습니다.

과제종류프롬프트 예시목표 출력 예시
q1VQA — 물체 색 (물체 중심 버전만)개체 지칭 접두어 뒤에 물체 색 질문
q2VQA — 물체와 탁자의 관계Given <img>. Q: Is the red object left, right, or center of the table?A: The red object is in the center of the table.
q3VQA — 물체 사이 관계Given <img>. Q: Is the yellow object below the blue object?A: No, the yellow object is not below the blue object.
q4VQA — 계획 실행 가능성Given <img>. Q: Is it possible to first grasp the blue object, then place it on the yellow object, and then grasp the yellow object?A: No, this is not possible.
p1계획 — 잡기Given <img>. Q: How to grasp the green object?A: First grasp the orange object and place it on the table, then grasp the green object.
p2계획 — 쌓기Given <img>. Q: How to stack the white object on top of the red object?A: First grasp the green object and place it on the table, then grasp the white object and place it on the red object.

물체 중심 버전에서는 모든 프롬프트 앞에 Obj 1 is <obj1>. … Obj j is <objj>. 접두어가 붙습니다.

부록 그림 8 — TAMP 시험 장면 (물체 6개)

부록 그림 8 — TAMP 시험 장면 (물체 4개)

그림 8 — TAMP 시험 장면 두 개입니다. 위는 물체 6개(학습 데이터는 3–5개), 아래는 물체 4개입니다.

전체 데이터로 학습한 입력 표현 비교

부록 표 7은 TAMP 환경 데이터만으로 학습한 결과입니다. 학습 장면은 96,000개이고 다른 데이터는 섞지 않았으며, 사전학습된 LLM은 고정했습니다.

물체 수ϕ\phiLLM 사전학습q1q2q3q4p1p2
3–5SayCan (정답 행동 가능성)----38.733.3
3–5state100.099.398.599.897.295.5
3–5state✓ (고정 해제)100.098.8100.097.697.795.3
3–5state100.098.499.798.597.696.0
3–5state (개체 지칭 없음)100.098.897.598.194.690.3
3–5ViT + TL (물체 중심)99.698.798.496.89.294.5
3–5ViT + TL (전역)-60.790.894.370.769.2
3–5ViT-4B (전역)-98.299.499.096.093.4
3–5ViT-4B 범용-97.1100.098.997.595.2
3–5OSRT99.699.1100.098.898.195.7
6state20.439.271.485.256.534.3
6state100.098.594.089.395.381.4
6state (개체 지칭 없음)77.783.793.691.081.257.1
8state18.427.138.187.524.66.7
8state100.098.395.389.891.389.3
8state (개체 지칭 없음)60.067.194.181.249.349.3
6 + 분포 밖 과제state (8B LLM)-0072.000
6 + 분포 밖 과제state (8B LLM)-49.389.868.528.215.7
6 + 분포 밖 과제state (62B LLM)-48.792.588.140.030.0

표 7 — 입력 표현별 TAMP 성공률(%)입니다. 분포 밖 과제는 학습 때 특수 토큰 obj_j로 가리키던 물체를 색으로 가리킵니다.

학습과 같은 3–5개 물체에서는 입력 표현 대부분의 성능이 비슷합니다. 물체 수를 늘리면 사전학습된 LLM을 쓴 모델, 특히 개체 지칭을 쓴 모델의 성능이 크게 높습니다. 8개 물체의 p2에서 사전학습하지 않은 LLM은 6.7%, 사전학습된 LLM은 89.3%입니다. 분포 밖 과제에서는 62B LLM이 8B보다 일반화가 좋고, 사전학습하지 않은 LLM은 거의 일반화하지 못합니다.

SayCan은 정답 행동 가능성 함수를 받아도 이 환경을 잘 풀지 못합니다. 행동 가능성 함수는 지금 당장 실행 가능한 기술만 제한할 뿐, TAMP의 긴 계획을 세우는 데 필요한 정보는 주지 않기 때문입니다.

표 7에서 ViT + TL (물체 중심)의 p1은 9.2로 인쇄돼 있습니다. 같은 행의 p2 94.5와 이웃한 행의 p1 값이 모두 70 이상인데 이 값만 크게 낮고, 논문은 이 값에 대해 설명하지 않습니다.

데이터 1%에서의 입력 표현 비교

표 1은 같은 3–5개 물체 설정에서 TAMP 데이터의 1%만 쓴 결과입니다. 계획 과제 p1, p2 각각 320개 예시입니다. LLM은 고정했고, 사전학습하지 않은 경우만 예외입니다.

입력 부호기물체 중심LLM 사전학습q1q2q3q4p1p2
State✓ (정답)99.489.890.388.345.046.1
State✓ (정답)100.096.395.193.155.949.7
ViT + TL✓ (정답)34.754.674.691.624.014.7
ViT-4B 단일 로봇-45.978.492.230.632.9
ViT-4B 전체 혼합-70.793.492.174.174.6
OSRT (VQA 없음)----71.975.1
OSRT99.798.2100.093.782.576.2
기준 모델q2q3p1p2
SayCan (정답 행동 가능성)--38.733.3
PaLI (zero-shot)0.00.0--

표 1 — TAMP 데이터가 전체 학습 데이터의 1%일 때 입력 표현별 성공률(%)입니다.

데이터가 적으면 입력 표현 사이 차이가 크게 벌어지고, 특히 계획 과제에서 차이가 납니다.

  • LLM 사전학습 — 상태 입력에서 사전학습된 LLM이 p1 45.0 → 55.9로 높습니다.
  • ViT 계열 — ViT + TL과 ViT-4B는 이 정도 데이터로는 계획 과제를 잘 풀지 못합니다. 그런데 ViT-4B를 다른 로봇 환경과 일반 시각-언어 데이터까지 함께 학습하면(전체 혼합) p1이 30.6에서 74.1, p2가 32.9에서 74.6으로 두 배 넘게 오릅니다. 서로 다른 로봇 몸체와 과제 사이의 전이입니다.
  • OSRT — 대규모 데이터 없이도 p1 82.5, p2 76.2로 가장 높습니다. 3D를 인식하는 물체 표현의 효과입니다.
  • VQA 데이터 제거 — OSRT에서 TAMP VQA 데이터를 빼고 계획 예시 640개만 학습하면 성능이 조금 떨어집니다(p1 82.5 → 71.9, p2 76.2 → 75.1). 같은 환경 안의 VQA 과제에서 계획 과제로도 전이가 일어난다는 뜻입니다.
  • PaLI — 로봇 데이터로 학습하지 않은 PaLI는 전형적인 VQA와 가장 비슷한 q2, q3만 평가했는데 둘 다 0.0입니다.

그림 4 — TAMP 계획 성공률에 대한 학습 방식의 영향

그림 4 — 데이터 1%의 TAMP에서 PaLM-E-12B의 전체 혼합 학습, 사전학습, LLM 고정 여부별 계획 성공률(p1·p2 평균)입니다.

그림 4는 PaLM-E-12B로 세 가지 선택을 비교합니다. 전체 혼합으로 학습하는지, ViT와 PaLM을 사전학습된 것으로 쓰는지, 언어 모델을 고정하는지 미세조정하는지입니다. 전체 혼합에는 평가 과제 데이터가 1%(과제당 320개)만 들어 있는데도 전체 혼합 학습의 효과가 가장 큽니다.


7. Language-Table 환경

과제와 실행 방식

Language-Table은 여러 물체를 탁자 위에서 미는 환경으로, Interactive Language 연구의 실제 탁자 설정과 시뮬레이션 환경을 씁니다. 긴 과제 세 가지를 평가합니다.

과제프롬프트
Task 1Q: There is a block that is closest to {i.e., top right corner}. Push that block to the other block of the same color.
Task 2Q: How to sort the blocks by colors into corners?
Task 3Q: How to push all the blocks that are on the {left/right} side together, without bringing over any of the blocks that are on the {right/left} side?

표 3 — Language-Table 과제 프롬프트입니다.

데이터 수집에서는 긴 과제 지시를 받은 작업자가 4초마다 짧은 명령을 입력합니다. 이 짧은 명령을 Interactive Language 정책이 받아 40스텝(10Hz로 4초) 실행하고, 작업자가 긴 과제가 끝났다고 판단해 'done'을 입력할 때까지 반복합니다. 실제 로봇 수집 절차도 시뮬레이션과 같습니다.

평가에서는 PaLM-E가 현재 이미지와 긴 과제를 받아 텍스트 지시를 내고, 학습된 하위 정책이 그 지시를 4초 동안 실행한 뒤 PaLM-E가 새 지시를 냅니다. 시뮬레이션의 Task 2와 3은 자동 보상으로 성공률을 재고 과제마다 80회 실행합니다. Task 1은 한 단계로 풀리는 과제라 시험 세트의 검증 정확도를 씁니다. 미세조정 버전은 사전학습된 PaLM-E를 9,000 스텝 추가 학습해 만듭니다.

결과

PaLM-E학습 데이터처음부터 학습LLM+ViT 사전학습LLM 고정과제 미세조정Task 1 (10 / 20 / 40)Task 2 (10 / 20 / 40)Task 3 (10 / 20 / 80)
12B단일 로봇n/a20.0 / 30.0 / 50.02.5 / 6.3 / 2.511.3 / 16.9 / 28.3
12B전체 혼합- / - / 20.0- / - / 36.3- / - / 29.4
12B전체 혼합- / - / 80.0- / - / 57.5- / - / 50.0
12B전체 혼합70.0 / 80.0 / 80.031.3 / 58.8 / 58.857.5 / 54.4 / 56.3
84B전체 혼합- / - / 90.0- / - / 53.8- / - / 64.4
zero-shot 기준 모델Task 1Task 2Task 3
SayCan (정답 행동 가능성)0.0--
PaLI0.0--

표 2 — Language-Table 시뮬레이션의 계획 과제 결과(%)입니다. 괄호 안은 과제당 시연 수입니다.

  • 인터넷 규모 데이터와의 공동 학습 — 로봇 계획 성능이 높아지고, 과제당 시연이 10개뿐인 조건에서 차이가 가장 큽니다. Task 1 시연 10개에서 단일 로봇 처음부터 학습은 20.0, 전체 혼합 후 미세조정은 70.0입니다.
  • 모델 크기 — 같은 설정에서 12B를 84B로 키우면 세 과제 중 두 과제(Task 1 80.0 → 90.0, Task 3 50.0 → 64.4)에서 오릅니다. Task 2는 57.5 → 53.8로 낮아집니다.
  • LLM 고정 — LLM을 고정한 12B는 20.0, 36.3, 29.4로 고정하지 않은 모델보다 낮습니다.
  • 기준 모델 — TAMP와 마찬가지로 SayCan과 zero-shot PaLI는 가장 쉬운 Task 1도 풀지 못합니다.

논문 본문은 이 결과 표를 "Tab. 3"으로, 과제 프롬프트 표의 캡션은 "Task prompts for Tab. 3"으로 적었지만, 성공률 표에 붙은 번호는 표 2입니다. 이 글에서는 표에 붙은 번호를 따릅니다.

실제 로봇 실행과 few-shot 일반화

그림 5 — 두 실제 로봇을 지휘하는 PaLM-E

그림 5 — PaLM-E 한 모델이 주방의 이동형 조작 과제와 탁자 조작 로봇의 one-shot·zero-shot 일반화에서 하위 정책을 지휘합니다.

그림 7 — Language-Table 실제 로봇 실행

그림 7 — PaLM-E가 사람의 방해에도 여러 단계의 탁자 조작 과제를 끝까지 이끌고, 새 물체 조합에 zero-shot으로 일반화합니다.

  • 여러 단계 과제와 방해 — 그림 7 (a)에서 PaLM-E는 "sort the blocks by colors into corners" 같은 긴 목표와 관측 이미지를 받아 실제 로봇을 여러 단계로 이끌고, 사람이 블록을 옮기는 방해에도 과제를 계속합니다. 본문 6.3절에 따르면 PaLM-E는 언어 하위 목표를 1 Hz로 내고, Interactive Language 정책은 저수준 로봇 행동을 5 Hz로 냅니다. 선행 연구(Interactive Language)에서는 사람이 하위 목표와 수정을 직접 입력해야 했습니다.
  • one-shot — 그림 5 (b)에서는 "put all the blocks in the center", "remove the blue blocks from the line" 같은 긴 과제 100개를 과제당 학습 예시 하나로 미세조정했습니다.
  • zero-shot — 새 물체 쌍이 등장하는 과제(그림 7 (c))와, 원래 로봇 데이터셋에도 미세조정 데이터에도 없던 장난감 거북이 같은 물체가 등장하는 과제(그림 5 (d))에도 일반화합니다.

실행 주기는 논문 안에서 두 가지로 적혀 있습니다. 실제 로봇 실행을 설명한 6.3절은 PaLM-E 1 Hz, 하위 정책 5 Hz이고, 부록 B.2의 데이터 수집과 시뮬레이션 평가 설명은 하위 정책이 명령 하나를 10Hz로 4초(40스텝) 실행한다고 적습니다. 논문은 두 설정의 차이를 따로 설명하지 않으므로 둘 다 원문 값대로 옮겼습니다.


8. 이동형 조작 환경

이동형 조작 실험은 SayCan의 설정을 대부분 따릅니다. 로봇은 사람의 지시를 받아 이동과 조작 행동의 순서를 계획합니다. 예를 들어 "I spilled my drink, can you bring me something to clean it up?"이라는 지시에는 "1. Find a sponge, 2. Pick up the sponge, 3. Bring it to the user, 4. Put down the sponge."라는 순서를 세워야 합니다. 하위 정책은 RGB 이미지와 자연어 지시를 받아 말단장치 제어 명령을 내는 RT-1입니다. 이 환경에서 체화 추론을 시험하는 사용 사례는 행동 가능성 예측, 실패 감지, 긴 과제 계획입니다.

행동 가능성 예측과 실패 감지

행동 가능성 예측은 하위 정책의 어떤 기술을 현재 환경에서 실행할 수 있는지 판단하는 문제입니다. Given <img>. Q: Is it possible to <skill> here? 형식의 VQA로 만듭니다. 실패 감지는 폐루프 계획에 필요한 기능으로, Given <img>. Q: Was <skill> successful? 형식입니다.

모델학습 데이터처음부터 학습LLM+ViT 사전학습LLM 고정실패 감지 F1행동 가능성 F1
PaLI (zero-shot)0.730.62
CLIP-FT0.65-
CLIP-FT-hindsight0.89-
QT-OPT-0.63
PaLM-E-12B단일 로봇n/a0.540.46
PaLM-E-12B단일 로봇0.910.78
PaLM-E-12B전체 혼합0.910.87
PaLM-E-12B전체 혼합0.770.91

표 4 — 이동형 조작 환경의 실패 감지와 행동 가능성 예측 F1 점수입니다.

  • 행동 가능성 — PaLM-E는 zero-shot PaLI와, QT-OPT로 학습한 가치 함수에 임계값을 거는 방식보다 높습니다.
  • 실패 감지 — PaLM-E는 zero-shot PaLI와, 이 데이터셋으로 미세조정한 CLIP보다 높습니다. 사후 재라벨링(hindsight relabeling) 데이터로 학습한 CLIP 모델 두 개를 쓰는 Xiao et al. (2022)의 방법(0.89)보다도 높습니다. 저자들은 이 방법이 PaLM-E보다 더 많은 정보를 받고, 이 데이터셋의 실패 감지만을 위해 설계됐다고 설명합니다.
  • 사전학습과 혼합 — 단일 로봇 데이터로 처음부터 학습하면 0.54 / 0.46이지만, LLM과 ViT를 사전학습된 것으로 쓰면 0.91 / 0.78이 되고, 전체 혼합으로 학습하면 행동 가능성이 0.87까지 오릅니다.

부록 표 9와 표 10은 같은 결과의 정밀도와 재현율입니다.

실패 감지 모델정밀도재현율F1
PaLI (zero-shot)0.590.980.73
CLIP-FT0.500.950.65
CLIP-FT-hindsight1.00.800.89
PaLM-E-12B 단일 로봇, 처음부터 학습0.520.550.54
PaLM-E-12B 단일 로봇, 사전학습, LLM 고정0.910.920.91
PaLM-E-12B 전체 혼합, 사전학습, LLM 고정0.890.930.91
PaLM-E-12B 전체 혼합, 사전학습, LLM 미세조정0.660.910.77

표 9 — 실패 감지의 정밀도·재현율·F1입니다.

행동 가능성 예측 모델정밀도재현율F1
PaLI (zero-shot)0.570.690.62
QT-OPT0.600.670.63
PaLM-E-12B 단일 로봇, 처음부터 학습0.670.350.46
PaLM-E-12B 단일 로봇, 사전학습, LLM 고정0.900.690.78
PaLM-E-12B 전체 혼합, 사전학습, LLM 고정0.950.800.87
PaLM-E-12B 전체 혼합, 사전학습, LLM 미세조정0.920.880.91

표 10 — 행동 가능성 예측의 정밀도·재현율·F1입니다.

실제 로봇의 긴 과제 계획

마지막으로 PaLM-E가 이동형 조작 과제의 계획을 종단간으로 수행합니다. 프롬프트 형식은 Human: <instruction> Robot: <step history>. I see <img>.입니다. PaLM-E는 지금까지 수행한 단계와 현재 장면 이미지를 조건으로 계획의 다음 단계를 생성하고, 생성된 단계는 SayCan에서 정의한 하위 정책에 대응시킵니다. PaLM-E가 "terminate"를 낼 때까지 이 과정을 자기회귀적으로 반복합니다. 학습에는 SayCan 실행 기록 2912개 시퀀스를 씁니다.

이 과제는 수치 없이 실제 주방에서 정성적으로 평가했습니다. 그림 5 (a)처럼 사람이 방해하는 상황에서도 긴 이동형 조작 과제를 수행합니다.


9. 일반 시각-언어 과제

논문의 초점은 아니지만, OK-VQA, VQA v2, COCO 캡션 결과도 보고합니다.

모델VQAv2 test-devVQAv2 test-stdOK-VQA valCOCO Karpathy test
범용 (한 모델)
PaLM-E-12B76.2-55.5135.0
PaLM-E-562B80.0-66.1138.7
과제별 미세조정 모델
Flamingo82.082.157.8†138.1
PaLI84.384.364.5149.1
PaLM-E-12B77.777.960.1136.0
PaLM-E-66B--62.9-
PaLM-E-84B80.5-63.3138.0
범용 (한 모델), LLM 고정
Tsimpoukelli et al. (2021) (Frozen)48.4---
PaLM-E-12B 고정70.3-51.5128.0

표 5 — 일반 시각-언어 과제 결과입니다. 범용 모델은 모든 평가에 같은 체크포인트를 씁니다. † 는 OK-VQA 32-shot(미세조정 아님)입니다.

  • OK-VQA — 범용 PaLM-E-562B 한 모델이 66.1로, OK-VQA에 따로 미세조정한 모델(PaLI 64.5)보다 높은 당시 최고 보고값입니다.
  • LLM 고정 VQA v2 — 저자들이 아는 한 LLM을 고정한 모델 중 가장 높은 VQA v2 성능입니다(PaLM-E-12B 고정 70.3, Frozen 48.4).

표 5에는 PaLM-E-66B 행이 있지만, 논문은 12B·84B·562B 조합만 정의하고 66B가 어떤 LLM과 ViT의 조합인지는 적지 않았습니다.


10. 일반 언어 과제와 파국적 망각

멀티모달 데이터로 LLM까지 학습하면 원래 언어 능력이 떨어질 수 있습니다. 저자들은 자연어 이해(Natural Language Understanding, NLU)와 자연어 생성(Natural Language Generation, NLG) 벤치마크 21개로 PaLM-E와 원래 PaLM을 비교합니다. LLM을 고정한 PaLM-E는 원래 PaLM과 성능이 같으므로, 표에는 LLM까지 학습한(고정 해제) PaLM-E만 있습니다.

그림 6 — 모델 크기와 언어 능력 망각

그림 6 — 일반 언어 과제에서 모델이 클수록 PaLM-E가 원래 PaLM 대비 잃는 성능이 줄어듭니다.

1-shot 평가PaLM-8BPaLM-E-12B (고정 해제)PaLM-62BPaLM-E-84B (고정 해제)PaLM-540BPaLM-E-562B (고정 해제)범주
TriviaQA (wiki) (EM)48.510.172.731.881.474.6NLG
Natural Questions (EM)10.61.623.17.629.327.2NLG
WebQuestions (EM)12.63.419.87.922.621.8NLG
Lambada57.81.475.526.181.883.3NLG
HellaSwag68.248.479.775.383.683.5NLU
StoryCloze78.768.783.883.986.186.3NLU
Winograd82.471.885.386.487.589.0NLU
Winogrande68.355.376.872.583.783.0NLU
RACE-M57.743.264.157.469.370.3NLU
RACE-H41.633.248.742.352.152.8NLU
PIQA76.168.180.978.283.984.9NLU
ARC-e71.353.478.971.485.086.3NLU
ARC-c42.330.951.846.760.162.6NLU
OpenBookQA47.441.451.251.653.655.8NLU
BoolQ64.761.683.181.688.789.4NLU
Copa82.077.093.091.091.093.0NLU
RTE57.854.971.559.678.775.1NLU
Wic50.650.048.650.263.264.1NLU
WSC81.468.484.975.886.385.6NLU
ReCoRD87.871.291.078.592.892.5NLU
CB41.137.555.473.283.980.3NLU
NLU 평균64.755.072.369.278.278.5
NLG 평균32.44.147.818.453.851.7
NLU 변화 (상대 %)-15.0%-4.3%+0.4%
NLG 변화 (상대 %)-87.3%-61.6%-3.8%

표 8 — 원래 PaLM과 LLM까지 학습한 PaLM-E의 NLU·NLG 전체 결과입니다.

모델이 클수록 언어 능력의 파국적 망각이 크게 줄어듭니다. 가장 작은 PaLM-E-12B는 멀티모달 학습 중 NLG 성능의 87.3%(상대값)를 잃지만, 가장 큰 PaLM-E-562B는 3.8%만 잃습니다. NLU에서는 562B가 오히려 0.4% 높습니다.

562B의 NLG 감소폭은 본문 6.6절에 3.9%, 표 8에 -3.8%로 적혀 있습니다. 표 8의 NLG 과제 네 개 점수로 평균을 다시 계산하면 PaLM-540B 53.775, PaLM-E-562B 51.725이고, 상대 감소는 3.81%입니다. 본문의 3.9%는 반올림한 평균(53.8, 51.7)으로 계산한 값으로 보여, 이 글은 표 값 3.8%를 씁니다. 12B(-87.3%)와 84B(-61.6%)는 과제 점수로 다시 계산한 값과 표 값이 같습니다.


11. PaLM-E-562B의 추가 능력

그림 2 — PaLM-E-562B의 능력 예시

그림 2 — PaLM-E-562B의 zero-shot 멀티모달 사고 사슬, 이미지 기반 농담, 여러 이미지 추론, 손글씨 수식 계산, 1인칭 영상 질의응답 예시입니다.

실험의 초점은 아니지만, PaLM-E-562B는 따로 학습하지 않은 능력도 보입니다.

능력내용
zero-shot 멀티모달 사고 사슬(chain-of-thought, CoT)이미지를 보고 단계별로 추론한 뒤 답함. zero-shot CoT는 원래 언어 전용 개념이고, 멀티모달 데이터에서는 과제별 프로그램으로 보인 적은 있지만 종단간 모델로는 저자들이 아는 한 처음임
이미지 기반 농담이미지를 보고 그 내용에 맞는 농담을 만듦
로봇 관련 멀티모달 능력지각, 시각에 근거한 대화, 계획
여러 이미지 프롬프트한 장짜리 이미지 프롬프트로만 학습했지만 여러 장의 이미지를 함께 추론함
OCR 없는 수식 계산텍스트 사이에 끼운 이미지 속 손글씨 숫자로 계산함
1인칭 영상 질의응답시간 정보가 붙은 1인칭 영상 장면에 대한 질문에 zero-shot으로 답함. Zeng et al. (2022)가 여러 모델을 연결해 보인 것을 한 모델 안에서 종단간으로 수행

12. 저자 논의 — 전이, 데이터 효율, 언어 능력 유지

범용 모델과 전문 모델

여러 과제와 데이터셋을 동시에 학습한 PaLM-E는 과제별로 따로 학습한 모델보다 성능이 크게 높습니다(그림 3).

  • TAMP — 그림 4에서 전체 혼합 공동 학습이 성능을 두 배 넘게 올립니다.
  • 이동형 조작 — 표 9에서 LLM·ViT 사전학습을 추가하고, 이동형 조작 데이터만 쓰는 대신 전체 혼합으로 학습하면 성능이 크게 오릅니다.
  • Language-Table — 표 2에서 같은 경향이 나타납니다.

데이터 효율

로봇 데이터는 대규모 언어나 시각-언어 데이터보다 훨씬 적습니다. PaLM-E는 위의 전이 덕분에 적은 로봇 예시로 과제를 풉니다. Language-Table에서는 과제당 10–80개, TAMP에서는 320개입니다. OSRT 결과는 기하 정보를 담은 입력 표현으로 데이터 효율을 높인 또 다른 사례이고, 저자들은 이를 대규모 시각 데이터를 활용하는 방법과 결합하는 것을 향후 과제로 제시합니다.

언어 능력 유지

멀티모달 학습 중 언어 능력을 유지하는 방법은 두 가지입니다.

  • LLM 고정 — 입력 부호기만 학습해 체화 언어 모델을 만들 수 있고 언어 능력은 그대로 유지됩니다. 다만 로봇 과제에서는 성능이 낮은 경우가 있었습니다(표 2의 LLM 고정 12B).
  • 모델 크기 확대 — 모델 전체를 종단간으로 학습해도 모델이 클수록 원래 언어 성능을 훨씬 많이 유지합니다(그림 6).

13. 논문에서 드러난 제약

논문에는 한계를 따로 모은 절이 없습니다. 본문에서 저자들이 명시한 제약은 다음과 같습니다.

첫째, PaLM-E는 로봇 행동을 직접 내지 않습니다. 계획이나 제어 과제에서는 작은 기술 어휘를 실행하는 하위 정책이 이미 있다고 가정하고, 그 하위 정책은 Interactive Language나 RT-1 같은 선행 방법을 수정 없이 씁니다. 하위 정책 자체는 긴 과제나 복잡한 지시를 풀지 못합니다.

둘째, LLM을 고정하는 방식은 언어 능력을 완전히 유지하지만 로봇 과제에서 성능이 낮을 때가 있습니다. LLM까지 학습하면 작은 모델에서 언어 능력 손실이 크고(12B의 NLG -87.3%), 이 손실을 줄이려면 모델을 562B 규모까지 키워야 했습니다.

셋째, 가장 데이터 효율이 좋았던 OSRT는 해당 환경 데이터로 학습한 장면 표현이고, 대규모 시각 데이터와 결합하는 방법은 향후 과제로 남았습니다.

넷째, 이동형 조작의 긴 과제 계획은 수치 없이 실제 주방에서 정성적으로만 평가했습니다.


14. 정리 — VLA 선행 연구에서의 위치

PaLM-E는 이미지·상태·3D 장면 표현을 부호기로 벡터열로 바꿔 사전학습된 LLM의 단어 임베딩 공간에 텍스트와 섞어 넣고, 로봇 계획과 일반 시각-언어 과제를 한 모델로 학습했습니다.

  • 멀티모달 문장 — 관측 벡터를 텍스트 토큰 사이 원하는 위치에 넣고, LLM의 위치 부호화를 그대로 씁니다. 출력은 텍스트입니다.
  • 입력 부호기 — 상태 벡터용 MLP, ViT-4B·ViT-22B, 물체 중심 ViT, OSRT를 비교했고, 데이터가 적을 때는 OSRT가 가장 좋았습니다(TAMP 1% p1 82.5).
  • 모델 규모 — PaLM 8B·62B·540B와 ViT를 조합해 PaLM-E-12B·84B·562B를 만들었습니다.
  • 전이 — 체화 데이터가 8.9%뿐인 전체 혼합으로 학습하면 세 로봇 환경 모두에서 성능이 오릅니다(TAMP 1% ViT-4B p1 30.6 → 74.1).
  • 시각-언어와 언어 성능 — PaLM-E-562B는 OK-VQA 66.1로 당시 최고이고, NLG 감소가 3.8%에 그칩니다.

VLA와의 연결

PaLM-E와 이후 VLA 모델은 입력 쪽 구조가 같습니다. 카메라 이미지를 ViT로 부호화해 언어 토큰과 같은 차원의 벡터로 바꾸고, 언어 지시와 함께 하나의 입력열로 LLM에 넣습니다. 차이는 출력 쪽에 있습니다.

모델입력출력저수준 로봇 행동을 만드는 주체
SayCan텍스트 (장면 정보는 행동 가능성 점수로 따로 제공)다음 기술 텍스트별도 하위 정책
PaLM-E이미지·상태 벡터 + 텍스트 (멀티모달 문장)다음 기술 텍스트별도 하위 정책 (Interactive Language, RT-1)
RT-1이미지 6장 + 언어 지시 임베딩차원별 256구간 이산 행동 토큰RT-1 자신 (35M 파라미터)
RT-2이미지 + 텍스트 (PaLM-E 또는 PaLI-X 입력 형식 그대로)행동을 나타내는 정수 문자열 토큰VLM 자신

PaLM-E는 이미지를 보고 추론하는 능력은 LLM 안으로 들였지만, 실제로 팔을 움직이는 행동은 여전히 RT-1 같은 별도 하위 정책이 만들었습니다. PaLM-E가 내는 것은 "스펀지를 집어라" 같은 상위 계획 텍스트입니다.

RT-2는 PaLM-E-12B를 백본으로 가져와 이 출력 방식을 바꿉니다. 모델 구조는 그대로 두고, 로봇 행동을 256구간으로 이산화한 정수 문자열을 텍스트 토큰처럼 학습 목표로 넣어, VLM이 상위 계획 대신 저수준 행동 토큰을 직접 생성하게 합니다. 이렇게 시각·언어 입력에서 행동을 직접 출력하는 모델에 RT-2가 붙인 이름이 시각-언어-행동(Vision-Language-Action, VLA) 모델입니다.

전체 목록은 VLA 선행 연구 목차에서 볼 수 있습니다.