VLA 계보 - 전체 목차7편

논문해석 - π0.5: a Vision-Language-Action Model with Open-World Generalization

들어가며

π0 논문해석은 사전학습된 시각-언어 모델(Vision-Language Model, VLM)에 행동 전문가(action expert)를 붙여, 연속 행동 묶음을 flow matching으로 생성하는 VLA를 만들었습니다. FAST 논문해석은 행동 묶음을 압축해 이산 토큰으로 바꾸면 VLA를 훨씬 빨리 학습할 수 있다는 것을 보였습니다. 두 연구 모두 평가 환경은 학습 데이터를 모은 환경과 비슷했습니다.

π0.5가 겨냥하는 조건은 다릅니다. 로봇이 학습 데이터에 한 번도 나오지 않은 집에 들어가 "부엌을 치워"라는 지시만 받고, 컵과 접시를 싱크대에 넣고 서랍을 닫고 쏟은 것을 닦는 일을 10~15분 동안 이어서 해야 합니다. 이런 과제를 모든 집과 모든 물건에 대해 로봇 시연으로 덮는 것은 불가능하므로, 저자들은 다른 종류의 데이터에서 지식을 옮겨 오는 학습 방법을 설계합니다.

π0.5의 학습 데이터 가운데 사전학습 단계 예시의 97.6%는 이동형 조작 로봇이 집안일을 하는 데이터가 아닙니다. 다른 로봇의 데이터, 웹의 이미지-텍스트 데이터, 사람이 붙인 하위 과제 설명이 대부분을 차지합니다. 그런데도 결과 모델은 처음 가 본 집에서 이동형 조작 로봇을 제어합니다.

📄 π0.5: a Vision-Language-Action Model with Open-World Generalization — Physical Intelligence (Kevin Black, Noah Brown, James Darpinian 외 저자 35명, 알파벳순), 2025-04 arxiv 공개

프로젝트 페이지는 pi.website/blog/pi05이고, arxiv 식별자는 2504.16054입니다. 이 글은 v1을 기준으로 합니다.

초록 요약

로봇이 쓸모 있으려면 실험실 밖의 실제 환경에서 실용적인 과제를 해내야 합니다. VLA 모델은 종단간(end-to-end) 로봇 제어에서 좋은 결과를 냈지만, 실제 환경에서 얼마나 넓게 일반화하는지는 아직 답이 없습니다. π0.5는 π0을 바탕으로, 성격이 서로 다른 과제를 함께 학습하는 공동 학습(co-training) 으로 넓은 일반화를 노린 모델입니다.

학습에는 여러 로봇의 데이터, 상위 수준 의미 예측, 웹 데이터 등이 들어가고, 한 학습 예시 안에 이미지 관측·언어 명령·물체 검출·하위 과제 예측·저수준 행동이 섞여 있는 혼합 예시도 씁니다. 실험 결과 이런 지식 전이가 일반화에 꼭 필요했습니다. 저자들은 학습 기반 종단간 로봇 시스템이 완전히 새로운 집에서 부엌이나 침실 청소처럼 길고 정교한 조작을 해내는 것을 처음으로 보였다고 밝힙니다.

그림 2 — 새 부엌을 치우는 π0.5

그림 2 — 학습 데이터에 없던 집의 부엌에서 하위 과제를 예측하고 저수준 행동을 내며 청소합니다.

로봇은 "찬장을 닫아", "물건을 서랍에 넣어", "쏟은 것을 닦아", "접시를 싱크대에 넣어" 같은 일반적인 과제를 받습니다. 모델은 매 추론 단계에서 "접시를 집어" 같은 하위 과제를 먼저 텍스트로 예측하고, 그 하위 과제에 맞는 행동을 냅니다.

논문 PDF에는 데이터 출처 전체를 요약한 그림 1이 있지만, arxiv HTML 판에는 이미지가 실려 있지 않습니다. 같은 내용은 아래 4절의 그림 4와 표에서 다룹니다.


1. 문제 — 학습 환경 밖의 일반화

일반화가 필요한 수준

본 적 없는 부엌을 치우라는 지시를 받았을 때 필요한 능력은 한 가지가 아닙니다. 저자들은 세 경우로 나눕니다.

경우예시필요한 것
데이터에 충분히 나온 동작칼이나 접시 집기다양한 장면·물체에서 모은 로봇 데이터
기존 기술을 새 방식·새 순서로 쓰는 동작처음 보는 구조의 싱크대에 그릇 넣기기술의 조정과 조합
장면의 의미를 알아야 하는 판단어느 서랍을 열지, 조리대 위 어느 물건이 식기 건조대인지사전 지식에 기반한 의미 이해

첫 번째 경우는 로봇 데이터를 더 많은 장면에서 모으면 해결됩니다. 두 번째와 세 번째 경우는 로봇 데이터만 늘려서는 모든 상황을 덮을 수 없습니다. 부엌 하나를 치우는 긴 과제에서 가능한 장면 조합을 로봇 시연으로 전부 모으는 것은 현실적으로 불가능합니다.

기존 연구와의 차이

연구 흐름해 온 것π0.5와의 차이
범용 로봇 조작 정책 (VLA 포함)다양한 장면·과제 데이터로 학습해 새 장면·과제에 일반화평가 환경이 대개 학습 데이터와 비슷함. 새 환경에서 된 것은 물체 집기·서랍 열기 같은 짧은 기술
로봇 외 데이터 공동 학습VLM 학습용 데이터를 섞어 새 물체·배경 일반화를 높임π0.5는 다른 로봇 데이터, 상위 하위 과제 예측, 말로 준 지시까지 공동 학습에 넣음
언어 기반 로봇 추론·계획VLM이 의미 단계를 예측하고 별도의 하위 정책이 실행π0.5는 같은 모델 하나가 상위 추론과 하위 추론을 모두 함
새 환경 일반화 로봇 시스템물체 집기처럼 좁은 기본 동작, 1분 미만의 짧은 과제π0.5는 수 분 걸리는 여러 단계 과제를 새 집에서 수행

상위 계획과 하위 제어를 나누는 방식은 SayCanPaLM-E가 썼습니다. 두 연구에서는 언어 모델이나 VLM이 하위 과제를 텍스트로 정하고, 별도로 학습한 하위 정책이 그 하위 과제를 실행했습니다. π0.5는 하위 과제 텍스트 예측과 행동 예측을 한 신경망 안에서 차례로 수행합니다. 저자들은 이 방식이 언어 모델의 사고 사슬(chain-of-thought)과 비슷하다고 설명하면서도, 상위 추론은 하위 행동 추론보다 낮은 빈도로 실행된다는 점에서 기존의 체화 사고 사슬(embodied chain-of-thought) 방법과 구분합니다.


2. 모델 구조 — 텍스트와 행동을 함께 내는 Transformer

그림 3 — 모델 개요

그림 3 — 사전학습에서는 모든 출력을 이산 토큰으로 학습하고, 사후학습에서 flow matching 행동 전문가를 붙여 하위 과제와 연속 행동을 차례로 냅니다.

그림 왼쪽은 사전학습 단계입니다. 사전학습된 VLM(그림 표기: SigLIP 400M + Gemma 2.6B)이 웹·로봇 데이터의 이미지와 과제별 프롬프트를 받아, 하위 과제 텍스트("put the plate in the sink"), 이산화된 행동 토큰, 이미지 설명, 경계 상자 좌표를 모두 토큰으로 출력합니다. 오른쪽은 사후학습과 추론입니다. 이미지와 상위 프롬프트("clean the bedroom")를 받아 하위 과제("pick up the pillow")를 텍스트로 예측하고, 그 하위 과제를 조건으로 행동 전문가(300M)가 잡음에서 연속 행동을 만듭니다.

입력과 출력

모델은 관측과 과제를 조건으로 행동 묶음과 텍스트의 결합 분포를 표현합니다.

πθ(at:t+H,^ot,)\pi_\theta(\mathbf{a}_{t:t+H}, \hat{\ell} \mid \mathbf{o}_t, \ell)
기호예시
ot\mathbf{o}_t시점 tt의 관측. 모든 카메라 이미지 It1,,Itn\mathbf{I}^1_t, \dots, \mathbf{I}^n_t와 로봇 상태 qt\mathbf{q}_t카메라 4대 영상 + 관절 각도·집게 자세·몸통 승강 위치·베이스 속도
\ell전체 과제 프롬프트"put away the dishes"
^\hat{\ell}모델이 내는 텍스트 토큰하위 과제 "pick up the plate", 또는 웹 데이터 질문의 답
at:t+H\mathbf{a}_{t:t+H}예측한 행동 묶음(action chunk)부록 설정 기준 행동 50걸음

저자들은 이 분포를 두 부분으로 나눕니다.

πθ(at:t+H,^ot,)=πθ(at:t+Hot,^)πθ(^ot,)\pi_\theta(\mathbf{a}_{t:t+H}, \hat{\ell} \mid \mathbf{o}_t, \ell) = \pi_\theta(\mathbf{a}_{t:t+H} \mid \mathbf{o}_t, \hat{\ell})\, \pi_\theta(\hat{\ell} \mid \mathbf{o}_t, \ell)

오른쪽 두 번째 항 πθ(^ot,)\pi_\theta(\hat{\ell} \mid \mathbf{o}_t, \ell)상위 추론(high-level inference) 입니다. 관측과 전체 과제를 보고 지금 할 하위 과제를 텍스트로 정합니다. 첫 번째 항 πθ(at:t+Hot,^)\pi_\theta(\mathbf{a}_{t:t+H} \mid \mathbf{o}_t, \hat{\ell})하위 추론(low-level inference) 입니다. 행동은 전체 과제 \ell이 아니라 방금 정한 하위 과제 ^\hat{\ell}만 조건으로 받습니다. 두 항 모두 같은 모델이 계산합니다.

한 추론 단계의 흐름

아래 표는 그림 7(a)에 실린 실제 예측으로 상위 추론과 하위 추론이 번갈아 실행되는 모습을 옮긴 것입니다.

순서입력 과제 \ell상위 추론 결과 ^\hat{\ell}하위 추론 결과
1"put the items in the drawer""pull out the drawer"서랍을 당기는 행동 묶음
2"put the items in the drawer""pull out the top right drawer"오른쪽 위 서랍을 당기는 행동 묶음
3"put the items in the drawer""pick up tong"집게(tong)를 집는 행동 묶음
4"put the items in the drawer""put tong into drawer"집게를 서랍에 넣는 행동 묶음
5"put the items in the drawer""push the top drawer"서랍을 미는 행동 묶음

상위 추론 결과는 그림 7(a) Home 1에 적힌 예측 문장이고, 하위 추론 결과 칸은 그 문장에 대응하는 행동을 말로 적은 것입니다.

전체 과제는 처음부터 끝까지 같고, 하위 과제만 장면에 따라 바뀝니다. 상위 추론에는 카메라 4대를 모두 쓰고, 하위 추론에는 손목 카메라 2대와 앞쪽 카메라만 씁니다.

토큰 종류와 전문가 가중치

모델은 입력 토큰 NNx1:Nx_{1:N}을 받아 출력 NNy1:Ny_{1:N}을 내는 Transformer입니다. 논문은 여기서 "토큰"을 넓은 뜻으로 씁니다. 입력 토큰은 세 종류입니다.

토큰 종류값의 모양처리 방식
텍스트 토큰 xiwx_i^w어휘표 번호(자연수)임베딩 행렬에서 해당 줄을 꺼냄
이미지 패치 xiIx_i^Ip×p×3p \times p \times 3 픽셀 값시각 부호기를 거침
행동 토큰 xiax_i^add차원 실수 벡터(flow matching 중간 값)선형 층으로 Transformer 임베딩 크기에 투영

토큰 종류에 따라 다른 부호기를 쓸 뿐 아니라, Transformer 안에서도 다른 가중치를 씁니다. π0과 같이 행동 토큰은 행동 전문가라는 별도 가중치 묶음이 처리합니다. 로봇 상태 qt\mathbf{q}_t는 이산화해 텍스트 토큰으로 넣습니다.

출력은 텍스트 토큰 로짓 MM개와 행동 출력 HH개로 나뉩니다. 앞의 MM개로 텍스트 ^\hat{\ell}을 뽑고, 뒤의 HH개는 행동 전문가가 내는 값을 선형 층으로 연속 출력으로 바꿔 행동 묶음을 얻습니다. M+HNM + H \le N이라서 모든 출력 위치에 손실이 걸리지는 않습니다. 이미지 패치 위치의 출력처럼 손실을 계산하지 않는 위치가 있기 때문입니다.

주의 마스크

주의 행렬 A(x1:N)[0,1]N×NA(x_{1:N}) \in [0,1]^{N \times N}은 어떤 토큰이 어떤 토큰을 참고할 수 있는지 정합니다. 일반 언어 모델은 앞쪽 토큰만 참고하는 인과 주의(causal attention)를 쓰지만, π0.5는 이미지 패치·텍스트 프롬프트·연속 행동 토큰 사이에서 양방향 주의(bidirectional attention)를 씁니다.

그림 18 — 주의 마스크 예시

그림 18 — 세로축 질의(query) 토큰이 가로축 키(key) 토큰을 참고할 수 있으면 짙은 칸입니다.

질의 토큰참고할 수 있는 토큰참고하지 않는 토큰
이미지 · 프롬프트 · 상태이미지 · 프롬프트 · 상태 전체 (양방향)FAST 행동 토큰, 행동 전문가 임베딩
FAST 행동 토큰앞의 접두부 전체 + 자기보다 앞의 FAST 토큰 (계단 모양)행동 전문가 임베딩
행동 전문가 임베딩접두부 전체 + 행동 전문가 임베딩끼리 (양방향)FAST 행동 토큰

행동 전문가 임베딩이 FAST 행동 토큰을 참고하지 못하게 막은 이유는, 같은 행동을 두 가지 방식으로 표현한 값 사이에 정보가 새지 않게 하기 위해서입니다. 행동 전문가가 FAST 토큰을 볼 수 있으면 정답 행동을 이미 담은 토큰을 보고 연속 행동을 맞힐 수 있습니다. 또 VLM 쪽 임베딩은 행동 전문가를 참고하지 않으므로, 정보는 VLM에서 행동 전문가 쪽으로만 흐릅니다.


3. 이산 행동 표현과 연속 행동 표현의 결합

두 표현의 장단점

행동을 표현하는 방식에는 두 가지가 있습니다.

방식학습추론
FAST 이산 토큰행동 묶음을 압축한 토큰을 다음 토큰 예측으로 학습. 학습이 빠름토큰을 하나씩 자기회귀로 생성해야 해서 느림
flow matching 연속 행동잡음과 행동 사이의 속도장을 회귀로 학습행동 묶음 전체를 몇 번의 적분 단계로 한꺼번에 생성해 빠름

FAST 논문은 이산 토큰으로 학습하면 VLA 학습이 훨씬 빨라진다는 것을 보였지만, 실시간 제어에 쓰기에는 자기회귀 디코딩이 느립니다. 저자들은 학습은 이산 토큰으로 하고 추론은 flow matching으로 하는 설계를 목표로 삼습니다.

flow matching 학습 목표

flow matching에서는 실제 행동 묶음 at:t+H\mathbf{a}_{t:t+H}와 표준 정규 분포에서 뽑은 잡음 ωN(0,I)\omega \sim \mathcal{N}(0, \mathbf{I})를 섞은 값을 만듭니다.

at:t+Hτ,ω=τat:t+H+(1τ)ω,τ[0,1]\mathbf{a}^{\tau,\omega}_{t:t+H} = \tau\, \mathbf{a}_{t:t+H} + (1-\tau)\, \omega, \quad \tau \in [0, 1]

τ\tau는 flow matching의 시간 값입니다. 이 식에서는 τ=1\tau = 1이면 실제 행동, τ=0\tau = 0이면 잡음 그 자체입니다. 모델은 이 섞인 값을 받아 벡터장 ωa\omega - \mathbf{a}를 예측하도록 학습합니다.

아래 표는 행동 한 차원만 떼어 계산한 예입니다.

항목
실제 행동 값 aa0.6
뽑은 잡음 ω\omega−1.0
시간 값 τ\tau0.3
모델 입력 τa+(1τ)ω\tau a + (1-\tau)\omega0.3×0.6+0.7×(1.0)=0.520.3 \times 0.6 + 0.7 \times (-1.0) = -0.52
학습 목표 ωa\omega - a1.00.6=1.6-1.0 - 0.6 = -1.6

실제 행동 값, 잡음, 시간 값은 계산 모양을 보여 주기 위한 임의의 예시 값입니다.

실제로는 이 계산이 행동 50걸음 × 행동 차원 수만큼의 모든 칸에서 동시에 일어납니다. 시간 값 τ\tau는 학습 예시마다 새로 뽑고, 모델은 서로 다른 τ\tau에서 섞인 값을 보며 같은 목표를 맞히도록 학습합니다. 적분을 어느 방향으로 진행하는지는 논문 본문에 적혀 있지 않습니다.

합친 손실 함수

π0.5는 FAST 토큰의 자기회귀 예측과 flow matching을 한 손실에 넣습니다.

ED,τ,ω[H(x1:M,fθ(ot,))+αωat:t+Hfθa(at:t+Hτ,ω,ot,)2]\mathbb{E}_{\mathcal{D},\tau,\omega}\Big[ H\big(x_{1:M}, f^{\ell}_\theta(\mathbf{o}_t, \ell)\big) + \alpha \big\| \omega - \mathbf{a}_{t:t+H} - f^{a}_\theta(\mathbf{a}^{\tau,\omega}_{t:t+H}, \mathbf{o}_t, \ell) \big\|^2 \Big]
H(x1:M,fθ)H(x_{1:M}, f^{\ell}_\theta)텍스트 토큰에 대한 교차 엔트로피 손실. FAST로 부호화한 행동 토큰도 여기 포함
ωafθa2\big\| \omega - \mathbf{a} - f^{a}_\theta \big\|^2행동 전문가 출력과 목표 벡터장의 제곱 오차
α\alpha두 손실의 비중을 정하는 실수

α=0\alpha = 0이면 두 번째 항이 사라져 행동까지 텍스트 토큰으로만 학습하는 일반 VLM이 됩니다. 사전학습은 이 설정으로 하고, 사후학습에서 행동 전문가 가중치를 추가해 α\alpha를 키웁니다. 저자들은 이 순서가 사전학습을 안정적으로 만들고 언어 지시를 잘 따르는 VLA를 만든다고 적습니다.

추론할 때는 텍스트 토큰 ^\hat{\ell}을 일반 자기회귀 디코딩으로 뽑은 뒤, 그 텍스트를 조건으로 잡음 제거 10단계를 거쳐 행동 at:t+H\mathbf{a}_{t:t+H}를 만듭니다.

본문 3절의 전처리 설명은 목표 벡터장을 ωat\omega - \mathbf{a}_t로 적고, 손실 식 (1)은 ωat:t+H\omega - \mathbf{a}_{t:t+H}로 적습니다. 식 (1)이 행동 묶음 전체를 대상으로 하므로 이 글은 at:t+H\mathbf{a}_{t:t+H}로 적었습니다.


4. 사전학습 — 서로 다른 데이터의 공동 학습

그림 4 — 사전학습·사후학습 과제 예시

그림 4 — 실험실 교차 몸체, 다양한 이동형·비이동형 조작, 상위 하위 과제, 웹 데이터, 말로 준 지시의 예시입니다.

첫 학습 단계에서 π0.5는 일반 자기회귀 Transformer로 학습합니다. 텍스트, 물체 위치, FAST로 부호화한 행동 토큰을 모두 다음 토큰 예측으로 맞힙니다. 사전학습 데이터는 다섯 종류입니다.

약어이름내용
MM다양한 이동형 조작기(Mobile Manipulator) 데이터이동형 조작 로봇이 약 100개 집에서 집안일을 한 데이터 약 400시간. 평가 과제와 가장 가까움
ME다양한 환경의 비이동형 로봇(Multi-Environment) 데이터한 팔 또는 두 팔을 표면이나 받침대에 고정한 로봇으로 여러 집에서 모은 데이터. 가볍고 옮기기 쉬워 더 많은 집에서 모음. 몸체는 이동형 로봇과 다름
CE실험실 교차 몸체(Cross-Embodiment) 데이터단순한 탁자 환경에서 여러 종류의 로봇으로 모은 과제(탁자 치우기, 셔츠 개기 등). 한 팔·두 팔, 고정·이동 베이스를 모두 포함. 공개 데이터셋 OXE 포함. π0이 쓴 데이터셋의 확장판
HL상위 하위 과제 예측(High-Level) 데이터MM·ME·CE 로봇 데이터에 하위 과제 설명과 경계 상자를 사람이 주석
WD다중 모달 웹 데이터(Web Data)이미지 설명(CapsFusion, COCO), 질의응답(Cambrian-7M, PixMo, VQAv2), 물체 위치 찾기

그림 4 왼쪽 위 "Laboratory cross-embodiment" 칸이 CE, "Diverse mobile manipulator"가 MM, "Diverse non-mobile manipulator"가 ME, "High-level subtask"가 HL, "Multi-modal web data"가 WD입니다. 오른쪽 "Verbal instruction"은 사후학습에서만 쓰는 데이터로, 5절에서 다룹니다.

하위 과제 주석

"침실을 치워" 같은 상위 명령을 "이불을 정리해", "베개를 집어" 같은 짧은 하위 과제로 나누면, 모델이 현재 장면을 보고 다음 행동을 더 잘 정할 수 있습니다. 여러 하위 과제로 이루어진 로봇 데이터에는 사람이 모든 구간에 하위 과제 설명을 붙였습니다. 모델은 현재 관측과 상위 명령을 보고 하위 과제 라벨을 텍스트로 예측하고, 그 라벨을 조건으로 행동을 예측하도록 함께 학습합니다. 현재 관측에 보이는 관련 물체의 경계 상자도 주석으로 붙여, 하위 과제보다 먼저 예측하게 합니다.

아래 표는 그림 4의 HL 예시를 옮긴 것입니다.

질문모델이 순서대로 내야 할 출력
"How would you clean the bedroom?"경계 상자 <loc0405><loc0011><loc0911><loc0197>closet → 하위 과제 "move to closet"
"How would you clean the kitchen?"경계 상자 <loc0571><loc0376><loc0815><loc0484>mitten, <loc0787><loc0346><loc1003><loc0490>drawer → 하위 과제 "move left arm forward and pick up mitten"

<loc…> 토큰 네 개가 상자 하나의 좌표이고, 그 뒤에 물체 이름이 붙습니다. 이 문자열도 텍스트 토큰이므로 다음 토큰 예측으로 학습됩니다.

웹 데이터

이미지 설명, 질의응답, 물체 위치 찾기 데이터를 사전학습에 넣습니다. 물체 위치 찾기에는 표준 데이터셋에 더해, 실내 장면과 가정용 물건에 경계 상자를 붙인 웹 데이터를 추가로 모았습니다. 그림 4의 WD 예시는 코끼리 사진의 한 영역 좌표를 주고 "Front legs of elephant"라고 설명하게 하거나, 파이 사진을 보고 어떤 파이인지 답하게 하는 과제입니다.

행동 데이터의 형식 맞추기

로봇마다 행동 공간이 다르므로, 행동 데이터를 한 모델에 넣으려면 형식을 맞춰야 합니다.

처리방법
예측 대상목표 관절 자세 또는 목표 말단장치(end-effector) 자세
제어 방식 구분텍스트 프롬프트에 <control_mode> joint/end effector <control_mode> 추가
정규화데이터셋마다, 행동 차원마다 1% 백분위수와 99% 백분위수를 써서 [1,1][-1, 1]로 변환
차원 맞추기모든 데이터셋 중 가장 큰 행동 공간에 맞춰 차원을 고정하고, 차원이 작은 로봇은 남는 칸을 0으로 채움

아래 표는 정규화를 한 차원에 대해 계산한 예입니다.

항목
어떤 데이터셋의 한 관절 행동 1% 백분위수−0.8 rad
같은 차원의 99% 백분위수1.2 rad
원래 행동 값0.7 rad
정규화 값 2×0.7(0.8)1.2(0.8)12 \times \dfrac{0.7 - (-0.8)}{1.2 - (-0.8)} - 10.5

백분위수와 행동 값은 임의의 예시 값이고, 선형 변환식은 1%→−1, 99%→1로 보내는 가장 단순한 형태로 적었습니다. 논문은 백분위수를 쓴다는 것만 밝히고 식을 적지 않았습니다.

차원 맞추기는 이렇게 됩니다. 행동 차원 수가 19로 고정됐다고 할 때, 18차원 로봇의 행동 벡터는 마지막 한 칸을 0으로 채웁니다.

로봇1~18번째 칸19번째 칸
19차원 로봇실제 행동 값실제 행동 값
18차원 로봇실제 행동 값0

고정 차원 수 19와 채우는 위치는 모양을 보여 주기 위한 예시입니다. 논문은 고정 차원 수를 적지 않았습니다.

사전학습 데이터의 구성 비율

논문은 데이터 종류별 비율을 표로 공개하지 않았습니다. 밝힌 수치는 사전학습 단계 예시의 97.6%가 이동형 조작 로봇의 집안일 데이터(MM)가 아닌 다른 출처에서 왔다는 것 하나입니다. 곧 MM은 사전학습 예시의 2.4%입니다.


5. 사후학습 — 이동형 조작 전문화와 행동 전문가 추가

이산 토큰으로 280k 걸음 사전학습한 뒤, 두 번째 단계인 사후학습(post-training)을 합니다. 목적은 두 가지입니다. 모델을 가정용 이동형 조작에 맞추고, flow matching으로 연속 행동 묶음을 만드는 행동 전문가를 추가하는 것입니다.

항목사전학습사후학습
학습 걸음 수280k추가 80k
손실다음 토큰 예측만 (α=0\alpha = 0)다음 토큰 예측 + flow matching (α=10.0\alpha = 10.0)
행동 전문가없음무작위 초기화로 추가
로봇 행동 데이터MM · ME · CEMM · ME (성공 에피소드 중 일정 길이 이하만)
웹 데이터 (WD)사용사용 (의미·시각 능력 유지)
하위 과제 데이터 (HL)MM · ME · CE 주석다양한 환경 데이터셋에 해당하는 부분
말로 준 지시 (VI)없음사용

CE를 사후학습에서 빼는 이유는 이동형 조작과 다양한 환경에 모델을 집중시키기 위해서입니다.

말로 준 지시 데이터

말로 준 지시(Verbal Instruction, VI) 데이터는 모델이 알맞은 하위 과제를 고르는 능력을 높이려고 새로 모은 것입니다. 숙련된 사용자가 학습된 하위 정책이 실행 중인 로봇에게 실시간으로 "컵을 싱크대에 넣어" 같은 하위 과제 명령을 말로 내려, 방 청소 같은 긴 과제를 단계별로 수행하게 합니다. 로봇 팔을 직접 조종하는 원격조작 대신 언어로 조종하는 방식이고, 그렇게 기록된 명령 순서가 좋은 상위 출력의 시연이 됩니다.

그림 4 오른쪽 VI 칸에는 다른 예도 있습니다. 정책이 "put plate in sink"를 실행했는데 실제로는 접시를 건조대에 올렸다면, 라벨을 "put plate on rack"으로 다시 붙입니다. 정책이 "push the top drawer"를 실행하다 파란 셔츠를 집었다면 "pick up blue shirt"로 고칩니다. 로봇이 실제로 한 동작에 맞춰 라벨을 바꾸는 방식입니다.


6. 로봇 시스템

그림 5 — 로봇 시스템 개요

그림 5 — 카메라 4대, 6자유도 팔 2개, 이동 베이스, 몸통 승강 장치를 갖춘 이동형 조작기 두 종입니다.

실험에는 두 종류의 이동형 조작기를 씁니다.

항목내용
평행 집게가 달린 6자유도 팔 2개, 손목마다 단안 RGB 카메라
베이스바퀴형 전방향(holonomic) 베이스. 상태·행동은 직선 속도 2차원 + 회전 속도 1차원
몸통 승강 장치1차원(위아래) 또는 2차원(위아래 + 앞뒤)
카메라손목 2대 + 팔 사이에 단 앞쪽·뒤쪽 카메라 2대
상태·행동 차원플랫폼에 따라 18 또는 19
제어팔·집게·몸통 승강의 목표 자세와 베이스 목표 속도를 50 Hz로 명령(행동 묶음 사용)
추종단순 PD 제어기. 별도의 궤적 계획이나 충돌 검출 없음

18과 19차원의 구성은 팔 2개 × (관절 6 + 집게 1) = 14, 베이스 3, 몸통 승강 1 또는 2를 더한 값입니다. 14 + 3 + 1 = 18, 14 + 3 + 2 = 19입니다. 집게를 차원 하나로 세는 계산은 논문이 적은 합계와 맞춰 본 것입니다.

행동 묶음 50걸음을 50 Hz 명령 주기로 계산하면 1초 분량의 목표 값입니다. 논문은 한 묶음 가운데 몇 걸음을 실행한 뒤 다시 추론하는지는 적지 않았습니다.

조작과 이동 제어를 모두 종단간으로 학습한 정책이 직접 냅니다.


7. 실험 1 — 실제 집에서의 일반화

그림 6 — 평가 환경

그림 6 — 통제된 비교용 모의 방(왼쪽)과 최종 평가용 실제 집(오른쪽). 모두 학습에 쓰지 않았습니다.

모든 실험은 학습에 쓰지 않은 새 환경에서 합니다. 정량 비교는 통제와 재현이 가능한 모의 가정 환경(mock home)에서 하고, 가장 현실적인 최종 평가는 학습 세트에 없는 실제 집 세 곳에서 합니다. 실험이 답하려는 질문은 다섯입니다.

  1. π0.5가 완전히 새로운 집에서 복잡한 여러 단계 과제로 일반화하는가
  2. 학습 데이터의 환경 수에 따라 일반화가 어떻게 달라지는가
  3. 공동 학습 데이터의 각 구성 요소가 최종 성능에 얼마나 기여하는가
  4. π0.5를 π0 VLA와 비교하면 어떤가
  5. 상위 추론이 얼마나 중요하고, 상위 추론 없는 방식이나 사람이 상위 과제를 정해 주는 방식과 비교하면 어떤가

평가 채점표

과제 성능은 성공/실패 대신 과제 진행률(task progress) 로 잽니다. 과제마다 채점표를 두고, 얻은 점수를 만점에 대한 백분율로 적습니다.

과제시작 상태점수 항목만점
싱크대에 그릇 넣기 (Dishes in Sink)싱크대 근처에 그릇 4개(접시·그릇·도마·식기)집을 때마다 +1, 싱크대에 넣을 때마다 +18
서랍에 물건 넣기 (Items in Drawer)조리대 위에 물건 1개물건 집기 +1, 서랍 열기 +1, 서랍에 넣기 +1, (물건이 안에 있을 때) 서랍 닫기 +14
빨래 바구니에 넣기 (Laundry Basket)바닥에 옷 한 벌이동해 옷 집기 +1, 바구니 안이나 위에 놓기 +1, 옷이 바구니 안에 완전히 들어감 +13
침대 정리 (Make Bed)흐트러진 침대이불을 펴 시트 덮기 +1, 베개 하나 머리맡에 놓기 +1, 두 번째 베개 놓기 +1, 이불을 아주 반듯하게 폄 +1, 두 베개를 아주 반듯하게 놓음 +15

싱크대 과제에서 그릇 4개 중 2개를 집어 싱크대에 넣고 나머지 2개는 집기만 했다면 2 + 2 + 2 = 6점, 곧 75%입니다. 앞 계산은 채점표 사용법을 보여 주기 위한 예시입니다.

평가 장소는 실제 집 세 곳과 모의 부엌 세 곳·모의 침실 세 곳을 합쳐 12곳입니다. 별도 언급이 없으면 정책마다 과제당 10회 평가하고, 한 비교 안에서는 모든 정책에 같은 네 장소를 써서 정책당 40회 평가합니다. 에피소드 하나가 수 분씩 걸려 평가에 시간이 많이 듭니다. 환경 변화의 영향을 줄이려고 정책들을 번갈아 실행했고, 로봇 고장이나 시간 제한 등으로 취소된 에피소드는 뺐습니다. 통계적 유의성은 시행 수가 다를 수 있다고 가정한 양측 t-검정으로 보고합니다.

실제 집 결과

그림 7(a) — 실제 집 실행 예시

그림 7(a) — 위부터 Home 1 서랍, Home 2 싱크대, Home 3 빨래 바구니 과제와 파란 글씨의 상위 추론 예측입니다.

그림 7(b) — 실제 집 정량 평가

그림 7(b) — 집과 과제별 평균 과제 진행률(10회 평균). 모의 환경 성능이 실제 집 성능과 비슷합니다.

로봇 두 종류를 모두 써서 실제 집 세 곳에서 침실 청소와 부엌 청소를 시켰습니다. 막대 위에 수치가 인쇄돼 있지 않아, 아래 표에는 그래프 눈금에서 읽은 근삿값을 옮겼습니다.

장소서랍에 물건 넣기싱크대에 그릇 넣기빨래 바구니
Real Home 1약 90%약 80%
Real Home 2약 94%약 90%
Real Home 3약 70%약 65%약 83%
모의 환경약 85%약 91%약 80%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다. "—"는 해당 집에서 평가하지 않은 과제입니다.

과제 대부분은 여러 물건을 옮기는 여러 단계 과제로 2~5분 걸립니다. 모델은 "접시를 싱크대에 넣어" 같은 단순한 상위 명령만 받고, "컵을 집어" 같은 단계는 상위 추론이 스스로 정합니다. 저자들은 정량 평가에 쓴 과제 외에도 모델이 훨씬 많은 과제를 수행할 수 있다고 적습니다.


8. 실험 2 — 학습 환경 수에 따른 일반화

실험 설정

이동형 조작 데이터의 환경 수를 3, 12, 22, 53, 82, 104곳으로 바꿔 학습합니다. 환경 수마다 사전학습과 사후학습 전체를 반복하면 계산량이 너무 크므로, 이 실험에서는 이동형 조작 데이터를 뺀 로봇 행동 데이터 혼합으로 사전학습한 뒤, 환경 수가 다른 이동형 조작 데이터로 사후학습한 모델끼리 비교합니다.

환경 수가 다르면 데이터 크기도 다르지만, 사후학습 걸음 수를 40k로 맞춰 모든 모델이 같은 수의 고유 데이터 샘플을 보게 했습니다. 환경 수의 효과만 보기 위해 데이터 크기 효과를 통제한 설정입니다.

평가는 두 가지입니다.

평가내용
여러 단계 과제모의 가정 환경에서 싱크대·서랍·빨래·침대 네 과제를 채점표로 평가
언어 지시 따르기부엌 조리대에서 언어 명령이 가리키는 특정 물건을 집어 서랍이나 싱크대에 넣기. 학습 데이터와 같은 범주의 새 물건(분포 안)과 학습에 없던 범주의 물건(분포 밖)을 따로 평가

여러 단계 과제 결과

그림 8 — 환경 수에 따른 성능

그림 8 — 학습 환경이 늘수록 네 과제 평균 성능이 오르고, 104곳 모델은 테스트 집 데이터로 학습한 기준선과 비슷합니다.

학습 환경 수평균 과제 진행률
3약 14%
12약 47%
22약 60%
53약 75%
82약 66%
104약 86%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

오른쪽 막대 셋은 비교용 기준선입니다.

기준선학습 방법평균 과제 진행률
in-domain data (짙은 초록)공동 학습 방법 그대로, 테스트 집 데이터를 학습에 포함약 83%
in-domain data no pre-training (옅은 초록)다른 공동 학습 과제 없이 테스트 집 데이터로만 학습약 39%
104 locations no pre-training (옅은 노랑)다른 공동 학습 과제 없이 104곳 이동형 조작 데이터로만 학습약 5%

그래프 눈금에서 읽은 근삿값입니다.

환경이 늘수록 성능은 대체로 오르고, 53곳에서 82곳 사이에서는 내려갑니다. 104곳 모델은 테스트 집 데이터를 직접 학습한 기준선(초록 점선)과 비슷한 성능을 냅니다.

사전학습 없이 학습한 두 기준선은 크게 낮습니다. 테스트 집 데이터를 본 경우에도 약 39%에 그치므로, 다른 출처의 데이터가 일반화에 꼭 필요합니다. 테스트 집 데이터 없이 104곳 데이터로만 학습하면 약 5%로, 공동 학습 사전학습의 효과가 특히 큽니다.

언어 지시 따르기 결과

그림 9 — 환경 수에 따른 언어 지시 따르기

그림 9 — 학습 환경 수에 따른 지시 따르기 비율(왼쪽)과 성공률(오른쪽), 분포 안·밖 물건별로 나눴습니다.

지표무엇을 세는가
지시 따르기 비율(follow rate)로봇이 명령이 가리킨 물건을 골랐는가
성공률(success rate)그 물건을 올바른 위치(서랍 안 또는 싱크대 안)에 넣었는가

그래프에서 읽은 근삿값입니다. 이 그래프의 가장 왼쪽 점은 약 12곳이고, 3곳 점은 없습니다.

학습 환경 수따르기 (분포 안)따르기 (분포 밖)성공 (분포 안)성공 (분포 밖)
약 12약 21%약 25%약 18%약 15%
약 22약 44%약 26%약 39%약 13%
약 52약 62%약 37%약 53%약 28%
약 82약 57%약 57%약 53%약 29%
약 104약 66%약 67%약 61%약 54%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

환경이 늘수록 두 지표 모두 오르고, 분포 안 물건이 분포 밖 물건보다 빨리 오릅니다. 저자들은 새 환경마다 새 가정용 물건이 들어오면서 모델이 전반적으로 강건해지고, 학습 데이터에 없던 물건 범주로도 일반화하기 시작한다고 해석합니다.


9. 실험 3 — 공동 학습 구성 요소의 제거

전체 π0.5와, 학습 혼합에서 일부를 뺀 변형을 비교합니다.

변형뺀 데이터
no WD웹 데이터
no ME다양한 환경의 비이동형 로봇 데이터
no CE실험실 교차 몸체 데이터
no ME or CE다른 로봇의 데이터 둘 다. 대상 이동형 조작 플랫폼 데이터와 웹 데이터만 남음

말로 준 지시(VI) 데이터의 효과는 11절에서 따로 봅니다.

모의 가정 환경 과제 결과

그림 10 — 학습 혼합 제거 실험, 모의 가정 환경

그림 10 — 네 과제 평균 과제 진행률(정책·과제당 10회). ME나 CE를 빼면 크게 떨어지고, WD 제거는 유의한 차이가 없습니다.

모델평균 과제 진행률 (그래프 근삿값)π0.5 대비 p 값 (그래프 인쇄 값)
π0.5약 78%
no WD약 72%p=0.385
no CE약 51%p<0.001
no ME약 54%p<0.001
no CE or ME약 40%p<0.001

평균 과제 진행률은 그래프 눈금에서 읽은 근삿값이고, p 값은 그래프에 인쇄된 값입니다.

다른 로봇 데이터 두 종류 가운데 하나라도 빼면 성능이 크게 떨어지고, 둘 다 빼면 더 떨어집니다. π0.5는 다른 환경(ME)과 다른 과제(CE) 양쪽의 몸체 간 전이에서 도움을 받습니다. 웹 데이터를 빼도 이 실험에서는 통계적으로 유의한 차이가 없지만, 아래 언어 지시 실험과 11절 상위 추론 실험에서는 웹 데이터의 영향이 큽니다.

언어 지시 따르기 결과

그림 11 — 학습 혼합 제거 실험, 언어 지시 따르기

그림 11 — 분포 안·밖 물건의 지시 따르기 비율과 성공률. WD는 분포 밖 성능에, ME와 CE는 양쪽 모두에 크게 영향을 줍니다.

모델따르기 (분포 안)성공 (분포 안)따르기 (분포 밖)성공 (분포 밖)
π0.5약 86%약 83%약 94%약 94%
no WD약 86%약 82%약 80%약 73%
no CE약 74%약 67%약 67%약 49%
no ME약 66%약 57%약 33%약 31%
no ME or CE약 56%약 50%약 33%약 33%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

ME나 CE를 빼면 모델 성능이 크게 떨어지는 경향은 그림 10과 같습니다. 달라지는 것은 웹 데이터입니다. 웹 데이터를 빼면 분포 안 물건 성능은 거의 그대로인데, 분포 밖 물건의 따르기 비율과 성공률이 크게 떨어집니다. 저자들은 물리적 물체에 대한 넓은 지식을 담은 웹 데이터 덕분에, 학습에 없던 범주의 물건이 들어간 명령도 이해하고 따른다고 추측합니다.


10. 실험 4 — 다른 VLA와의 비교

그림 12 — 다른 모델과의 비교

그림 12 — 모의 가정 환경 네 과제에서 π0.5가 π0과 π0-FAST+Flow를 모두 앞섭니다.

비교 모델

모델학습 방법상위 추론
π0처음부터 행동 전문가를 쓰는 flow matching 학습불가
π0-FAST+Flow식 (1)의 FAST + flow matching 결합 학습과 두 단계 학습을 따르되, 로봇 행동 데이터만 사용 (HL · WD 없음)불가
π0.5두 단계 학습 + HL · WD 추가가능

공정한 비교를 위해 모든 모델에 같은 교차 몸체 로봇 학습 세트를 주고, 학습 걸음 수도 비슷하게 맞췄습니다. π0.5와 π0의 차이는 두 가지입니다. 첫째, π0.5는 HL과 WD를 추가로 씁니다. 둘째, π0.5는 사전학습에서 이산 토큰으로 학습하고 사후학습에서만 행동 전문가를 쓰지만, π0은 항상 행동 전문가를 씁니다. π0-FAST+Flow는 두 번째 차이만 없앤 모델로, π0을 π0.5에 최대한 가깝게 만든 강한 비교 대상입니다.

결과

과제π0.5π0-FAST+Flow (no HL)π0 300kπ0 80k
싱크대에 그릇 넣기약 91%약 55%약 41%약 19%
서랍에 물건 넣기약 85%약 70%약 32%약 5%
빨래 바구니약 80%약 73%약 31%약 39%
침대 정리약 58%약 48%약 20%약 14%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

π0.5는 네 과제 모두에서 π0과 강화판 π0-FAST+Flow를 앞서고, π0-FAST+Flow와의 차이는 싱크대 과제에서 가장 크고 빨래 바구니 과제에서 가장 작습니다. π0을 300k 걸음까지 더 오래 학습해도 π0.5가 앞섭니다. 저자들은 이 결과가 FAST 논문처럼, FAST 토큰 학습이 순수 확산 기반 학습보다 계산량 대비 효율적이라는 것을 확인해 준다고 적습니다.

언어 지시 따르기 비교

그림 15 — 언어 지시 따르기에서 다른 모델과의 비교

그림 15 — π0.5가 π0-FAST+Flow를 조금, π0을 크게 앞섭니다.

모델지시 따르기 비율성공률
π0.5약 77%약 71%
π0-FAST+Flow (no HL)약 68%약 64%
π0 300k약 19%약 16%
π0 80k약 35%약 27%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

π0.5는 π0-FAST+Flow보다 조금 높고 π0보다는 훨씬 높습니다. 저자들은 이 차이가 이산 토큰 학습이 언어 지시 따르기에 중요하다는 것을 보여 준다고 해석합니다. π0은 더 오래 학습한 300k 모델이 80k 모델보다 오히려 낮습니다. 논문은 이 역전을 따로 설명하지 않았습니다.


11. 실험 5 — 상위 추론의 중요성

π0.5의 상위 추론은 "침실을 치워" 같은 상위 명령을 받아 "베개를 집어" 같은 하위 과제를 내고, 그 하위 과제를 하위 행동 추론의 조건으로 넘깁니다. 일반 VLA처럼 과제 프롬프트를 하위 시스템에 바로 넣거나, 다른 모델을 상위 정책으로 쓰는 기준선을 만들 수 있습니다. 아래 방법은 모두 π0.5의 하위 추론을 그대로 쓰고 상위 정책만 바꿉니다.

방법상위 정책학습 데이터
π0.5π0.5 자신이 상위·하위 추론을 모두 함전체
no WDπ0.5에서 웹 데이터를 뺀 모델WD 제외
no VIπ0.5에서 말로 준 지시 데이터를 뺀 모델VI 제외
implicit HL실행 중 상위 추론을 하지 않음하위 과제 데이터는 학습에 포함
no HL실행 중 상위 추론을 하지 않음하위 과제 데이터도 학습에서 제외
GPT-4 HLGPT-4에 과제 설명과 자주 쓰는 라벨 목록을 프롬프트로 주고 하위 과제를 고르게 함로봇 데이터로 학습하지 않음
human HL숙련된 사람이 하위 과제를 정함성능 상한을 보기 위한 기준

그림 13 — 상위 추론 방식 평가

그림 13 — 전체 π0.5가 가장 높고, 상위 추론 없이 하위 과제 데이터만 학습한 implicit HL이 두 번째입니다.

방법평균 과제 진행률 (그래프 근삿값)π0.5 대비 p 값 (그래프 인쇄 값)
π0.5약 78%
implicit HL약 71%p=0.144
no HL약 62%p=0.011
no VI약 60%p=0.009
no WD약 60%p=0.008
GPT-4 HL약 57%p=0.002
human HL약 63%p=0.016

평균 과제 진행률은 그래프 눈금에서 읽은 근삿값이고, p 값은 그래프에 인쇄된 값입니다.

  • π0.5 — 가장 높고, 사람이 하위 과제를 정해 주는 human HL보다도 높습니다.
  • implicit HL — 두 번째로 높습니다. 실행 중에는 상위 추론을 하지 않지만 하위 과제 예측 데이터를 학습에 넣은 모델입니다. 하위 과제를 명시적으로 추론하면 이득이 있지만, 그 이득의 상당 부분은 하위 과제 예측 데이터를 학습 혼합에 넣는 것만으로 얻습니다.
  • no HL — 하위 과제 데이터를 학습에서도 빼면 유의하게 낮아집니다.
  • no VI — 말로 준 지시 데이터는 이동형 조작 상위 예시의 약 11%밖에 안 되지만, 빼면 유의하게 낮아집니다.
  • no WD — 유의하게 낮습니다. 저자들은 웹 데이터의 이득 상당 부분이 상위 정책을 개선하는 데서 나온다고 봅니다.
  • GPT-4 HL — 가장 낮습니다. 저자들은 로봇 데이터로 VLM을 적응시켜야 한다고 해석합니다.

12. 부록 — 과제별 분해와 모델 세부 설정

언어 지시 따르기 실험 설정

언어 지시 실험은 학습에 없던 부엌 장면 두 곳에서 "가위를 서랍에 넣어", "도마를 싱크대에 넣어" 같은 구체적인 명령을 줍니다.

시나리오물건 5개범주
서랍에 넣기집게(tongs), 나무 서빙 스푼, 캔 따개, 가위, 작은 노란 머스터드분포 안
싱크대에 넣기컵, 그릇, 접시, 플라스틱 숟가락, 도마분포 안
서랍에 넣기 (새 물건)깔때기, 약병, 그릴 점화기, 라이터, 보안경분포 밖 (학습 세트에 없는 범주)

매 시행마다 물건 5개를 놓고 그중 하나를 옮기라고 합니다. 명령을 해석하지 못하는 정책이 가까운 물건을 집는 요령을 쓰지 못하도록, 목표 물건을 방해물보다 멀리 둡니다. 명령을 이해하지 못하는 정책이 무작위로 고르면 지시 따르기 비율은 약 20%(5개 중 1개)가 됩니다.

그림 14(a) — 분포 안 물건, 서랍 과제

그림 14(a) — 분포 안 물건을 서랍에 넣는 실험의 시작 상태입니다.

그림 14(b) — 분포 안 물건, 싱크대 과제

그림 14(b) — 분포 안 물건을 싱크대에 넣는 실험의 시작 상태입니다.

그림 14(c) — 분포 밖 물건, 서랍 과제

그림 14(c) — 학습에 없던 범주의 물건을 서랍에 넣는 실험의 시작 상태입니다.

학습 혼합 제거 실험의 과제별 결과

그림 16 — 학습 혼합 제거 실험의 과제별 분해

그림 16 — 네 과제별로 나눈 학습 혼합 변형의 과제 진행률입니다.

과제π0.5no WDno CEno MEno CE or ME
서랍에 물건 넣기약 85%약 52%약 32%약 27%약 5%
싱크대에 그릇 넣기약 91%약 100%약 65%약 65%약 67%
빨래 바구니약 80%약 83%약 70%약 73%약 47%
침대 정리약 58%약 54%약 40%약 52%약 42%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

  • 서랍에 물건 넣기 — ME, CE, WD 중 무엇을 빼도 크게 떨어지고, 전부 빼면 가장 크게 떨어집니다. 매우 넓은 범주의 일상 물건을 알아봐야 하는 과제라서, 여러 데이터 출처의 지식이 필요하다고 저자들은 봅니다.
  • 싱크대에 그릇 넣기 — 웹 데이터를 빼도 떨어지지 않고(그래프에서는 오히려 약 100%), ME나 CE를 빼면 떨어집니다. 로봇 데이터에서 배우는 일반적인 조작 방법이 주로 필요한 과제로 해석합니다.
  • 빨래 바구니, 침대 정리 — 교차 몸체 데이터를 빼면 떨어지지만, 다른 변화에는 대체로 덜 민감합니다.

상위 추론 방법의 과제별 결과

그림 17 — 상위 추론 방법의 과제별 분해

그림 17 — 네 과제별로 나눈 상위 추론 방법의 과제 진행률입니다.

과제π0.5implicit HLno HLno VIno WDGPT-4 HLhuman HL
서랍에 물건 넣기약 85%약 79%약 70%약 48%약 40%약 52%약 52%
싱크대에 그릇 넣기약 91%약 77%약 55%약 77%약 91%약 55%약 79%
빨래 바구니약 80%약 83%약 73%약 83%약 80%약 87%약 83%
침대 정리약 58%약 46%약 48%약 35%약 31%약 38%약 40%

그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.

  • 서랍과 싱크대 과제 — 상위 추론이 결정적입니다. no HL에서 크게 떨어지고, π0.5가 GPT-4 HL을 앞섭니다. 저자들은 도메인 데이터로 미세조정한 상위 모델이 하위 정책의 성공을 돕는 방식을 배운다고 해석합니다.
  • 서랍 과제의 웹 데이터 — 웹 데이터를 빼면 크게 떨어집니다. 덜 본 물건으로 일반화하는 데 의미 지식이 중요하다는 학습 혼합 실험 결과와 같습니다.
  • 빨래 바구니 — 상위 정책 선택에 거의 민감하지 않습니다.

부록 본문은 이 마지막 항목을 "빨래 바구니와 싱크대 과제는 상위 정책 선택에 덜 민감하다"고 적었습니다. 바로 앞 문장에서 싱크대 과제를 상위 추론이 결정적인 과제로 꼽았고, 그래프에서도 싱크대 과제는 no HL과 GPT-4 HL에서 약 55%로 떨어지므로, 이 글에서는 빨래 바구니만 덜 민감한 과제로 적었습니다.

모델 세부 설정

π0.5는 π0을 바탕으로, 시각-언어 이해에 PaliGemma VLM을 백본(backbone)으로 쓰고 빠른 행동 생성에 행동 전문가를 씁니다.

항목VLM 백본행동 전문가
초기화PaliGemma 가중치무작위 (사후학습 시작 시)
파라미터2B (부록 표기)300M
너비(width)20481024
깊이(depth)1818
MLP 차원16,3844096
주의 헤드 수1818
키·값 헤드 수11
헤드 차원256256

VLM 백본은 π0처럼 이미지 열과 언어 프롬프트를 받고, 여기에 토큰화한 로봇 상태와 자기회귀로 예측할 토큰화 행동을 더 받습니다. 행동 전문가는 행동 지평 50, 곧 H=49H = 49인 잡음 섞인 행동 토큰 at:t+Hτ,ω\mathbf{a}^{\tau,\omega}_{t:t+H}을 받습니다. tt부터 t+49t+49까지 세면 50걸음입니다. 잡음 섞인 행동 묶음(행동 차원 dd)은 먼저 선형 층 하나로 Transformer 임베딩 크기에 투영됩니다.

시간 값의 입력 방식

π0은 flow matching 시간 값 τ\tau를 잡음 섞인 행동과 합쳐 Transformer에 넣었습니다. π0.5는 τ\tau만 따로 MLP로 투영한 뒤, 적응형 RMSNorm으로 행동 전문가의 각 층에 시간 정보를 넣습니다. 시간 MLP는 다음 형태입니다.

swish(W2swish(W1ϕ(τ))),W1,W2Rw×w\mathrm{swish}\big(W_2 \cdot \mathrm{swish}(W_1 \cdot \phi(\tau))\big), \quad W_1, W_2 \in \mathbb{R}^{w \times w}

ϕ:RRw\phi: \mathbb{R} \to \mathbb{R}^w는 사인파 위치 부호화 함수입니다. 스칼라 τ\tau 하나를 ww차원 벡터로 바꾸고, 선형 변환과 swish 활성화를 두 번 거칩니다. 행동 전문가가 내는 행동 토큰 y1:Hay^a_{1:H}는 마지막 선형 투영으로 목표 벡터장이 됩니다.

시간 값의 표본 분포

학습할 때 τ\tau를 균등 분포 U(0,1)\mathcal{U}(0,1)에서 뽑지 않고, π0을 따라 낮은 시간 값에 비중을 두는 분포에서 뽑습니다.

p(τ)=Beta(sτs; α=1.5, β=1),s=0.999p(\tau) = \mathrm{Beta}\Big(\frac{s - \tau}{s};\ \alpha = 1.5,\ \beta = 1\Big), \quad s = 0.999

ss보다 큰 시간 값은 뽑지 않습니다. 적분 간격 δ\delta1s1 - s보다 크면 그 구간의 값은 쓰이지 않기 때문입니다. s=0.999s = 0.999는 적분을 최대 1,000단계(δ>0.001\delta > 0.001)까지 할 수 있게 하는 값입니다. 여기의 α\alpha, β\beta는 베타 분포의 모양 값이고, 3절 손실 함수의 α\alpha와는 다른 기호입니다.

이미지 증강

모든 입력 이미지에 다음 순서로 증강을 적용합니다.

transforms = [
    augmax.RandomCrop(int(width * 0.95), int(height * 0.95)),
    augmax.Resize(width, height),
    augmax.Rotate((-5, 5)),
    augmax.ColorJitter(brightness=0.3, contrast=0.4, saturation=0.5),
]
단계내용
무작위 자르기가로·세로 95% 크기로 무작위 위치를 잘라냄
크기 조정원래 크기로 되돌림
회전−5도에서 5도 사이로 무작위 회전
색 변화밝기 0.3, 대비 0.4, 채도 0.5 범위에서 무작위 변화

13. 논문 안의 불일치

위치내용이 글의 처리
그림 3 캡션과 부록 A-E그림 3은 VLM을 "SigLIP (400M) + Gemma (2.6B)"로 적고, 부록은 "2B VLM"이라고 적음두 표기를 해당 위치에 각각 그대로 적음. 어느 기준의 파라미터 수인지 논문이 설명하지 않음
3절 본문과 식 (1)목표 벡터장을 본문은 ωat\omega - \mathbf{a}_t, 식 (1)은 ωat:t+H\omega - \mathbf{a}_{t:t+H}로 적음행동 묶음 전체를 대상으로 하는 식 (1) 표기를 씀
부록 A-D 상위 추론 분석서랍·싱크대 과제는 상위 추론이 결정적이라고 쓴 뒤, 이어서 빨래 바구니·싱크대 과제는 상위 정책 선택에 덜 민감하다고 씀그림 17에서 싱크대 과제는 방법에 따라 크게 변하므로, 덜 민감한 과제는 빨래 바구니로만 적음
그림 11 캡션"학습 환경 수를 바꿔 학습한 뒤" 평가했다고 적었지만, 그림에는 환경 수 축이 없고 학습 혼합 변형별 막대만 있음그림 내용(학습 혼합 변형 비교)을 기준으로 설명함
그림 11과 그림 15의 π0.5같은 언어 지시 실험인데 π0.5 지시 따르기 비율이 그림 11에서는 분포 안 약 86%, 그림 15에서는 약 77%로 다름두 그림이 분포 안·밖 중 무엇을 평균했는지 논문이 밝히지 않아, 그림별 값을 각각 적음
그림 1본문이 그림 1을 참조하지만 arxiv HTML 판에는 이미지가 없음PDF에 그림 1이 있다는 사실만 적음

14. 저자가 밝힌 한계

첫째, 넓게 일반화하지만 여전히 실수를 합니다. 익숙하지 않은 서랍 손잡이나 로봇이 물리적으로 열기 어려운 찬장처럼 계속 어려운 환경이 있고, 닦아야 할 얼룩을 로봇 팔이 가리는 식으로 부분 관측 때문에 어려운 동작도 있습니다. 상위 하위 과제 추론이 쉽게 흔들리는 경우도 있습니다. 물건을 넣는 동안 서랍을 여러 번 열고 닫는 행동이 예입니다. 더 나은 공동 학습과 전이, 더 큰 데이터셋으로 풀 과제로 봅니다.

둘째, 비교적 단순한 프롬프트만 처리합니다. 모델이 다룰 수 있는 프롬프트의 복잡도는 학습 데이터가 정하므로, 사람이 붙이거나 합성한 더 복잡하고 다양한 주석으로 더 복잡한 선호와 지시를 넣을 수 있다고 봅니다.

셋째, 맥락이 비교적 짧습니다. 방 사이를 이동하거나 물건을 둔 위치를 기억해야 하는 과제처럼 부분 관측이 더 심한 설정에서는, 더 긴 맥락과 기억이 필요합니다.

넷째, 서로 다른 데이터 출처의 한 가지 조합만 탐색했습니다. 말로 준 지시에서 배우는 능력은 새로운 감독 방식이고, 사람이 로봇에게 맥락 지식을 주는 다른 방법도 앞으로 탐색할 수 있다고 적습니다.


15. 정리 — 계보에서의 위치

  • 공동 학습 데이터 — 이동형 조작 데이터 약 400시간(약 100개 집)에 비이동형 로봇(ME), 실험실 교차 몸체(CE), 하위 과제 주석(HL), 웹 데이터(WD)를 더해 사전학습하고, 사후학습에 말로 준 지시(VI)를 더했습니다. 사전학습 예시의 97.6%가 MM 이외의 출처입니다.
  • 한 모델의 상위·하위 추론 — 같은 신경망이 하위 과제 텍스트를 먼저 예측하고, 그 텍스트를 조건으로 행동 묶음을 냅니다.
  • 두 단계 행동 표현 — 사전학습 280k 걸음은 FAST 이산 토큰만으로 학습하고, 사후학습 80k 걸음에서 flow matching 행동 전문가(300M)를 추가해 추론 때 잡음 제거 10단계로 연속 행동을 만듭니다.
  • 결과 — 학습에 없던 실제 집 세 곳에서 부엌·침실 청소 과제를 수행했고, 학습 환경이 104곳이 되면 테스트 집 데이터로 학습한 모델과 비슷한 성능을 냈습니다. 다른 로봇 데이터를 빼면 성능이 크게 떨어지고, 웹 데이터는 분포 밖 물건과 상위 추론에서 효과가 컸습니다.

앞선 모델과의 비교

항목SayCan · PaLM-Eπ0FAST (π0-FAST)π0.5
상위 과제 결정언어 모델·VLM이 텍스트로 결정없음없음같은 모델이 텍스트로 결정
하위 행동 생성별도로 학습한 하위 정책행동 전문가 flow matchingFAST 토큰 자기회귀사전학습은 FAST 토큰, 사후학습·추론은 행동 전문가 flow matching
한 신경망 여부상위·하위가 다른 모델한 모델한 모델한 모델
공동 학습 데이터로봇 행동 데이터로봇 행동 데이터로봇 행동 + HL + WD (+ VI)
평가 환경학습 환경과 비슷함학습 환경과 비슷함학습 환경과 비슷함학습에 없던 집

SayCan · PaLM-E, π0, FAST 열은 이 논문의 관련 연구 설명과 비교 실험 설명을 기준으로 적었습니다.

π0.5는 π0의 flow matching 행동 생성, FAST의 이산 토큰 학습, SayCan과 PaLM-E의 상위 계획·하위 실행 구조를 한 모델 안에 넣고, 여기에 다른 로봇과 웹의 데이터를 공동 학습해 학습 환경 밖으로 일반화를 넓혔습니다. 계보의 다음 연구로는 OpenVLA의 미세조정 방식을 바꾼 OpenVLA-OFT와, 휴머노이드용 이중 시스템 구조를 제안한 GR00T N1이 이어집니다.

전체 목록은 VLA 계보 목차에서 볼 수 있습니다.