들어가며
π0 논문해석은 사전학습된 시각-언어 모델(Vision-Language Model, VLM)에 행동 전문가(action expert)를 붙여, 연속 행동 묶음을 flow matching으로 생성하는 VLA를 만들었습니다. FAST 논문해석은 행동 묶음을 압축해 이산 토큰으로 바꾸면 VLA를 훨씬 빨리 학습할 수 있다는 것을 보였습니다. 두 연구 모두 평가 환경은 학습 데이터를 모은 환경과 비슷했습니다.
π0.5가 겨냥하는 조건은 다릅니다. 로봇이 학습 데이터에 한 번도 나오지 않은 집에 들어가 "부엌을 치워"라는 지시만 받고, 컵과 접시를 싱크대에 넣고 서랍을 닫고 쏟은 것을 닦는 일을 10~15분 동안 이어서 해야 합니다. 이런 과제를 모든 집과 모든 물건에 대해 로봇 시연으로 덮는 것은 불가능하므로, 저자들은 다른 종류의 데이터에서 지식을 옮겨 오는 학습 방법을 설계합니다.
π0.5의 학습 데이터 가운데 사전학습 단계 예시의 97.6%는 이동형 조작 로봇이 집안일을 하는 데이터가 아닙니다. 다른 로봇의 데이터, 웹의 이미지-텍스트 데이터, 사람이 붙인 하위 과제 설명이 대부분을 차지합니다. 그런데도 결과 모델은 처음 가 본 집에서 이동형 조작 로봇을 제어합니다.
📄 π0.5: a Vision-Language-Action Model with Open-World Generalization — Physical Intelligence (Kevin Black, Noah Brown, James Darpinian 외 저자 35명, 알파벳순), 2025-04 arxiv 공개
프로젝트 페이지는 pi.website/blog/pi05이고, arxiv 식별자는 2504.16054입니다. 이 글은 v1을 기준으로 합니다.
초록 요약
로봇이 쓸모 있으려면 실험실 밖의 실제 환경에서 실용적인 과제를 해내야 합니다. VLA 모델은 종단간(end-to-end) 로봇 제어에서 좋은 결과를 냈지만, 실제 환경에서 얼마나 넓게 일반화하는지는 아직 답이 없습니다. π0.5는 π0을 바탕으로, 성격이 서로 다른 과제를 함께 학습하는 공동 학습(co-training) 으로 넓은 일반화를 노린 모델입니다.
학습에는 여러 로봇의 데이터, 상위 수준 의미 예측, 웹 데이터 등이 들어가고, 한 학습 예시 안에 이미지 관측·언어 명령·물체 검출·하위 과제 예측·저수준 행동이 섞여 있는 혼합 예시도 씁니다. 실험 결과 이런 지식 전이가 일반화에 꼭 필요했습니다. 저자들은 학습 기반 종단간 로봇 시스템이 완전히 새로운 집에서 부엌이나 침실 청소처럼 길고 정교한 조작을 해내는 것을 처음으로 보였다고 밝힙니다.

그림 2 — 학습 데이터에 없던 집의 부엌에서 하위 과제를 예측하고 저수준 행동을 내며 청소합니다.
로봇은 "찬장을 닫아", "물건을 서랍에 넣어", "쏟은 것을 닦아", "접시를 싱크대에 넣어" 같은 일반적인 과제를 받습니다. 모델은 매 추론 단계에서 "접시를 집어" 같은 하위 과제를 먼저 텍스트로 예측하고, 그 하위 과제에 맞는 행동을 냅니다.
논문 PDF에는 데이터 출처 전체를 요약한 그림 1이 있지만, arxiv HTML 판에는 이미지가 실려 있지 않습니다. 같은 내용은 아래 4절의 그림 4와 표에서 다룹니다.
1. 문제 — 학습 환경 밖의 일반화
일반화가 필요한 수준
본 적 없는 부엌을 치우라는 지시를 받았을 때 필요한 능력은 한 가지가 아닙니다. 저자들은 세 경우로 나눕니다.
| 경우 | 예시 | 필요한 것 |
|---|---|---|
| 데이터에 충분히 나온 동작 | 칼이나 접시 집기 | 다양한 장면·물체에서 모은 로봇 데이터 |
| 기존 기술을 새 방식·새 순서로 쓰는 동작 | 처음 보는 구조의 싱크대에 그릇 넣기 | 기술의 조정과 조합 |
| 장면의 의미를 알아야 하는 판단 | 어느 서랍을 열지, 조리대 위 어느 물건이 식기 건조대인지 | 사전 지식에 기반한 의미 이해 |
첫 번째 경우는 로봇 데이터를 더 많은 장면에서 모으면 해결됩니다. 두 번째와 세 번째 경우는 로봇 데이터만 늘려서는 모든 상황을 덮을 수 없습니다. 부엌 하나를 치우는 긴 과제에서 가능한 장면 조합을 로봇 시연으로 전부 모으는 것은 현실적으로 불가능합니다.
기존 연구와의 차이
| 연구 흐름 | 해 온 것 | π0.5와의 차이 |
|---|---|---|
| 범용 로봇 조작 정책 (VLA 포함) | 다양한 장면·과제 데이터로 학습해 새 장면·과제에 일반화 | 평가 환경이 대개 학습 데이터와 비슷함. 새 환경에서 된 것은 물체 집기·서랍 열기 같은 짧은 기술 |
| 로봇 외 데이터 공동 학습 | VLM 학습용 데이터를 섞어 새 물체·배경 일반화를 높임 | π0.5는 다른 로봇 데이터, 상위 하위 과제 예측, 말로 준 지시까지 공동 학습에 넣음 |
| 언어 기반 로봇 추론·계획 | VLM이 의미 단계를 예측하고 별도의 하위 정책이 실행 | π0.5는 같은 모델 하나가 상위 추론과 하위 추론을 모두 함 |
| 새 환경 일반화 로봇 시스템 | 물체 집기처럼 좁은 기본 동작, 1분 미만의 짧은 과제 | π0.5는 수 분 걸리는 여러 단계 과제를 새 집에서 수행 |
상위 계획과 하위 제어를 나누는 방식은 SayCan과 PaLM-E가 썼습니다. 두 연구에서는 언어 모델이나 VLM이 하위 과제를 텍스트로 정하고, 별도로 학습한 하위 정책이 그 하위 과제를 실행했습니다. π0.5는 하위 과제 텍스트 예측과 행동 예측을 한 신경망 안에서 차례로 수행합니다. 저자들은 이 방식이 언어 모델의 사고 사슬(chain-of-thought)과 비슷하다고 설명하면서도, 상위 추론은 하위 행동 추론보다 낮은 빈도로 실행된다는 점에서 기존의 체화 사고 사슬(embodied chain-of-thought) 방법과 구분합니다.
2. 모델 구조 — 텍스트와 행동을 함께 내는 Transformer

그림 3 — 사전학습에서는 모든 출력을 이산 토큰으로 학습하고, 사후학습에서 flow matching 행동 전문가를 붙여 하위 과제와 연속 행동을 차례로 냅니다.
그림 왼쪽은 사전학습 단계입니다. 사전학습된 VLM(그림 표기: SigLIP 400M + Gemma 2.6B)이 웹·로봇 데이터의 이미지와 과제별 프롬프트를 받아, 하위 과제 텍스트("put the plate in the sink"), 이산화된 행동 토큰, 이미지 설명, 경계 상자 좌표를 모두 토큰으로 출력합니다. 오른쪽은 사후학습과 추론입니다. 이미지와 상위 프롬프트("clean the bedroom")를 받아 하위 과제("pick up the pillow")를 텍스트로 예측하고, 그 하위 과제를 조건으로 행동 전문가(300M)가 잡음에서 연속 행동을 만듭니다.
입력과 출력
모델은 관측과 과제를 조건으로 행동 묶음과 텍스트의 결합 분포를 표현합니다.
| 기호 | 뜻 | 예시 |
|---|---|---|
| 시점 의 관측. 모든 카메라 이미지 와 로봇 상태 | 카메라 4대 영상 + 관절 각도·집게 자세·몸통 승강 위치·베이스 속도 | |
| 전체 과제 프롬프트 | "put away the dishes" | |
| 모델이 내는 텍스트 토큰 | 하위 과제 "pick up the plate", 또는 웹 데이터 질문의 답 | |
| 예측한 행동 묶음(action chunk) | 부록 설정 기준 행동 50걸음 |
저자들은 이 분포를 두 부분으로 나눕니다.
오른쪽 두 번째 항 이 상위 추론(high-level inference) 입니다. 관측과 전체 과제를 보고 지금 할 하위 과제를 텍스트로 정합니다. 첫 번째 항 이 하위 추론(low-level inference) 입니다. 행동은 전체 과제 이 아니라 방금 정한 하위 과제 만 조건으로 받습니다. 두 항 모두 같은 모델이 계산합니다.
한 추론 단계의 흐름
아래 표는 그림 7(a)에 실린 실제 예측으로 상위 추론과 하위 추론이 번갈아 실행되는 모습을 옮긴 것입니다.
| 순서 | 입력 과제 | 상위 추론 결과 | 하위 추론 결과 |
|---|---|---|---|
| 1 | "put the items in the drawer" | "pull out the drawer" | 서랍을 당기는 행동 묶음 |
| 2 | "put the items in the drawer" | "pull out the top right drawer" | 오른쪽 위 서랍을 당기는 행동 묶음 |
| 3 | "put the items in the drawer" | "pick up tong" | 집게(tong)를 집는 행동 묶음 |
| 4 | "put the items in the drawer" | "put tong into drawer" | 집게를 서랍에 넣는 행동 묶음 |
| 5 | "put the items in the drawer" | "push the top drawer" | 서랍을 미는 행동 묶음 |
상위 추론 결과는 그림 7(a) Home 1에 적힌 예측 문장이고, 하위 추론 결과 칸은 그 문장에 대응하는 행동을 말로 적은 것입니다.
전체 과제는 처음부터 끝까지 같고, 하위 과제만 장면에 따라 바뀝니다. 상위 추론에는 카메라 4대를 모두 쓰고, 하위 추론에는 손목 카메라 2대와 앞쪽 카메라만 씁니다.
토큰 종류와 전문가 가중치
모델은 입력 토큰 개 을 받아 출력 개 을 내는 Transformer입니다. 논문은 여기서 "토큰"을 넓은 뜻으로 씁니다. 입력 토큰은 세 종류입니다.
| 토큰 종류 | 값의 모양 | 처리 방식 |
|---|---|---|
| 텍스트 토큰 | 어휘표 번호(자연수) | 임베딩 행렬에서 해당 줄을 꺼냄 |
| 이미지 패치 | 픽셀 값 | 시각 부호기를 거침 |
| 행동 토큰 | 차원 실수 벡터(flow matching 중간 값) | 선형 층으로 Transformer 임베딩 크기에 투영 |
토큰 종류에 따라 다른 부호기를 쓸 뿐 아니라, Transformer 안에서도 다른 가중치를 씁니다. π0과 같이 행동 토큰은 행동 전문가라는 별도 가중치 묶음이 처리합니다. 로봇 상태 는 이산화해 텍스트 토큰으로 넣습니다.
출력은 텍스트 토큰 로짓 개와 행동 출력 개로 나뉩니다. 앞의 개로 텍스트 을 뽑고, 뒤의 개는 행동 전문가가 내는 값을 선형 층으로 연속 출력으로 바꿔 행동 묶음을 얻습니다. 이라서 모든 출력 위치에 손실이 걸리지는 않습니다. 이미지 패치 위치의 출력처럼 손실을 계산하지 않는 위치가 있기 때문입니다.
주의 마스크
주의 행렬 은 어떤 토큰이 어떤 토큰을 참고할 수 있는지 정합니다. 일반 언어 모델은 앞쪽 토큰만 참고하는 인과 주의(causal attention)를 쓰지만, π0.5는 이미지 패치·텍스트 프롬프트·연속 행동 토큰 사이에서 양방향 주의(bidirectional attention)를 씁니다.

그림 18 — 세로축 질의(query) 토큰이 가로축 키(key) 토큰을 참고할 수 있으면 짙은 칸입니다.
| 질의 토큰 | 참고할 수 있는 토큰 | 참고하지 않는 토큰 |
|---|---|---|
| 이미지 · 프롬프트 · 상태 | 이미지 · 프롬프트 · 상태 전체 (양방향) | FAST 행동 토큰, 행동 전문가 임베딩 |
| FAST 행동 토큰 | 앞의 접두부 전체 + 자기보다 앞의 FAST 토큰 (계단 모양) | 행동 전문가 임베딩 |
| 행동 전문가 임베딩 | 접두부 전체 + 행동 전문가 임베딩끼리 (양방향) | FAST 행동 토큰 |
행동 전문가 임베딩이 FAST 행동 토큰을 참고하지 못하게 막은 이유는, 같은 행동을 두 가지 방식으로 표현한 값 사이에 정보가 새지 않게 하기 위해서입니다. 행동 전문가가 FAST 토큰을 볼 수 있으면 정답 행동을 이미 담은 토큰을 보고 연속 행동을 맞힐 수 있습니다. 또 VLM 쪽 임베딩은 행동 전문가를 참고하지 않으므로, 정보는 VLM에서 행동 전문가 쪽으로만 흐릅니다.
3. 이산 행동 표현과 연속 행동 표현의 결합
두 표현의 장단점
행동을 표현하는 방식에는 두 가지가 있습니다.
| 방식 | 학습 | 추론 |
|---|---|---|
| FAST 이산 토큰 | 행동 묶음을 압축한 토큰을 다음 토큰 예측으로 학습. 학습이 빠름 | 토큰을 하나씩 자기회귀로 생성해야 해서 느림 |
| flow matching 연속 행동 | 잡음과 행동 사이의 속도장을 회귀로 학습 | 행동 묶음 전체를 몇 번의 적분 단계로 한꺼번에 생성해 빠름 |
FAST 논문은 이산 토큰으로 학습하면 VLA 학습이 훨씬 빨라진다는 것을 보였지만, 실시간 제어에 쓰기에는 자기회귀 디코딩이 느립니다. 저자들은 학습은 이산 토큰으로 하고 추론은 flow matching으로 하는 설계를 목표로 삼습니다.
flow matching 학습 목표
flow matching에서는 실제 행동 묶음 와 표준 정규 분포에서 뽑은 잡음 를 섞은 값을 만듭니다.
는 flow matching의 시간 값입니다. 이 식에서는 이면 실제 행동, 이면 잡음 그 자체입니다. 모델은 이 섞인 값을 받아 벡터장 를 예측하도록 학습합니다.
아래 표는 행동 한 차원만 떼어 계산한 예입니다.
| 항목 | 값 |
|---|---|
| 실제 행동 값 | 0.6 |
| 뽑은 잡음 | −1.0 |
| 시간 값 | 0.3 |
| 모델 입력 | |
| 학습 목표 |
실제 행동 값, 잡음, 시간 값은 계산 모양을 보여 주기 위한 임의의 예시 값입니다.
실제로는 이 계산이 행동 50걸음 × 행동 차원 수만큼의 모든 칸에서 동시에 일어납니다. 시간 값 는 학습 예시마다 새로 뽑고, 모델은 서로 다른 에서 섞인 값을 보며 같은 목표를 맞히도록 학습합니다. 적분을 어느 방향으로 진행하는지는 논문 본문에 적혀 있지 않습니다.
합친 손실 함수
π0.5는 FAST 토큰의 자기회귀 예측과 flow matching을 한 손실에 넣습니다.
| 항 | 뜻 |
|---|---|
| 텍스트 토큰에 대한 교차 엔트로피 손실. FAST로 부호화한 행동 토큰도 여기 포함 | |
| 행동 전문가 출력과 목표 벡터장의 제곱 오차 | |
| 두 손실의 비중을 정하는 실수 |
이면 두 번째 항이 사라져 행동까지 텍스트 토큰으로만 학습하는 일반 VLM이 됩니다. 사전학습은 이 설정으로 하고, 사후학습에서 행동 전문가 가중치를 추가해 를 키웁니다. 저자들은 이 순서가 사전학습을 안정적으로 만들고 언어 지시를 잘 따르는 VLA를 만든다고 적습니다.
추론할 때는 텍스트 토큰 을 일반 자기회귀 디코딩으로 뽑은 뒤, 그 텍스트를 조건으로 잡음 제거 10단계를 거쳐 행동 를 만듭니다.
본문 3절의 전처리 설명은 목표 벡터장을 로 적고, 손실 식 (1)은 로 적습니다. 식 (1)이 행동 묶음 전체를 대상으로 하므로 이 글은 로 적었습니다.
4. 사전학습 — 서로 다른 데이터의 공동 학습

그림 4 — 실험실 교차 몸체, 다양한 이동형·비이동형 조작, 상위 하위 과제, 웹 데이터, 말로 준 지시의 예시입니다.
첫 학습 단계에서 π0.5는 일반 자기회귀 Transformer로 학습합니다. 텍스트, 물체 위치, FAST로 부호화한 행동 토큰을 모두 다음 토큰 예측으로 맞힙니다. 사전학습 데이터는 다섯 종류입니다.
| 약어 | 이름 | 내용 |
|---|---|---|
| MM | 다양한 이동형 조작기(Mobile Manipulator) 데이터 | 이동형 조작 로봇이 약 100개 집에서 집안일을 한 데이터 약 400시간. 평가 과제와 가장 가까움 |
| ME | 다양한 환경의 비이동형 로봇(Multi-Environment) 데이터 | 한 팔 또는 두 팔을 표면이나 받침대에 고정한 로봇으로 여러 집에서 모은 데이터. 가볍고 옮기기 쉬워 더 많은 집에서 모음. 몸체는 이동형 로봇과 다름 |
| CE | 실험실 교차 몸체(Cross-Embodiment) 데이터 | 단순한 탁자 환경에서 여러 종류의 로봇으로 모은 과제(탁자 치우기, 셔츠 개기 등). 한 팔·두 팔, 고정·이동 베이스를 모두 포함. 공개 데이터셋 OXE 포함. π0이 쓴 데이터셋의 확장판 |
| HL | 상위 하위 과제 예측(High-Level) 데이터 | MM·ME·CE 로봇 데이터에 하위 과제 설명과 경계 상자를 사람이 주석 |
| WD | 다중 모달 웹 데이터(Web Data) | 이미지 설명(CapsFusion, COCO), 질의응답(Cambrian-7M, PixMo, VQAv2), 물체 위치 찾기 |
그림 4 왼쪽 위 "Laboratory cross-embodiment" 칸이 CE, "Diverse mobile manipulator"가 MM, "Diverse non-mobile manipulator"가 ME, "High-level subtask"가 HL, "Multi-modal web data"가 WD입니다. 오른쪽 "Verbal instruction"은 사후학습에서만 쓰는 데이터로, 5절에서 다룹니다.
하위 과제 주석
"침실을 치워" 같은 상위 명령을 "이불을 정리해", "베개를 집어" 같은 짧은 하위 과제로 나누면, 모델이 현재 장면을 보고 다음 행동을 더 잘 정할 수 있습니다. 여러 하위 과제로 이루어진 로봇 데이터에는 사람이 모든 구간에 하위 과제 설명을 붙였습니다. 모델은 현재 관측과 상위 명령을 보고 하위 과제 라벨을 텍스트로 예측하고, 그 라벨을 조건으로 행동을 예측하도록 함께 학습합니다. 현재 관측에 보이는 관련 물체의 경계 상자도 주석으로 붙여, 하위 과제보다 먼저 예측하게 합니다.
아래 표는 그림 4의 HL 예시를 옮긴 것입니다.
| 질문 | 모델이 순서대로 내야 할 출력 |
|---|---|
| "How would you clean the bedroom?" | 경계 상자 <loc0405><loc0011><loc0911><loc0197>closet → 하위 과제 "move to closet" |
| "How would you clean the kitchen?" | 경계 상자 <loc0571><loc0376><loc0815><loc0484>mitten, <loc0787><loc0346><loc1003><loc0490>drawer → 하위 과제 "move left arm forward and pick up mitten" |
<loc…> 토큰 네 개가 상자 하나의 좌표이고, 그 뒤에 물체 이름이 붙습니다. 이 문자열도 텍스트 토큰이므로 다음 토큰 예측으로 학습됩니다.
웹 데이터
이미지 설명, 질의응답, 물체 위치 찾기 데이터를 사전학습에 넣습니다. 물체 위치 찾기에는 표준 데이터셋에 더해, 실내 장면과 가정용 물건에 경계 상자를 붙인 웹 데이터를 추가로 모았습니다. 그림 4의 WD 예시는 코끼리 사진의 한 영역 좌표를 주고 "Front legs of elephant"라고 설명하게 하거나, 파이 사진을 보고 어떤 파이인지 답하게 하는 과제입니다.
행동 데이터의 형식 맞추기
로봇마다 행동 공간이 다르므로, 행동 데이터를 한 모델에 넣으려면 형식을 맞춰야 합니다.
| 처리 | 방법 |
|---|---|
| 예측 대상 | 목표 관절 자세 또는 목표 말단장치(end-effector) 자세 |
| 제어 방식 구분 | 텍스트 프롬프트에 <control_mode> joint/end effector <control_mode> 추가 |
| 정규화 | 데이터셋마다, 행동 차원마다 1% 백분위수와 99% 백분위수를 써서 로 변환 |
| 차원 맞추기 | 모든 데이터셋 중 가장 큰 행동 공간에 맞춰 차원을 고정하고, 차원이 작은 로봇은 남는 칸을 0으로 채움 |
아래 표는 정규화를 한 차원에 대해 계산한 예입니다.
| 항목 | 값 |
|---|---|
| 어떤 데이터셋의 한 관절 행동 1% 백분위수 | −0.8 rad |
| 같은 차원의 99% 백분위수 | 1.2 rad |
| 원래 행동 값 | 0.7 rad |
| 정규화 값 | 0.5 |
백분위수와 행동 값은 임의의 예시 값이고, 선형 변환식은 1%→−1, 99%→1로 보내는 가장 단순한 형태로 적었습니다. 논문은 백분위수를 쓴다는 것만 밝히고 식을 적지 않았습니다.
차원 맞추기는 이렇게 됩니다. 행동 차원 수가 19로 고정됐다고 할 때, 18차원 로봇의 행동 벡터는 마지막 한 칸을 0으로 채웁니다.
| 로봇 | 1~18번째 칸 | 19번째 칸 |
|---|---|---|
| 19차원 로봇 | 실제 행동 값 | 실제 행동 값 |
| 18차원 로봇 | 실제 행동 값 | 0 |
고정 차원 수 19와 채우는 위치는 모양을 보여 주기 위한 예시입니다. 논문은 고정 차원 수를 적지 않았습니다.
사전학습 데이터의 구성 비율
논문은 데이터 종류별 비율을 표로 공개하지 않았습니다. 밝힌 수치는 사전학습 단계 예시의 97.6%가 이동형 조작 로봇의 집안일 데이터(MM)가 아닌 다른 출처에서 왔다는 것 하나입니다. 곧 MM은 사전학습 예시의 2.4%입니다.
5. 사후학습 — 이동형 조작 전문화와 행동 전문가 추가
이산 토큰으로 280k 걸음 사전학습한 뒤, 두 번째 단계인 사후학습(post-training)을 합니다. 목적은 두 가지입니다. 모델을 가정용 이동형 조작에 맞추고, flow matching으로 연속 행동 묶음을 만드는 행동 전문가를 추가하는 것입니다.
| 항목 | 사전학습 | 사후학습 |
|---|---|---|
| 학습 걸음 수 | 280k | 추가 80k |
| 손실 | 다음 토큰 예측만 () | 다음 토큰 예측 + flow matching () |
| 행동 전문가 | 없음 | 무작위 초기화로 추가 |
| 로봇 행동 데이터 | MM · ME · CE | MM · ME (성공 에피소드 중 일정 길이 이하만) |
| 웹 데이터 (WD) | 사용 | 사용 (의미·시각 능력 유지) |
| 하위 과제 데이터 (HL) | MM · ME · CE 주석 | 다양한 환경 데이터셋에 해당하는 부분 |
| 말로 준 지시 (VI) | 없음 | 사용 |
CE를 사후학습에서 빼는 이유는 이동형 조작과 다양한 환경에 모델을 집중시키기 위해서입니다.
말로 준 지시 데이터
말로 준 지시(Verbal Instruction, VI) 데이터는 모델이 알맞은 하위 과제를 고르는 능력을 높이려고 새로 모은 것입니다. 숙련된 사용자가 학습된 하위 정책이 실행 중인 로봇에게 실시간으로 "컵을 싱크대에 넣어" 같은 하위 과제 명령을 말로 내려, 방 청소 같은 긴 과제를 단계별로 수행하게 합니다. 로봇 팔을 직접 조종하는 원격조작 대신 언어로 조종하는 방식이고, 그렇게 기록된 명령 순서가 좋은 상위 출력의 시연이 됩니다.
그림 4 오른쪽 VI 칸에는 다른 예도 있습니다. 정책이 "put plate in sink"를 실행했는데 실제로는 접시를 건조대에 올렸다면, 라벨을 "put plate on rack"으로 다시 붙입니다. 정책이 "push the top drawer"를 실행하다 파란 셔츠를 집었다면 "pick up blue shirt"로 고칩니다. 로봇이 실제로 한 동작에 맞춰 라벨을 바꾸는 방식입니다.
6. 로봇 시스템

그림 5 — 카메라 4대, 6자유도 팔 2개, 이동 베이스, 몸통 승강 장치를 갖춘 이동형 조작기 두 종입니다.
실험에는 두 종류의 이동형 조작기를 씁니다.
| 항목 | 내용 |
|---|---|
| 팔 | 평행 집게가 달린 6자유도 팔 2개, 손목마다 단안 RGB 카메라 |
| 베이스 | 바퀴형 전방향(holonomic) 베이스. 상태·행동은 직선 속도 2차원 + 회전 속도 1차원 |
| 몸통 승강 장치 | 1차원(위아래) 또는 2차원(위아래 + 앞뒤) |
| 카메라 | 손목 2대 + 팔 사이에 단 앞쪽·뒤쪽 카메라 2대 |
| 상태·행동 차원 | 플랫폼에 따라 18 또는 19 |
| 제어 | 팔·집게·몸통 승강의 목표 자세와 베이스 목표 속도를 50 Hz로 명령(행동 묶음 사용) |
| 추종 | 단순 PD 제어기. 별도의 궤적 계획이나 충돌 검출 없음 |
18과 19차원의 구성은 팔 2개 × (관절 6 + 집게 1) = 14, 베이스 3, 몸통 승강 1 또는 2를 더한 값입니다. 14 + 3 + 1 = 18, 14 + 3 + 2 = 19입니다. 집게를 차원 하나로 세는 계산은 논문이 적은 합계와 맞춰 본 것입니다.
행동 묶음 50걸음을 50 Hz 명령 주기로 계산하면 1초 분량의 목표 값입니다. 논문은 한 묶음 가운데 몇 걸음을 실행한 뒤 다시 추론하는지는 적지 않았습니다.
조작과 이동 제어를 모두 종단간으로 학습한 정책이 직접 냅니다.
7. 실험 1 — 실제 집에서의 일반화

그림 6 — 통제된 비교용 모의 방(왼쪽)과 최종 평가용 실제 집(오른쪽). 모두 학습에 쓰지 않았습니다.
모든 실험은 학습에 쓰지 않은 새 환경에서 합니다. 정량 비교는 통제와 재현이 가능한 모의 가정 환경(mock home)에서 하고, 가장 현실적인 최종 평가는 학습 세트에 없는 실제 집 세 곳에서 합니다. 실험이 답하려는 질문은 다섯입니다.
- π0.5가 완전히 새로운 집에서 복잡한 여러 단계 과제로 일반화하는가
- 학습 데이터의 환경 수에 따라 일반화가 어떻게 달라지는가
- 공동 학습 데이터의 각 구성 요소가 최종 성능에 얼마나 기여하는가
- π0.5를 π0 VLA와 비교하면 어떤가
- 상위 추론이 얼마나 중요하고, 상위 추론 없는 방식이나 사람이 상위 과제를 정해 주는 방식과 비교하면 어떤가
평가 채점표
과제 성능은 성공/실패 대신 과제 진행률(task progress) 로 잽니다. 과제마다 채점표를 두고, 얻은 점수를 만점에 대한 백분율로 적습니다.
| 과제 | 시작 상태 | 점수 항목 | 만점 |
|---|---|---|---|
| 싱크대에 그릇 넣기 (Dishes in Sink) | 싱크대 근처에 그릇 4개(접시·그릇·도마·식기) | 집을 때마다 +1, 싱크대에 넣을 때마다 +1 | 8 |
| 서랍에 물건 넣기 (Items in Drawer) | 조리대 위에 물건 1개 | 물건 집기 +1, 서랍 열기 +1, 서랍에 넣기 +1, (물건이 안에 있을 때) 서랍 닫기 +1 | 4 |
| 빨래 바구니에 넣기 (Laundry Basket) | 바닥에 옷 한 벌 | 이동해 옷 집기 +1, 바구니 안이나 위에 놓기 +1, 옷이 바구니 안에 완전히 들어감 +1 | 3 |
| 침대 정리 (Make Bed) | 흐트러진 침대 | 이불을 펴 시트 덮기 +1, 베개 하나 머리맡에 놓기 +1, 두 번째 베개 놓기 +1, 이불을 아주 반듯하게 폄 +1, 두 베개를 아주 반듯하게 놓음 +1 | 5 |
싱크대 과제에서 그릇 4개 중 2개를 집어 싱크대에 넣고 나머지 2개는 집기만 했다면 2 + 2 + 2 = 6점, 곧 75%입니다. 앞 계산은 채점표 사용법을 보여 주기 위한 예시입니다.
평가 장소는 실제 집 세 곳과 모의 부엌 세 곳·모의 침실 세 곳을 합쳐 12곳입니다. 별도 언급이 없으면 정책마다 과제당 10회 평가하고, 한 비교 안에서는 모든 정책에 같은 네 장소를 써서 정책당 40회 평가합니다. 에피소드 하나가 수 분씩 걸려 평가에 시간이 많이 듭니다. 환경 변화의 영향을 줄이려고 정책들을 번갈아 실행했고, 로봇 고장이나 시간 제한 등으로 취소된 에피소드는 뺐습니다. 통계적 유의성은 시행 수가 다를 수 있다고 가정한 양측 t-검정으로 보고합니다.
실제 집 결과

그림 7(a) — 위부터 Home 1 서랍, Home 2 싱크대, Home 3 빨래 바구니 과제와 파란 글씨의 상위 추론 예측입니다.

그림 7(b) — 집과 과제별 평균 과제 진행률(10회 평균). 모의 환경 성능이 실제 집 성능과 비슷합니다.
로봇 두 종류를 모두 써서 실제 집 세 곳에서 침실 청소와 부엌 청소를 시켰습니다. 막대 위에 수치가 인쇄돼 있지 않아, 아래 표에는 그래프 눈금에서 읽은 근삿값을 옮겼습니다.
| 장소 | 서랍에 물건 넣기 | 싱크대에 그릇 넣기 | 빨래 바구니 |
|---|---|---|---|
| Real Home 1 | 약 90% | — | 약 80% |
| Real Home 2 | — | 약 94% | 약 90% |
| Real Home 3 | 약 70% | 약 65% | 약 83% |
| 모의 환경 | 약 85% | 약 91% | 약 80% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다. "—"는 해당 집에서 평가하지 않은 과제입니다.
과제 대부분은 여러 물건을 옮기는 여러 단계 과제로 2~5분 걸립니다. 모델은 "접시를 싱크대에 넣어" 같은 단순한 상위 명령만 받고, "컵을 집어" 같은 단계는 상위 추론이 스스로 정합니다. 저자들은 정량 평가에 쓴 과제 외에도 모델이 훨씬 많은 과제를 수행할 수 있다고 적습니다.
8. 실험 2 — 학습 환경 수에 따른 일반화
실험 설정
이동형 조작 데이터의 환경 수를 3, 12, 22, 53, 82, 104곳으로 바꿔 학습합니다. 환경 수마다 사전학습과 사후학습 전체를 반복하면 계산량이 너무 크므로, 이 실험에서는 이동형 조작 데이터를 뺀 로봇 행동 데이터 혼합으로 사전학습한 뒤, 환경 수가 다른 이동형 조작 데이터로 사후학습한 모델끼리 비교합니다.
환경 수가 다르면 데이터 크기도 다르지만, 사후학습 걸음 수를 40k로 맞춰 모든 모델이 같은 수의 고유 데이터 샘플을 보게 했습니다. 환경 수의 효과만 보기 위해 데이터 크기 효과를 통제한 설정입니다.
평가는 두 가지입니다.
| 평가 | 내용 |
|---|---|
| 여러 단계 과제 | 모의 가정 환경에서 싱크대·서랍·빨래·침대 네 과제를 채점표로 평가 |
| 언어 지시 따르기 | 부엌 조리대에서 언어 명령이 가리키는 특정 물건을 집어 서랍이나 싱크대에 넣기. 학습 데이터와 같은 범주의 새 물건(분포 안)과 학습에 없던 범주의 물건(분포 밖)을 따로 평가 |
여러 단계 과제 결과

그림 8 — 학습 환경이 늘수록 네 과제 평균 성능이 오르고, 104곳 모델은 테스트 집 데이터로 학습한 기준선과 비슷합니다.
| 학습 환경 수 | 평균 과제 진행률 |
|---|---|
| 3 | 약 14% |
| 12 | 약 47% |
| 22 | 약 60% |
| 53 | 약 75% |
| 82 | 약 66% |
| 104 | 약 86% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
오른쪽 막대 셋은 비교용 기준선입니다.
| 기준선 | 학습 방법 | 평균 과제 진행률 |
|---|---|---|
| in-domain data (짙은 초록) | 공동 학습 방법 그대로, 테스트 집 데이터를 학습에 포함 | 약 83% |
| in-domain data no pre-training (옅은 초록) | 다른 공동 학습 과제 없이 테스트 집 데이터로만 학습 | 약 39% |
| 104 locations no pre-training (옅은 노랑) | 다른 공동 학습 과제 없이 104곳 이동형 조작 데이터로만 학습 | 약 5% |
그래프 눈금에서 읽은 근삿값입니다.
환경이 늘수록 성능은 대체로 오르고, 53곳에서 82곳 사이에서는 내려갑니다. 104곳 모델은 테스트 집 데이터를 직접 학습한 기준선(초록 점선)과 비슷한 성능을 냅니다.
사전학습 없이 학습한 두 기준선은 크게 낮습니다. 테스트 집 데이터를 본 경우에도 약 39%에 그치므로, 다른 출처의 데이터가 일반화에 꼭 필요합니다. 테스트 집 데이터 없이 104곳 데이터로만 학습하면 약 5%로, 공동 학습 사전학습의 효과가 특히 큽니다.
언어 지시 따르기 결과

그림 9 — 학습 환경 수에 따른 지시 따르기 비율(왼쪽)과 성공률(오른쪽), 분포 안·밖 물건별로 나눴습니다.
| 지표 | 무엇을 세는가 |
|---|---|
| 지시 따르기 비율(follow rate) | 로봇이 명령이 가리킨 물건을 골랐는가 |
| 성공률(success rate) | 그 물건을 올바른 위치(서랍 안 또는 싱크대 안)에 넣었는가 |
그래프에서 읽은 근삿값입니다. 이 그래프의 가장 왼쪽 점은 약 12곳이고, 3곳 점은 없습니다.
| 학습 환경 수 | 따르기 (분포 안) | 따르기 (분포 밖) | 성공 (분포 안) | 성공 (분포 밖) |
|---|---|---|---|---|
| 약 12 | 약 21% | 약 25% | 약 18% | 약 15% |
| 약 22 | 약 44% | 약 26% | 약 39% | 약 13% |
| 약 52 | 약 62% | 약 37% | 약 53% | 약 28% |
| 약 82 | 약 57% | 약 57% | 약 53% | 약 29% |
| 약 104 | 약 66% | 약 67% | 약 61% | 약 54% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
환경이 늘수록 두 지표 모두 오르고, 분포 안 물건이 분포 밖 물건보다 빨리 오릅니다. 저자들은 새 환경마다 새 가정용 물건이 들어오면서 모델이 전반적으로 강건해지고, 학습 데이터에 없던 물건 범주로도 일반화하기 시작한다고 해석합니다.
9. 실험 3 — 공동 학습 구성 요소의 제거
전체 π0.5와, 학습 혼합에서 일부를 뺀 변형을 비교합니다.
| 변형 | 뺀 데이터 |
|---|---|
| no WD | 웹 데이터 |
| no ME | 다양한 환경의 비이동형 로봇 데이터 |
| no CE | 실험실 교차 몸체 데이터 |
| no ME or CE | 다른 로봇의 데이터 둘 다. 대상 이동형 조작 플랫폼 데이터와 웹 데이터만 남음 |
말로 준 지시(VI) 데이터의 효과는 11절에서 따로 봅니다.
모의 가정 환경 과제 결과

그림 10 — 네 과제 평균 과제 진행률(정책·과제당 10회). ME나 CE를 빼면 크게 떨어지고, WD 제거는 유의한 차이가 없습니다.
| 모델 | 평균 과제 진행률 (그래프 근삿값) | π0.5 대비 p 값 (그래프 인쇄 값) |
|---|---|---|
| π0.5 | 약 78% | — |
| no WD | 약 72% | p=0.385 |
| no CE | 약 51% | p<0.001 |
| no ME | 약 54% | p<0.001 |
| no CE or ME | 약 40% | p<0.001 |
평균 과제 진행률은 그래프 눈금에서 읽은 근삿값이고, p 값은 그래프에 인쇄된 값입니다.
다른 로봇 데이터 두 종류 가운데 하나라도 빼면 성능이 크게 떨어지고, 둘 다 빼면 더 떨어집니다. π0.5는 다른 환경(ME)과 다른 과제(CE) 양쪽의 몸체 간 전이에서 도움을 받습니다. 웹 데이터를 빼도 이 실험에서는 통계적으로 유의한 차이가 없지만, 아래 언어 지시 실험과 11절 상위 추론 실험에서는 웹 데이터의 영향이 큽니다.
언어 지시 따르기 결과

그림 11 — 분포 안·밖 물건의 지시 따르기 비율과 성공률. WD는 분포 밖 성능에, ME와 CE는 양쪽 모두에 크게 영향을 줍니다.
| 모델 | 따르기 (분포 안) | 성공 (분포 안) | 따르기 (분포 밖) | 성공 (분포 밖) |
|---|---|---|---|---|
| π0.5 | 약 86% | 약 83% | 약 94% | 약 94% |
| no WD | 약 86% | 약 82% | 약 80% | 약 73% |
| no CE | 약 74% | 약 67% | 약 67% | 약 49% |
| no ME | 약 66% | 약 57% | 약 33% | 약 31% |
| no ME or CE | 약 56% | 약 50% | 약 33% | 약 33% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
ME나 CE를 빼면 모델 성능이 크게 떨어지는 경향은 그림 10과 같습니다. 달라지는 것은 웹 데이터입니다. 웹 데이터를 빼면 분포 안 물건 성능은 거의 그대로인데, 분포 밖 물건의 따르기 비율과 성공률이 크게 떨어집니다. 저자들은 물리적 물체에 대한 넓은 지식을 담은 웹 데이터 덕분에, 학습에 없던 범주의 물건이 들어간 명령도 이해하고 따른다고 추측합니다.
10. 실험 4 — 다른 VLA와의 비교

그림 12 — 모의 가정 환경 네 과제에서 π0.5가 π0과 π0-FAST+Flow를 모두 앞섭니다.
비교 모델
| 모델 | 학습 방법 | 상위 추론 |
|---|---|---|
| π0 | 처음부터 행동 전문가를 쓰는 flow matching 학습 | 불가 |
| π0-FAST+Flow | 식 (1)의 FAST + flow matching 결합 학습과 두 단계 학습을 따르되, 로봇 행동 데이터만 사용 (HL · WD 없음) | 불가 |
| π0.5 | 두 단계 학습 + HL · WD 추가 | 가능 |
공정한 비교를 위해 모든 모델에 같은 교차 몸체 로봇 학습 세트를 주고, 학습 걸음 수도 비슷하게 맞췄습니다. π0.5와 π0의 차이는 두 가지입니다. 첫째, π0.5는 HL과 WD를 추가로 씁니다. 둘째, π0.5는 사전학습에서 이산 토큰으로 학습하고 사후학습에서만 행동 전문가를 쓰지만, π0은 항상 행동 전문가를 씁니다. π0-FAST+Flow는 두 번째 차이만 없앤 모델로, π0을 π0.5에 최대한 가깝게 만든 강한 비교 대상입니다.
결과
| 과제 | π0.5 | π0-FAST+Flow (no HL) | π0 300k | π0 80k |
|---|---|---|---|---|
| 싱크대에 그릇 넣기 | 약 91% | 약 55% | 약 41% | 약 19% |
| 서랍에 물건 넣기 | 약 85% | 약 70% | 약 32% | 약 5% |
| 빨래 바구니 | 약 80% | 약 73% | 약 31% | 약 39% |
| 침대 정리 | 약 58% | 약 48% | 약 20% | 약 14% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
π0.5는 네 과제 모두에서 π0과 강화판 π0-FAST+Flow를 앞서고, π0-FAST+Flow와의 차이는 싱크대 과제에서 가장 크고 빨래 바구니 과제에서 가장 작습니다. π0을 300k 걸음까지 더 오래 학습해도 π0.5가 앞섭니다. 저자들은 이 결과가 FAST 논문처럼, FAST 토큰 학습이 순수 확산 기반 학습보다 계산량 대비 효율적이라는 것을 확인해 준다고 적습니다.
언어 지시 따르기 비교

그림 15 — π0.5가 π0-FAST+Flow를 조금, π0을 크게 앞섭니다.
| 모델 | 지시 따르기 비율 | 성공률 |
|---|---|---|
| π0.5 | 약 77% | 약 71% |
| π0-FAST+Flow (no HL) | 약 68% | 약 64% |
| π0 300k | 약 19% | 약 16% |
| π0 80k | 약 35% | 약 27% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
π0.5는 π0-FAST+Flow보다 조금 높고 π0보다는 훨씬 높습니다. 저자들은 이 차이가 이산 토큰 학습이 언어 지시 따르기에 중요하다는 것을 보여 준다고 해석합니다. π0은 더 오래 학습한 300k 모델이 80k 모델보다 오히려 낮습니다. 논문은 이 역전을 따로 설명하지 않았습니다.
11. 실험 5 — 상위 추론의 중요성
π0.5의 상위 추론은 "침실을 치워" 같은 상위 명령을 받아 "베개를 집어" 같은 하위 과제를 내고, 그 하위 과제를 하위 행동 추론의 조건으로 넘깁니다. 일반 VLA처럼 과제 프롬프트를 하위 시스템에 바로 넣거나, 다른 모델을 상위 정책으로 쓰는 기준선을 만들 수 있습니다. 아래 방법은 모두 π0.5의 하위 추론을 그대로 쓰고 상위 정책만 바꿉니다.
| 방법 | 상위 정책 | 학습 데이터 |
|---|---|---|
| π0.5 | π0.5 자신이 상위·하위 추론을 모두 함 | 전체 |
| no WD | π0.5에서 웹 데이터를 뺀 모델 | WD 제외 |
| no VI | π0.5에서 말로 준 지시 데이터를 뺀 모델 | VI 제외 |
| implicit HL | 실행 중 상위 추론을 하지 않음 | 하위 과제 데이터는 학습에 포함 |
| no HL | 실행 중 상위 추론을 하지 않음 | 하위 과제 데이터도 학습에서 제외 |
| GPT-4 HL | GPT-4에 과제 설명과 자주 쓰는 라벨 목록을 프롬프트로 주고 하위 과제를 고르게 함 | 로봇 데이터로 학습하지 않음 |
| human HL | 숙련된 사람이 하위 과제를 정함 | 성능 상한을 보기 위한 기준 |

그림 13 — 전체 π0.5가 가장 높고, 상위 추론 없이 하위 과제 데이터만 학습한 implicit HL이 두 번째입니다.
| 방법 | 평균 과제 진행률 (그래프 근삿값) | π0.5 대비 p 값 (그래프 인쇄 값) |
|---|---|---|
| π0.5 | 약 78% | — |
| implicit HL | 약 71% | p=0.144 |
| no HL | 약 62% | p=0.011 |
| no VI | 약 60% | p=0.009 |
| no WD | 약 60% | p=0.008 |
| GPT-4 HL | 약 57% | p=0.002 |
| human HL | 약 63% | p=0.016 |
평균 과제 진행률은 그래프 눈금에서 읽은 근삿값이고, p 값은 그래프에 인쇄된 값입니다.
- π0.5 — 가장 높고, 사람이 하위 과제를 정해 주는 human HL보다도 높습니다.
- implicit HL — 두 번째로 높습니다. 실행 중에는 상위 추론을 하지 않지만 하위 과제 예측 데이터를 학습에 넣은 모델입니다. 하위 과제를 명시적으로 추론하면 이득이 있지만, 그 이득의 상당 부분은 하위 과제 예측 데이터를 학습 혼합에 넣는 것만으로 얻습니다.
- no HL — 하위 과제 데이터를 학습에서도 빼면 유의하게 낮아집니다.
- no VI — 말로 준 지시 데이터는 이동형 조작 상위 예시의 약 11%밖에 안 되지만, 빼면 유의하게 낮아집니다.
- no WD — 유의하게 낮습니다. 저자들은 웹 데이터의 이득 상당 부분이 상위 정책을 개선하는 데서 나온다고 봅니다.
- GPT-4 HL — 가장 낮습니다. 저자들은 로봇 데이터로 VLM을 적응시켜야 한다고 해석합니다.
12. 부록 — 과제별 분해와 모델 세부 설정
언어 지시 따르기 실험 설정
언어 지시 실험은 학습에 없던 부엌 장면 두 곳에서 "가위를 서랍에 넣어", "도마를 싱크대에 넣어" 같은 구체적인 명령을 줍니다.
| 시나리오 | 물건 5개 | 범주 |
|---|---|---|
| 서랍에 넣기 | 집게(tongs), 나무 서빙 스푼, 캔 따개, 가위, 작은 노란 머스터드 | 분포 안 |
| 싱크대에 넣기 | 컵, 그릇, 접시, 플라스틱 숟가락, 도마 | 분포 안 |
| 서랍에 넣기 (새 물건) | 깔때기, 약병, 그릴 점화기, 라이터, 보안경 | 분포 밖 (학습 세트에 없는 범주) |
매 시행마다 물건 5개를 놓고 그중 하나를 옮기라고 합니다. 명령을 해석하지 못하는 정책이 가까운 물건을 집는 요령을 쓰지 못하도록, 목표 물건을 방해물보다 멀리 둡니다. 명령을 이해하지 못하는 정책이 무작위로 고르면 지시 따르기 비율은 약 20%(5개 중 1개)가 됩니다.

그림 14(a) — 분포 안 물건을 서랍에 넣는 실험의 시작 상태입니다.

그림 14(b) — 분포 안 물건을 싱크대에 넣는 실험의 시작 상태입니다.

그림 14(c) — 학습에 없던 범주의 물건을 서랍에 넣는 실험의 시작 상태입니다.
학습 혼합 제거 실험의 과제별 결과

그림 16 — 네 과제별로 나눈 학습 혼합 변형의 과제 진행률입니다.
| 과제 | π0.5 | no WD | no CE | no ME | no CE or ME |
|---|---|---|---|---|---|
| 서랍에 물건 넣기 | 약 85% | 약 52% | 약 32% | 약 27% | 약 5% |
| 싱크대에 그릇 넣기 | 약 91% | 약 100% | 약 65% | 약 65% | 약 67% |
| 빨래 바구니 | 약 80% | 약 83% | 약 70% | 약 73% | 약 47% |
| 침대 정리 | 약 58% | 약 54% | 약 40% | 약 52% | 약 42% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
- 서랍에 물건 넣기 — ME, CE, WD 중 무엇을 빼도 크게 떨어지고, 전부 빼면 가장 크게 떨어집니다. 매우 넓은 범주의 일상 물건을 알아봐야 하는 과제라서, 여러 데이터 출처의 지식이 필요하다고 저자들은 봅니다.
- 싱크대에 그릇 넣기 — 웹 데이터를 빼도 떨어지지 않고(그래프에서는 오히려 약 100%), ME나 CE를 빼면 떨어집니다. 로봇 데이터에서 배우는 일반적인 조작 방법이 주로 필요한 과제로 해석합니다.
- 빨래 바구니, 침대 정리 — 교차 몸체 데이터를 빼면 떨어지지만, 다른 변화에는 대체로 덜 민감합니다.
상위 추론 방법의 과제별 결과

그림 17 — 네 과제별로 나눈 상위 추론 방법의 과제 진행률입니다.
| 과제 | π0.5 | implicit HL | no HL | no VI | no WD | GPT-4 HL | human HL |
|---|---|---|---|---|---|---|---|
| 서랍에 물건 넣기 | 약 85% | 약 79% | 약 70% | 약 48% | 약 40% | 약 52% | 약 52% |
| 싱크대에 그릇 넣기 | 약 91% | 약 77% | 약 55% | 약 77% | 약 91% | 약 55% | 약 79% |
| 빨래 바구니 | 약 80% | 약 83% | 약 73% | 약 83% | 약 80% | 약 87% | 약 83% |
| 침대 정리 | 약 58% | 약 46% | 약 48% | 약 35% | 약 31% | 약 38% | 약 40% |
그래프 눈금에서 읽은 근삿값이며, 논문에 인쇄된 수치가 아닙니다.
- 서랍과 싱크대 과제 — 상위 추론이 결정적입니다. no HL에서 크게 떨어지고, π0.5가 GPT-4 HL을 앞섭니다. 저자들은 도메인 데이터로 미세조정한 상위 모델이 하위 정책의 성공을 돕는 방식을 배운다고 해석합니다.
- 서랍 과제의 웹 데이터 — 웹 데이터를 빼면 크게 떨어집니다. 덜 본 물건으로 일반화하는 데 의미 지식이 중요하다는 학습 혼합 실험 결과와 같습니다.
- 빨래 바구니 — 상위 정책 선택에 거의 민감하지 않습니다.
부록 본문은 이 마지막 항목을 "빨래 바구니와 싱크대 과제는 상위 정책 선택에 덜 민감하다"고 적었습니다. 바로 앞 문장에서 싱크대 과제를 상위 추론이 결정적인 과제로 꼽았고, 그래프에서도 싱크대 과제는 no HL과 GPT-4 HL에서 약 55%로 떨어지므로, 이 글에서는 빨래 바구니만 덜 민감한 과제로 적었습니다.
모델 세부 설정
π0.5는 π0을 바탕으로, 시각-언어 이해에 PaliGemma VLM을 백본(backbone)으로 쓰고 빠른 행동 생성에 행동 전문가를 씁니다.
| 항목 | VLM 백본 | 행동 전문가 |
|---|---|---|
| 초기화 | PaliGemma 가중치 | 무작위 (사후학습 시작 시) |
| 파라미터 | 2B (부록 표기) | 300M |
| 너비(width) | 2048 | 1024 |
| 깊이(depth) | 18 | 18 |
| MLP 차원 | 16,384 | 4096 |
| 주의 헤드 수 | 18 | 18 |
| 키·값 헤드 수 | 1 | 1 |
| 헤드 차원 | 256 | 256 |
VLM 백본은 π0처럼 이미지 열과 언어 프롬프트를 받고, 여기에 토큰화한 로봇 상태와 자기회귀로 예측할 토큰화 행동을 더 받습니다. 행동 전문가는 행동 지평 50, 곧 인 잡음 섞인 행동 토큰 을 받습니다. 부터 까지 세면 50걸음입니다. 잡음 섞인 행동 묶음(행동 차원 )은 먼저 선형 층 하나로 Transformer 임베딩 크기에 투영됩니다.
시간 값의 입력 방식
π0은 flow matching 시간 값 를 잡음 섞인 행동과 합쳐 Transformer에 넣었습니다. π0.5는 만 따로 MLP로 투영한 뒤, 적응형 RMSNorm으로 행동 전문가의 각 층에 시간 정보를 넣습니다. 시간 MLP는 다음 형태입니다.
는 사인파 위치 부호화 함수입니다. 스칼라 하나를 차원 벡터로 바꾸고, 선형 변환과 swish 활성화를 두 번 거칩니다. 행동 전문가가 내는 행동 토큰 는 마지막 선형 투영으로 목표 벡터장이 됩니다.
시간 값의 표본 분포
학습할 때 를 균등 분포 에서 뽑지 않고, π0을 따라 낮은 시간 값에 비중을 두는 분포에서 뽑습니다.
보다 큰 시간 값은 뽑지 않습니다. 적분 간격 가 보다 크면 그 구간의 값은 쓰이지 않기 때문입니다. 는 적분을 최대 1,000단계()까지 할 수 있게 하는 값입니다. 여기의 , 는 베타 분포의 모양 값이고, 3절 손실 함수의 와는 다른 기호입니다.
이미지 증강
모든 입력 이미지에 다음 순서로 증강을 적용합니다.
transforms = [
augmax.RandomCrop(int(width * 0.95), int(height * 0.95)),
augmax.Resize(width, height),
augmax.Rotate((-5, 5)),
augmax.ColorJitter(brightness=0.3, contrast=0.4, saturation=0.5),
]
| 단계 | 내용 |
|---|---|
| 무작위 자르기 | 가로·세로 95% 크기로 무작위 위치를 잘라냄 |
| 크기 조정 | 원래 크기로 되돌림 |
| 회전 | −5도에서 5도 사이로 무작위 회전 |
| 색 변화 | 밝기 0.3, 대비 0.4, 채도 0.5 범위에서 무작위 변화 |
13. 논문 안의 불일치
| 위치 | 내용 | 이 글의 처리 |
|---|---|---|
| 그림 3 캡션과 부록 A-E | 그림 3은 VLM을 "SigLIP (400M) + Gemma (2.6B)"로 적고, 부록은 "2B VLM"이라고 적음 | 두 표기를 해당 위치에 각각 그대로 적음. 어느 기준의 파라미터 수인지 논문이 설명하지 않음 |
| 3절 본문과 식 (1) | 목표 벡터장을 본문은 , 식 (1)은 로 적음 | 행동 묶음 전체를 대상으로 하는 식 (1) 표기를 씀 |
| 부록 A-D 상위 추론 분석 | 서랍·싱크대 과제는 상위 추론이 결정적이라고 쓴 뒤, 이어서 빨래 바구니·싱크대 과제는 상위 정책 선택에 덜 민감하다고 씀 | 그림 17에서 싱크대 과제는 방법에 따라 크게 변하므로, 덜 민감한 과제는 빨래 바구니로만 적음 |
| 그림 11 캡션 | "학습 환경 수를 바꿔 학습한 뒤" 평가했다고 적었지만, 그림에는 환경 수 축이 없고 학습 혼합 변형별 막대만 있음 | 그림 내용(학습 혼합 변형 비교)을 기준으로 설명함 |
| 그림 11과 그림 15의 π0.5 | 같은 언어 지시 실험인데 π0.5 지시 따르기 비율이 그림 11에서는 분포 안 약 86%, 그림 15에서는 약 77%로 다름 | 두 그림이 분포 안·밖 중 무엇을 평균했는지 논문이 밝히지 않아, 그림별 값을 각각 적음 |
| 그림 1 | 본문이 그림 1을 참조하지만 arxiv HTML 판에는 이미지가 없음 | PDF에 그림 1이 있다는 사실만 적음 |
14. 저자가 밝힌 한계
첫째, 넓게 일반화하지만 여전히 실수를 합니다. 익숙하지 않은 서랍 손잡이나 로봇이 물리적으로 열기 어려운 찬장처럼 계속 어려운 환경이 있고, 닦아야 할 얼룩을 로봇 팔이 가리는 식으로 부분 관측 때문에 어려운 동작도 있습니다. 상위 하위 과제 추론이 쉽게 흔들리는 경우도 있습니다. 물건을 넣는 동안 서랍을 여러 번 열고 닫는 행동이 예입니다. 더 나은 공동 학습과 전이, 더 큰 데이터셋으로 풀 과제로 봅니다.
둘째, 비교적 단순한 프롬프트만 처리합니다. 모델이 다룰 수 있는 프롬프트의 복잡도는 학습 데이터가 정하므로, 사람이 붙이거나 합성한 더 복잡하고 다양한 주석으로 더 복잡한 선호와 지시를 넣을 수 있다고 봅니다.
셋째, 맥락이 비교적 짧습니다. 방 사이를 이동하거나 물건을 둔 위치를 기억해야 하는 과제처럼 부분 관측이 더 심한 설정에서는, 더 긴 맥락과 기억이 필요합니다.
넷째, 서로 다른 데이터 출처의 한 가지 조합만 탐색했습니다. 말로 준 지시에서 배우는 능력은 새로운 감독 방식이고, 사람이 로봇에게 맥락 지식을 주는 다른 방법도 앞으로 탐색할 수 있다고 적습니다.
15. 정리 — 계보에서의 위치
- 공동 학습 데이터 — 이동형 조작 데이터 약 400시간(약 100개 집)에 비이동형 로봇(ME), 실험실 교차 몸체(CE), 하위 과제 주석(HL), 웹 데이터(WD)를 더해 사전학습하고, 사후학습에 말로 준 지시(VI)를 더했습니다. 사전학습 예시의 97.6%가 MM 이외의 출처입니다.
- 한 모델의 상위·하위 추론 — 같은 신경망이 하위 과제 텍스트를 먼저 예측하고, 그 텍스트를 조건으로 행동 묶음을 냅니다.
- 두 단계 행동 표현 — 사전학습 280k 걸음은 FAST 이산 토큰만으로 학습하고, 사후학습 80k 걸음에서 flow matching 행동 전문가(300M)를 추가해 추론 때 잡음 제거 10단계로 연속 행동을 만듭니다.
- 결과 — 학습에 없던 실제 집 세 곳에서 부엌·침실 청소 과제를 수행했고, 학습 환경이 104곳이 되면 테스트 집 데이터로 학습한 모델과 비슷한 성능을 냈습니다. 다른 로봇 데이터를 빼면 성능이 크게 떨어지고, 웹 데이터는 분포 밖 물건과 상위 추론에서 효과가 컸습니다.
앞선 모델과의 비교
| 항목 | SayCan · PaLM-E | π0 | FAST (π0-FAST) | π0.5 |
|---|---|---|---|---|
| 상위 과제 결정 | 언어 모델·VLM이 텍스트로 결정 | 없음 | 없음 | 같은 모델이 텍스트로 결정 |
| 하위 행동 생성 | 별도로 학습한 하위 정책 | 행동 전문가 flow matching | FAST 토큰 자기회귀 | 사전학습은 FAST 토큰, 사후학습·추론은 행동 전문가 flow matching |
| 한 신경망 여부 | 상위·하위가 다른 모델 | 한 모델 | 한 모델 | 한 모델 |
| 공동 학습 데이터 | — | 로봇 행동 데이터 | 로봇 행동 데이터 | 로봇 행동 + HL + WD (+ VI) |
| 평가 환경 | 학습 환경과 비슷함 | 학습 환경과 비슷함 | 학습 환경과 비슷함 | 학습에 없던 집 |
SayCan · PaLM-E, π0, FAST 열은 이 논문의 관련 연구 설명과 비교 실험 설명을 기준으로 적었습니다.
π0.5는 π0의 flow matching 행동 생성, FAST의 이산 토큰 학습, SayCan과 PaLM-E의 상위 계획·하위 실행 구조를 한 모델 안에 넣고, 여기에 다른 로봇과 웹의 데이터를 공동 학습해 학습 환경 밖으로 일반화를 넓혔습니다. 계보의 다음 연구로는 OpenVLA의 미세조정 방식을 바꾼 OpenVLA-OFT와, 휴머노이드용 이중 시스템 구조를 제안한 GR00T N1이 이어집니다.
전체 목록은 VLA 계보 목차에서 볼 수 있습니다.