들어가며
RT-1과 RT-2는 모두 구글 로봇 한 종이 사무실 주방에서 모은 시연으로 학습했습니다. RT-2는 웹 데이터로 시각·언어 지식을 넓혔지만, 로봇 행동 데이터는 여전히 로봇 한 종의 것이었습니다. 반면 로봇 학습 연구실은 전 세계에 많고, 연구실마다 Franka, UR5, WidowX 같은 서로 다른 로봇으로 데이터를 모아 왔습니다. 이 데이터는 대부분 각자의 형식으로 흩어져 있어서 한 모델의 학습에 같이 쓰이지 않았습니다.
Open X-Embodiment 는 이 흩어진 데이터를 한 형식으로 모은 데이터셋이자, 그 데이터로 RT-1과 RT-2를 다시 학습한 실험 보고서입니다. 제목의 X-Embodiment는 cross-embodiment, 곧 여러 몸체(embodiment)에 걸친 학습을 뜻합니다. 몸체는 로봇의 팔 구조, 집게, 카메라 배치, 제어 방식까지 포함한 로봇 하드웨어 한 종을 가리킵니다. 논문이 묻는 질문은 다른 로봇의 데이터를 섞어 학습하면 내 로봇의 성능이 오르는가입니다.
📄 Open X-Embodiment: Robotic Learning Datasets and RT-X Models — Open X-Embodiment Collaboration (Abby O’Neill, Abdul Rehman, Abhinav Gupta 외, 저자 294명) / 21개 기관, 2023-10 공개 (v9 2025-05)
프로젝트 페이지는 robotics-transformer-x.github.io이고, arxiv 식별자는 2310.08864입니다. 이 글은 arxiv v9를 기준으로 합니다.
초록 요약
자연어 처리와 컴퓨터 비전에서는 크고 다양한 데이터로 학습한 범용 모델 하나를 여러 응용의 출발점으로 쓰는 방식이 자리 잡았습니다. 로봇 학습은 여전히 응용마다, 로봇마다, 심지어 환경마다 모델을 따로 학습합니다. 저자들은 새 로봇·과제·환경에 효율적으로 맞출 수 있는 범용 교차 로봇 정책을 로봇에서도 만들 수 있는지 탐구하려고, 표준 형식의 데이터셋과 모델을 공개합니다. 데이터셋은 21개 기관의 협업으로 모은 22종 로봇의 데이터이고, 527개 기술(160266개 과제)을 담습니다. 이 데이터로 학습한 대용량 모델 RT-X는 다른 로봇의 경험을 활용해 여러 로봇의 성능을 끌어올리는 긍정적 전이(positive transfer)를 보입니다.

첫 페이지 그림 — 34개 연구실·21개 기관의 60개 데이터셋에서 22종 몸체, 527개 기술, 100만 개 에피소드를 모았습니다.
그림 가운데 상자가 데이터셋의 규모를 요약합니다. 311개 장면에서 모은 100만 개 에피소드, 34개 연구실과 21개 기관, 22종 몸체, 527개 기술, 60개 데이터셋, 그리고 지시문에서 뽑은 속성 1,798개·물체 5,228개·공간 관계 23,486개입니다. 양옆은 QT-Opt, Bridge, RT-1, Cable Routing 같은 원래 데이터셋의 장면과 지시 예시입니다.
1. 문제 — 로봇마다 따로 학습하는 관행
로봇 데이터의 규모와 폭
비전과 자연어 처리의 교훈은 넓은 데이터로 학습한 범용 모델이 좁은 데이터로 학습한 전용 모델을 앞서는 경우가 많다는 것입니다. 웹에서 모은 이미지-텍스트로 학습한 CLIP이 고정 어휘 분류기를 앞서고, 거대 텍스트로 학습한 언어 모델이 과제 전용 시스템을 앞섭니다.
로봇은 이 교훈을 적용하기 어렵습니다. 논문이 비교한 규모는 이렇습니다.
| 분야 | 대표 벤치마크 데이터 규모 |
|---|---|
| 비전 | 5M–18M |
| 자연어 처리 | 1.5B–4.5B |
| 로봇 | 가장 큰 수집 사업도 위 규모의 일부 |
로봇 데이터셋은 규모도 작고, 대개 환경 하나, 물체 묶음 하나, 좁은 과제 범위처럼 어느 한 축에서 좁습니다. RT-1이 로봇 13대로 17개월을 들여 모은 약 13만 개 시연도 로봇 한 종, 사무실 주방 몇 곳의 데이터입니다.
교차 몸체 학습이라는 관점
저자들은 데이터셋 하나하나는 좁더라도, 여러 로봇·연구실·환경의 데이터셋을 합치면 환경과 로봇의 변화를 더 넓게 담는다고 봅니다. 그래서 일반화하는 로봇 정책을 얻으려면 여러 로봇 플랫폼의 데이터로 학습하는 교차 몸체 학습(X-embodiment training) 이 필요하다는 관점을 취합니다.
논문의 목표는 두 가지입니다.
- 여러 로봇과 환경의 데이터로 학습한 정책이 긍정적 전이 를 보여, 평가 환경의 데이터만으로 학습한 정책보다 나은지 확인합니다.
- 이후 교차 몸체 연구를 위해 대규모 로봇 데이터셋을 정리해 공개합니다.
저자들은 새로운 구조나 알고리즘을 제안하지 않는다고 명시합니다. RT-1과 RT-2를 거의 그대로 가져와 데이터만 바꿔 학습하고, 그 모델과 데이터, 도구를 함께 공개하는 것이 기여입니다.
기존 연구와의 차이
| 기존 연구 | 접근 | 이 논문과의 차이 |
|---|---|---|
| 몸체 간 전이 (시뮬레이션·실물) | 공유 행동 표현, 표현 학습 목적 함수, 몸체 정보로 정책 적응, 로봇·환경 표현 분리 등 몸체 차이를 줄이는 장치를 따로 설계 | 몸체 차이를 줄이는 장치 없이 여러 몸체 데이터로 정책을 직접 학습 |
| 사람-로봇 전이 | 도메인 변환이나 전이 가능한 표현으로 사람 영상과 로봇의 차이를 줄임 | 사람 영상이 아니라 로봇 데이터끼리 결합 |
| 대규모 로봇 데이터셋 (잡기, 밀기, 원격조작 시연 등) | RoboNet을 빼면 같은 종류 로봇의 데이터 | 여러 몸체에 걸친 데이터를 한 저장소로 표준화 |
| 언어 조건 로봇 학습 (BC-Z, RT-1, RT-2 등) | 사전학습 언어 임베딩이나 시각-언어 모델을 모방 학습에 사용 | 같은 방식을 대규모 다중 몸체 시연 데이터로 확장 |
Transformer로 교차 몸체 학습과 전이를 보인 선행 연구(Gato, RoboCat 등)도 있습니다. 이 논문은 여기에 웹 규모 사전학습과 교차 몸체 전이가 어떻게 함께 작용하는지를 더해 분석합니다.
2. 긍정적 전이의 의미
긍정적 전이는 "다른 데이터를 섞었더니 원래 과제 성능이 올랐다"는 결과를 가리킵니다. 이 논문에서는 비교 대상을 두 가지로 둡니다.
- 원래 방법(Original Method) — 그 데이터셋을 만든 연구팀이 자기 데이터로만 학습한 모델입니다. 그 데이터에 맞춰 최적화된 모델이므로 합리적인 기준선입니다.
- 같은 데이터로만 학습한 RT-1 — 구조는 RT-1-X와 똑같고 학습 데이터만 평가 데이터셋 하나로 한정한 모델입니다.
RT-1과 RT-1-X는 신경망 구조가 같습니다. 그래서 두 모델의 차이는 오로지 학습 데이터에서 옵니다. 실제 결과 하나를 예로 들면, 7절의 Cable Routing 과제에서 같은 구조의 RT-1은 자기 데이터로만 학습했을 때 18%이고, 여러 로봇 데이터를 섞은 RT-1-X는 56%입니다. 이 차이가 이 논문에서 말하는 긍정적 전이입니다. 반대로 섞은 데이터 때문에 성능이 떨어지면 부정적 전이라고 부릅니다. 7절의 Autolab UR5처럼 원래 방법보다 낮게 나오는 경우도 있습니다.
3. Open X-Embodiment 데이터셋
규모
Open X-Embodiment 저장소는 두 가지를 공개합니다. 22종 로봇 몸체에서 모은 100만 개가 넘는 로봇 궤적의 데이터셋과, 추론과 미세조정에 바로 쓸 수 있는 RT-X 모델 체크포인트입니다.
| 항목 | 값 |
|---|---|
| 실물 로봇 궤적 | 100만 개 이상 |
| 로봇 몸체 | 22종 (단일 로봇 팔, 양팔 로봇, 사족 보행 로봇 포함) |
| 원본 데이터셋 | 60개 |
| 참여 연구실 | 34개 |
| 참여 기관 | 21개 |
| 장면 | 311개 |
| 기술 | 527개 |
| 과제 | 160266개 |
60개 데이터셋은 새로 모은 것이 아니라 기존 로봇 데이터셋을 모아 형식을 통일한 것입니다. 저자들은 커뮤니티가 참여를 넓혀 데이터셋을 계속 키울 계획이라고 밝힙니다.
RLDS 형식
데이터는 RLDS(Reinforcement Learning Datasets) 형식으로 저장합니다. RLDS는 데이터를 직렬화된 tfrecord 파일에 담는 형식입니다. 로봇마다 다른 행동 공간과 입력 종류, 이를테면 색 카메라 수가 다르거나 깊이 카메라나 점군(point cloud)이 있는 경우를 모두 수용하고, 주요 딥러닝 프레임워크에서 병렬로 빠르게 불러올 수 있습니다.
데이터 한 건의 모양은 에피소드 하나가 시간 순서대로 이어진 걸음(step)의 목록인 구조입니다. 걸음 하나에는 그 시점의 관측, 로봇이 낸 행동, 과제 지시문이 들어갑니다. 논문 본문은 필드 이름까지 적지 않으므로, 아래 표는 두 데이터셋이 같은 틀에 들어가는 모양을 보여 주기 위한 예시입니다.
| 걸음 안의 항목 | 데이터셋 A (카메라 2대, 위치 제어) | 데이터셋 B (카메라 1대 + 깊이, 속도 제어) |
|---|---|---|
| 관측 — 이미지 | 손목 카메라, 3인칭 카메라 | 3인칭 카메라 |
| 관측 — 기타 | 없음 | 깊이 이미지 |
| 행동 | 말단장치 위치 변화량 + 집게 | 말단장치 속도 + 집게 |
| 지시문 | "pick up the orange fruit" | "route cable" |
표의 구성은 설명을 위한 예시이며, 실제 60개 데이터셋별 구성은 프로젝트 페이지에 정리돼 있습니다.
형식은 같아도 안의 내용은 데이터셋마다 다릅니다.
데이터셋 분석

그림 1 — (a) 몸체별 데이터셋 수 (b) 몸체별 장면 수 (c) 몸체별 궤적 수 (d) 자주 나오는 기술 (e) 자주 나오는 물체.
(a)는 22종 몸체마다 데이터셋이 몇 개인지를 보여 줍니다. Franka가 가장 많고, xArm 6개, Sawyer 4개, Google Robot·Kuka iiwa·UR5가 각 3개로 뒤를 잇습니다. Unitree A1 같은 사족 보행 로봇, RC Car, TurtleBot 2 같은 이동 로봇도 데이터셋 하나씩 들어 있습니다.
(b) 장면 수는 데이터셋 메타데이터로 센 값입니다. Franka 데이터셋이 많아서 시각적으로 다른 장면도 Franka가 가장 많습니다. (c) 궤적 수는 양상이 다릅니다. xArm과 Google Robot이 가장 많은데, 소수의 대형 데이터셋이 궤적 수를 크게 차지하기 때문입니다. 데이터셋 수로는 Franka가, 궤적 수로는 xArm이 가장 많아서, 어느 기준으로 세느냐에 따라 데이터가 많은 몸체가 달라집니다.
(d)와 (e)는 지시문으로 분석했습니다. PaLM 언어 모델로 지시문에서 물체와 행동을 뽑아 셌습니다. 기술은 집기(picking)가 압도적으로 많고 옮기기(moving), 밀기(pushing), 놓기(placing)가 뒤를 잇습니다. 대부분 집어-놓기 계열이지만, 닦기(wiping)나 조립하기(assembling)처럼 드물게 나오는 기술도 있습니다. 물체는 도형, 용기, 가구, 음식, 가전, 식기 범주에 걸쳐 가정용 물체를 폭넓게 담습니다.
4. 데이터 형식 통일 — 관측과 행동의 거친 정렬
문제 — 로봇마다 다른 관측과 행동
교차 몸체 모델을 만들 때 가장 먼저 부딪히는 문제는 로봇마다 관측 공간과 행동 공간이 크게 다르다는 것입니다. 카메라 수와 위치가 다르고, 어떤 로봇은 말단장치의 목표 위치를, 어떤 로봇은 속도를 명령으로 받습니다. 제어 주기도 다릅니다.
아래 표는 그림 2 오른쪽에 실린 세 데이터셋의 행동 공간입니다.
| 데이터셋 예시 (그림 2) | 제어 주기 | 집게 | 위치 행동 | 회전 행동 |
|---|---|---|---|---|
| Route cable | 10 Hz | 닫힌 상태로 고정 | 속도 | Z축 회전 속도만 |
| Pick apple from top drawer and place on counter | 3 Hz | 사용 | 위치 변화량 | 회전 변화량 |
| Pick up the orange fruit | 5 Hz | 사용 | 위치 변화량 | 회전 없음 |
세 로봇은 명령의 주기, 단위, 차원 구성이 모두 다릅니다.
해결 — 거친 정렬
저자들은 데이터셋 사이의 관측·행동 공간을 거칠게 정렬(coarse alignment) 합니다. 물리적 의미까지 정확히 맞추지 않고, 모델이 같은 모양의 입력과 출력을 다룰 수 있을 정도로만 맞춥니다.
관측 쪽 에서는 데이터셋마다 대표 카메라 시점 하나를 골라 입력 이미지로 쓰고, 공통 해상도로 크기를 맞춥니다. 모델은 최근 이미지 몇 장의 이력과 언어 지시를 관측으로 받습니다. 논문은 모델 입력에 로봇 종류를 따로 넣는다고 적지 않습니다.
행동 쪽 에서는 원래 행동을 7차원 말단장치 행동으로 바꿉니다. x, y, z, 롤(roll), 피치(pitch), 요(yaw), 집게 벌림이고, 로봇에 따라 이 값 자체이거나 그 변화율입니다. 여기에 에피소드 종료 여부 1차원을 더해 모두 8차원이고, 각 차원을 256개 구간으로 균등하게 나눠 토큰으로 만듭니다. RT-1과 RT-2가 쓰던 이산화와 같습니다.
데이터셋별 정규화
이산화하기 전에 행동을 데이터셋마다 따로 정규화(normalize) 합니다. 그래서 모델이 낸 같은 출력도 어느 몸체에서 쓰는지에 따라 다른 물리량으로 되돌려(de-normalize) 해석됩니다.
논문은 정규화 공식을 적지 않습니다. 아래 표는 흔히 쓰는 최솟값-최댓값 정규화를 가정하고, 모양을 보여 주기 위해 임의로 고른 값입니다.
| 단계 | 데이터셋 A (x 위치 변화량) | 데이터셋 B (x 속도) |
|---|---|---|
| 원래 값의 범위 | −0.02 ~ 0.02 m | −0.5 ~ 0.5 m/s |
| 어떤 시점의 원래 값 | 0.01 m | 0.25 m/s |
| −1 ~ 1로 정규화한 값 | 0.5 | 0.5 |
| 256구간 번호 | 191 | 191 |
임의의 예시 값입니다. 구간 번호는 (정규화 값 + 1) ÷ 2 × 255를 내림한 값입니다.
두 데이터셋의 서로 다른 행동이 같은 토큰 191이 됩니다. 추론할 때 모델이 191을 내면, 데이터셋 A의 로봇에서는 x 방향으로 0.01 m 움직이라는 명령으로, 데이터셋 B의 로봇에서는 x 방향 0.25 m/s로 움직이라는 명령으로 되돌립니다.
정렬하지 않은 부분
거친 정렬이라서 맞추지 않은 것도 많습니다.
- 카메라 — 로봇에 대한 카메라의 상대 위치와 카메라 특성이 데이터셋마다 달라서, 대표 시점을 골라도 이미지는 크게 다릅니다.
- 좌표계 — 말단장치를 제어하는 좌표계를 데이터셋 사이에 맞추지 않습니다.
- 행동의 의미 — 행동 값이 절대 위치인지 상대 위치인지, 위치인지 속도인지는 각 로봇의 원래 제어 방식을 따릅니다.
그 결과 같은 행동 벡터가 로봇마다 전혀 다른 움직임을 만들 수 있습니다. 저자들은 이런 차이를 줄이는 장치 없이도 긍정적 전이가 나타나는지를 보려 합니다.
5. RT-X 모델 — RT-1-X와 RT-2-X
그림 2 — 두 모델 모두 이미지와 텍스트 지시를 받아 이산화한 말단장치 행동을 냅니다. 오른쪽은 데이터셋마다 다른 행동 공간 예시입니다.
교차 몸체 데이터는 크고 이질적이라, 이 데이터를 활용할 만큼 용량이 큰 모델이 필요합니다. 저자들은 Transformer 기반 로봇 정책인 RT-1과 RT-2를 거의 그대로 가져와 교차 몸체 설정에 맞춥니다. 학습한 모델을 각각 RT-1-X, RT-2-X 라고 부릅니다.
RT-1-X
RT-1은 로봇 제어용으로 설계한 35M 파라미터 Transformer입니다. 이 논문의 설명에 따르면 이미지 15장의 이력과 언어 지시를 받습니다. 이미지는 ImageNet으로 사전학습한 EfficientNet을 거치고, 지시는 USE 임베딩이 됩니다. 시각 표현과 언어 표현을 FiLM 층으로 섞어 시각-언어 토큰 81개를 만들고, decoder-only Transformer가 이 토큰에서 행동 토큰을 냅니다.
이 설명은 RT-1 논문해석과 두 군데가 다릅니다. RT-1 논문은 이미지 이력을 6장으로 쓰고, 이미지당 81개 토큰을 TokenLearner로 8개로 줄여 Transformer에 넣습니다. 이 논문은 15장이라고 적고 TokenLearner를 언급하지 않습니다. RT-1-X가 실제로 이력 길이를 바꿨는지, 요약하면서 생략한 것인지는 논문에서 확인할 수 없습니다.
RT-2-X
RT-2는 인터넷 규모의 시각·언어 데이터와 로봇 제어 데이터로 함께 학습한 시각-언어-행동 모델(VLA) 계열입니다. 행동 토큰을 텍스트 토큰으로 바꾸기 때문에, 사전학습한 시각-언어 모델(VLM)이라면 무엇이든 로봇 제어용으로 미세조정할 수 있고 VLM 백본(backbone)의 일반화 능력 일부가 로봇 제어로 넘어옵니다.
이 논문은 RT-2 가운데 RT-2-PaLI-X 변형을 씁니다. 시각 모델 ViT와 언어 모델 UL2로 이루어지고, 주로 WebLI 데이터셋으로 사전학습한 VLM이 백본입니다. 크기는 55B이고, 제거 실험에서는 5B도 씁니다.
논문은 RT-2의 행동 문자열 예시로 "1 128 91 241 5 101 127" 을 다시 싣습니다. 이 예시는 정수가 7개라서 8차원 행동과 맞지 않습니다. RT-2 논문에서 옮겨 온 같은 예시이고, RT-2 논문해석의 행동 토큰화 절에 8개짜리 예시와 함께 정리해 두었습니다.
두 모델의 비교
| 항목 | RT-1-X | RT-2-X |
|---|---|---|
| 구조 | 로봇 제어 전용 (FiLM EfficientNet + Transformer) | VLM 백본 (ViT + UL2) |
| 파라미터 | 35M | 55B (제거 실험에서 5B) |
| 사전학습 | ImageNet 이미지 부호기, USE 지시 임베딩 | 웹 규모 시각·언어 데이터로 학습한 VLM 전체 |
| 학습 데이터 | 로봇 데이터 혼합만 | 원래 VLM 데이터와 로봇 데이터 혼합을 약 1:1로 섞은 공동 미세조정(co-fine-tuning) |
| 손실 | 행동 구간에 대한 범주형 교차 엔트로피 | 전체 언어 토큰에 대한 범주형 교차 엔트로피 |
| 추론 위치 | 로봇 쪽 로컬 | 클라우드 서비스에 올리고 네트워크로 질의 |
| 추론 주기 | 로봇이 요구하는 3–10 Hz | 로봇이 요구하는 3–10 Hz |
로봇 데이터 혼합
모든 실험에 같은 로봇 데이터 혼합 을 씁니다. 로봇 팔 9종의 데이터이고, 다음 12개 데이터셋에서 가져왔습니다.
| 데이터셋 | 데이터셋 | 데이터셋 |
|---|---|---|
| RT-1 | QT-Opt | Bridge |
| Task Agnostic Robot Play | Jaco Play | Cable Routing |
| RoboTurk | NYU VINN | Austin VIOLA |
| Berkeley Autolab UR5 | TOTO | Language Table |
실험에 쓴 로봇은 9종으로 전체 데이터셋의 22종보다 적습니다. 저자들은 실험 시점에는 위 데이터가 전부였고 이후 데이터셋을 계속 늘렸기 때문이라고 설명합니다. 앞으로 늘어난 데이터셋으로도 정책을 학습할 계획이라고 밝힙니다.
6. 실험 설계 — 세 가지 질문
실험은 교차 몸체 학습의 효과에 대한 세 가지 질문에 답합니다.
- 여러 로봇의 데이터로 함께 학습(co-training)하면 학습한 과제의 성능이 오르는가
- 여러 플랫폼과 과제의 데이터로 함께 학습하면 처음 보는 과제로 더 잘 일반화하는가
- 모델 크기, 구조, 데이터 구성 같은 설계 선택이 성능과 일반화에 어떤 영향을 주는가
로봇 6종에서 모두 3600회의 평가 시행을 했습니다.
| 절 | 평가 | 사용 모델 | 비교 대상 |
|---|---|---|---|
| 7 | 소규모 데이터셋 도메인의 분포 안 성능 | RT-1-X | 원래 방법, 해당 데이터로만 학습한 RT-1 |
| 8 | 대규모 데이터셋 도메인의 분포 안 성능 | RT-1-X, RT-2-X | 원래 방법, 해당 데이터로만 학습한 RT-1 |
| 9 | 분포 밖 일반화와 창발 기술 | RT-2-X | 구글 로봇 데이터로만 학습한 RT-2 |
| 10 | 설계 결정 제거 실험 | RT-2-X 변형 | 행끼리 비교 |
분포 안 평가는 두 종류로 나눕니다. 데이터가 적은 도메인에서는 큰 데이터셋에서 넘어오는 전이로 성능이 크게 오를 것으로 예상하고, 데이터가 많은 도메인에서는 추가 개선이 더 어려울 것으로 예상합니다. 모든 평가는 원래 논문과 같은 평가 방식과 같은 로봇으로 하고, 모델은 모두 전체 로봇 데이터 혼합으로 학습합니다.
7. 소규모 데이터셋 도메인

그림 3 — 다섯 데이터셋에서 원래 방법·RT-1·RT-1-X의 성공률입니다. 연구실 로고는 실물 평가 장소, 로봇 그림은 평가에 쓴 몸체입니다.
| 평가 데이터셋 | 원래 방법 | 원래 방법 성공률 | RT-1 | RT-1-X |
|---|---|---|---|---|
| Kitchen Manipulation | MVP BC-RNN | 43 | 48 | 63 |
| Cable Routing | ResNet + MLP | 24 | 18 | 56 |
| NYU Door Opening | VINN | 53 | 65 | 80 |
| Autolab UR5 | ResNet + MLP | 53 | 25 | 45 |
| Task-Agnostic Play | TACORL, HULC2 | 33 | 68 | 72 |
| 평균 | 41 | 44 | 63 |
단위는 성공률(%)입니다. 그림 3의 막대에 인쇄된 값을 옮겼습니다.
RT-1-X는 다섯 데이터셋 가운데 네 곳에서 원래 방법을 앞섭니다. 예외는 Autolab UR5로, 원래 방법이 53%, RT-1-X가 45%입니다. 데이터가 적은 도메인일수록 다른 로봇 데이터를 함께 학습하는 이득이 크다는 것이 저자들의 해석입니다.
같은 구조의 RT-1과 비교하면 전이의 크기가 더 분명합니다. Cable Routing에서 RT-1은 18%로 원래 방법보다도 낮지만, 같은 구조에 다른 로봇 데이터를 섞은 RT-1-X는 56%입니다. Autolab UR5에서도 RT-1의 25%가 RT-1-X에서 45%로 오릅니다. 구조가 같으니 이 차이는 로봇 데이터 혼합으로 함께 학습한 효과입니다.
그림 3의 캡션과 논문 VI절(논의)은 RT-1-X의 평균 성공률이 원래 방법과 RT-1 어느 쪽보다도 50% 높다 고 적습니다. 인쇄된 평균으로 계산하면 원래 방법 대비 63 ÷ 41 ≈ 1.54배로 약 54% 높고, RT-1 대비 63 ÷ 44 ≈ 1.43배로 약 43% 높습니다. 또 RT-1의 평균은 다섯 값(48, 18, 65, 25, 68)으로 계산하면 44.8이라 그림의 44와 조금 다릅니다. 44.8로 계산하면 RT-1 대비 약 41% 높습니다. "50% 높다"는 원래 방법에 대해서는 대체로 맞고, RT-1에 대해서는 실제 차이보다 큰 표현입니다.
8. 대규모 데이터셋 도메인
데이터가 이미 많은 도메인에서는 Bridge 데이터셋과 RT-1 데이터셋으로 분포 안 성능을 평가합니다. 로봇은 각각 WidowX와 Google Robot입니다.
| 평가 설정 | Bridge | Bridge | RT-1 논문 6개 기술 |
|---|---|---|---|
| 평가 장소 | IRIS (Stanford) | RAIL Lab (UCB) | Google Robotic Lab |
| 로봇 몸체 | WidowX | WidowX | Google Robot |
| 원래 방법 | LCBC | LCBC | - |
| 원래 방법 성공률 | 13% | 13% | - |
| RT-1 | 40% | 30% | 92% |
| RT-1-X | 27% | 27% | 73% |
| RT-2-X (55B) | 50% | 30% | 91% |
표 1 — 대규모 다몸체 데이터를 흡수하는 데 모델 용량이 미치는 영향을 보는 실험입니다.
RT-1-X의 과소적합
데이터가 많은 도메인에서 RT-1-X는 해당 데이터로만 학습한 RT-1보다 낮습니다. IRIS에서 40% 대 27%, RAIL Lab에서 30% 대 27%, 구글 로봇에서 92% 대 73%입니다. 저자들은 이 결과를 과소적합(underfitting) 으로 해석합니다.
과소적합은 모델이 학습 데이터조차 충분히 맞추지 못하는 상태입니다. RT-1-X의 35M 파라미터는 9종 로봇의 서로 다른 카메라 시점, 좌표계, 행동 단위를 한꺼번에 표현해야 합니다. 데이터가 적은 7절 도메인에서는 다른 데이터가 도움이 됐지만, 한 도메인의 데이터만으로도 이미 모델 용량을 채우는 경우에는 여러 로봇 데이터를 함께 담을 여유가 부족합니다.
RT-2-X의 결과
55B 파라미터의 RT-2-X는 IRIS에서 50%로 원래 방법(13%)과 RT-1(40%)을 모두 앞섭니다. 저자들은 이를 근거로, 데이터가 풍부한 도메인에서도 교차 로봇 학습이 성능을 올릴 수 있지만 충분히 큰 용량의 구조를 쓸 때만 그렇다고 결론 내립니다.
본문은 RT-2-X가 원래 방법과 RT-1을 모두 앞선다고 적지만, 표 1에서 그 설명이 성립하는 곳은 IRIS뿐입니다. RAIL Lab에서는 RT-2-X와 RT-1이 30%로 같고, RT-1 논문 6개 기술에서는 RT-2-X가 91%로 RT-1의 92%보다 1%p 낮습니다. 세 설정 모두에서 RT-2-X가 RT-1-X보다 높은 것은 맞습니다.
9. 분포 밖 일반화와 창발 기술
이 절은 데이터가 많은 도메인에서 RT-2-X로, 교차 몸체 학습이 분포 밖 설정과 더 복잡한 새 지시로의 일반화를 돕는지 봅니다. 결과는 10절의 표 2에 함께 실려 있습니다.
처음 보는 물체·배경·환경
RT-2 논문과 같은 일반화 평가를 합니다. 처음 보는 물체를 처음 보는 환경과 배경에서 다룰 수 있는지 봅니다. RT-2가 62%, RT-2-X가 61%로 거의 같습니다(표 2의 1행과 2행, 마지막 열). 저자들은 예상한 결과라고 설명합니다. RT-2는 VLM 백본 덕분에 이 축에서 이미 잘 일반화하므로, 로봇 데이터를 더 섞어도 더 오를 여지가 적습니다.
창발 기술 평가

그림 4 — Bridge 데이터셋에만 있고 구글 로봇 데이터셋에는 없는 기술을 구글 로봇으로 평가합니다.
로봇 사이의 지식 전이를 직접 보려고, 구글 로봇 데이터셋에는 없고 다른 로봇인 WidowX의 Bridge 데이터셋에만 있는 물체와 기술을 구글 로봇으로 시킵니다. 이 논문은 이런 기술을 창발 기술(emergent skills) 이라고 부릅니다. 그림 4의 과제는 세 종류입니다.
| 종류 | 예시 지시 | 요구되는 것 |
|---|---|---|
| (a) 절대 위치 동작 | "move the chip bag to the top right of the counter", "move to top right / right / bottom right" | 조리대나 화면 안의 절대 위치 개념 |
| (b) 물체 기준 상대 동작 | "move apple between coke and cup" | 두 물체 사이라는 상대 위치 개념 |
| (c) 전치사에 따른 행동 변화 | "put apple on cloth" 와 "move apple near cloth" | on·into·on top of와 near의 차이에 따라 다른 동작 |
(c)는 같은 물체 두 개로 전치사만 바꿔, 올려놓아야 하는지 옆에 가져다 두기만 하면 되는지를 구분하게 합니다.
| 모델 | 학습한 로봇 데이터 | 창발 기술 성공률 |
|---|---|---|
| RT-2 (55B) | 구글 로봇 행동 데이터 | 27.3% |
| RT-2-X (55B) | 로봇 데이터 혼합 | 75.8% |
| RT-2-X (55B) | 로봇 데이터 혼합에서 Bridge만 제외 | 42.8% |
RT-2-X는 RT-2보다 약 3배 높습니다(75.8 ÷ 27.3 ≈ 2.78). 구글 로봇은 이미 자기 데이터가 많은 로봇인데도, 다른 로봇의 데이터를 함께 학습하자 자기 데이터셋에 없던 기술을 수행하게 됐습니다.
Bridge 데이터셋만 빼고 나머지는 똑같이 학습한 RT-2-X는 42.8%로 크게 떨어집니다. 평가한 기술이 Bridge에만 있었으므로, 추가로 생긴 기술의 상당 부분이 WidowX 데이터에서 넘어왔다고 볼 수 있습니다. Bridge를 뺀 모델도 RT-2의 27.3%보다는 높은데, 논문은 이 차이를 따로 해석하지 않습니다.
10. 설계 결정 제거 실험
| 행 | 모델 | 크기 | 이력 길이 | 데이터셋 | 웹 데이터와 공동 학습 | 초기 체크포인트 | 창발 기술 | 일반화 |
|---|---|---|---|---|---|---|---|---|
| (1) | RT-2 | 55B | 없음 | 구글 로봇 행동 | 예 | 웹 사전학습 | 27.3% | 62% |
| (2) | RT-2-X | 55B | 없음 | 로봇 데이터 | 예 | 웹 사전학습 | 75.8% | 61% |
| (3) | RT-2-X | 55B | 없음 | Bridge 제외 로봇 데이터 | 예 | 웹 사전학습 | 42.8% | 54% |
| (4) | RT-2-X | 5B | 2 | 로봇 데이터 | 예 | 웹 사전학습 | 44.4% | 52% |
| (5) | RT-2-X | 5B | 없음 | 로봇 데이터 | 예 | 웹 사전학습 | 14.5% | 30% |
| (6) | RT-2-X | 5B | 2 | 로봇 데이터 | 아니오 | 처음부터 학습 | 0% | 1% |
| (7) | RT-2-X | 5B | 2 | 로봇 데이터 | 아니오 | 웹 사전학습 | 48.7% | 47% |
표 2 — 일반화(처음 보는 물체·배경·환경)와 창발 기술(다른 데이터셋의 기술을 구글 로봇으로)에 대한 설계 결정의 영향입니다.
초기 체크포인트 는 학습을 웹으로 사전학습한 VLM 가중치에서 시작했는지, 무작위 가중치에서 시작했는지입니다. 웹 데이터와 공동 학습 은 로봇 데이터로 학습하는 동안 원래 VLM 데이터를 계속 섞었는지입니다. "아니오"이면서 초기 체크포인트가 웹 사전학습인 (7)행은, 사전학습한 VLM에서 시작하되 로봇 데이터로만 미세조정한 모델입니다.
이력 길이 는 현재 이미지 외에 과거 이미지를 몇 장 입력으로 넣는지를 나타내는 열입니다. "없음"은 현재 이미지 한 장만 보는 설정이고, 논문은 2가 현재 이미지를 포함한 장수인지 과거 이미지 수인지 따로 적지 않습니다.
짧은 이미지 이력
(4)행과 (5)행은 이력 길이만 다릅니다. 이력을 2로 두면 창발 기술 44.4%, 일반화 52%이고, 이력이 없으면 14.5%, 30%입니다. 짧은 이미지 이력이 일반화를 크게 높입니다.
웹 사전학습
(4)행과 (6)행은 초기 체크포인트와 공동 학습 여부가 다릅니다. 웹 사전학습 가중치에서 시작하면 44.4%, 52%이고, 처음부터 학습하면 0%, 1%입니다. RT-2 논문의 결론처럼, 큰 모델에서 높은 성능을 내려면 웹 사전학습이 결정적입니다.
모델 크기
저자들은 (2)행과 (4)행을 비교해 55B 모델이 5B 모델보다 창발 기술 성공률이 크게 높다고 설명합니다(75.8% 대 44.4%). 더 큰 용량이 로봇 데이터셋 사이의 전이를 더 크게 한다는 해석입니다. 다만 두 행은 크기 외에 이력 길이도 다릅니다. (2)행은 이력이 없고 (4)행은 이력이 2입니다. 이력을 넣은 쪽이 작은 모델이라 크기의 효과는 오히려 덜 드러나는 방향이지만, 이 비교에는 크기와 이력 두 요인이 함께 들어 있습니다.
공동 미세조정과 미세조정
(4)행과 (7)행은 웹 데이터와의 공동 학습 여부만 다릅니다. 공동 미세조정은 44.4%, 52%이고, 로봇 데이터만으로 미세조정하면 48.7%, 47%입니다. 창발 기술은 미세조정 쪽이, 일반화는 공동 미세조정 쪽이 조금 높아 두 방식이 비슷합니다.
RT-2 논문에서는 공동 미세조정이 미세조정보다 분명히 나았습니다. 저자들은 결과가 달라진 이유를 RT-2-X의 로봇 데이터가 RT-2의 로봇 데이터보다 훨씬 다양하기 때문으로 봅니다. RT-2에서는 웹 데이터가 로봇 데이터에 없는 다양성을 채웠다면, 여러 로봇·환경의 데이터를 섞은 RT-2-X에서는 로봇 데이터 자체가 그 다양성을 어느 정도 갖췄다는 해석입니다.
11. 저자가 밝힌 한계
첫째, 감지와 구동 방식이 크게 다른 로봇은 실험에서 다루지 않았습니다. 실험에 쓴 9종은 모두 로봇 팔이고, 입력도 대표 카메라 이미지 하나로 맞췄습니다.
둘째, 학습 데이터에 없던 새 로봇으로의 일반화는 연구하지 않았습니다. 모든 평가는 학습 데이터에 포함된 몸체에서 했습니다.
셋째, 긍정적 전이가 언제 일어나고 언제 일어나지 않는지에 대한 판단 기준을 제시하지 않았습니다. 7절의 Autolab UR5와 8절의 RT-1-X처럼 섞은 데이터가 성능을 낮춘 경우가 있었지만, 그 조건을 설명하는 기준은 앞으로의 과제로 남깁니다.
저자들은 이 연구가 교차 로봇 학습이 실현 가능하고 실용적이라는 사례이자, 이 방향의 연구에 쓸 도구를 제공한다고 정리합니다.
12. 논문 안의 수치 불일치
본문과 표를 대조하면서 확인한 불일치를 한곳에 모았습니다. 위치 열의 절 번호는 이 글 기준이고, 로마 숫자는 논문의 절 번호입니다.
| 위치 | 논문의 서술 | 표·그림으로 확인한 값 |
|---|---|---|
| 7절 · 그림 3 캡션과 논문 VI절 | RT-1-X 평균이 원래 방법·RT-1 어느 쪽보다도 50% 높음 | 원래 방법 대비 약 54%, RT-1 대비 약 43% (RT-1 평균을 44.8로 계산하면 약 41%) |
| 7절 · 그림 3 평균 막대 | RT-1 평균 44 | 다섯 값의 평균은 44.8 |
| 8절 · 논문 V-A절 | RT-2-X가 원래 방법과 RT-1을 모두 앞섬 | IRIS에서만 성립. RAIL Lab 30% 동률, RT-1 6개 기술 91% 대 92% |
| 9절 · 논문 VI절 | RT-2-X가 약 3배의 일반화 향상 | 약 3배(27.3% → 75.8%)는 창발 기술 열. 일반화 열은 62% 대 61% |
| 10절 · 논문 V-C절 | (2)행과 (4)행으로 크기 효과를 설명 | 두 행은 이력 길이도 다름 |
| 5절 · 논문 IV-B절 | RT-1은 이미지 15장, 시각-언어 토큰 81개를 Transformer에 입력 | RT-1 논문은 이미지 6장, TokenLearner로 이미지당 8개 토큰 |
| 5절 · 논문 IV-B절 | RT-2 행동 예시 "1 128 91 241 5 101 127" | 정수 7개. 행동은 8차원 |
13. 정리 — VLA 계보에서의 위치
Open X-Embodiment는 새 모델 구조를 내놓은 논문이 아닙니다. RT-1과 RT-2의 구조를 거의 그대로 두고, 학습 데이터를 로봇 한 종에서 여러 로봇으로 바꿨을 때 무엇이 달라지는지를 측정한 논문입니다.
- 데이터 통일 — 21개 기관의 60개 데이터셋을 RLDS 형식으로 모아, 22종 몸체와 100만 개가 넘는 궤적을 한 번에 불러올 수 있게 했습니다.
- 거친 정렬 — 대표 카메라 한 대와 데이터셋별로 정규화한 7차원 말단장치 행동만 맞추고, 좌표계와 제어 방식의 차이는 그대로 둔 채 학습했습니다.
- 긍정적 전이 — 데이터가 적은 도메인에서는 35M RT-1-X도 평균 41%에서 63%로 올랐고, 데이터가 많은 도메인에서는 55B RT-2-X처럼 큰 모델에서만 이득이 났습니다.
- 로봇 간 기술 전이 — 구글 로봇이 WidowX 데이터에만 있던 기술을 27.3%에서 75.8%로 수행하게 됐고, Bridge를 빼면 42.8%로 떨어졌습니다.
RT-1·RT-2와의 비교
| 항목 | RT-1 | RT-2 | RT-X |
|---|---|---|---|
| 로봇 데이터 | 구글 로봇 1종 | 구글 로봇 1종 (RT-1 데이터) | 9종 로봇, 12개 데이터셋 혼합 |
| 모델 | 35M 로봇 전용 Transformer | VLM (5B · 12B · 55B) | RT-1 구조(35M), RT-2-PaLI-X 구조(5B · 55B) |
| 행동 출력 | 256구간 이산 토큰 | 같은 이산화를 텍스트 토큰으로 | 같은 이산화, 데이터셋별 정규화 |
| 새로 보인 것 | 대규모 실물 데이터로 학습한 Transformer 정책 | 웹 지식의 로봇 제어 전이 | 로봇 사이의 데이터 전이 |
| 공개 | 모델 코드 | 비공개 | 데이터셋, RT-1-X 체크포인트 |
RT-2가 남긴 한계 가운데 하나는 로봇 행동 데이터가 로봇 한 종에 묶여 있다는 것이었습니다. Open X-Embodiment는 여러 로봇의 데이터를 모아 이 한계를 다루고, 그 데이터가 로봇 사이에서 실제로 전이된다는 것을 보였습니다. 그러나 가장 좋은 결과를 낸 RT-2-X의 백본 PaLI-X는 공개되지 않은 VLM이라, 다른 연구자가 그 가중치에서 출발해 미세조정할 수 없습니다. 다음 편의 OpenVLA는 Open X-Embodiment 데이터로 VLA를 학습하고 모델 가중치를 공개합니다.
전체 목록은 VLA 계보 목차에서 볼 수 있습니다.