들어가며
컴퓨터 비전과 자연어 처리는 몇 년 사이에 작업마다 따로 데이터를 모으고 따로 모델을 만들던 방식을 버렸습니다. 넓고 큰 데이터로 범용 모델을 한 번 학습해 두면, 개별 작업은 적은 데이터로 풀리거나 아예 추가 데이터 없이도 풀립니다. 로봇은 이 흐름에 늦게 합류했습니다. 실물 로봇 데이터는 비싸고, 모인 데이터는 대개 특정 로봇과 특정 작업에 묶여 있었기 때문입니다.
RT-1(Robotics Transformer 1) 은 같은 공식이 로봇에서도 성립하는지를 실물 규모로 확인한 논문입니다. 사무실 주방에서 로봇 13대로 17개월 동안 약 13만 개의 시연을 모으고, 이미지와 언어 지시를 받아 행동을 토큰으로 내놓는 Transformer를 설계했습니다. 이 모델은 뒤이어 나오는 RT-2가 "시각-언어-행동(Vision-Language-Action, VLA)"이라는 이름을 붙이게 되는 구조의 원형입니다.
📄 RT-1: Robotics Transformer for Real-World Control at Scale — Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar 외 (저자 51명, 알파벳순) / Robotics at Google·Everyday Robots·Google Research Brain Team, 2022-12 공개 (v2 2023-08), RSS 2023
프로젝트 페이지는 robotics-transformer1.github.io이고, 모델 코드는 github.com/google-research/robotics_transformer에 공개돼 있습니다. arxiv 식별자는 2212.06817입니다.
초록 요약
다른 분야의 대형 모델은 크고 다양한 데이터에서 배운 지식을 개별 작업으로 옮겨, 추가 데이터가 거의 없어도 높은 성능을 냅니다. 로봇 분야에서는 아직 이 능력이 확인되지 않았습니다. 실물 로봇 데이터를 모으기가 어려운 만큼, 오히려 로봇에서 일반화 능력이 더 절실합니다. 저자들은 특정 작업에 얽매이지 않는 열린 학습과, 그렇게 모인 다양한 데이터를 전부 흡수할 만큼 용량이 큰 구조가 함께 있어야 범용 로봇 모델이 된다고 봅니다. 이 가설을 따라 Robotics Transformer라는 모델 계열을 제안하고, 실물 로봇으로 대규모 데이터를 모은 뒤 데이터 크기·모델 크기·데이터 다양성에 따라 일반화가 어떻게 달라지는지를 실험으로 확인합니다.

그림 1(b) — 700개 넘는 작업·13만 개 시연으로 학습하고, 새 작업·방해물·장기 과제·새 데이터 출처로 평가합니다.
그림의 다섯 칸이 논문의 실험 축과 그대로 겹칩니다. 학습한 작업 수행, 처음 보는 작업으로의 일반화, 배경·방해물·장면 변화에 대한 강건성, 여러 단계가 이어지는 장기 과제, 그리고 시뮬레이션이나 다른 로봇처럼 성격이 전혀 다른 데이터의 흡수입니다. 전체 평가는 실물 로봇 시행 3000회가 넘습니다.
1. 문제 — 데이터와 모델, 두 가지 난관
기존 로봇 학습의 한계
모방 학습(imitation learning)이든 강화 학습(reinforcement learning)이든, 기존의 종단간(end-to-end) 로봇 학습은 로봇이 해야 할 작업에 딱 맞춘 데이터를 따로 모았습니다. 단일 작업이든 다중 작업이든 작업끼리 주고받는 것이 거의 없었습니다. 비전과 자연어 처리가 오래전에 벗어난 방식이 로봇에는 그대로 남아 있었던 셈입니다.
대형 다중 작업 로봇 정책이 없던 것은 아닙니다. 다만 저마다 빈 곳이 있었습니다.
| 기존 연구 | 한계 |
|---|---|
| Gato (Reed et al., 2022) | 실물 로봇 작업의 폭이 좁음. 사실상 색 블록 쌓기 한 가지를 학습했고 새 작업 일반화는 평가하지 않음 |
| 언어 지시 추종 계열 (Shridhar et al.) | 새 작업 일반화보다 학습한 작업 수행에 초점 |
| BC-Z (Jang et al., 2021) | 새 작업 일반화를 노렸지만 성능이 상대적으로 낮음 |
두 가지 난관
저자들이 꼽은 난관은 알맞은 데이터셋과 알맞은 모델입니다.
데이터 쪽에서는 규모와 폭이 동시에 필요합니다. 여기에 조건이 하나 더 붙습니다. 작업끼리 구조적으로 충분히 이어져 있어야 모델이 비슷한 작업 사이의 패턴을 찾고, 그 패턴을 새로 조합해 처음 보는 작업을 해낼 수 있습니다.
모델 쪽에서는 용량과 속도가 부딪힙니다. 언어 지시에 따라 수백 가지 작업을 배우려면 Transformer처럼 용량이 큰 구조가 필요한데, 로봇 제어기는 실시간으로 돌아야 합니다. Transformer는 바로 이 실시간 조건에서 약합니다. RT-1은 카메라 이미지·지시·모터 명령을 모두 압축된 토큰으로 바꿔 Transformer에 넣는 방식으로 이 충돌을 풉니다.
2. 문제 정의 — 언어 조건부 행동 복제
논문의 정식화는 단순합니다. 시각 관측과 언어 지시를 받아 순차적으로 행동을 고르는 문제입니다.
시점 에 정책 는 언어 지시 와 첫 이미지 를 받고, 행동 분포 에서 행동 를 뽑아 로봇에 적용합니다. 이후에도 지금까지의 이미지 전체 를 조건으로 행동 를 계속 뽑고, 종료 조건에 닿으면 멈춥니다. 이 한 번의 상호작용 전체를 에피소드(episode)라고 부릅니다. 에피소드가 끝나면 지시를 해냈는지를 나타내는 이진 보상 이 주어지고, 목표는 이 보상의 기댓값을 최대화하는 것입니다.
학습은 행동 복제(behavior cloning) 입니다. 모든 에피소드가 성공한 시연(보상 1)으로 이루어진 데이터셋에서, 이미지와 지시가 주어졌을 때 시연 행동 의 음의 로그 가능도를 최소화합니다.
Transformer는 이 정책을 매개변수화하는 도구입니다. 입력 를 토큰 열 로, 행동 를 토큰 열 로 바꾸면 로봇 제어가 곧 시퀀스 모델링 문제가 됩니다. 게임 플레이(Decision Transformer)나 시뮬레이션 로봇 연구에서 먼저 성공한 발상을 실물 조작으로 가져온 것입니다.
3. 시스템 — 로봇, 주방, 데이터

그림 2 — (a) 로봇 교실 (b) Kitchen1 (c) Kitchen2 (d) 이동형 조작기 (e) 기본 물체 세트 (f) 집기용 확장 물체 세트.
로봇은 Everyday Robots의 이동형 조작기(mobile manipulator) 입니다. 7자유도 팔, 두 손가락 집게, 이동 베이스를 갖췄고 카메라 이미지는 300 × 300입니다.
환경은 셋입니다. 대규모 수집을 위해 실제 주방을 본떠 부분 조리대만 세운 학습 환경인 로봇 교실(robot classroom)(a), 그리고 평가용 실제 사무실 주방 두 곳입니다. Kitchen1(b)과 Kitchen2(c)는 학습 환경과 조리대는 비슷하지만 조명·배경·주방 구조가 다릅니다. 서랍 대신 찬장이 있거나 싱크대가 보이는 식입니다. 로봇 교실이 Kitchen1을 본떴기 때문에 Kitchen2가 더 어려운 일반화 무대가 됩니다.
데이터 — 13대, 17개월, 13만 개
| 항목 | 값 |
|---|---|
| 시연 수 | 약 130k |
| 로봇 대수 | 13대 |
| 수집 기간 | 17개월 |
| 지시 수 | 700개 이상 (표 1 합계 744) |
| 수집 방식 | 사람 원격조작 시연, 에피소드마다 수행한 지시를 텍스트로 주석 |
지시는 동사 하나와 그 주변의 명사 한두 개로 이루어집니다. "place water bottle upright", "open the drawer" 같은 형태입니다. 논문은 작업의 수를 이 언어 지시의 수로 세고, 동사 기준으로 묶은 것을 기술(skill) 이라고 부릅니다.
| 기술 | 지시 수 | 설명 | 예시 지시 |
|---|---|---|---|
| Pick Object | 130 | 표면에서 물체 들어 올리기 | pick iced tea can |
| Move Object Near Object | 337 | 첫 물체를 둘째 물체 근처로 옮기기 | move pepsi can near rxbar blueberry |
| Place Object Upright | 8 | 길쭉한 물체 세우기 | place water bottle upright |
| Knock Object Over | 8 | 길쭉한 물체 넘어뜨리기 | knock redbull can over |
| Open Drawer | 3 | 찬장 서랍 열기 | open the top drawer |
| Close Drawer | 3 | 찬장 서랍 닫기 | close the middle drawer |
| Place Object into Receptacle | 84 | 용기에 물체 넣기 | place brown chip bag into white bowl |
| Pick Object from Receptacle and Place on the Counter | 162 | 용기에서 꺼내 조리대에 놓기 | pick green jalapeno chip bag from paper bowl and place on counter |
| 6.3·6.4절 과제 | 9 | 현실적인 긴 지시용 기술 | open the large glass jar of pistachios · pull napkin out of dispenser · grab scooper |
| 합계 | 744 |
표 1 — RT-1 수집 기술 목록과 기술별 지시 수.
기술 목록은 여러 물체로 여러 행동을 보이도록 골랐고(그림 2(e)), 집기 기술은 물체 종류를 크게 늘려 다양한 물체로 일반화되도록 했습니다(그림 2(f)). 새 지시를 추가할 때 특정 기술을 가정하지 않으므로 데이터를 계속 붙여 능력을 넓힐 수 있는 구조입니다.
수집 절차도 규모에 맞춰 설계했습니다. 에피소드가 시작되면 로봇이 스스로 자기 자리로 가서, 어떤 지시를 시연할지와 장면을 어떻게 섞을지를 조작자에게 알려 줍니다. 지시 표본 추출과 배경 무작위화는 별도 소프트웨어 모듈이 맡아 데이터 균형을 유지합니다. 조작자는 로봇을 직접 눈으로 보면서 VR 리모컨 2개로 시연합니다. 리모컨의 3차원 위치·회전 변위는 집게의 6자유도 변위로, 조이스틱의 x·y는 이동 베이스의 회전각과 주행 거리로 대응시켜, 시연의 행동 공간이 정책의 행동 공간과 같아지도록 맞췄습니다.
4. 모델 — 이미지 6장과 지시에서 행동 토큰까지

그림 3 — 지시 임베딩이 FiLM으로 EfficientNet을 조건화하고, TokenLearner가 줄인 토큰을 Transformer가 행동 토큰으로 바꿉니다.
전체 흐름을 먼저 한 번에 봅니다.
전체 파라미터는 35M입니다. 다른 분야의 대형 모델에 비하면 작지만, 뒤에서 보듯 이 크기는 실시간 제어 조건이 정한 상한입니다.
지시와 이미지의 토큰화
과거 이미지 6장을 ImageNet으로 사전학습한 EfficientNet-B3 에 통과시킵니다. 해상도 300 × 300 이미지 한 장이 마지막 합성곱 층에서 9 × 9 × 512 공간 특징 지도가 되고, 이를 펼쳐 81개 시각 토큰을 얻습니다. Gato처럼 이미지를 패치로 잘라 토큰을 만들지 않는다는 점이 다릅니다.
언어 지시는 이 이미지 토크나이저 안으로 일찍 들어갑니다. 지시를 Universal Sentence Encoder(USE) 로 임베딩한 뒤, 사전학습된 EfficientNet 내부에 끼워 넣은 FiLM(Feature-wise Linear Modulation) 층의 입력으로 씁니다. FiLM은 특징 지도에 와 형태의 아핀 변환을 거는데, 와 를 지시 임베딩에서 계산합니다. 덕분에 이미지 특징을 뽑는 단계에서부터 지금 지시와 관련된 특징에 집중할 수 있습니다.
사전학습된 망 중간에 새 층을 끼우면 중간 활성값이 흐트러져 사전학습 가중치의 이점이 사라집니다. 저자들은 FiLM의 아핀 변환을 만드는 밀집층(, )의 가중치를 0으로 초기화했습니다. 처음에는 FiLM이 항등 함수로 동작해 사전학습된 기능을 그대로 보존합니다. 이 항등 초기화 FiLM 은 ImageNet 사전학습 없이 EfficientNet을 처음부터 학습할 때도 성능을 높였지만, 사전학습 초기화를 넘지는 못했습니다.
| 구성 | 값 |
|---|---|
| 블록 | MBConv 26개 + FiLM 층 |
| 파라미터 | 16M |
| 출력 | 이미지당 시각-언어 토큰 81개 |
TokenLearner
Transformer가 볼 토큰 수를 더 줄여 추론을 빠르게 하려고 TokenLearner 를 씁니다. 원소 단위 어텐션으로 많은 토큰을 적은 토큰으로 대응시키는 모듈로, 정보량에 따라 이미지 토큰을 부드럽게 골라 중요한 조합만 다음 층에 넘깁니다. 이미지당 81개 토큰이 8개로 줄어듭니다. 그림 3 기준 이 모듈의 파라미터는 34k입니다.
Transformer
이미지 한 장당 8개 토큰을 이력 6장에 걸쳐 이어 붙이면 48개 토큰이 되고, 위치 인코딩을 더해 Transformer에 넣습니다. Transformer는 self-attention 층 8개, 파라미터 19M인 decoder-only 시퀀스 모델입니다.
행동 토큰화
행동은 11차원입니다.
| 묶음 | 차원 | 내용 |
|---|---|---|
| 팔 | 7 | x, y, z, roll, pitch, yaw, 집게 벌림 |
| 베이스 | 3 | x, y, yaw |
| 모드 | 1 (이산) | 팔 제어 / 베이스 제어 / 에피소드 종료 중 전환 |
연속 차원은 각 변수의 범위 안에서 균일한 256개 구간(bin) 으로 이산화(discretization) 합니다. 목표값을 256개 구간 중 하나로 대응시키므로, 행동 한 차원이 256개 어휘 중 하나를 고르는 분류 문제가 됩니다.
손실은 표준 범주형 교차 엔트로피(categorical cross-entropy)이고, 기존 Transformer 기반 제어기에서 쓰던 인과 마스킹(causal masking)을 적용합니다. 로봇은 "종료" 행동을 내거나 미리 정한 시간 한도에 닿을 때까지 3 Hz로 폐루프 제어를 이어갑니다.
추론 속도 — 모델 크기의 상한
로봇 모델은 빠르고 일정한 추론 속도가 필수라는 점에서 언어·이미지 생성 모델과 다릅니다. 이 논문의 지시를 사람이 수행하면 2~4초가 걸렸고, 모델이 그보다 크게 느리면 안 됩니다. 실험으로 따져 보니 최소 3 Hz 제어가 필요했고, 시스템의 다른 지연을 빼면 모델 추론에 쓸 수 있는 시간은 100 ms 미만이었습니다.
추론을 빠르게 한 기법은 두 가지입니다.
| 기법 | 추론 가속 |
|---|---|
| TokenLearner로 EfficientNet 출력 토큰 수 줄이기 | 2.4배 |
| 겹치는 이력 창의 토큰을 한 번만 계산해 재사용 | 1.7배 |
속도 평균만이 아니라 흔들림도 잡았습니다. 행동 계산에 쓴 상태를 포착한 뒤 곧바로 행동을 적용하지 않고, 모든 구성요소에서 관측된 최대 지연인 280 ms만큼 고정 시간 기다린 뒤 적용합니다. 그래서 행동이 일정한 주기로 나갑니다.
5. 실험 설계 — 네 가지 평가 축과 비교 대상
비교 대상
비교 대상은 Gato와 BC-Z입니다. 원 논문의 모델은 이 평가에 필요한 일반화 능력이 없으므로, 두 기준선 모두 RT-1과 같은 데이터로 학습 했습니다. 비교되는 것은 데이터나 작업 세트가 아니라 순수하게 모델 구조입니다. 기준선도 RT-1이 모은 크고 다양한 데이터의 혜택을 보므로 기준선에 유리한 비교라고 저자들은 설명합니다.
| 모델 | RT-1과의 차이 |
|---|---|
| Gato | 같은 Transformer 계열. 이미지 토큰을 언어와 무관하게 패치마다 따로 계산(늦은 융합), 사전학습 텍스트 임베딩 없음, TokenLearner나 비자기회귀 행동 같은 추론 속도 고려 없음. 원래 1.2B(로봇 추론 1.9 s)를 RT-1 수준인 37M으로 줄여 사용 |
| BC-Z | ResNet 기반, SayCan에 쓰인 정책. 이전 시점을 보지 않는 피드포워드 모델, 이산 토큰 대신 연속 행동 출력 |
| BC-Z XL | BC-Z를 RT-1과 비슷한 파라미터 수로 키운 버전 |
평가 축
| 축 | 구성 |
|---|---|
| 학습한 작업(seen) | 학습 세트에서 뽑은 200개 이상의 지시. 집기 36, 넘어뜨리기 35, 세우기 35, 옮기기 48, 서랍 열고 닫기 18, 서랍에서 꺼내고 넣기 36. 물체 배치·시간대·로봇 위치는 바뀜 |
| 처음 보는 작업(unseen) | 새 지시 21개. 기술과 물체는 각각 학습에 있었지만 그 조합은 처음 |
| 강건성 | 방해물 강건성 30개 작업, 배경 강건성 22개 작업 |
| 장기 과제 | 실제 주방 두 곳에서 15개 긴 지시, 지시당 약 10단계 |
학습 세트의 작업은 12개 기술에 걸쳐 744개(표 1 합계)이고, 학습한 작업 평가는 그중에서 뽑은 200개 이상(위 기술별 내역 합 208개)으로 치릅니다. 처음 보는 작업은 학습에서 53개를 빼 두었고(부록 표 8에 53개 지시가 모두 실려 있습니다), 6.1절 평가에는 그중 21개를 씁니다. 부록 D.1은 학습한 작업 평가를 "744개 작업에서 평가"라고 적었지만, 744는 학습 세트 전체의 작업 수이고 실제 평가 규모는 6.1절의 200개 이상입니다.

그림 4 — 1행 방해물 쉬움·보통·어려움, 2행 원래 환경·무늬 식탁보·새 주방, 3행 실제 주방의 일반화 L1·L2·L3.
부록 D.1의 난이도 정의를 표로 옮기면 이렇습니다.
| 평가 | 쉬움 | 보통 | 어려움 |
|---|---|---|---|
| 방해물 (3개 작업) | 방해물 0, 2, 5개 | 방해물 9개, 목표 콜라캔은 가리지 않음 | 방해물 9개, 더 붐비고 콜라캔 일부 가림 |
| 배경 (6개 작업) | 학습과 같은 배경·조리대 | 같은 배경 + 무늬 식탁보 | 완전히 새 주방과 새 조리대 |
학습 데이터의 방해물은 0~4개였으므로 보통과 어려움은 모두 학습 분포 밖입니다.
6. 결과 — 많은 지시의 학습과 일반화

표 2 그래프 — 학습한 작업·처음 보는 작업·방해물·배경 네 축에서 RT-1과 기준선 성공률.
| 모델 | 학습한 작업 | 처음 보는 작업 | 방해물 | 배경 |
|---|---|---|---|---|
| Gato | 65 | 52 | 43 | 35 |
| BC-Z | 72 | 19 | 47 | 41 |
| BC-Z XL | 56 | 43 | 23 | 35 |
| RT-1 | 97 | 76 | 83 | 59 |
표 2 — 전체 성능 비교 (성공률 %).
RT-1은 200개가 넘는 학습한 지시의 97%를 해냅니다. BC-Z보다 25%, Gato보다 32% 높습니다. 처음 보는 지시에서는 76%로 다음 기준선인 Gato(52%)보다 24% 높습니다. 초록에는 이 차이가 25%로 적혀 있지만 표 2의 값으로 계산하면 24%입니다. 방해물 83%와 배경 59%는 각각 다음 기준선보다 36%, 18% 높습니다.
처음 보는 지시로 일반화되는 것은 언어 조건화 덕분에 이미 본 개념의 새 조합을 이해할 수 있어서입니다. 그런데 기준선도 모두 언어 조건부이므로 원리상 같은 이점을 가집니다. 차이가 어디서 오는지는 8절의 제거 실험이 답합니다.
BC-Z의 처음 보는 작업 19%가 눈에 띕니다. 학습한 작업에서는 72%로 Gato보다 높은데 일반화에서는 가장 낮습니다. 부록 표 13의 방해물 세부를 보면 쉬움 100, 보통 67, 어려움 7로, 목표 물체가 가려지면 성공률이 크게 떨어집니다.
현실 주방 시나리오
학습 환경과 크게 다른 실제 사무실 주방에서, 여러 분포 이동이 동시에 걸린 과제를 만들었습니다. 서랍에 간식 채우기, 넘어진 양념병 정리와 사람이 열어 둔 서랍 닫기, 오렌지와 냅킨으로 간식 준비, 주방 곳곳에서 선글라스와 문어 인형 찾아오기입니다.
| 수준 | 추가되는 일반화 |
|---|---|
| L1 | 새 조리대 배치와 조명 |
| L2 | L1 + 처음 보는 방해물 (주방 병 용기 등) |
| L3 | L2 + 크게 다른 작업 설정, 새 물체, 싱크대 옆처럼 처음 보는 위치 |

표 3 그래프 — 일반화 수준 L1·L2·L3에서 모델별 성공률.
| 모델 | 전체 | L1 | L2 | L3 |
|---|---|---|---|---|
| Gato | 30 | 63 | 25 | 0 |
| BC-Z | 45 | 38 | 50 | 50 |
| BC-Z XL | 55 | 63 | 75 | 38 |
| RT-1 | 70 | 88 | 75 | 50 |
표 3 — 현실 일반화 시나리오 (성공률 %).
RT-1은 모든 수준에서 가장 강건합니다. Gato는 L1에서는 괜찮지만 어려운 수준으로 갈수록 급격히 떨어져 L3에서 0이 됩니다. BC-Z 계열은 L2에서 괜찮고 L3에서 Gato보다 낫지만 RT-1의 일반화에는 못 미칩니다.
원문 그림 5는 여러 지시에 걸친 RT-1의 평가 궤적 예시이고, 부록 그림 10·11·12는 각각 배경·현실 지시·방해물 평가의 궤적 예시입니다. 가장 어려운 배경 설정은 조리대 질감·조명·조리대 소재·배경이 모두 다른 새 주방이고, 가장 어려운 방해물 설정은 장면이 극도로 어수선해 목표 물체가 가려진 상태입니다.
7. 이질적인 데이터의 흡수 — 시뮬레이션과 다른 로봇
RT-1이 성격이 크게 다른 데이터를 원래 작업 성능을 잃지 않고 흡수하는지를 두 실험으로 확인합니다.
시뮬레이션 데이터
실물 시연 데이터 전부에, 로봇이 실물로 본 적 없는 물체가 등장하는 시뮬레이션 데이터를 더했습니다. 평가는 모두 실물 세계에서, 집기와 옮기기 기술로 합니다.
| 학습 데이터 | 실물 물체 · 학습한 기술 | 시뮬레이션 물체 · 학습한 기술 | 시뮬레이션 물체 · 처음 보는 기술 |
|---|---|---|---|
| 실물만 | 92 | 23 | 7 |
| 실물 + 시뮬레이션 | 90 (-2) | 87 (+64) | 33 (+26) |
표 4 — 시뮬레이션 데이터 흡수 (성공률 %). 시뮬레이션 물체는 실물로 본 적 없는 물체입니다.
세 열의 뜻을 구분해야 수치가 읽힙니다. 가운데 열은 "시뮬레이션 물체 집기"처럼 그 지시가 시뮬레이션 데이터에 있던 경우입니다. 오른쪽 열은 그 물체가 시뮬레이션에서 집기로만 등장했고, "시뮬레이션 물체를 사과 근처로 옮기기" 같은 지시는 시뮬레이션에도 실물에도 없던 경우입니다.
실물 작업 성능은 92에서 90으로 거의 그대로입니다. 시뮬레이션에서만 본 물체와 작업은 23%에서 87%로 올라 실물 데이터가 있는 작업 수준에 가까워졌습니다. 물체는 실물로 본 적 없고 지시는 어디서도 본 적 없는 오른쪽 열도 7%에서 33%로 올랐습니다.
다른 로봇의 데이터

그림 6 — Everyday Robots 데이터와 Kuka 통 집기 데이터로 함께 학습하고, 통 집기·교실 평가로 확인합니다.
두 번째 실험은 로봇 자체가 다른 데이터를 섞습니다. QT-Opt에서 Kuka IIWA로 모은 성공 에피소드 209k개입니다. 통 안의 물체를 가리지 않고 집는 데이터입니다.
이 조합은 까다롭습니다. 로봇의 외형과 행동 공간이 다르고, 배치된 환경의 겉모습과 동역학도 다릅니다. 게다가 QT-Opt 데이터는 사람 시연이 아니라 강화 학습 에이전트가 모은 것이라 행동 분포 자체가 완전히 다릅니다.
| 학습 데이터 | 교실 평가 | 통 집기 평가 |
|---|---|---|
| Kuka 통 집기 + EDR | 90 (-2) | 39 (+17) |
| EDR만 | 92 | 22 |
| Kuka 통 집기만 | 0 | 0 |
표 5 — 두 로봇 데이터 혼합 (성공률 %). EDR은 Everyday Robots 로봇입니다.
두 데이터를 섞어도 원래 교실 평가는 2%만 떨어집니다. Kuka 데이터와 비슷한 통 집기 설정을 EDR 로봇으로 평가하면, EDR 데이터만 쓴 모델의 22%가 39%로 올라 거의 2배가 됩니다.
Kuka 데이터만으로 학습해 EDR 로봇에서 평가하면 0%입니다. 몸체가 다른 로봇의 행동은 그대로 옮겨지지 않습니다. 그런데 두 로봇 데이터를 섞으면, EDR 로봇으로 통 집기를 시연한 적이 없어도 Kuka가 겪은 상태를 보고 EDR의 올바른 행동을 추론합니다. 다른 로봇의 경험을 관찰해 새 기술을 얻는 흡수 능력으로, 뒤에 이어지는 다중 로봇 데이터셋 연구의 출발점이 되는 결과입니다.

부록 그림 7 — 모델 카드에 실린 정량 요약으로, 표 2·표 4·표 5의 핵심 수치를 한 줄에 모았습니다.
8. 장기 과제 — SayCan 안의 RT-1
긴 과제에서는 조작 기술의 성공률이 특히 중요합니다. 과제 길이가 늘수록 전체 성공률이 지수적으로 줄어들기 때문입니다. 이동과 조작을 함께 하는 과제라 베이스 위치 변화에 대한 강건성도 필요합니다.
SayCan 은 언어 모델을 로봇의 실행 가능성(affordance)에 접지시키는 틀입니다. 퓨샷(few-shot) 프롬프트로 긴 자연어 과제를 하위 기술의 순서로 쪼개고, 실행 가능성 함수로는 MT-Opt로 학습한 가치 함수를 씁니다. 하위 기술이 많을수록 조합 가능한 상위 지시가 조합적으로 늘어나므로, RT-1의 기술 폭이 그대로 드러나는 무대입니다.
평가에는 SayCan 논문의 장기 과제 계열 15개 지시를 썼습니다. 지시 하나를 끝내는 데 평균 9.6단계, 조작 기술은 평균 2.4개가 들어갑니다. "How would you bring me two sodas?", "I spilled my coke on the table, how would you throw it away and then bring me something to help clean?" 같은 지시입니다.
| 방법 | Kitchen1 계획 | Kitchen1 실행 | Kitchen2 계획 | Kitchen2 실행 |
|---|---|---|---|---|
| 원래 SayCan* | 73 | 47 | - | - |
| SayCan + Gato | 87 | 33 | 87 | 0 |
| SayCan + BC-Z | 87 | 53 | 87 | 13 |
| SayCan + RT-1 | 87 | 67 | 87 | 67 |
표 6 — SayCan 방식 장기 과제 (성공률 %). *원래 SayCan 평가는 프롬프트가 조금 달라 계획 성공률이 더 낮습니다.
원래 SayCan을 뺀 모든 방법의 계획 성공률은 87%로 같으므로, 실행 성공률 차이는 전부 조작 정책의 차이입니다. Kitchen1에서 RT-1이 67%로 가장 높습니다. 로봇 교실이 Kitchen1을 본떴기 때문에 Kitchen2는 훨씬 어렵습니다. 여기서 Gato는 장기 과제를 하나도 끝내지 못하고 BC-Z는 13%에 그칩니다. RT-1은 Kitchen1과 똑같이 67%로 성능이 떨어지지 않았습니다. 원래 SayCan 논문은 새 주방을 평가하지 않았습니다. 보조 영상에서는 Kitchen2의 처음 보는 서랍을 조작하고, 최대 50단계에 이르는 매우 긴 과제를 계획·실행하는 모습을 보입니다.
9. 데이터의 양과 다양성
Transformer 기반 모델의 파라미터 확장은 앞선 연구가 이미 보였습니다. 로봇에서는 실제 로봇 위의 지연 조건이 모델 크기를 먼저 묶기 때문에, 모델 크기가 주된 병목이 아닌 경우가 많습니다. 그래서 이 논문은 전통적으로 데이터가 부족한 로봇 학습에서 더 중요한 데이터셋 크기와 다양성을 따로 떼어 봅니다.
두 축을 분리하는 방법은 이렇습니다. 크기를 줄일 때는 작업 다양성을 유지한 채 데이터가 가장 많은 작업부터 덜어내, 작업당 예시를 200개(데이터 51%), 100개(37%), 50개(22.5%)로 제한합니다. 다양성을 줄일 때는 데이터가 가장 적은 작업부터 빼서, 전체 데이터의 97%는 남기되 작업은 75%만 남깁니다.

표 7 그래프 — 초록 화살표는 데이터 크기 감소, 보라 화살표는 다양성 감소. 다양성이 더 가파르게 성능을 깎습니다.
| 조건 | 작업 % | 데이터 % | 학습한 작업 | 일반화 전체 | 처음 보는 작업 | 방해물 | 배경 |
|---|---|---|---|---|---|---|---|
| RT-1 (전체) | 100 | 100 | 97 | 73 | 76 | 83 | 59 |
| 데이터 축소 | 100 | 51 | 71 | 50 | 52 | 39 | 59 |
| 데이터 축소 | 100 | 37 | 55 | 46 | 57 | 35 | 47 |
| 데이터 축소 | 100 | 22 | 59 | 29 | 14 | 31 | 41 |
| 다양성 축소 | 75 | 97 | 86 | 54 | 67 | 42 | 53 |
표 7 — 데이터 제거 실험 (성공률 %).
데이터 크기를 줄이면 성능이 대체로 떨어지고, 일반화는 더 가파르게 떨어집니다. 데이터를 좁히면 훨씬 가파르게, 특히 일반화에서 크게 떨어집니다. 작업 25%를 빼고 데이터 97%를 남긴 모델의 일반화(54)는 데이터를 49%까지 줄인 모델(51% 조건, 50)과 비슷한 수준입니다. 저자들은 여기서 데이터의 양보다 다양성이 더 중요하다 고 결론짓습니다.

부록 그림 9 — 2021년 1분기부터 2022년 4분기까지 작업 수(막대), 데이터 양(검은 선), 학습한 작업 성공률(초록 선).
부록 C.4의 이 그림은 17개월의 수집 과정을 시간 순으로 보여 줍니다. 작업 수는 1개에서 36, 272, 432개를 거쳐 741개로 늘었고, 데이터와 학습한 작업 성공률도 함께 올라갑니다. 저자들은 데이터와 로봇 능력을 이보다 빠르게 키우는 기법을 향후 과제로 꼽습니다.
10. 제거 실험 — 성능 차이의 출처
6절에서 남긴 질문, 같은 데이터로 학습한 기준선과의 차이가 어디서 오는지를 부록 D.4가 다룹니다. 저자들이 세운 가설은 넷입니다. 모델의 용량과 표현력, 복잡한 여러 갈래 행동 분포를 쉽게 표현하는 행동 표현, ImageNet 사전학습 초기화, 짧은 관측 이력입니다.

표 13 그래프 — 기준선과 각 제거 모델의 RT-1 대비 성공률 차이.
| 모델 | 학습한 작업 | 처음 보는 작업 | 방해물 전체 | 쉬움 | 보통 | 어려움 | 배경 | 추론 시간 (ms) |
|---|---|---|---|---|---|---|---|---|
| Gato | 65 (-32) | 52 (-24) | 43 (-40) | 71 | 44 | 29 | 35 (-24) | 129 |
| BC-Z | 72 (-25) | 19 (-57) | 47 (-36) | 100 | 67 | 7 | 41 (-18) | 5.3 |
| BC-Z XL | 56 (-41) | 43 (-33) | 23 (-60) | 57 | 33 | 0 | 35 (-24) | 5.9 |
| RT-1 | 97 | 76 | 83 | 100 | 100 | 64 | 59 | 15 |
| RT-1 w/o big model | 89 (-8) | 62 (-14) | 77 (-6) | 100 | 100 | 50 | 53 (-6) | 13.5 |
| RT-1 w/o pre-training | 84 (-13) | 43 (-33) | 60 (-23) | 100 | 67 | 36 | 41 (-18) | 15 |
| RT-1 w/ continuous actions | 68 (-29) | 43 (-33) | 37 (-46) | 71 | 67 | 0 | 35 (-24) | 16 |
| RT-1 w/ auto-regressive actions | 85 (-12) | 71 (-5) | 67 (-16) | 100 | 78 | 43 | 65 (+6) | 36 |
| RT-1 w/o history | 82 (-15) | 62 (-14) | 50 (-33) | 71 | 89 | 14 | 59 (+0) | 15 |
| RT-1 w/o Transformer | 86 (-13) | 62 (-14) | 67 (-16) | 100 | 100 | 29 | 59 (+0) | 26 |
표 13 — 모델 제거 실험 (성공률 %, 괄호는 RT-1 대비 차이).
연속 행동 — 가장 큰 하락
차원별 256구간 이산 행동을 표준적인 연속 가우시안 분포(평균제곱오차 손실, 다변량 정규 출력)로 바꾸면 모든 축에서 크게 떨어집니다. 학습한 작업 -29, 처음 보는 작업 -33, 방해물 -46이고 어려운 방해물에서는 0입니다. 차원별 이산화는 여러 갈래(multimodal)로 갈라지는 복잡한 분포를 표현할 수 있지만, 가우시안은 봉우리 하나만 잡습니다. 사람 시연처럼 복잡하고 다양한 데이터에서는 흔히 쓰는 연속 가우시안이 크게 불리합니다.
ImageNet 사전학습 — 일반화의 원천
사전학습을 빼면 처음 보는 작업이 33% 떨어집니다. ImageNet의 크고 다양한 시각 데이터에서 온 지식이 일반화와 강건성에 크게 기여합니다. 부록 D.5는 USE 언어 임베딩도 함께 묶어, RT-1이 이 사전학습 모델들이 배운 데이터의 일반성과 다양성을 일부 물려받는다고 해석합니다.
이력과 Transformer
이력을 빼면(이미지 6장 → 1장) 주로 방해물 강건성에 영향이 가서 -33이 되고, 어려운 방해물은 64에서 14로 떨어집니다. Transformer를 빼면(사전학습 EfficientNet만 사용) 학습한 작업·처음 보는 작업·방해물에서 고르게 조금씩 떨어집니다.
모델 크기
ImageNet 사전학습을 유지하면서 크기를 줄이려고 파라미터를 40%만 줄였습니다(35M → 21M). 성능은 떨어지지만 다른 제거보다는 덜 떨어집니다. 6.3절 결과 해석에는 이 축소가 "31M → 25M"으로 적혀 있지만, 31M에서 25M은 약 19% 감소라 같은 문장의 40%와 맞지 않습니다. 실험 설정을 설명한 문단의 35M → 21M이 정확히 40% 감소입니다.
자기회귀 행동과 추론 속도
Gato나 Decision Transformer처럼 앞서 낸 행동 토큰을 조건으로 다음 행동 토큰을 내는 자기회귀(auto-regressive) 방식은 성능 이득이 없고(배경만 +6) 추론을 2배 넘게 느리게 만듭니다(15 → 36 ms). 그래서 최종 RT-1은 행동을 자기회귀로 생성하지 않습니다.
추론 시간 열은 카메라 지연이나 통신 오버헤드처럼 모든 모델에 공통인 지연을 뺀 순수 네트워크 추론 시간입니다. RT-1은 파라미터 수가 비슷한 Gato보다 한 자릿수 가까이 빠르지만(15 대 129 ms), ResNet 기반 BC-Z(5.3 ms)보다는 상당히 느립니다.
언어의 이른 융합과 어텐션

부록 그림 13 — 층과 헤드마다 다른 곳을 보되, 대체로 집을 수 있는 물체처럼 상호작용 여지가 큰 곳에 집중합니다.
RT-1은 FiLM으로 언어를 이미지 처리 초반에 섞고, Gato는 늦게 섞습니다. 이른 융합 덕분에 이미지 토큰이 지금 지시와 관련된 특징에만 집중할 수 있고, 저자들은 이것이 Gato의 약한 방해물 성능을 설명할 수 있다고 봅니다. 어텐션 지도를 보면 2층 6번 헤드는 집기 작업에서 할라피뇨 칩 봉지와 펩시캔에, 4층 2번 헤드는 서랍 열기 작업에서 서랍에 집중합니다. 이런 어텐션 병목이 압축된 표현을 만들어 방해물과 배경 변화를 효과적으로 무시하게 됩니다.
11. 부록 자료

부록 그림 8 — 원본 시뮬레이션, RetinaGAN을 적용한 시뮬레이션, 실물 세계의 카메라 이미지 비교.
대규모 모델 선택 — 실물에서 시뮬레이션으로
지시가 수백 개로 늘면 모델을 평가하기가 어려워집니다. 개발 중 모델 계열과 데이터 분포를 비교할 때도, 한 학습 실행에서 가장 좋은 체크포인트를 고를 때도 문제입니다. 오프라인 강화 학습에서 오프폴리시 평가(off-policy evaluation)라는 이름으로 여러 방법이 나왔지만, 다중 작업 로봇 학습 시스템을 대규모로 평가하는 문제는 여전히 열려 있습니다.
저자들은 실물 데이터로 학습한 정책을 시뮬레이터에서 돌려 보는 실물→시뮬레이션(real to sim) 평가를 모델 선택 도구로 씁니다. 시뮬레이션은 모델 선택에만 쓰이고, 7절 실험을 빼면 학습 데이터는 전부 실물입니다. Lee et al.(2022b)의 시뮬레이션 환경을 확장해 5.2절 작업 중 551개를 지원하고, 작업마다 장면 무작위화·로봇 자세 무작위화·성공 판정 기준을 정의했습니다. 시뮬레이션과 실물 사이의 시각 차이는 시뮬레이션 이미지를 실물처럼 바꾸는 RetinaGAN으로 매 시점 메웁니다.
실물 데이터로만 학습한 모델은 시뮬레이션보다 실물에서 더 잘 합니다. 그래도 실물에서 성능이 높은 정책은 시뮬레이션에서도 성공률이 더 높아, 시뮬레이션 성공률의 순서가 실물 성공률의 순서를 예측하는 데 쓸모가 있습니다. 시뮬레이션→실물(sim-to-real)과 달리 이 설정은 시뮬레이션 정확도에 대한 요구가 느슨합니다. 방향만 맞으면 실물과 시뮬레이션 성공률 사이의 차이가 크더라도 받아들일 수 있습니다.
모델 카드
부록 B의 모델 카드는 RT-1을 Everyday Robots 로봇의 조작 작업 제어용으로 한정합니다. 다른 로봇 몸체·환경·크게 다른 후속 작업에 쓸 학습된 표현으로 적합한지는 불분명하고, 사람과의 상호작용에는 적합하지 않다고 명시합니다. 현재 연구 설정 밖에서는 아직 적합성을 평가하지 않은 초기 연구로 분류합니다.
12. 저자가 밝힌 한계
첫째, 모방 학습 방법이라 그 계열의 과제를 그대로 물려받습니다. 시연자의 성능을 넘어서지 못할 수 있습니다.
둘째, 새 지시로의 일반화는 이미 본 개념의 조합에 머뭅니다. 한 번도 본 적 없는 완전히 새로운 동작으로는 아직 일반화하지 못합니다.
셋째, 작업 세트가 크지만 정교한 조작은 많지 않습니다.
향후 방향으로는 비전문가가 지시형 데이터 수집과 모델 프롬프팅으로 로봇을 가르쳐 기술 수를 더 빨리 늘리는 방법, 환경 다양성을 크게 늘려 배경·환경 강건성을 높이는 방법, 확장 가능한 어텐션과 메모리로 반응 속도와 문맥 유지 능력을 높이는 방법을 꼽습니다.
13. 정리 — VLA 계보에서의 위치
RT-1은 두 가지를 동시에 보였습니다. 하나는 로봇 제어를 이미지·언어 토큰에서 행동 토큰으로 가는 시퀀스 모델링 문제로 바꿔도 실시간으로 돌릴 수 있다는 것이고, 다른 하나는 그렇게 만든 모델이 크고 다양한 실물 데이터를 흡수할수록 일반화한다는 것입니다.
- FiLM으로 이른 언어 융합 을 하고 TokenLearner로 토큰을 줄여, 35M 모델이 3 Hz 제어 예산 안에 들어갑니다.
- 차원별 256구간 이산 행동 이 여러 갈래 행동 분포를 담아, 연속 가우시안보다 모든 축에서 크게 앞섭니다.
- 데이터의 양보다 다양성 이 일반화를 결정하고, 시뮬레이션이나 다른 로봇의 데이터도 원래 성능을 거의 잃지 않고 흡수됩니다.
이 가운데 행동을 토큰으로 내놓는 설계가 다음 편으로 곧장 이어집니다. RT-1의 언어 이해는 USE 임베딩 하나에 기대고, 시각 지식은 ImageNet 사전학습에서 옵니다. 그렇다면 인터넷 규모의 이미지·텍스트로 학습한 대형 시각-언어 모델에 행동 토큰을 텍스트처럼 출력하게 하면 어떻게 될까요. 이 질문에 답한 것이 RT-2입니다. RT-2는 RT-1의 데이터를 그대로 쓰면서 모델을 시각-언어 모델로 바꾸고, 이 구조에 VLA라는 이름을 붙입니다.
다른 로봇 데이터를 섞어 성능이 오른 7절의 결과는 이후 22종 로봇의 데이터를 모은 Open X-Embodiment로, 이산 행동 토큰은 OpenVLA로, 그리고 토큰 대신 연속 행동을 직접 생성하는 방향은 π0로 이어집니다.