들어가며
원조 UMI 논문해석은 로봇 없이 시연을 모아 여러 로봇에 배포할 수 있다는 것을 보였습니다. 이후 계보는 그 장치를 다듬는 쪽으로 갈라졌습니다. FastUMI는 설치 난이도를, exUMI와 TacUMI는 감각의 폭을, 농업용 저가 하드웨어는 야외 견고성을 손봤습니다.
RDT2는 방향이 다릅니다. UMI 데이터를 얼마나 크게 키울 수 있느냐를 묻습니다. UMI 하드웨어를 3D 프린팅 대신 CNC로 다시 만들어 약 100대를 찍어 내고, 100곳이 넘는 실제 가정에 뿌려 1만 시간이 넘는 시연을 모았습니다. 그 데이터로 7B 규모 시각-언어 모델(Vision-Language Model, VLM) 위에 로봇 기반 모델(foundation model)을 올리고, 처음 보는 로봇 팔에 미세조정 없이(zero-shot) 얹었습니다. 수집기의 계보가 기반 모델에 닿는 지점입니다.
📄 RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization — Songming Liu, Bangguo Li, Kai Ma, Lingxuan Wu, Hengkai Tan, Xiao Ouyang, Hang Su, Jun Zhu / Tsinghua University, 2026-02-03, cs.RO, arxiv 식별자 2602.03310
초록 요약
시각-언어-행동(Vision-Language-Action, VLA) 모델은 범용 로봇으로 가는 길처럼 보이지만, 데이터가 모자라고 구조가 비효율적이며 하드웨어 플랫폼을 넘나들지 못한다는 벽에 막혀 있습니다. RDT2는 7B 파라미터 VLM 위에 세운 로봇 기반 모델로, 처음 보는 몸체(embodiment)에 미세조정 없이 얹어 열린 어휘(open-vocabulary) 과제를 시키는 것을 목표로 삼습니다. 그러려면 데이터부터 있어야 하니, 몸체를 가리지 않도록(embodiment-agnostic) 손본 UMI로 1만 시간이 넘는 시연을 모아 오픈소스로 공개된 로봇 데이터셋 가운데 가장 큰 축에 드는 것을 만들었습니다. 학습은 잔차 벡터 양자화(Residual Vector Quantization, RVQ)에서 흐름 정합(flow matching)을 거쳐 증류(distillation)로 이어지는 3단 레시피로, 언어 쪽의 이산적인 지식과 제어 쪽의 연속적인 값을 차례로 맞춰 갑니다. 그렇게 만든 RDT2는 처음 보는 물체와 장면, 지시, 로봇 플랫폼에 한꺼번에 일반화하는 첫 모델 축에 들었고, 탁구처럼 정교하면서 길고 빠른 후속 과제에서도 최신 기준선을 앞섰습니다.
1. 하드웨어 — 3D 프린팅으로는 1만 시간을 못 버팁니다

그림 1(a) — 대규모 수집에서의 일관성과 신뢰성을 높이려 다시 설계한 UMI 하드웨어입니다.
원조 UMI 하드웨어로는 현장에서 대규모로 모을 만한 신뢰성이 나오지 않았습니다. 저자들은 구조를 단단하게 하고, 표류 없는 적외선 추적을 넣고, 어지러운 환경에서도 손이 잘 들어가도록 시스템 전체를 다시 만들었습니다.
| 항목 | 원조 UMI | RDT2의 UMI | 이점 |
|---|---|---|---|
| 제작 | 3D 프린팅 (PLA / PETG) | CNC (나일론 66 & 유리섬유) | 더 높은 강성, 더 나은 가공 정확도와 일관성. 장기·고빈도 수집에 적합 |
| 추적 | SLAM | 적외선 | 말단장치 6차원 자세 추적 정밀도 향상. 고속 운동·무늬 없는 배경·투명한 배경에 더 강함 |
| 말단장치 | 평행 턱 | 링크 집게 | 더 조밀한 구조. 좁은 틈이나 어지러운 환경에서의 손재주와 접근성 개선 |

그림 9(a) — 연산 유닛, 고주파 시각 시스템, 정밀 적외선 추적, 맞춤 집게 인터페이스를 통합한 손에 드는 데이터 수집 장치입니다.
기록은 Intel Core Ultra 7 155H에 32GB RAM과 2TB SSD를 단 산업용 제어 유닛이 맡습니다. 시각은 Hikrobot MV-CS016-10UC 산업용 카메라가 맡는데, Sony IMX273 전역 셔터 CMOS 센서에 (1.6MP) 해상도, 최대 249 fps입니다. 수집할 때는 30 Hz로 낮춰 씁니다. 추적은 HTC VIVE Tracker 3.0 네 개를 쓰는 적외선 측위입니다.
집게 쪽 결정이 이 논문에서 특히 중요합니다. 로봇 실행에는 ZhiXing CTAG2F120 집게를 쓰고, 손에 드는 장치에는 그 집게의 배치와 기하를 그대로 베낀 비구동 복제품을 답니다. 복제품 섀시는 유리섬유 강화 나일론 66(PA66+GF)을 CNC로 깎았습니다. 작업자는 기계식 리밋 스위치가 달린 슬라이딩 레일로 벌림 폭을 손으로 조절하는데, 그 범위를 로봇 집게의 운동 범위와 한 치도 어긋나지 않게 맞췄습니다.
2. 배포 — 같은 카메라, 같은 집게, 같은 홈 포즈

그림 1(b) — 같은 기종의 카메라와 집게만 달면 배포가 끝납니다.

그림 1(c) — 우리 UMI로 모은 데이터로 학습한 정책은 다양한 로봇 팔에 미세조정 없이 옮겨집니다.
배포는 Franka Research 3(FR3)와 Universal Robots UR5e 두 팔에서 검증했습니다. 두 팔 모두 수집에 쓴 것과 같은 ZhiXing 평행 턱 집게를 달고, 같은 Hikrobot 카메라를 손안(eye-in-hand)에 답니다.

그림 9(b) — 손에 드는 수집 장치의 평균 시작 시점을 시각적으로 재현하는 홈 포즈입니다.
학습과 추론의 상태 분포를 맞추려고 로봇을 정해진 홈 포즈에서 출발시킵니다. 손에 든 장치가 시작할 때 카메라가 보던 평균적인 화면을 로봇이 그대로 재현하는 자세입니다. 원조 UMI의 시점 일관성 원칙을 궤적 전체가 아니라 시작점에만 적용한 셈입니다.
3. 데이터셋 — 100곳의 가정, 50개 작업대
데이터셋은 100곳이 넘는 서로 다른 가정에서 모은 약 1만 시간 분량입니다. 쇼룸이나 모형 아파트, 요양원처럼 잘 정돈된 장소도 있지만 상당 부분은 유료 크라우드소싱으로 실제 개인 가정에서 모았습니다. 실험실에서는 흉내 내기 어려운 롱테일 물체와 재질, 공간 배치가 여기서 들어옵니다.
가정에서 시킬 작업은 집기와 놓기, 붓기, 닦기, 흔들기, 정리하기 등 50개가 넘습니다. 수집자는 큰 줄기의 지시만 받고 자기 집에 있는 물건으로 해내되, 쓰는 물건과 용기와 방식을 일부러 바꿔 가며 하도록 유도했습니다. 짐 싸기라면 손에 잡히는 대로 배낭이든 비닐봉지든 바구니든 넣는 식입니다. 가정 기록에만 1,000종이 넘는 물체가 등장합니다.
가정 데이터를 보완하려고 작업대 50개를 둔 병렬 수집 전용 시설도 운영했습니다. 3,000종이 넘는 물체 풀에서 조합을 뽑아 잡기와 들기, 목표 영역으로 옮기기 같은 조작 원시동작(primitive)을 빠짐없이 덮습니다. 작업 유형은 변형체 조작 30.2%, 표면 상호작용 22.4%, 접촉이 많은 조작 21.5%, 동적 작업 10.8%, 관절체 조작 9.4%, 기타 5.7%로 나뉩니다.

그림 11 — 높은 수준의 작업 지시로 기록을 잘라 작업 단위 클립을 만들고, 다시 세밀한 행동 구간으로 분해하는 2단계 주석 예시입니다.
주석은 2단계로 답니다. 먼저 큰 줄기의 지시로 기록을 작업 단위 클립으로 나누고, 그 클립을 다시 세밀한 행동 구간으로 쪼갭니다. 저장할 때는 "오른손으로 빨간 컵을 잡아라" 같은 자연어를 쓰되 손과 물체와 행동 원시동작을 지정하는 스키마를 지키고, 여기에 뜻이 같은 다른 표현과 짧게 줄인 표현을 덧붙이는 언어 증강을 걸었습니다. 기계 주석은 Google Gemini 2.5 Pro가 달았습니다. VLM 사전학습에는 Ego4D와 QaEgo4D, HD-EPIC, RoboVQA, RoboBrain(ShareRobot), PixMo-Cap-QA와 Cambrian-10M을 섞은 1,200만 개가 넘는 질의응답 쌍을 씁니다.
4. 학습 — 이산과 연속을 순서대로 붙입니다

그림 2 — 1단계에서 이산화한 행동 데이터로 7B VLM 백본을 사전학습해 시각-언어 추론 능력을 얻고, 2단계에서 작은 확산 행동 전문가를 학습시켜 연속 행동을 효율적으로 생성하며, 매우 동적인 과제를 위해 3단계에서 확산 정책을 1단계 생성기로 증류해 극도로 빠른 추론 속도를 얻습니다.
이산 표현은 사전학습된 VLM의 확률적 출력과 자연스럽게 맞물리는 대신 양자화 오차와 자기회귀 표집의 비효율을 떠안습니다. 확산 같은 연속 표현은 표집이 빠르지만 수렴이 느리고 VLM 안의 이산 지식을 망가뜨릴 수 있습니다. RDT2는 둘을 순서대로 이어 붙여 각각의 장점만 챙깁니다.
1단계. 연속 행동 묶음 를 1차원 시간 합성곱 신경망으로 차원 잠재 개로 부호화한 뒤, 깊이 의 반복 과정으로 양자화합니다. 각 단계에서 잔차에 가장 가까운 코드북 항목을 고르고 그만큼을 빼는 방식입니다.
코드북 붕괴(codebook collapse)를 막으려고 코드북 차원을 낮추고, 유클리드 거리 대신 코사인 유사도를 쓰고, 지수이동평균으로 갱신을 다듬고, 한 번도 켜지지 않은 코드북 항목은 일정 주기마다 다시 뿌립니다. 백본은 Qwen2.5-VL 7B이고, 어휘에서 가장 드문 항목 1,024개를 행동 토큰 자리로 비워 뒀습니다. UMI 데이터에 시각-언어 데이터를 조금 섞어 다음 토큰 예측 목적으로 128K 반복 학습합니다.
2단계. 백본을 얼리고 전용 행동 전문가를 학습합니다. RDT-1B의 400M 파라미터 변형인데, 속도를 올리려고 다중 헤드 주의(MHA)를 그룹 질의 주의(GQA)로 바꿨습니다. 얼어붙은 백본의 층마다 잠재 특징을 교차 주의로 받아 흐름 정합 손실로 연속 행동을 만들어 냅니다.
추론에서는 스텝 크기 , 그러니까 5회 적분으로 잡음을 걷어냅니다. 백본 출력은 적분 도중 변하지 않으니 한 번만 계산하면 됩니다. UMI 데이터에서 66K 반복 학습했습니다.
3단계. 탁구처럼 빠른 과제에서는 5회 순전파가 병목이 되므로, 2단계 정책을 1스텝 생성기로 증류합니다. 교사 궤적을 미리 만들어 두지 않고 학습 도중 그때그때 계산하는 점이 특이합니다. 저차원 행동은 적분 몇 번이면 끝나 비용이 감당할 만하고, 미리 만든 데이터에 학생이 과적합할 위험도 크게 줄어듭니다.
5. 미세조정 없는 일반화 — "4U" 설정

그림 15 — 집기, 집어 옮기기, 닦기, 흔들기, 버튼 누르기의 다섯 원시동작으로 구성한 제로샷 실험 장면입니다.
평가 설정 자체가 이 논문의 주장입니다. 저자들이 4U라 부르는 조건, 곧 처음 보는 몸체(Unseen embodiment)와 장면(Unseen scene), 물체(Unseen object), 지시(Unseen instruction)입니다. 학습 집합에 한 번도 없던 세 장면을 골랐고, 시험용 물건은 새로 샀고, 시험 지시는 학습 집합과 겹치는 것을 걷어냈습니다. 환경 3곳과 몸체 2종(FR3와 UR5e), 처음 보는 물체 100종이 넘는 조건에서 과제마다 256회씩 시행했습니다.
| 과제 | RDT2-FM | RDT2-VQ |
|---|---|---|
| 집기 | 41% | 45% |
| 집어 옮기기 | 29% | 26% |
| 닦기 | 52% | 51% |
| 버튼 누르기 | 27% | 25% |
| 흔들기 | 47% | 44% |
성공률 자체는 높지 않습니다. 그런데 여기서 볼 것은 절대값이 아니라, 사람 데이터만으로 학습한 모델이 몸체까지 포함한 여러 요인을 한꺼번에 바꿔도 버텼다는 점입니다. 로봇 데이터는 사전학습에 한 줄도 들어가지 않았습니다.
측정이 믿을 만한지도 따로 확인했습니다. 집기 과제를 RDT2-FM으로 1,000회 반복해 성공률이 수렴하는 것을 보았는데, 최종값은 44.00%였고 표준오차 구간은 언제나 이 값을 품었습니다. 이후 실험은 신뢰성과 인건비가 만나는 지점인 을 씁니다. 로봇 정책 논문에서 흔히 빠지는 대목을 정면으로 다뤘습니다.
6. 규모 법칙 — 데이터와 모델을 같이 키워야 합니다
모델 크기별로 전체 데이터셋을 고르게 뽑아 1에포크만 학습하고 중간 체크포인트마다 학습 손실을 봤습니다. 토큰이 한 번씩만 소비되니 학습 손실이 그대로 처음 보는 표본에 대한 일반화 지표가 됩니다.
적합 결과는 , , , , 입니다. 모델 파라미터와 데이터를 함께 키우면 성능이 뚜렷하고 예측 가능하게 오른다는 뜻입니다. 저자들은 여기서 곧장, 크게 키울 수 있는 수집 방식을 찾아 데이터를 늘리는 것이 모델 지능을 올리는 길이라고 결론을 냅니다. UMI 계보 전체가 왜 중요한지에 대한 답이기도 합니다.
7. 추론 속도와 미세조정 성능
증류의 효과는 추론 주파수에서 드러납니다.
| 모델 | 크기 | 추론 주파수 |
|---|---|---|
| -FAST | 3B | 1.6 Hz |
| RDT2-VQ | 7B | 2.7 Hz |
| 3B | 17.0 Hz | |
| RDT2-FM | 7B | 16.0 Hz |
| RDT2-UltraFast | 7B | 23.0 Hz |
보다 두 배 넘는 크기인데도 RDT2-UltraFast가 가장 빠릅니다. 자기회귀 쪽에서는 RVQ 토크나이저가 행동 토큰 수를 줄여 RDT2-VQ가 앞서고, 확산 쪽에서는 3단계의 1스텝 증류가 결정적입니다.

그림 16 — 옷 개기, 식탁 정리, 지퍼 열기, 동적 버튼 누르기, 탁구를 포함한 미세조정 실험 과제들입니다.
과제마다 시연 200개로 미세조정해 -FAST, 와 비교했습니다. 결과는 RDT2-UltraFast 기준입니다.
| 과제 | 지표 | RDT2 | -FAST | |
|---|---|---|---|---|
| 옷 개기 | 성공률(%) | 77 | 36 | 29 |
| 하위작업1: 왼쪽 소매(%) | 97 | 92 | 80 | |
| 하위작업2: 오른쪽 소매(%) | 95 | 70 | 61 | |
| 하위작업3: 최종 접기(%) | 81 | 45 | 38 | |
| 처음 보는 물체(%) | 51 | 15 | 10 | |
| 식탁 정리 | 진척 점수(최대 1.0) | 0.58 | 0.39 | 0.30 |
| 처음 보는 장면(최대 1.0) | 0.33 | 0.17 | 0.11 | |
| 지퍼 열기 | 성공률(%) | 45 | 13 | 8 |
| 버튼 누르기 | 반응 시간(ms) | +97 | +323 | +981 |
| 탁구 | 타구율(%) 1x/1.2x/1.5x/1.7x/2x | 88 / 85 / 76 / 69 / 68 | 78 / 74 / 58 / 57 / 56 | N/A |
세 축에서 갈립니다. 변형체 조작인 옷 개기는 성공률 77%로 기준선의 두 배를 넘고, 처음 보는 셔츠에서는 51% 대 15%로 네 배 가까이 벌어집니다. 장기 작업인 식탁 정리에서는 진척 점수 0.58로 앞서고, 배경과 조명을 바꾼 처음 보는 장면에서도 0.33을 지킵니다. 동적 작업에서는 숙련된 사람 원격조작자(평균 2661 ms)보다 97 ms 늦게 버튼을 누르고, 탁구는 2배속에서도 68%를 받아칩니다. -FAST는 탁구에서 쓸 만큼 빠른 정책을 아예 만들지 못했습니다.
절제 실험도 두 가지를 짚습니다. 확산만으로 학습하는 것보다 자기회귀 사전학습을 먼저 거치는 쪽이 훨씬 빨리 수렴하고 최종 손실도 낮습니다. VLM의 이산 지식을 건드리지 않으면서 좋은 출발점을 준다는 설명입니다. 그리고 RVQ는 같은 이산화 오차에서 FAST 토크나이저보다 토큰을 최대 3분의 2가량 아낍니다.
8. 정리 — 계보에서 RDT2의 자리
RDT2는 UMI 계보의 상한을 재려는 시도입니다.
- 하드웨어를 산업 부품으로 다시 만듭니다. CNC 나일론 66과 유리섬유, 적외선 추적, 링크 집게. 1만 시간을 견디려면 3D 프린팅으로는 부족했습니다.
- 집게를 로봇과 물리적으로 일치시킵니다. 로봇용 ZhiXing 집게의 비구동 복제품을 만들고 운동 범위까지 맞춰, 몸체 불가지론을 말이 아니라 기하로 만들었습니다.
- 3단 레시피. RVQ 이산화로 VLM의 지식을 지키면서 빠르게 수렴시키고, 흐름 정합으로 표현력과 효율을 얻고, 1스텝 증류로 실시간 속도를 확보합니다.
- 4U 제로샷. 로봇 데이터 없이 사람 시연만으로 학습한 모델이 처음 보는 로봇·장면·물체·지시의 조합에서 작동합니다.
한계도 명확합니다. 제로샷 성공률은 25~52% 구간이라 그대로 갖다 쓸 수준이 아니라, 길이 열렸다는 정도를 보여 주는 수치입니다. 배포 검증도 같은 집게를 단 FR3와 UR5e 두 팔에 그칩니다. 저자들 스스로 짚듯 개인 가정에서 모은 데이터라 개인정보 보호와 익명화 문제가 따라붙고, 처음 보는 물리적 맥락에서 어떻게 움직일지 모르니 안전 가드레일도 필요합니다.
그럼에도 규모 법칙이 던지는 말은 계보 전체를 향합니다. 모델만 키워서는 안 되고, 크게 키울 수 있는 수집 방식을 찾아 데이터도 함께 늘려야 합니다. 원조 UMI가 로봇 없이 시연을 모으는 길을 낸 뒤로 계보가 해 온 일이 바로 그 수집 방식을 다듬는 것이었고, RDT2는 그 축적이 어디까지 닿는지를 보여 준 편입니다.