들어가며
원조 UMI 논문해석에서 본 대로, UMI는 로봇을 데이터 수집에서 떼어내는 데 성공했습니다. 그런데 그 UMI를 실제로 자기 연구실에 들여놓으려는 사람들은 곧 다른 벽에 부딪혔습니다. ORB-SLAM3를 제대로 굴리는 일 자체가 만만치 않고, 집게가 특정 로봇 부품에 묶여 있으며, 설치가 복잡했습니다. FastUMI는 UMI를 통째로 뜯어고쳐 이 벽을 넘습니다. 계보로 보면 UMI 바로 다음 세대에 해당하는, 가장 먼저 갈라져 나온 가지입니다.
📄 FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset — Zhaxizhuoma, Kehui Liu, Chuyue Guan, Zhongjie Jia, Ziniu Wu, Xin Liu, Tianyu Wang, Shuai Liang, Pengan Chen, Pingrui Zhang, Haoming Song, Delin Qu, Dong Wang, Zhigang Wang, Nieqing Cao, Yan Ding, Bin Zhao, Xuelong Li (총 18인) / 2024-09-29, cs.RO, arxiv 식별자 2409.19499
초록 요약
실제 환경의 로봇 조작 데이터는 범용 행동 정책(generalist action policy)을 만드는 데 핵심이지만, 기존 수집 방식은 비용이 높고(high cost), 특정 하드웨어에 종속되며(hardware dependency), 설치가 복잡해(complex setup) 데이터가 여전히 부족합니다. FastUMI는 UMI를 크게 재설계해 이 셋을 정면으로 풉니다. 첫째, 분리형 하드웨어 설계(decoupled hardware design) 와 대폭의 기계 구조 개조로 전용 로봇 부품 의존을 없애면서도 관측 시점(observation perspective)은 일관되게 유지합니다. 둘째, 복잡한 시각-관성 오도메트리(Visual-Inertial Odometry, VIO) 구현을 시판(off-the-shelf) 추적 모듈로 교체해 정확도는 유지하면서 배치 난이도를 낮춥니다. 셋째, 데이터 수집·검증·모방학습(imitation learning) 알고리즘 연동을 아우르는 생태계(ecosystem) 를 제공합니다. 여기에 22개 일상 과제에 걸친 1만 개 이상의 실세계 시연 궤적(demonstration trajectory) 을 오픈소스로 공개했습니다.
1. 문제 — 좁은 시야로는 맥락이 담기지 않습니다
FastUMI가 가장 먼저 손댄 것은 카메라입니다.

그림 2 — 왼쪽은 좁은 시야각(FOV)을 가진 D435i 카메라, 오른쪽은 155도 광각으로 보는 GoPro입니다.
기존 방식이 쓰던 D435i 같은 카메라는 시야각이 좁아 손 조작 장면의 맥락을 충분히 담지 못합니다. FastUMI는 약 155도 광각의 GoPro 를 써서 조작 주변 환경까지 넓게 담습니다. 넓은 시야는 정책이 물체와 손과 배경의 관계를 함께 배우도록 돕습니다. 이 선택이 얼마나 결정적인지는 뒤의 표 V에서 숫자로 확인됩니다.
2. 전체 그림 — 손잡이에서 로봇으로, 시점을 그대로 옮깁니다
FastUMI의 뼈대는 한 문장으로 요약됩니다. 사람이 손으로 시연할 때 카메라가 보던 시점을, 로봇이 실행할 때도 똑같이 재현한다. 시점이 같아야 손 시연으로 배운 정책이 로봇 위에서 그대로 작동합니다.
3. 하드웨어 — 같은 화면을 두 번 만듭니다
FastUMI 하드웨어는 세 가지 모습으로 나타납니다. 손잡이형 장치(handheld device) 는 사람이 시연 데이터를 모으는 데 쓰며, 시각 피드백용 GoPro, 말단장치(end-effector) 자세 추적용 RealSense T265, 집게 벌림(gripper aperture)을 재는 손끝 마커, 두 카메라를 고정하는 상단 커버로 구성됩니다. 로봇 장착형 장치(robot-mounted device) 는 학습된 정책을 로봇 팔에서 실행하는 형태로, 손잡이형과 구성을 그대로 대응시킵니다. ISO 표준 호환 카메라 마운트와 연장 암, 플랜지 플레이트로 다양한 팔과 집게 형상에 맞춥니다. 이 덕분에 서로 다른 구성에서도 GoPro 시점이 일관되게 유지됩니다.
원문 그림 1(물리 프로토타입 전체 사진)은 arxiv HTML 판에서 렌더링이 누락되어 이미지를 불러올 수 없습니다. 대신 위 문단으로 내용을 옮겼습니다. 나머지 그림 2
12와 표 IVII은 모두 실었습니다.

그림 3 — 두 시점 모두 GoPro 어안(fisheye) 렌즈 영상에서 집게 손끝의 바닥이 빨간 점선에 맞춰집니다.
그림 3은 관측 시점 일관성을 구체적으로 증명합니다. 손으로 들 때와 로봇에 달 때 집게 손끝이 화면에서 같은 위치 에 오도록 마운트를 설계해, 두 화면을 서로 바꿔치기해도 알아채기 어려울 만큼 정렬했습니다.

그림 4 — xArm 집게의 유효 길이는 완전히 닫힘과 완전히 열림 사이에서 약 1 cm 변하며, 이는 시연을 옮길 때 어긋남(misalignment)을 일으킵니다.
집게가 벌어지고 닫힐 때 유효 길이가 약 1 cm 변합니다. 이 변화를 무시하면 손 시연과 로봇 실행 사이에 위치 오차가 생깁니다. FastUMI는 교체형(plug-in) 손끝으로 이 기하 변화를 반영하고, 뒤에 나오는 동적 오차 보정(dynamic error compensation)으로 수식 차원에서도 보상합니다.
4. 소프트웨어 — SLAM을 시판 모듈로 갈아끼웁니다
원조 UMI가 ORB-SLAM3에 의존했다면, FastUMI는 그 자리를 시판 추적 모듈로 대체합니다. 구현 난이도가 크게 떨어지는 대신, 추적 오차가 시간이 지나며 쌓이는 누적 오차(drift) 문제는 그대로 남습니다.

그림 5 — 왼쪽은 탁자 위의 파란색 3D 프린팅 홈(groove)으로 루프 클로저(loop closure)의 시각 기준이 되고, 오른쪽은 RVIZ에 표시된 T265 궤적이 파란 홈을 다시 지날 때 초기 기준(초록 점선 상자)과 정렬되는 모습입니다.
FastUMI는 탁자에 파란색 기준 홈 을 두고 시연의 시작과 끝에서 그 위치를 다시 방문하게 만듭니다. 궤적이 초기 기준으로 다시 정렬되면서 누적 오차가 접힙니다.

그림 11 — 집게가 탁자에 가까워지며 시각 특징(visual feature)을 가릴 때 오차가 정점을 찍고, 원래 시점으로 돌아오면 다시 회복됩니다.
VIO 오차는 일정하지 않습니다. 가림(occlusion) 상황에서 커졌다가 회복 됩니다. 집게가 탁자 가까이 가면 카메라가 특징점을 잃어 오차가 튀지만, 시점이 복원되면 다시 줄어듭니다. 이 두 가지 — 가림에서의 오차 봉우리와 루프 클로저에서의 회복 — 를 한 그림에 겹쳐 보면 이렇습니다.
이 특성을 알아야 루프 클로저와 오차 보정 설계가 왜 필요한지 납득됩니다.
5. 좌표계 변환 — 카메라가 아니라 집게가 기준입니다

그림 6 — T265 중심에서 집게 중심까지의 오프셋 , 그리고 로봇 베이스 좌표계에서의 집게 중심 자세 를 나타냅니다.
추적 모듈이 재는 것은 카메라 중심의 위치와 자세인데, 정작 필요한 것은 집게 중심(말단장치) 의 자세입니다. 둘 사이의 고정 오프셋 를 알면 서로 변환할 수 있습니다. 논문은 이를 다음 관계로 정리합니다.
정책 학습에 쓰는 상대 이동은 연속한 두 시점의 차이로 얻습니다.
집게 벌림 폭 는 손끝 마커 사이 거리 를 최소·최대 사이에서 정규화해 얻습니다.
앞서 본 손끝 길이 변화도 여기서 보정됩니다. 벌림 폭 에 따라 손끝 길이 보정량 를 계산하고, 말단장치의 축 방향으로 위치를 밀어 보정한 뒤 역기구학(IK)으로 관절각을 구합니다.
6. 깊이 보강 — 단안 카메라의 약점을 메웁니다

그림 7 — 윗줄은 잘라낸 GoPro 프레임, 아랫줄은 Depth Anything V2가 생성한 대응 깊이 추정 결과입니다.
FastUMI는 단안(monocular) GoPro만 쓰므로 깊이 정보가 약합니다. 이를 메우려고 Depth Anything V2 로 각 프레임의 깊이를 추정해 정책 입력에 더합니다. 또한 1인칭(first-person) 시점에 맞춰 행동 묶음 변환기(Action Chunking with Transformers, ACT)를 개선한 변형들을 제안합니다. ACT 계열의 학습 손실은 다음과 같습니다.
7. 데이터셋 — 22개 과제, 1만 궤적

그림 8 — 왼쪽은 대표 GoPro 프레임(주황 라벨은 과제, 파란 숫자는 시연 개수), 오른쪽은 과제별 비율과 조작 기술(manipulation skill) 분포입니다.
FastUMI 데이터셋은 22개 일상 과제에 걸친 1만 개 이상의 실세계 시연 궤적 으로 구성됩니다. 힌지 여닫기, 집어 옮기기, 밀기, 버튼 누르기 등 다양한 조작 유형을 폭넓게 아우릅니다.
8. 실험 — 무엇이 성능을 만드는가

그림 9 — 힌지 조작(과제 1–4), 집어 옮기기(과제 5–10), 집어 밀기(과제 11), 버튼 누르기(과제 12)를 포함합니다.

그림 10 — 왼쪽은 손잡이형 장치에 부착한 4개의 반사 마커(reflective marker), 오른쪽은 Pick Cup 과제의 예시 장면입니다.
궤적 오차 (표 I)
광학 모션 캡처로 얻은 정답(ground-truth) 궤적과 비교한 결과입니다. 단위는 mm입니다.
| 추적 모듈 | 과제 | Traj1 | Traj2 | Traj3 | Traj4 | Traj5 | Traj6 | Traj7 | Traj8 | Traj9 | Traj10 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RealSense T265 | Pick Cup | 11 | 10 | 12 | 11 | 11 | 12 | 11 | 10 | 7 | 10 |
| RealSense T265 | Open Container | 19 | 16 | 18 | 17 | 19 | 17 | 17 | 17 | 18 | 19 |
| RealSense T265 | Rearrange Coke | 36 | 21 | 21 | 20 | 19 | 22 | 21 | 25 | 22 | 26 |
| RoboBaton MINI | Pick Cup | 17 | 15 | 16 | 14 | 13 | 15 | 15 | 14 | 16 | 17 |
| RoboBaton MINI | Open Container | 10 | 11 | 10 | 11 | 11 | 12 | 11 | 12 | 12 | 12 |
시판 추적 모듈만으로도 조작 정책 학습에 쓸 만한 궤적 품질이 나옵니다.
기준 정책 성능 (표 II)
확산 정책(Diffusion Policy, DP, 상대 TCP 좌표)과 ACT(절대 관절 좌표)의 과제별 성공률입니다.
| # | 과제 | 조작 유형 | DP (상대 TCP) | ACT (절대 관절) |
|---|---|---|---|---|
| 1 | Open Container | Hinged | 93.33 | 86.67 |
| 2 | Open Roaster | Hinged | 80.00 | 86.67 |
| 3 | Open Drawer | Hinged | 53.33 | 80.00 |
| 4 | Open Suitcase | Hinged | 40.00 | 86.67 |
| 5 | Rearrange Coke | Pick-Place | 80.00 | 86.67 |
| 6 | Fold Towel | Pick-Place | 93.33 | 73.33 |
| 7 | Pick Bear | Pick-Place | 80.00 | 20.00 |
| 8 | Unplug Charger | Pick-Place | 86.67 | 86.67 |
| 9 | Pick Lid | Pick-Place | 53.33 | 93.33 |
| 10 | Pick Pen | Pick-Place | 53.33 | 20.00 |
| 11 | Sweep Trash | Pick-Push | 46.67 | 6.67 |
| 12 | Open Ricecooker | Button Press | 20.00 | 80.00 |
DP와 ACT는 과제마다 강점이 갈립니다. Pick Bear·Pick Pen·Sweep Trash처럼 깊이와 정밀 조작이 필요한 과제에서 ACT가 약하고, 반대로 Open Ricecooker에서는 ACT가 강합니다. 이 편차가 다음 두 개선의 동기입니다.
깊이 보강 효과 (표 III)
| 과제 | 원본 DP | 깊이 보강 DP |
|---|---|---|
| Pick Lid | 53.33% | 80.00% |
| Open Ricecooker | 20.00% | 93.33% |
깊이를 더하면 깊이 의존적 과제에서 성공률이 크게 오릅니다. 단안 카메라의 약점을 정확히 겨냥한 처방입니다.
ACT 변형 비교 (표 IV)
| 과제 | ACT (관절) | Smooth-ACT (관절) | PoseACT 절대 (TCP) | PoseACT 상대 (TCP) |
|---|---|---|---|---|
| Pick Bear | 20.00% | 60.00% | 80.00% | 73.33% |
| Sweep Trash | 6.67% | 26.67% | 53.33% | 60.00% |
1인칭 시점에 맞춘 개선이 원본 ACT를 크게 앞섭니다. 특히 말단장치(TCP) 좌표를 쓰는 PoseACT가 관절 좌표 ACT보다 훨씬 견고합니다. 관절이 아니라 말단장치 기준으로 행동을 표현하라는 원조 UMI의 교훈이 여기서도 반복됩니다.
카메라 설정의 영향 (표 V)
| 과제 | D435i (1인칭) | GoPro 평면 렌즈 (1인칭) |
|---|---|---|
| Pick Bear | 0% | 6.67% |
| Open Container | 0% | 93.33% |
| 과제 | D435i (1인칭 & 3인칭) | GoPro 어안 렌즈 (1인칭) |
|---|---|---|
| Pick Bear | 86.67% | 80.00% |
| Open Container | 100.00% | 100.00% |
좁은 D435i를 1인칭 단독으로 쓰면 성능이 0%로 무너지지만, GoPro 어안 렌즈 를 쓰면 1인칭만으로도 D435i의 1인칭과 3인칭 조합에 필적합니다. 앞머리에서 카메라부터 바꾼 이유가 이 표에 있습니다.
데이터 규모의 영향 (표 VI)
| 과제 | 데이터 200개 | 데이터 400개 | 데이터 800개 |
|---|---|---|---|
| Pick Cup | 20.00% | 26.67% | 53.33% |
데이터가 많을수록 성공률이 오릅니다. 1만 궤적 데이터셋을 공개한 이유가 여기 있습니다.
9. 부록 — 추적 모듈은 바꿔 낄 수 있습니다
| 항목 | RealSense T265 | RoboBaton MINI |
|---|---|---|
| 출력 주파수 (Hz) | 200 | 20 |
| 정확도 (mm) | 10 | 10 |
| 시야각 (FOV) | 163°(대각) | 164.7°(대각) / 164.7°(수평) / 123.8°(수직) |
| 해상도 | 848×800 | 640×480 |
| 무게 (g) | 55 | 68 |
| 크기 (mm) | 108×24.5×12.5 | 101.6×32.25×17.70 |
| SDK | Windows/Linux, ROS1 | Windows/Linux, HTTP/ROS2 |

그림 12 — T265를 대체할 수 있는 시판 추적 모듈입니다.
두 모듈 모두 약 10 mm 정확도를 냅니다. RoboBaton MINI는 출력 주파수가 낮지만 더 넓은 시야와 최신 SDK를 제공합니다. T265가 단종된 뒤에도 FastUMI를 계속 쓸 수 있다는 것이, 하드웨어 독립성이라는 주장의 실제 근거입니다.
10. 저자가 밝힌 한계
첫째, 감지 방식의 한계 입니다. 시각 데이터에만 의존해, 정밀한 힘과 촉각 피드백이 필요한 과제에는 부족합니다. 촉각·힘 센서를 통합하면 더 견고한 정책 학습이 가능합니다.
둘째, 로봇 호환성 제약 입니다. 단일 팔과 양팔 플랫폼은 지원하지만, 이동형 조작기(mobile manipulator)처럼 전신 제어(whole-body control)가 필요한 형태에는 맞춰져 있지 않습니다.
셋째, 유선 데이터 전송 입니다. 유선 연결에 의존해 이동성과 현장 활용이 제약됩니다.
11. 정리 — 계보에서 FastUMI의 자리
FastUMI는 원조 UMI의 아이디어를 그대로 두고 구현의 문턱만 낮춘 논문입니다.
- 광각 GoPro가 좁은 시야로 무너지던 성능을 살립니다.
- 시판 추적 모듈이 ORB-SLAM3 구현 부담을 걷어냅니다.
- 분리형 마운트가 로봇 전용 부품 의존을 없앱니다.
- 22개 과제 1만 궤적이 후속 연구의 공용 자산이 됩니다.
한계로 남긴 세 가지 — 촉각 부재, 이동형 조작기 미지원, 유선 의존 — 는 그대로 다음 세대의 과제 목록이 됩니다. 촉각은 exUMI가, 이동형 조작은 Mobile UMI가 이어받습니다. 계보의 출발점이 궁금하다면 원조 UMI 논문해석으로 돌아가면 됩니다.