UMI 계보 - 전체 목차2편

논문해석 - FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset

들어가며

원조 UMI 논문해석에서 본 대로, UMI는 로봇을 데이터 수집에서 떼어내는 데 성공했습니다. 그런데 그 UMI를 실제로 자기 연구실에 들여놓으려는 사람들은 곧 다른 벽에 부딪혔습니다. ORB-SLAM3를 제대로 굴리는 일 자체가 만만치 않고, 집게가 특정 로봇 부품에 묶여 있으며, 설치가 복잡했습니다. FastUMI는 UMI를 통째로 뜯어고쳐 이 벽을 넘습니다. 계보로 보면 UMI 바로 다음 세대에 해당하는, 가장 먼저 갈라져 나온 가지입니다.

📄 FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset — Zhaxizhuoma, Kehui Liu, Chuyue Guan, Zhongjie Jia, Ziniu Wu, Xin Liu, Tianyu Wang, Shuai Liang, Pengan Chen, Pingrui Zhang, Haoming Song, Delin Qu, Dong Wang, Zhigang Wang, Nieqing Cao, Yan Ding, Bin Zhao, Xuelong Li (총 18인) / 2024-09-29, cs.RO, arxiv 식별자 2409.19499

초록 요약

실제 환경의 로봇 조작 데이터는 범용 행동 정책(generalist action policy)을 만드는 데 핵심이지만, 기존 수집 방식은 비용이 높고(high cost), 특정 하드웨어에 종속되며(hardware dependency), 설치가 복잡해(complex setup) 데이터가 여전히 부족합니다. FastUMI는 UMI를 크게 재설계해 이 셋을 정면으로 풉니다. 첫째, 분리형 하드웨어 설계(decoupled hardware design) 와 대폭의 기계 구조 개조로 전용 로봇 부품 의존을 없애면서도 관측 시점(observation perspective)은 일관되게 유지합니다. 둘째, 복잡한 시각-관성 오도메트리(Visual-Inertial Odometry, VIO) 구현을 시판(off-the-shelf) 추적 모듈로 교체해 정확도는 유지하면서 배치 난이도를 낮춥니다. 셋째, 데이터 수집·검증·모방학습(imitation learning) 알고리즘 연동을 아우르는 생태계(ecosystem) 를 제공합니다. 여기에 22개 일상 과제에 걸친 1만 개 이상의 실세계 시연 궤적(demonstration trajectory) 을 오픈소스로 공개했습니다.


1. 문제 — 좁은 시야로는 맥락이 담기지 않습니다

FastUMI가 가장 먼저 손댄 것은 카메라입니다.

그림 2 — 좁은 시야각의 D435i와 155도 광각의 GoPro

그림 2 — 왼쪽은 좁은 시야각(FOV)을 가진 D435i 카메라, 오른쪽은 155도 광각으로 보는 GoPro입니다.

기존 방식이 쓰던 D435i 같은 카메라는 시야각이 좁아 손 조작 장면의 맥락을 충분히 담지 못합니다. FastUMI는 약 155도 광각의 GoPro 를 써서 조작 주변 환경까지 넓게 담습니다. 넓은 시야는 정책이 물체와 손과 배경의 관계를 함께 배우도록 돕습니다. 이 선택이 얼마나 결정적인지는 뒤의 표 V에서 숫자로 확인됩니다.


2. 전체 그림 — 손잡이에서 로봇으로, 시점을 그대로 옮깁니다

FastUMI의 뼈대는 한 문장으로 요약됩니다. 사람이 손으로 시연할 때 카메라가 보던 시점을, 로봇이 실행할 때도 똑같이 재현한다. 시점이 같아야 손 시연으로 배운 정책이 로봇 위에서 그대로 작동합니다.


3. 하드웨어 — 같은 화면을 두 번 만듭니다

FastUMI 하드웨어는 세 가지 모습으로 나타납니다. 손잡이형 장치(handheld device) 는 사람이 시연 데이터를 모으는 데 쓰며, 시각 피드백용 GoPro, 말단장치(end-effector) 자세 추적용 RealSense T265, 집게 벌림(gripper aperture)을 재는 손끝 마커, 두 카메라를 고정하는 상단 커버로 구성됩니다. 로봇 장착형 장치(robot-mounted device) 는 학습된 정책을 로봇 팔에서 실행하는 형태로, 손잡이형과 구성을 그대로 대응시킵니다. ISO 표준 호환 카메라 마운트와 연장 암, 플랜지 플레이트로 다양한 팔과 집게 형상에 맞춥니다. 이 덕분에 서로 다른 구성에서도 GoPro 시점이 일관되게 유지됩니다.

원문 그림 1(물리 프로토타입 전체 사진)은 arxiv HTML 판에서 렌더링이 누락되어 이미지를 불러올 수 없습니다. 대신 위 문단으로 내용을 옮겼습니다. 나머지 그림 212와 표 IVII은 모두 실었습니다.

그림 3 — 손잡이형과 로봇 장착형의 시각 정렬

그림 3 — 두 시점 모두 GoPro 어안(fisheye) 렌즈 영상에서 집게 손끝의 바닥이 빨간 점선에 맞춰집니다.

그림 3은 관측 시점 일관성을 구체적으로 증명합니다. 손으로 들 때와 로봇에 달 때 집게 손끝이 화면에서 같은 위치 에 오도록 마운트를 설계해, 두 화면을 서로 바꿔치기해도 알아채기 어려울 만큼 정렬했습니다.

그림 4 — xArm 집게에 통합한 플러그인 손끝 설계

그림 4 — xArm 집게의 유효 길이는 완전히 닫힘과 완전히 열림 사이에서 약 1 cm 변하며, 이는 시연을 옮길 때 어긋남(misalignment)을 일으킵니다.

집게가 벌어지고 닫힐 때 유효 길이가 약 1 cm 변합니다. 이 변화를 무시하면 손 시연과 로봇 실행 사이에 위치 오차가 생깁니다. FastUMI는 교체형(plug-in) 손끝으로 이 기하 변화를 반영하고, 뒤에 나오는 동적 오차 보정(dynamic error compensation)으로 수식 차원에서도 보상합니다.


4. 소프트웨어 — SLAM을 시판 모듈로 갈아끼웁니다

원조 UMI가 ORB-SLAM3에 의존했다면, FastUMI는 그 자리를 시판 추적 모듈로 대체합니다. 구현 난이도가 크게 떨어지는 대신, 추적 오차가 시간이 지나며 쌓이는 누적 오차(drift) 문제는 그대로 남습니다.

그림 5 — 파란 기준 홈과 루프 클로저

그림 5 — 왼쪽은 탁자 위의 파란색 3D 프린팅 홈(groove)으로 루프 클로저(loop closure)의 시각 기준이 되고, 오른쪽은 RVIZ에 표시된 T265 궤적이 파란 홈을 다시 지날 때 초기 기준(초록 점선 상자)과 정렬되는 모습입니다.

FastUMI는 탁자에 파란색 기준 홈 을 두고 시연의 시작과 끝에서 그 위치를 다시 방문하게 만듭니다. 궤적이 초기 기준으로 다시 정렬되면서 누적 오차가 접힙니다.

그림 11 — Pick Cup 과제 동안의 VIO 오차 시간 변화

그림 11 — 집게가 탁자에 가까워지며 시각 특징(visual feature)을 가릴 때 오차가 정점을 찍고, 원래 시점으로 돌아오면 다시 회복됩니다.

VIO 오차는 일정하지 않습니다. 가림(occlusion) 상황에서 커졌다가 회복 됩니다. 집게가 탁자 가까이 가면 카메라가 특징점을 잃어 오차가 튀지만, 시점이 복원되면 다시 줄어듭니다. 이 두 가지 — 가림에서의 오차 봉우리와 루프 클로저에서의 회복 — 를 한 그림에 겹쳐 보면 이렇습니다.

애니메이션 로딩 중...

이 특성을 알아야 루프 클로저와 오차 보정 설계가 왜 필요한지 납득됩니다.


5. 좌표계 변환 — 카메라가 아니라 집게가 기준입니다

그림 6 — T265 중심에서 집게 중심까지의 오프셋

그림 6 — T265 중심에서 집게 중심까지의 오프셋 Δc2g\Delta_{c2g}, 그리고 로봇 베이스 좌표계에서의 집게 중심 자세 (pb2g,Rb2g)(p_{b2g}, R_{b2g}) 를 나타냅니다.

추적 모듈이 재는 것은 카메라 중심의 위치와 자세인데, 정작 필요한 것은 집게 중심(말단장치) 의 자세입니다. 둘 사이의 고정 오프셋 Δc2g\Delta_{c2g} 를 알면 서로 변환할 수 있습니다. 논문은 이를 다음 관계로 정리합니다.

pcam(i)=pb2g+piRb2gΔc2g,Rcam(i)=RbaseRip^{(i)}_{cam} = p_{b2g} + p_i - R_{b2g}\,\Delta_{c2g}, \qquad R^{(i)}_{cam} = R_{base}\,R_i pee(i)=pcam(i)+Rcam(i)Δc2g,Ree(i)=Rcam(i)p^{(i)}_{ee} = p^{(i)}_{cam} + R^{(i)}_{cam}\,\Delta_{c2g}, \qquad R^{(i)}_{ee} = R^{(i)}_{cam}

정책 학습에 쓰는 상대 이동은 연속한 두 시점의 차이로 얻습니다.

prel(i)=pee(i+1)pee(i),Rrel(i)=(Ree(i))1Ree(i+1)p^{(i)}_{rel} = p^{(i+1)}_{ee} - p^{(i)}_{ee}, \qquad R^{(i)}_{rel} = \left(R^{(i)}_{ee}\right)^{-1} R^{(i+1)}_{ee}

집게 벌림 폭 WW 는 손끝 마커 사이 거리 dd 를 최소·최대 사이에서 정규화해 얻습니다.

W=ddmindmaxdmin×GmaxW = \frac{d - d_{min}}{d_{max} - d_{min}} \times G_{max}

앞서 본 손끝 길이 변화도 여기서 보정됩니다. 벌림 폭 W(i)W(i) 에 따라 손끝 길이 보정량 d(i)d(i) 를 계산하고, 말단장치의 zz 축 방향으로 위치를 밀어 보정한 뒤 역기구학(IK)으로 관절각을 구합니다.

d(i)=dclosedclosedopenWmaxW(i),pee(i)=pee(i)d(i)Ree(i)e^zd(i) = d_{close} - \frac{d_{close} - d_{open}}{W_{max}} W(i), \qquad p'^{(i)}_{ee} = p^{(i)}_{ee} - d(i)\,R^{(i)}_{ee}\hat{e}_z

6. 깊이 보강 — 단안 카메라의 약점을 메웁니다

그림 7 — 깊이 매핑 과정

그림 7 — 윗줄은 잘라낸 GoPro 프레임, 아랫줄은 Depth Anything V2가 생성한 대응 깊이 추정 결과입니다.

FastUMI는 단안(monocular) GoPro만 쓰므로 깊이 정보가 약합니다. 이를 메우려고 Depth Anything V2 로 각 프레임의 깊이를 추정해 정책 입력에 더합니다. 또한 1인칭(first-person) 시점에 맞춰 행동 묶음 변환기(Action Chunking with Transformers, ACT)를 개선한 변형들을 제안합니다. ACT 계열의 학습 손실은 다음과 같습니다.

L=a^a1+a^GRUa1+λKL(μ,logσ2)\mathcal{L} = \lVert \hat{a} - a \rVert_1 + \lVert \hat{a}_{GRU} - a \rVert_1 + \lambda \cdot KL(\mu, \log \sigma^2)

7. 데이터셋 — 22개 과제, 1만 궤적

그림 8 — FastUMI 데이터셋 개요

그림 8 — 왼쪽은 대표 GoPro 프레임(주황 라벨은 과제, 파란 숫자는 시연 개수), 오른쪽은 과제별 비율과 조작 기술(manipulation skill) 분포입니다.

FastUMI 데이터셋은 22개 일상 과제에 걸친 1만 개 이상의 실세계 시연 궤적 으로 구성됩니다. 힌지 여닫기, 집어 옮기기, 밀기, 버튼 누르기 등 다양한 조작 유형을 폭넓게 아우릅니다.


8. 실험 — 무엇이 성능을 만드는가

그림 9 — 정책 추론 평가에 사용한 12개 과제

그림 9 — 힌지 조작(과제 1–4), 집어 옮기기(과제 5–10), 집어 밀기(과제 11), 버튼 누르기(과제 12)를 포함합니다.

그림 10 — 반사 마커와 광학 모션 캡처 기준 궤적

그림 10 — 왼쪽은 손잡이형 장치에 부착한 4개의 반사 마커(reflective marker), 오른쪽은 Pick Cup 과제의 예시 장면입니다.

궤적 오차 (표 I)

광학 모션 캡처로 얻은 정답(ground-truth) 궤적과 비교한 결과입니다. 단위는 mm입니다.

추적 모듈과제Traj1Traj2Traj3Traj4Traj5Traj6Traj7Traj8Traj9Traj10
RealSense T265Pick Cup1110121111121110710
RealSense T265Open Container19161817191717171819
RealSense T265Rearrange Coke36212120192221252226
RoboBaton MINIPick Cup17151614131515141617
RoboBaton MINIOpen Container10111011111211121212

시판 추적 모듈만으로도 조작 정책 학습에 쓸 만한 궤적 품질이 나옵니다.

기준 정책 성능 (표 II)

확산 정책(Diffusion Policy, DP, 상대 TCP 좌표)과 ACT(절대 관절 좌표)의 과제별 성공률입니다.

#과제조작 유형DP (상대 TCP)ACT (절대 관절)
1Open ContainerHinged93.3386.67
2Open RoasterHinged80.0086.67
3Open DrawerHinged53.3380.00
4Open SuitcaseHinged40.0086.67
5Rearrange CokePick-Place80.0086.67
6Fold TowelPick-Place93.3373.33
7Pick BearPick-Place80.0020.00
8Unplug ChargerPick-Place86.6786.67
9Pick LidPick-Place53.3393.33
10Pick PenPick-Place53.3320.00
11Sweep TrashPick-Push46.676.67
12Open RicecookerButton Press20.0080.00

DP와 ACT는 과제마다 강점이 갈립니다. Pick Bear·Pick Pen·Sweep Trash처럼 깊이와 정밀 조작이 필요한 과제에서 ACT가 약하고, 반대로 Open Ricecooker에서는 ACT가 강합니다. 이 편차가 다음 두 개선의 동기입니다.

깊이 보강 효과 (표 III)

과제원본 DP깊이 보강 DP
Pick Lid53.33%80.00%
Open Ricecooker20.00%93.33%

깊이를 더하면 깊이 의존적 과제에서 성공률이 크게 오릅니다. 단안 카메라의 약점을 정확히 겨냥한 처방입니다.

ACT 변형 비교 (표 IV)

과제ACT (관절)Smooth-ACT (관절)PoseACT 절대 (TCP)PoseACT 상대 (TCP)
Pick Bear20.00%60.00%80.00%73.33%
Sweep Trash6.67%26.67%53.33%60.00%

1인칭 시점에 맞춘 개선이 원본 ACT를 크게 앞섭니다. 특히 말단장치(TCP) 좌표를 쓰는 PoseACT가 관절 좌표 ACT보다 훨씬 견고합니다. 관절이 아니라 말단장치 기준으로 행동을 표현하라는 원조 UMI의 교훈이 여기서도 반복됩니다.

카메라 설정의 영향 (표 V)

과제D435i (1인칭)GoPro 평면 렌즈 (1인칭)
Pick Bear0%6.67%
Open Container0%93.33%
과제D435i (1인칭 & 3인칭)GoPro 어안 렌즈 (1인칭)
Pick Bear86.67%80.00%
Open Container100.00%100.00%

좁은 D435i를 1인칭 단독으로 쓰면 성능이 0%로 무너지지만, GoPro 어안 렌즈 를 쓰면 1인칭만으로도 D435i의 1인칭과 3인칭 조합에 필적합니다. 앞머리에서 카메라부터 바꾼 이유가 이 표에 있습니다.

데이터 규모의 영향 (표 VI)

과제데이터 200개데이터 400개데이터 800개
Pick Cup20.00%26.67%53.33%

데이터가 많을수록 성공률이 오릅니다. 1만 궤적 데이터셋을 공개한 이유가 여기 있습니다.


9. 부록 — 추적 모듈은 바꿔 낄 수 있습니다

항목RealSense T265RoboBaton MINI
출력 주파수 (Hz)20020
정확도 (mm)1010
시야각 (FOV)163°(대각)164.7°(대각) / 164.7°(수평) / 123.8°(수직)
해상도848×800640×480
무게 (g)5568
크기 (mm)108×24.5×12.5101.6×32.25×17.70
SDKWindows/Linux, ROS1Windows/Linux, HTTP/ROS2

그림 12 — RoboBaton MINI 제품 이미지

그림 12 — T265를 대체할 수 있는 시판 추적 모듈입니다.

두 모듈 모두 약 10 mm 정확도를 냅니다. RoboBaton MINI는 출력 주파수가 낮지만 더 넓은 시야와 최신 SDK를 제공합니다. T265가 단종된 뒤에도 FastUMI를 계속 쓸 수 있다는 것이, 하드웨어 독립성이라는 주장의 실제 근거입니다.


10. 저자가 밝힌 한계

첫째, 감지 방식의 한계 입니다. 시각 데이터에만 의존해, 정밀한 힘과 촉각 피드백이 필요한 과제에는 부족합니다. 촉각·힘 센서를 통합하면 더 견고한 정책 학습이 가능합니다.

둘째, 로봇 호환성 제약 입니다. 단일 팔과 양팔 플랫폼은 지원하지만, 이동형 조작기(mobile manipulator)처럼 전신 제어(whole-body control)가 필요한 형태에는 맞춰져 있지 않습니다.

셋째, 유선 데이터 전송 입니다. 유선 연결에 의존해 이동성과 현장 활용이 제약됩니다.


11. 정리 — 계보에서 FastUMI의 자리

FastUMI는 원조 UMI의 아이디어를 그대로 두고 구현의 문턱만 낮춘 논문입니다.

  • 광각 GoPro가 좁은 시야로 무너지던 성능을 살립니다.
  • 시판 추적 모듈이 ORB-SLAM3 구현 부담을 걷어냅니다.
  • 분리형 마운트가 로봇 전용 부품 의존을 없앱니다.
  • 22개 과제 1만 궤적이 후속 연구의 공용 자산이 됩니다.

한계로 남긴 세 가지 — 촉각 부재, 이동형 조작기 미지원, 유선 의존 — 는 그대로 다음 세대의 과제 목록이 됩니다. 촉각은 exUMI가, 이동형 조작은 Mobile UMI가 이어받습니다. 계보의 출발점이 궁금하다면 원조 UMI 논문해석으로 돌아가면 됩니다.