UMI 계보 - 전체 목차13편

논문해석 - TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks

들어가며

원조 UMI 논문해석 이후 계보의 관심사는 오랫동안 "어떻게 더 많이, 더 정확하게 모을까"였습니다. FastUMI는 추적 모듈을 갈아끼웠고, exUMI는 촉각을 붙였고, 앞 편의 FARM은 힘을 행동 공간까지 밀어 넣었습니다.

TacUMI는 여기서 질문을 한 칸 옮깁니다. 모은 다음에 무엇을 하느냐입니다. 산업 조립이나 가사처럼 긴 시간에 걸친(long-horizon) 작업은 모듈형 기술(skill)이 줄줄이 이어진 형태인데, ACT나 확산 정책(Diffusion Policy) 같은 모방학습 프레임워크는 시연 한 편을 통째로 다루기 때문에 이런 작업을 한 번에 배우지 못합니다. 긴 시연을 의미 있는 단위로 먼저 잘라 줘야 합니다.

그런데 그 경계가 눈에 보이지 않습니다. 케이블을 장착할 때 작업자는 케이블을 팽팽하게 당겨 장력을 만드는데, 이 단계는 겉으로 거의 움직임이 없어 영상으로는 알아채기 어렵고 촉각 신호에서만 뚜렷하게 잡힙니다. TacUMI는 촉각과 힘토크와 자세를 한 집게에 모은 수집기, 그리고 그 다중 모달 데이터로 시연을 잘라 내는 학습 프레임워크를 함께 내놓습니다.

📄 TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks — Tailai Cheng, Kejia Chen, Lingyun Chen, Liding Zhang, Yue Zhang, Yao Ling, Mahdi Hamad, Zhenshan Bing, Fan Wu, Karan Sharma, Alois Knoll / Technical University of Munich · Agile Robots SE, 2026-01-21, cs.RO, arxiv 식별자 2601.14550

설계와 실험 결과가 프로젝트 페이지 tac-umi.github.io/TacUMI에 공개돼 있습니다.

초록 요약

복잡한 장기 조작을 배우려면 작업을 의미 단위로 쪼갤 수 있어야 합니다. 그런데 접촉이 많은 작업에서는 영상과 로봇 자기수용감각(proprioception)만 봐서는 그 밑에서 일어나는 사건 전이(event transition)가 드러나지 않습니다. TacUMI는 UMI의 설계를 이어받아 ViTac 센서와 힘-토크(force-torque, F/T) 센서, 자세 추적기를 로봇에 그대로 얹히는 집게 하나에 몰아넣고, 사람이 시연하는 동안 이 양식(modality)을 한 시계로 함께 기록합니다. 그렇게 모은 신호를 시간 모델에 넣어 끊이지 않고 이어지는 조작에서 의미 있는 사건 경계를 찾아내는 것이 이 논문의 분할 프레임워크입니다. 까다로운 케이블 장착(cable mounting) 과제에서 분할 정확도가 90%를 넘었고, 쓰는 양식을 늘릴수록 정확도가 뚜렷하게 올랐습니다.


1. 실험 무대 — 양손이 서로 다른 감각을 나눠 듭니다

그림 1 — 케이블 장착 과제의 전체 설정

그림 1 — 왼손은 ViTac 센서와 Vive Tracker를 갖춘 개조 UMI 집게를, 오른손은 다중 모달 데이터 수집용 TacUMI 집게를 잡고 있으며, 가운데 카메라가 시연 중 3인칭 시각 정보를 기록합니다.

양손 작업에서는 감각을 손마다 나눠 답니다. 케이블 장착에서 오른손 TacUMI에는 F/T 센서와 Vive Tracker를 달아 케이블을 안정적으로 쥐고 경로를 따라 안내하게 하고, 왼손 집게에는 ViTac 센서와 Vive Tracker를 달아 장력 걸기와 위치 맞추기, 클립에 끼우기 같은 정밀 조작을 맡깁니다.


2. 하드웨어 — 트리거를 놓아도 물고 있게 만듭니다

그림 2 — TacUMI 집게의 분해도

그림 2 — ① ViTac 센서(GelSight Mini), ② 6자유도 자세 추적용 Vive tracker, ③ 랙앤피니언 기구에 연결된 파지 구동 트리거, ④ 임의의 턱 벌림 폭에서 트리거를 잠글 수 있는 연속 잠금부, ⑤ 6축 힘/토크 센서, ⑥ 한 손 조작에 맞춘 인체공학 손잡이입니다.

설계 결정 네 가지가 겹쳐 있습니다.

로봇 호환 F/T 적층. 6축 F/T 센서를 집게 본체와 표준 로봇 플랜지 모양의 뒤쪽 손잡이 사이에 끼웁니다. 로봇에서 부품이 쌓이는 순서를 그대로 지킨 배치라, 사람이 쥐고 움직일 때 재는 렌치(wrench)가 로봇이 실행할 때의 로봇-환경 상호작용과 같은 자리에서 잡힙니다. 좌표계를 다시 맞추거나 임시 보정을 덧대는 일이 없습니다.

연속 자기잠금 트리거. UMI식 랙앤피니언 트리거는 그대로 두어 세게 당길수록 손가락이 더 닫히는 감각을 살리고, 여기에 어느 벌림에서든 턱을 강체로 고정하는 연속 잠금을 더했습니다. 기존 설계에서는 파지를 유지하려면 트리거를 계속 눌러야 했고 그 구동력이 F/T 측정에 그대로 새어 들었습니다. 잠그고 나면 손가락과 잡힌 물체가 도구의 뻣뻣한 연장이 되어, F/T 센서에는 바깥에서 오는 접촉 렌치만 남습니다.

ViTac 감지. 손끝 슬롯에 ViTac 모듈을 꽂아 미세한 표면 변형을 잡습니다. 눈으로는 구분되지 않는 상태를 촉각으로 갈라 주는 역할입니다.

표류 없는 6자유도 추적. 상단 커버에 Vive Tracker를 단단히 고정하고 도구 중심점(Tool Center Point, TCP)까지의 변환을 고정값으로 두면, 시연이 길어져도 궤적에 표류(drift)가 거의 쌓이지 않습니다. 원조 UMI의 시각-관성 SLAM이 긴 시연에서 겪던 누적 오차를 아예 구조에서 걷어낸 선택입니다.

몸체는 대부분 3D 프린팅 부품이라 가볍고, 무게 중심을 손바닥 근처에 두어 한 손으로 다룰 수 있습니다. 트리거는 검지로 당기고, 잠금은 엄지로 걸어 검지로 풉니다.


3. 잠금 기구 비교 — 왜 굳이 연속 잠금인가

그림 6 — 네 가지 집게 설계 비교

그림 6 — (a) 잠금 기구 없는 설계, (b) 래칫 기반 잠금 설계, (c) 인장 스프링으로 손끝을 닫아 두는 설계, (d) 임의 파지 폭에서 안정적으로 잠기는 제안 설계입니다.

그림 7 — 집게 설계별·원격조작 로봇의 힘 측정 비교

그림 7 — (a) 잠금 없는 집게, (b) 래칫 잠금 집게, (c) 인장 스프링 집게, (d) 촉각·힘 감지를 통합한 제안 TacUMI 집게, (e) 손목 장착 F/T 센서를 갖춘 원격조작 로봇입니다.

네 설계를 같은 케이블 장착 과제에 써 보고, 잰 F/T를 로봇 말단장치 좌표계로 옮겨 비교했습니다. (a)도 F/T를 잡기는 합니다. 다만 작업자가 트리거를 계속 쥐고 있어야 해서 들쭉날쭉한 구동력이 섞여 들고 전처리로도 걸러지지 않습니다. (b)의 래칫 잠금은 파지 폭이 뚝뚝 끊기는 탓에 케이블을 단단히 물지 못하고, 당기는 도중 빠져나가 과제가 통째로 실패합니다. (c)와 (d)는 (e)의 원격조작 데이터와 결이 같은 신호를 내는데, (c)는 스프링 강성 탓에 지름이 큰 케이블이나 더 넓게 벌려야 하는 물체를 잡지 못해 쓸 수 있는 범위가 좁습니다.

넓은 파지 폭을 감당하면서 전처리 뒤에 손목 F/T 센서를 단 원격조작 로봇의 데이터와 거의 겹치는 신호를 내는 것은 제안 설계 (d)뿐입니다. 남는 미세한 차이는 손에 들고 한 시연과 원격조작 시연의 수행 차이에서 옵니다.

수집 속도도 함께 쟀습니다. 케이블을 방향이 서로 다른 세 클립에 차례로 끼우는 한 번의 시행에 원격조작은 평균 4분이 걸렸고, 손에 드는 집게는 1분 10초가 걸렸습니다.

그림 5 — 케이블 장착 과제의 진행 과정

그림 5 — TacUMI로 케이블을 방향이 서로 다른 세 개의 U자형 클립에 차례로 끼웁니다.


4. F/T 전처리 — 사람의 손동작을 기록에서 지웁니다

그림 4 — 원본 F/T 데이터와 처리된 F/T 데이터의 비교

그림 4 — (a) 원본 F/T 데이터로, 트리거를 당겨 잠그는 구간(파란 음영)과 푸는 구간(초록 음영)이 힘·토크 측정에 뚜렷한 교란을 일으킵니다. (b) 처리된 F/T 데이터로, 이 세 동작의 영향이 제거돼 로봇이 그대로 쓸 수 있는 신호가 됩니다.

연속 잠금 덕분에 잠근 직후의 힘·토크는 거의 0으로 떨어집니다. 내부 구동 효과가 사라져 로봇 손목 F/T 센서로 잰 값과 비슷해졌다는 뜻입니다. 그래도 트리거를 당기고 잠그고 푸는 그 순간의 교란은 남습니다.

이 구간을 지우는 방법이 재미있습니다. 뒤에 나올 분할 모델과 같은 구조의 모델을 하나 더 학습시켜 트리거 관련 구간을 골라낸 다음, 그 구간을 각 시퀀스의 첫 20 프레임(트리거를 건드리지 않은 구간)에서 잰 평균과 표준편차를 가진 가우시안 잡음으로 갈아 끼웁니다. 0으로 밀어 버리지 않고 잡음을 채워 넣어야 신호의 통계적 성질과 시간적 연속성이 그대로 남기 때문입니다.

집게에서 잰 렌치를 로봇 말단장치 좌표계 {R}\{\mathrm{R}\} 로 옮기는 사상은 표준 렌치 변환을 따릅니다.

FR=RGRFG,τR=RGRτG+rGR×(RGRFG)\mathbf{F}_{R} = R_{GR}\,\mathbf{F}_{G}, \qquad \boldsymbol{\tau}_{R} = R_{GR}\,\boldsymbol{\tau}_{G} + \mathbf{r}_{GR} \times \left(R_{GR}\,\mathbf{F}_{G}\right)

여기서 RGRR_{GR} 은 집게 F/T 센서 좌표계에서 로봇 F/T 센서 좌표계로 가는 회전 행렬이고, rGR\mathbf{r}_{GR} 은 두 측정 중심 사이의 변위 벡터입니다. 손목 센서 위치와 TCP 구성이 다른 플랫폼에도 수집한 F/T를 그대로 옮겨 쓰는 근거가 여기 있습니다.


5. 사건 분할 — 532차원을 시간축으로 읽습니다

그림 3 — 제안 사건 분할 알고리즘의 파이프라인

그림 3 — (a) 데이터 추출, (b) 슬라이딩 윈도, (c) 학습, (d) 소프트 투표 추론의 네 단계로 이뤄집니다.

매 시점의 특징 벡터는 네 갈래를 이어 붙여 만듭니다.

xt=[Itactile(t)I3rd-view(t)f(t)P(t)]R532\boldsymbol{x}_{t} = \big[\boldsymbol{I}_{\text{tactile}}^{(t)} \,\|\, \boldsymbol{I}_{\text{3rd-view}}^{(t)} \,\|\, \boldsymbol{f}^{(t)} \,\|\, \boldsymbol{P}^{(t)}\big] \in \mathbb{R}^{532}

촉각 프레임은 ImageNet 사전학습 ResNet-50에 넣고 분류 머리를 잘라낸 뒤 선형 층으로 256차원을 뽑습니다. 3인칭 영상에는 확산 정책에서 따온 대로 배치 정규화(BatchNorm)를 전부 그룹 정규화(GroupNorm)로 바꾼 ResNet-18을 쓰는데, 전역 평균 풀링과 완전연결층을 떼고 공간 소프트맥스(spatial softmax)로 공간 주의 특징을 뽑아 256차원으로 사영합니다. 원본 6차원 F/T 스트림은 앞 절의 전처리를 거쳐 상호작용 성분만 남고, 자세는 추적기 값을 TCP로 옮겨 손마다 7차원씩 양손 합쳐 14차원입니다.

시간 모델은 셋을 비교합니다. 방향당 은닉 크기 128의 3층 양방향 LSTM(BiLSTM), 팽창 1차원 합성곱과 GELU·층 정규화를 쓰는 잔차 블록으로 쌓은 시간 합성곱 신경망(Temporal Convolutional Network, TCN), 학습된 선형 사영과 사인 위치 부호화를 쓰는 Transformer 부호화기입니다.

학습에는 길이 50, 보폭 10의 슬라이딩 윈도로 잘라낸 부분 시퀀스를 씁니다. 순차 작업에서는 아무 일도 일어나지 않는 idle 클래스가 프레임 수를 지나치게 많이 차지하므로, idle 이 프레임의 80%를 넘는 윈도는 버려 행동 비율을 최소 20%로 못 박습니다. 추론에서는 한 프레임이 여러 윈도에 걸치니, 그 윈도의 클래스 확률을 평균해 가장 높은 쪽을 고르는 소프트 투표로 원래 길이의 라벨 시퀀스를 되살립니다.

y^t=argmaxc{1,,C}1Ktk=1Ktpt,c(k)\hat{y}_{t} = \arg\max_{c \in \{1,\dots,C\}} \frac{1}{K_{t}} \sum_{k=1}^{K_{t}} p^{(k)}_{t,c}

센서마다 주파수가 제각각인 문제는 가장 느린 쪽에 맞춰 풉니다. Bota Systems SensONE F/T 센서는 1000 Hz, GelSight Mini ViTac 센서는 온라인 처리까지 포함해 16.67 Hz, HTC Vive Tracker는 60 Hz, 고정 위치 RealSense D435i는 60 Hz로 도는데, 전부 16.67 Hz로 내려 맞춥니다.


6. 결과 — 양식을 더할수록 경계가 보입니다

TacUMI로 모은 데이터에서의 프레임 단위 정확도입니다.

입력 양식BiLSTMTCNTransformer
카메라만0.76080.72170.3180
카메라 + 촉각0.90760.88800.6765
카메라 + F/T0.86320.83250.6645
카메라 + 자세0.81650.76750.4242
카메라 + 촉각 + F/T0.93590.90510.7459
카메라 + 촉각 + F/T + 자세0.94020.89450.7596

BiLSTM이 일관되게 앞섭니다. 과거와 미래 문맥을 함께 보며 경계를 짚을 수 있고 30k 프레임이라는 작은 데이터와 센서 잡음에도 잘 버티기 때문입니다. Transformer 부호화기는 데이터를 훨씬 더 먹는 데다 잡음에 민감하고, TCN은 미래 쪽 문맥을 아예 보지 못합니다.

양식 쪽에서는 3인칭 영상만 쓰는 설정이 가장 나쁩니다. 촉각이나 F/T를 얹으면 정확도가 크게 오르는 반면 TCP 자세를 얹으면 거의 오르지 않고, 세 양식에서 네 양식으로 갈 때 개선이 없는 것도 같은 까닭입니다. 케이블 장착에서 쥐고 장력을 걸고 클립에 끼우는 결정적인 순간에는 TCP 자세가 거의 움직이지 않아, 분할에 보탤 정보가 없습니다.

그림 8 — 입력 양식과 모델 구조별 클래스 단위 분할 성능

그림 8 — idle, grasped, under a linear force, under torque, released 다섯 행동 클래스의 평균 F1 점수 히트맵으로, 붉은 쪽으로 갈수록 클래스별 분할 정확도가 높습니다.

graspedidle 은 신호가 뚜렷해 모델 대부분이 높은 F1을 냅니다. releasedunder torque 에서 눈에 띄게 떨어지는데, 이웃한 국면과 잘 구분되지 않는 미묘한 전이라서 그렇습니다. 특히 released 는 길어야 2~5 프레임밖에 지속되지 않아 한두 프레임만 틀려도 F1이 곤두박질칩니다.


7. 교차 플랫폼 검증 — 손에 든 시연으로 배워 로봇 데이터를 자릅니다

모델은 TacUMI 데이터로만 학습시키고, 시험은 sigma.7 햅틱 장치로 Franka Emika 로봇 두 대를 주종(master-slave)으로 원격조작해 모은 데이터에서 했습니다. 안내하는 팔에는 손목 F/T 센서를, 조작하는 팔에는 손끝 촉각 센서를 달아 손에 드는 장치와 같은 양식을 잡게 했습니다.

입력 양식BiLSTMTCNTransformer
카메라만0.22880.18200.2227
카메라 + 촉각0.74740.60020.5351
카메라 + F/T0.66110.63660.4126
카메라 + 자세0.46940.46360.2256
카메라 + 촉각 + F/T0.91550.87930.8092
카메라 + 촉각 + F/T + 자세0.91040.72620.7796

3인칭 카메라만 쓰면 0.2288로 무너집니다. 학습과 검증은 손에 든 TacUMI의 시연인데 시험은 로봇 말단장치의 조작이니, 두 몸체 사이의 영역 격차(domain gap)가 여기서 그대로 드러납니다. 촉각이나 F/T를 더하면 크게 오르지만 집게 데이터보다는 여전히 10~20% 낮습니다. 저자들은 sigma.7 두 대로 로봇 둘을 모는 쪽이 더 어려워 시연이 덜 안정적이었다고 설명합니다.

그런데 촉각과 F/T를 함께 쓰면 0.9155까지 올라 집게 데이터의 0.9359에 거의 따라붙습니다. 시각은 몸체가 바뀌면 무너지지만 접촉에서 나오는 신호는 몸체를 넘어 살아남습니다. 손에 든 장치로 모은 시연을 로봇 실행 데이터에 그대로 쓸 수 있다는 주장의 근거가 여기 있습니다.


8. 정리 — 계보에서 TacUMI의 자리

TacUMI는 UMI 계보에서 "수집 다음은 분해"라는 축을 세운 논문입니다.

  • 다중 모달 수집기. ViTac과 6축 F/T와 Vive Tracker를 로봇 호환 적층으로 한 집게에 담고, 모든 스트림을 16.67 Hz로 맞춥니다.
  • 연속 잠금. 트리거 힘이 F/T 기록에 새어 들지 않게 기구로 막고, 남는 교란은 따로 둔 분할 모델로 찾아 잡음으로 갈아 끼웁니다. 래칫의 끊긴 파지가 케이블을 놓친다는 것도 실측으로 보였습니다.
  • 표류 없는 자세. SLAM 대신 Vive Tracker를 써서 장기 시연의 누적 오차를 없앱니다.
  • 분할 프레임워크. 532차원 융합 특징을 BiLSTM으로 읽어 케이블 장착 시연을 다섯 클래스로 자르고, 프레임 단위 정확도가 최고 0.9402까지 나옵니다.
  • 속도. 같은 과제에서 원격조작 4분 대 손에 든 집게 1분 10초입니다.

저자들이 스스로 남긴 한계도 분명합니다. 평가가 케이블 장착 한 과제에 머물러 있어 일반성은 아직 확인되지 않았고, 잘라낸 분할을 실제 모방학습에 물려 기술을 배우게 하는 일은 다음 숙제로 남았습니다. 촉각을 관측으로 쓰는 exUMI, 힘을 행동으로 쓰는 FARM과 나란히 놓으면, TacUMI는 같은 촉각 신호를 시연의 문법을 읽는 데 쓴 갈래입니다.

다음 편은 이 계보의 반대편 끝입니다. 수집기를 개선해 1만 시간을 모으고, 그 데이터로 기반 모델(foundation model)을 세운 RDT2입니다.