들어가며
원조 UMI 논문해석의 집게에는 카메라만 달려 있습니다. exUMI 논문해석이 이 빈자리를 처음 겨냥해 촉각 센서를 붙였고, 촉각 예측 사전학습으로 접촉 동역학을 배우게 했습니다. 그런데 exUMI의 촉각 데이터는 실험실 안에서 모인 것이었습니다.
Touch in the Wild는 같은 빈자리를 다른 각도에서 채웁니다. 촉각 센서를 야외로 들고 나갈 만큼 얇고 가볍게 만든 다음, 시각과 촉각이라는 성질이 전혀 다른 두 신호를 한 공간에 억지로 밀어 넣는 대신 서로를 복원하게 시켜서 배우게 합니다. 시험관을 손 안에서 돌려 꽂거나 피펫으로 액체를 옮기는, 눈만으로는 도저히 안 되는 일이 목표입니다.
📄 Touch in the Wild: Learning Fine-Grained Manipulation with a Portable Visuo-Tactile Gripper — Xinyue Zhu, Binghao Huang, Yunzhu Li (Columbia University) / 2025-07-20 게재, NeurIPS 2025, arxiv 식별자 2507.15062
초록 요약
손에 드는 집게는 들고 다니기 쉽고 쓸모가 넓어 사람 시연을 모으는 도구로 자리 잡았는데, 정작 촉각 감지가 붙은 설계는 드뭅니다. 정밀 조작에서 접촉 피드백이 성패를 가르는데도 그렇습니다. 이 논문은 촉각 센서를 넣은 가벼운 휴대용 집게를 만들어 실세계 현장(in-the-wild)에서 시각과 촉각을 동기 수집합니다. 그 위에 얹은 학습 틀은 두 감각을 하나로 합치되 각각의 고유한 성질은 뭉개지 않는 교차 모달(cross-modal) 표현학습입니다. 학습을 돌려 보니 따로 시키지 않았는데도 접촉 영역을 일관되게 보는, 사람이 읽어낼 수 있는 표현이 나타났습니다. 이 표현을 하위 조작 과제에 얹으면 정책 학습이 더 효율적이고 효과도 좋아져서, 시험관 삽입(test tube insertion)이나 피펫 유체 이송(pipette-based fluid transfer)처럼 손끝이 정밀해야 하는 과제에서 정확도와 외란(disturbance) 견고성이 함께 올라갑니다.
1. 문제 — 촉각 하드웨어는 밖으로 못 나갔습니다

그림 1 — (a) 휴대형 집게가 철물점·메이커스페이스·캠퍼스에서 시각과 촉각을 동기 수집하고, (b) 두 감각을 융합한 표현이 정밀 조작 정책을 뒷받침합니다.
논문은 현장 시각-촉각 수집을 막아온 벽을 둘로 나눕니다.
하나는 하드웨어입니다. 소프트 버블(soft bubble) 센서는 손에 들기에 너무 크고, GelSight 같은 광학식 센서는 부피가 크거나 현장에서 오래 버티지 못합니다. 실험실 밖으로 들고 나갈 만한 촉각 센서가 사실상 없었습니다.
다른 하나는 학습입니다. 촉각은 국소적이고 물리적인 반면 시각은 넓은 공간 맥락을 담습니다. 정리되지 않은 대규모 데이터에서 규모도 성격도 다른 두 감각을 함께 살리는 표현을 배우는 일은 아직 풀리지 않았습니다.
정작 촉각이 가장 아쉬운 곳이 현장이라는 게 이 상황의 얄궂은 지점입니다. 조명이 나쁘거나 배경이 어수선하면 시각은 흔들리지만 접촉력은 조명에도 카메라 시점에도 아랑곳없이 그대로입니다. 그런데도 지금까지의 현장 수집 시스템은 시각 전용이었습니다.
2. 하드웨어 — 손가락 안에 얇은 배열을 넣습니다

그림 2 — (a) 현장 수집 장면과 좌우 손가락의 촉각 신호 예시, (b) 유연 촉각 센서와 어안 카메라를 단 집게 근접 사진, (c) 같은 센서 구성을 갖춘 XArm 850 로봇입니다.
촉각 패드는 3D-ViTac의 삼중층 설계를 물려받아 압저항(piezoresistive) 감지층을 연성인쇄회로(flexible printed circuit, FPC) 두 장 사이에 끼운 구조이고, 이 패드가 핀 모양 순응 손가락 안에 들어갑니다. 원본 설계에서 두 군데를 바꿨습니다.
먼저 공간 해상도입니다. 3D-ViTac이 쓰던 스테인리스강 전극은 해상도와 신호 안정성을 둘 다 붙잡고 있었는데, 이를 FPC 전극으로 바꾸니 배선 간격이 균일해지면서 패드당 12 × 32 택셀(taxel) 해상도가 나왔습니다. 택셀 하나는 2 × 2 mm² 넓이입니다.
제작 속도도 따라 올라갔습니다. FPC라서 공구 없이 조립되고, 패드 하나를 5분 이내에 만들어 2분이면 집게에 답니다.
각 패드는 아두이노 기반 맞춤 PCB에 연결되고 두 보드가 집게 손바닥 아래에 들어갑니다. 배터리까지 넣은 손잡이 전체 무게가 약 962 g이라 오래 들고 다녀도 부담이 적고, 핸드백만 한 크기라 식료품점이나 야외 시장에도 그대로 들고 나갑니다.
동기화 — 하드웨어 없이 QR 코드로
촉각은 23 Hz, GoPro Hero 9는 60 Hz로 둘 다 20 Hz를 넘지만 클럭 드리프트(clock drift)와 카메라의 낮은 타임스탬프 정밀도 탓에 그냥 붙이면 어긋납니다. 논문은 외부 동기화 장비를 하나도 쓰지 않고 이 문제를 넘깁니다.
시연 전에 카메라 앞으로 현재 호스트 시각을 띄운 QR 코드를 30 Hz로 갱신하며 보여 주고, 촉각은 ROS2로 발행하되 패킷마다 호스트 클럭 타임스탬프를 실어 둡니다. 나중에 영상 속 QR 코드를 디코딩하면 프레임별 호스트 시각이 되살아나 두 스트림이 같은 클럭 위에서 맞물립니다.
3. 학습 틀 — 서로를 복원하게 만듭니다

그림 3 — 1단계는 대규모 데이터로 교차 모달 복원 사전학습, 2단계는 그 부호기를 자기수용감각과 함께 확산 정책의 조건으로 쓰는 구조입니다.
관측 정의부터 봅니다. RGB 이미지 는 손목의 어안 카메라에서 오고, 촉각 이미지 는 좌우 손끝의 12 × 32 배열을 세로로 쌓은 것입니다. 목표는 두 감각을 융합하되 각자의 구조를 보존하는 부호기(encoder) 를 자기지도(self-supervised)로 학습하는 것입니다.
왜 대조학습이 아니라 마스킹 복원인가
선행 연구는 서로 다른 감각의 임베딩을 맞출 때 주로 대조학습(contrastive learning)을 씁니다. 논문은 여기에 반대합니다. 대조 목적함수는 두 임베딩이 서로 가까워지도록 밀어붙이는데, 그 압력에 촉각이 담고 있던 세밀하고 기하에 민감한 신호가 눌려 버리기 때문입니다.
대신 마스킹 오토인코딩(masked autoencoding)을 씁니다. 촉각의 일부를 가린 뒤 남은 촉각과 시각 맥락을 함께 보고 가려진 자리를 채우게 시키는 방식입니다.
이렇게 하면 촉각 고유의 정보는 살아남고, 모자란 자리를 메우려고 모델이 알아서 시각을 끌어다 씁니다. 두 감각을 같게 만드는 대신 서로에게 쓸모 있게 만드는 셈입니다.
부호기 구성
촉각 쪽은 단일 채널 맵에 고정 컬러맵을 씌워 3채널 이미지로 바꾼 뒤 겹치지 않는 4 × 4 패치로 잘라 6 × 8 패치 격자를 만듭니다. 학습할 때는 표본의 95%에서 패치의 60~80%를 학습 가능한 마스크 토큰으로 가리고, 나머지 5%는 온전히 보여 줍니다. 가려진 촉각 입력은 3층 CNN을 거쳐 차원 임베딩 가 됩니다.
시각 쪽은 CLIP으로 초기화한 ViT-B/16이 처리하고, 마지막 [CLS] 토큰을 시각 임베딩 로 씁니다. 전 층을 학습률 로 미세조정합니다.
융합은 다중 헤드 교차 주의(multi-head cross-attention) 두 번으로 합니다.
각각 층 정규화(LayerNorm)를 거쳐 이어 붙이면 입니다. 촉각이 시각을 조회하고, 갱신된 촉각을 다시 시각이 조회하는 양방향 구조입니다. 복호기는 2층 MLP와 시그모이드로 촉각 이미지를 복원합니다. 학습을 안정시키려고 감쇠 계수 0.9995의 지수이동평균(EMA) 목표 부호기를 함께 굴립니다.
2단계에서는 사전학습된 부호기 출력 와 자기수용감각 (말단장치 자세, 집게 벌림)를 조건으로 확산 정책(diffusion policy)을 학습합니다. CLIP 백본과 촉각 CNN, 교차 주의 층을 포함한 모든 부호기 구성요소가 이 단계에서 함께 미세조정됩니다.
4. 데이터 — 260만 쌍, 43개 과제, 12개 환경

그림 4 — 논문의 핵심 4개 과제(36.7%), 분포를 넓히는 실내 과제(25.1%), 야외 현장 과제(38.2%)로 나뉩니다.
사전학습 데이터셋은 260만 개가 넘는 시각-촉각 쌍입니다. 실내외 12개 환경에서 모은 2,700개 이상의 시연과 43개 조작 과제가 여기 들어 있습니다. 갈래는 셋입니다. 논문의 핵심 네 과제, 분포를 넓히려고 더한 다른 실내 과제, 그리고 30개가 넘는 야외 현장 과제입니다. 야외 쪽에는 접시 나르기, 캔버스 정리, 공 던지기, 책 꽂기 같은 일이 들어갑니다.

그림 5 — 분포 내와 분포 밖 입력 모두에서 촉각을 정확히 복원하고, 시각 모듈의 주의는 배경이나 물체 친숙도와 무관하게 집게-접촉 영역에 몰립니다.
이 논문에서 가장 눈길이 가는 대목입니다. 아무도 그렇게 하라고 시키지 않았는데 ViT의 자기 주의(self-attention)가 접촉 영역에 몰립니다. 촉각을 복원하려면 어디가 닿았는지부터 봐야 하니, 마스킹 복원 목적함수 하나로 사람이 읽어낼 수 있는 표현이 저절로 자라난 셈입니다.
5. 실험 — 눈만으로는 안 되는 네 과제

그림 6 — 위에서부터 시험관 수거, 연필 삽입, 유체 이송, 화이트보드 지우기의 단계별 장면입니다.
과제는 필요한 정보의 종류에 따라 둘로 갈립니다.
먼저 손 안의 상태를 알아야 하는 쪽입니다. 시험관 수거는 상자에서 시험관을 집어 랙을 이용해 손 안에서 방향을 바꾼 뒤 정확히 꽂습니다. 연필 삽입은 세워 잡은 연필을 재배향해 연필깎이에 넣습니다.
다른 쪽은 세밀한 힘을 알아야 합니다. 유체 이송은 피펫으로 액체를 빨아들여 다른 용기로 옮기는데, 압력이 정확하지 않으면 액체를 못 뽑거나 흘립니다. 화이트보드 지우기는 마커 자국을 지우되 시스템을 망가뜨릴 힘을 넘지 않아야 합니다.
과제마다 초기 로봇 위치와 환경 조건에 적당한 무작위성을 주고 20회씩 시행했고, 모든 정책은 수렴 지점인 60에포크까지 학습했습니다.
기준 정책 비교 (표 1)
손 안의 상태 정보가 필요한 과제
| 방식 | 시험관 수거 (197 시연) 파지 | 재배향 | 삽입 | 전체 | 연필 삽입 (170 시연) 재배향 | 삽입 | 전체 |
|---|---|---|---|---|---|---|---|
| 시각 전용 | 1.00 | 0.25 | 0.25 | 0.25 | 0.50 | 0.65 | 0.45 |
| 교차 주의 제거 | 1.00 | 1.00 | 0.50 | 0.50 | 0.80 | 0.75 | 0.70 |
| 사전학습 제거 | 1.00 | 1.00 | 0.70 | 0.70 | 0.80 | 0.80 | 0.75 |
| 사전학습 포함 (제안) | 1.00 | 1.00 | 0.85 | 0.85 | 0.95 | 0.90 | 0.85 |
세밀한 힘 정보가 필요한 과제
| 방식 | 유체 이송 (160 시연) 흡입 | 이송 | 배출 | 전체 | 화이트보드 (105 시연) 1차 | 2차 | 전체 |
|---|---|---|---|---|---|---|---|
| 시각 전용 | 0.95 | 0.85 | 0.55 | 0.55 | 0.65 | 0.65 | 0.55 |
| 교차 주의 제거 | 0.90 | 0.75 | 0.75 | 0.70 | 0.70 | 0.50 | 0.45 |
| 사전학습 제거 | 1.00 | 0.90 | 0.80 | 0.80 | 0.60 | 0.75 | 0.60 |
| 사전학습 포함 (제안) | 1.00 | 1.00 | 0.90 | 0.90 | 0.70 | 0.75 | 0.70 |
시험관 수거에서 시각 전용은 파지까지 1.00으로 완벽하다가 재배향에서 0.25로 주저앉습니다. 촉각을 붙이면 그 자리가 1.00이 됩니다. 손 안에서 물체가 어느 방향으로 놓였는지는 카메라 하나로는 가려서 안 보이고, 손끝만 압니다.
재미있는 것은 교차 주의를 뺀 단순 이어붙이기가 화이트보드 지우기에서 0.45로 시각 전용(0.55)보다 오히려 나쁘다는 점입니다. 두 감각을 그냥 이어 붙이면 정책이 한쪽에 지나치게 기대게 되는데, 이 과제에서는 촉각 신호를 키우려고 과한 힘을 주다가 안전 정지를 불렀다는 것이 논문의 설명입니다. 감각을 더하는 것만으로는 모자라고, 어떻게 엮느냐가 결과를 뒤집습니다.
6. 사전학습이 무엇을 바꾸는가

그림 7 — 시험관 수거 과제에서, 사전학습을 거친 정책이 적은 데이터와 적은 에포크 영역 모두에서 일관되게 앞섭니다.
효과는 데이터와 학습이 모자란 쪽에서 가장 크게 벌어집니다.
시연이 60개 미만이면 사전학습 없는 정책은 파지한 다음 어디로 갈지 몰라 멈춰 서기 일쑤입니다. 사전학습을 거친 정책은 시연 30개만으로도 훨씬 매끄러운 궤적을 그리고, 실패하더라도 마지막 삽입 단계에서만 실패합니다. 시각과 촉각의 대응을 미리 배워 둔 덕에 하위 정책은 행동 궤적만 익히면 되기 때문입니다.
에포크가 60 미만이면 사전학습 없는 정책이 초기 배치에 민감해집니다. 시험관이 가파르게 놓여 잡기 어려운 경우 재배향을 과하게 하거나 모자라게 해서 실패합니다.
센서를 갈아 끼워도 되는가 (표 2)
프로젝트 내내 손잡이형 집게와 로봇 집게는 서로 다른 센서 쌍을 썼습니다. 확인 삼아 한 번도 쓰지 않은 새 센서를 만들어 갈아 끼우고 시험관 수거를 다시 평가했습니다.
| 시험관 수거 | 파지 | 재배향 | 삽입 | 전체 |
|---|---|---|---|---|
| 사전학습 정책 (원래 센서) | 1.00 | 1.00 | 0.85 | 0.85 |
| 사전학습 정책 (새 센서) | 1.00 | 1.00 | 0.85 | 0.85 |
성공률이 완전히 같습니다. 센서를 5분에 하나씩 찍어내 갈아 끼워도 정책이 그대로 돈다는 뜻이고, 대규모 배포를 노리는 설계에서는 이 성질이 큽니다.
과제 데이터를 빼고 사전학습하면 (표 3)
사전학습 데이터에서 하위 과제의 시연을 통째로 뺀 실험입니다. 시험관 수거와 화이트보드 지우기를 각각 제거하고 부호기를 다시 학습했습니다. 남은 데이터는 약 2,500개 시연입니다.
| 정책 | 시험관 파지 | 재배향 | 삽입 | 전체 | 화이트보드 1차 | 2차 | 전체 |
|---|---|---|---|---|---|---|---|
| 사전학습 포함 (제안) | 1.00 | 1.00 | 0.85 | 0.85 | 0.70 | 0.75 | 0.70 |
| 과제 데이터 제외 | 1.00 | 1.00 | 0.80 | 0.80 | 0.75 | 0.75 | 0.75 |
성능이 거의 같고 화이트보드 지우기는 오히려 조금 올라갑니다. 사전학습이 특정 시연을 외우는 게 아니라 시각과 촉각의 일반적인 대응을 배운다는 근거이고, 현장에서 아무 과제나 모아 부어도 도움이 된다는 뜻이기도 합니다.

그림 10 — 사전학습을 거친 정책은 집게와 물체 같은 과제 관련 접촉 영역을 보고, 그렇지 않은 정책은 배경 특징에 주의를 흘립니다.

그림 11 — 네 과제에서 기준 방법들이 전형적으로 실패하는 지점과 그 원인입니다.
7. 저자가 밝힌 한계
논문은 결론에서 한 가지를 다음 과제로 남깁니다. 지금까지의 평가는 평행 집게를 단 단일 팔 위에서만 이뤄졌는데, 손잡이형 장치의 구성을 그대로 옮긴 결과입니다. 앞으로는 다지 손(multi-finger dexterous hand)으로 넓혀 촉각 피드백이 더 많이 쓰이는 조작까지 다루겠다고 밝힙니다.
같은 시기에 나온 ViTaMIn도 휴대형 시각-촉각 수집 시스템과 교차 모달 학습 틀을 내놓았는데, 저자들은 시스템 설계와 표현학습 전략, 과제 초점이 서로 다르다고 밝히며 함께 읽기를 권합니다.
8. 정리 — 계보에서 Touch in the Wild의 자리
이 논문은 exUMI와 같은 빈자리를 겨냥하되, 다른 두 곳을 밉니다.
- 센서를 밖으로 내보냅니다. 압저항 배열과 FPC 전극으로 5분에 하나씩 찍어내는 얇은 촉각 패드가 962 g짜리 손잡이에 실려 야외 시장까지 나갑니다.
- 감각을 맞추지 않고 엮습니다. 대조학습 대신 마스킹 복원을 써서 촉각의 세밀한 신호를 지키고, 양방향 교차 주의로 두 감각이 서로를 조회하게 합니다.
- 접촉 영역 주목이 저절로 나타납니다. 지도 신호 없이도 ViT의 주의가 손끝과 물체 접촉면에 몰립니다.
- 사전학습이 데이터를 아낍니다. 시연 30개, 에포크 10회 같은 빠듯한 조건에서 차이가 가장 크게 벌어집니다.
계보 안에서 보면 이 연구는 현장 수집의 확장 가능성을 촉각까지 끌고 온 지점에 놓입니다. FastUMI가 남긴 한계 목록의 첫 항목이 "감지 방식의 한계 — 시각에만 의존한다"였는데, 그 항목이 여기서 하드웨어와 학습 양쪽에서 지워집니다. 계보의 출발점이 궁금하다면 원조 UMI 논문해석으로 돌아가면 됩니다.