들어가며
원조 UMI의 전제는 단순하고 강력했습니다. 로봇을 데이터 수집에서 떼어내면 어디서든 시연을 모을 수 있다. 이 계보는 그 전제 위에서 FastUMI의 시판 추적 모듈, exUMI의 촉각, MV-UMI의 다시점, Mobile UMI의 이동성으로 뻗어 나갔습니다.
그런데 손에 들고 모은 데이터에는 아무도 정면으로 다루지 않은 구멍이 하나 있습니다. 손에 든 장치가 기록하는 것은 일어난 움직임인데, 로봇 제어기가 필요로 하는 것은 시키려던 움직임입니다. 자유공간에서는 이 둘이 거의 같지만 접촉이 걸리는 순간 갈라집니다. 물체에 눌린 채 밀고 있는 손의 궤적을 그대로 명령 궤적으로 쓰면, 제어기는 닿지도 못할 목표를 향해 계속 밀어붙이고 그 오차가 고스란히 접촉력이 됩니다.
BRIDGE는 이 구멍을 행동 유효성(action validity)이라는 개념으로 정식화합니다. 처방도 흥미롭습니다. handheld 데이터를 버리지도, 전부 원격조작(teleoperation)으로 갈아엎지도 않습니다. 실패하는 구간만 골라 부분 원격조작으로 메우되, 두 데이터를 그냥 섞으면 오히려 나빠지므로 상태를 보고 전문가를 갈라 보내는 게이트를 답니다. handheld와 teleop이 경쟁 관계가 아니라 분업 관계라는 주장입니다.
📄 Bridging Handheld and Teleoperated Supervision for Contact-Rich Manipulation via State-Gated Experts — Vidullan Surendran, Neehar Peri, David Watkins / RAI Institute · Carnegie Mellon University, 2026-06-25, cs.RO, arxiv 식별자 2606.26603
초록 요약
UMI 같은 손에 드는(handheld) 수집 장치는 다양한 환경에서 데이터를 확장성 있게 모을 수 있게 해 주지만, 담기는 것은 관측된 행동(observed action)뿐이고 로봇 제어기가 실제로 실행하는 원하는 행동(desired action)은 담기지 않습니다. 원격조작은 반대로 원하는 행동을 직접 담는 대신 수집에 시간이 너무 오래 걸립니다. 저자들은 이 상충을 과제 국면별 행동 유효성이라는 렌즈로 다시 봅니다. handheld 궤적은 오차에 관대한 자유공간 국면에서는 쓸 만한 지도(supervision)가 되지만, 접촉에 민감한 국면에서는 동역학적 실현 가능성(dynamic feasibility)이 없어 높은 강성으로 관측 궤적을 그대로 좇으면 크고 위험한 접촉력이 생깁니다. 그렇다고 과제 전체를 원격조작할 필요는 없고, 기저(base) handheld 정책이 실패하는 구간만 골라 부분 원격조작 시연을 모으는 혼합 전략이 효율적입니다. 다만 handheld 데이터와 국면별 원격조작 데이터를 그냥 섞으면 handheld만 쓴 것보다 성능이 오히려 나빠집니다. 저자들은 이 불일치를 풀려고 현재 로봇 상태를 보고 국면별 전문가 헤드 사이를 오가는 확산 정책 전문가 혼합(mixture of diffusion policy experts), BRIDGE(Bi-modal Routing for Imitation Data via Gated Experts)를 내놓습니다. 접촉에 민감한 구간에서 그 국면에 맞는 원하는 행동을 쓸 수 있게 되면서, 접촉이 많은 조작 과제 셋에서 handheld 전용 기준선보다 성공률이 최대 36.7% 올라갑니다.
1. 핵심 구분 — 관측된 행동과 원하는 행동
이 논문 전체가 한 구분 위에 서 있습니다.
- 관측된 행동 — 로봇 말단장치(end-effector) 또는 손에 든 장치가 물리적으로 실현한 상태.
- 원하는 행동 — 로봇 제어기에 보낸 기준 궤적.
강성이 무한하지 않고, 필터가 걸리고, 추종 오차가 있고, 접촉이 끼어들기 때문에 관측된 행동은 원하는 행동에서 자주 벗어납니다. 그런데 UMI 계열 장치는 관측된 행동만 기록합니다.
저자들이 짚는 것은 이 벗어남이 구간마다 다르다는 점입니다. 자유공간에서는 관측된 궤적이 원하는 궤적의 충실한 대리(proxy)입니다. 접촉이 걸린 구간에서는 명령한 자세가 접촉면 아래로 파고드는 동안 실제 자세는 표면에 막혀 멈춥니다. 그 사이에 간극 가 벌어져 하중이 풀릴 때까지 닫히지 않고, 임피던스 제어기에서는 이 간극이 그대로 접촉력이 됩니다.
접촉 구간의 관측 궤적은 애초에 실현 가능한 명령 궤적이 아니었습니다. 그러니 관측만으로 만든 라벨은 무엇이든 원래 의도를 되살릴 수 없습니다. handheld 데이터의 근본 한계가 여기 있습니다.
논문은 이 주장을 그림으로만 설명하지 않고 실제 시스템 로그로 증명합니다.

그림 8 — 위: 실제 시스템에서 배선을 한 번 실행하는 동안 명령한 수직 말단장치 위치와 달성한 위치입니다. 자유공간 국면(파랑)에서는 제어기가 명령 자세를 바짝 좇지만, 하중 접촉 아래(주황)에서는 추종 간극이 열린 채 유지되다가 하중이 풀린 뒤에야 닫힙니다. 아래: 위치 오차 크기와 임피던스 법칙으로 유도한 접촉력입니다.
수치도 구체적입니다. 원격조작 수준 강성 N/m에서 접촉 중 최대 간극이 약 53 mm였고, 여기 대응하는 접촉력이 N입니다. 저자들은 이 힘을 따로 계측한 값이 아니라 측정된 desired와 observed의 불일치에서 유도한 값이라고 밝혀 둡니다.
그림 1은 이 상충을 강성 두 조건으로 대비합니다. 높은 강성( N/m)은 관측 궤적을 잘 좇는 대신 최대 접촉력 10.21 N을 냅니다. 낮은 강성(300 N/m)은 최대 힘을 2.64 N으로 낮추지만 접촉을 통과해 버려 관측 궤적을 좇지 못합니다. 기준선으로 그은 5 N을 사이에 두고 양쪽 다 만족스럽지 않습니다.
원문 그림 1(행동 유효성 개념도), 그림 5(라우터 정밀도–재현율 곡선 및 t-SNE), 그림 7(데이터 확장 곡선)은 arxiv HTML 판에서 벡터 도형으로 그려져 이미지 파일로 존재하지 않아 싣지 못했습니다. 해당 수치는 본문과 표로 옮겼습니다.
2. DM-UMI — 한 장치로 두 모드
부분 원격조작을 하려면 같은 장치를 손에 들고 쓸 때도, 로봇을 조종할 때도 그대로 써야 합니다. 그래야 두 데이터의 관측 시점과 그립 형상이 어긋나지 않습니다.
원조 UMI는 궤적 복원에 오프라인 단안 SLAM을, 집게 벌림 추정에 ArUco 태그 검출을 씁니다. 야외 수집에는 좋지만 결과를 나중에 따로 처리해야 한다는 점이 걸립니다. 원격조작은 이 값들을 실시간으로 알아야 합니다.
그래서 저자들은 Dual-Mode UMI(DM-UMI)를 만듭니다. UMI의 센싱 스택을 이렇게 바꿉니다.
- XVISIO DS80 SLAM 카메라 — 온라인 6자유도 자세 추정.
- 자기식 위치 센서 — 집게 벌림 폭 측정.
이 둘을 그대로 로봇 말단장치 자세와 집게 명령으로 흘려보내면 원격조작 모드가 됩니다.
DS80의 정확도는 모션 캡처 환경(Vicon Vantage V16 카메라 20대)에서 DM-UMI 시연 1000개로 측정했습니다.
| 통계 | 절대 이동 오차 (mm) | 상대 이동 오차 (mm) | 절대 회전 오차 (deg) | 상대 회전 오차 (deg) |
|---|---|---|---|---|
| 중앙값 | 22.6 | 0.9 | 4.0 | 0.2 |
| 평균 | 25.9 | 1.1 | 6.3 | 0.2 |
| 표준편차 | 16.1 | 0.7 | 5.1 | 0.2 |
절대 오차는 평균 25.9 mm로 커 보이지만 상대 자세로 재면 1.1 mm까지 뚝 떨어집니다. 정책이 상대 자세를 예측하도록 학습되니 실제로 중요한 것은 뒤쪽 값입니다.
수집 시간도 잽니다. 과제 하나당 시연 한 개의 평균 소요 시간입니다.
| 과제 | Handheld (초) | 부분 원격조작 (초) | 전체 원격조작 (초) |
|---|---|---|---|
| Pipe Insertion | 6.7 ± 1.6 | 6.7 ± 2.0 | 15.3 ± 2.2 |
| Battery Insertion | 11.1 ± 1.7 | 15.5 ± 3.6 | 27.6 ± 4.0 |
| NIST Pulley Task | 10.5 ± 2.6 | 9.7 ± 4.5 | 24.7 ± 3.3 |
handheld 수집이 약 3배 빠르고, 부분 원격조작도 전체 원격조작보다 약 2배 빠릅니다. 게다가 이 벽시계 시간은 전체 원격조작의 실제 비용을 낮춰 잡은 값입니다. 힘 피드백 없이 O링 장력을 넓은 동작 범위 내내 유지해야 하는 도르래 과제에서는 조작자가 오래 불편한 자세로 버텨야 했고, 로봇 제어기 오류도 자주 났습니다.
로봇에 달린 집게와 손에 드는 집게는 몸체 생김새가 다릅니다. 모델이 이 시각적 차이를 지름길로 삼지 못하도록 집게 몸체에 마스크를 씌웁니다.

그림 6(a) — 로봇에 장착된 집게의 손목 시점 화면입니다.

그림 6(c) — 두 장치의 몸체 차이를 모델이 이용하지 못하도록 집게 몸체에 마스크를 씌웁니다.
3. 3단계 수집·학습 파이프라인
BRIDGE의 전체 순서는 세 단계입니다. 먼저 실패를 관찰하고 그 자리만 메우는 구조입니다.

그림 2 — 먼저 DM-UMI의 handheld 모드로 기저 시연을 모아 과제 뼈대를 배우고, 기저 정책을 학습·평가해 실패 양상을 찾습니다. 다음으로 원격조작 모드로 그 실패를 겨냥한 지원 데이터셋을 모아 기저 정책을 얼린 채 지원 헤드를 학습합니다. 마지막으로 두 헤드를 하드 스위칭하는 라우터를 학습합니다.
기저 데이터셋은 관측된 행동만 담고 넓은 커버리지를 맡습니다. 지원 데이터셋은 원하는 행동을 담고 기저 정책이 흔들리는 국소 영역만 맡습니다. 역할이 겹치지 않습니다.
4. 구조 — 확산 정책 위에 얹은 라우터
기저 정책은 확산 정책(Diffusion Policy)에서 파생됐지만 두 군데를 손봤습니다.

그림 3 — 시각 관측을 DINOv2로 인코딩해 Perceiver IO 블록에 넣고, 교차 어텐션으로 상태 특징과 융합합니다. 이 공유 잠재 표현이 상태 조건 라우터로 넘어가 관측 확산 헤드와 원하는 행동 확산 헤드 사이를 하드 스위칭합니다.
먼저 공간 토큰을 살립니다. 확산 기반 정책은 대개 ViT 인코더에서 클래스(CLS) 토큰 하나만 전역 시각 기술자로 씁니다. 효율적이긴 하지만 공간 구조를 모델 앞단에서 압축해 버려서, 말단장치와 환경 사이의 정밀한 공간 관계를 따지기 어려워집니다. BRIDGE는 DINOv2가 내놓는 공간 패치 토큰을 전부 살려 둡니다. 518×518 이미지에 패치 크기 14면 공간 토큰이 1369개 나오므로, PerceiverIO 방식의 학습 가능한 질의(query) 집합으로 교차 어텐션을 쌓아 토큰 수를 줄입니다.
다음으로 헤드를 둘로 나눕니다. 기저 전문가 는 관측된 행동을, 지원 전문가 는 원하는 행동을 예측합니다. 2단계에서는 기저 전문가와 공유 시각 인코더를 얼려 둔 채 지원 잠재 어댑터 와 헤드 만 표준 확산 손실로 학습합니다.
라우터를 만드는 방법
3단계는 게이트 학습입니다. 여기가 이 논문에서 가장 영리한 부분입니다.
라우터는 과제 손실만으로 저절로 학습되는 것이 아니라, 비모수 잠재 지지 신호(non-parametric latent support signal)로 유도됩니다. 기저 정책 에서 두 데이터셋 샘플의 중간 잠재 를 뽑되, 기저와 지원 시연이 겹치는 영역에서 애매한 유사 라벨이 생기지 않도록 지원 잠재의 근방에 있는 기저 잠재를 먼저 걷어냅니다. 그러고 나서 각 은행에서 최근접 이웃과의 평균 코사인 유사도를 구합니다.
이렇게 만든 k-최근접 이웃 분류기를 MLP 게이트 에 이진 교차 엔트로피로 증류합니다.
추론 시에는 게이트 출력에 문턱값 를 적용해 하드 스위칭합니다.
배포 설정은 이고, 라우터 출력이 순간적으로 튀어 지원 전문가를 잘못 켜는 일이 없도록 0.25초 연속 유지될 때만 켜지는 디바운스를 겁니다. 명령은 100 Hz로 보간해 1 kHz 카티전 임피던스 제어기로 흘려보냅니다.
잔차 정책(Residual Policy Learning)과의 차이도 분명히 해 둡니다. BRIDGE의 지원 전문가는 기저 행동 분포 전체를 보정하는 법을 배우지 않습니다. 관측된 행동과 원하는 행동을 서로 다른 종류의 지도로 두고, 지원 행동 다양체 안에 들어왔을 때만 그쪽으로 넘깁니다.
5. 과제와 데이터 — 시간은 길고 공간은 짧은 지원 데이터
평가 과제는 셋입니다. 전부 정밀한 기하 정렬과 외력 아래 안정적 접촉 처리를 요구합니다.

그림 4(위) — NIST 조립 과제 보드 #2를 변형한 도르래 배선입니다. 잘 휘는 O링을 잡고 작은 도르래와 큰 도르래를 돌아 배선하며, 정밀한 말단장치 이동 내내 O링 장력을 유지해야 합니다.

그림 4(가운데) — 파이프를 잡아 공차가 좁은 구멍에 삽입합니다. 안정적 파지, 6자유도 정렬, 힘을 고려한 삽입이 모두 필요합니다.

그림 4(아래) — AA 배터리를 집어 스프링이 든 칸에 삽입합니다. 배터리가 자리를 잡는 동안 스프링을 계속 눌러야 하므로 외력 아래 말단장치 제어를 시험합니다.
수집량은 이렇습니다.
| 과제 | 기저 시연 수 | 지원 시연 수 | 전체 원격조작 시연 수 | 지원 시간 비율 | 지원 거리 비율 |
|---|---|---|---|---|---|
| NIST Pulley Routing | 201 | 50 | 60 | 37.8% | 7.4% |
| Pipe Insertion | 100 | 81 | 60 | 24.5% | 3.4% |
| Battery Insertion | 290 | 59 | 100 | 61.1% | 14.9% |
여기 담긴 관찰이 중요합니다. 지원 데이터는 궤적의 시간축에서는 큰 몫을 차지하지만 공간으로 보면 희소합니다. 배터리 삽입은 시간의 61.1%를 차지하면서 말단장치 경로 길이로는 14.9%밖에 안 됩니다. 접촉 구간에서 로봇이 느리게 움직이기 때문입니다.

그림 10(c) — 파란 궤적은 한 에피소드의 전체 말단장치 경로이고, 빨간 강조 구간이 지원 구간입니다. 도르래 배선에서 지원 구간의 중앙값 커버리지는 궤적 길이의 8%입니다.
궤적 길이 기준 지원 구간 중앙값은 배터리 삽입 15%, 파이프 삽입 4%, 도르래 배선 8%입니다. 전체 원격조작 데이터셋은 기저와 지원 데이터셋을 합친 것과 대략 같은 벽시계 예산으로 모았습니다.
6. 결과 — 단순 혼합의 역효과
평가 로봇은 카티전 임피던스 제어기를 돌리는 Franka FR3 7자유도 팔입니다. 비교 대상은 넷입니다. handheld만 쓴 기저 정책, 원격조작만 쓴 기저 정책(상한선), 둘을 합친 데이터로 학습한 단순 혼합(Naive Mix), 그리고 BRIDGE입니다.
NIST 도르래 배선
중앙·좌·우·상·하 다섯 위치에서 각 5회, 총 25회 시험입니다. 지그를 각 방향으로 ±2 cm 이동시킵니다.
| 방법 | 부분 성적 (C-L-R-T-B) | 점수 | 성공률 |
|---|---|---|---|
| Base Policy (Handheld) | 4–5–2–0–0 | 11/25 | 44.0% |
| Naive Mix | 0–0–0–0–0 | 0/25 | 0% |
| BRIDGE (Ours) | 4–4–4–4–3 | 19/25 | 76.0% |
| Base Policy (Teleoperated) | 5–5–4–4–3 | 21/25 | 84% |
handheld 기저 정책은 44.0%지만 상·하 위치에서 성적이 0으로 무너집니다. 높은 강성으로 좇다 보니 Franka 제어기 결함이 자주 났고, 명령을 평활화하면 결함은 줄어드는 대신 추종이 나빠졌습니다. 결함이 난 시행은 실패로 세지 않고 빼낸 뒤 다시 돌려 유효 25회를 채웠습니다.
단순 혼합은 0%입니다. 관측 라벨과 원하는 행동 라벨을 한 정책에 섞으면 조작이 부정확해져서, 실제로는 도르래 윗면을 건드리며 배선 홈을 놓칩니다. BRIDGE는 하중 배선 구간에서 지원 전문가로 넘기고 그 구간을 낮은 강성으로 실행해 76.0%까지 올라갑니다. 전체 원격조작 상한선 84.0%에 거의 닿습니다.
파이프 삽입
좌·중·우 각 10회, 총 30회입니다.
| 방법 | 완전 삽입 (L–C–R) | 점수 | 성공률 |
|---|---|---|---|
| Base Policy (Handheld) | 0–2–2 | 17.25/30 | 13.3% |
| Naive Mix | 0–0–2 | 8/30 | 6.7% |
| BRIDGE (Ours) | 3–7–5 | 22.00/30 | 50.0% |
| Base Policy (Teleoperated) | 3–7–9 | 23.75/30 | 63.3% |
handheld 기저 정책은 파이프를 정렬까지는 곧잘 하지만 접촉 근처의 추종 오차 때문에 삽입에서 무너집니다(13.3%). BRIDGE는 최종 정렬과 삽입 국면에서만 원하는 행동을 명령해 성공률을 네 배로 올립니다. handheld 대비 +36.7%로, 초록에서 말한 최대 개선치가 이 과제입니다.
스프링 배터리 삽입
좌·중·우 각 10회, 지그를 ±1 cm 이동시킵니다.
| 방법 | 완전 삽입 (L–C–R) | 점수 | 성공률 |
|---|---|---|---|
| Base Policy (Handheld) | 0–3–0 | 11.25/30 | 10.0% |
| Naive Mix | 0–0–0 | 2.75/30 | 0.0% |
| BRIDGE (Ours) | 3–4–3 | 19.75/30 | 33.3% |
| Base Policy (Teleoperated) | 2–7–3 | 19.75/30 | 40.0% |
불일치가 접촉 국면에 몰려 있다는 주장을 가장 잘 보여주는 과제입니다. 단순 혼합은 배터리를 약 40% 확률로 집기는 하는데, 운반하는 내내 배터리를 오른쪽으로 밀어내는 편향을 일관되게 보이며 결국 칸에 넣지 못합니다. 라벨을 섞으면 최종 접촉 국면에 닿기도 전에 학습된 행동 분포가 뒤틀린다는 뜻입니다. BRIDGE는 자유공간 운반 실력을 그대로 두고 삽입 국면만 지원 시연으로 고쳐 성공률을 세 배 넘게 올립니다. 부분 점수도 11.25에서 19.75로 올라, 실패한 시행마저 완료에 훨씬 가까워졌습니다.
세 과제를 관통하는 결론은 이렇습니다. 지원 데이터가 말단장치 경로 길이의 15% 미만만 덮으면서도 전체 원격조작 상한선까지의 격차를 최대 79% 회수합니다.
7. 라우터 분석 — 정밀도보다 앞세운 재현율
라우터는 파이프 삽입 과제에서 평가했습니다. 데이터셋이나 몸체 특유의 흔적을 이용해 성능이 부풀려지는 일이 없도록, 지원 국면을 사람이 손으로 라벨링한 별도 원격조작 데이터셋을 씁니다.
MLP 라우터는 재현율 99.0%, 정밀도 69.0%를 냈고 평균 정밀도는 0.981입니다. 정밀도가 낮아 보이지만 일부러 그렇게 맞춘 균형입니다. 기저 정책이 삽입 정렬을 잘못 떠맡는 쪽이 더 위험하니, 인계를 놓치느니 조금 일찍 켜는 편을 택했습니다.
t-SNE 잠재 임베딩을 보면 기저 상태와 지원 상태가 뚜렷이 갈리고, 오탐 45건은 지원 다양체 경계 근처의 전이 상태에 몰려 있으며 미탐은 1건뿐입니다(기저 은행 772개, 기저 평가 366개, 지원 은행 328개, 지원 평가 100개 기준). 최근접 이웃 설계와 맞아떨어지는 결과입니다. 지원 은행이 지원 상태 분포를 덮으니 라우팅이 그 다양체 안으로 자연히 제한되고, 동떨어진 영역까지 외삽할 일이 없습니다.
8. 규모 실험 — handheld 증량의 한계
파이프 삽입에서 데이터를 늘려 본 결과가 이 논문의 주장을 가장 날카롭게 만듭니다.
| 방법 | 점수 | 성공률 |
|---|---|---|
| Base Policy (Handheld, 100 demos) | 17.25/30 | 13.3% |
| Base Policy (Handheld, 200 demos) | 18.50/30 | 23.3% |
| Base Policy (Handheld, 328 demos) | 19.00/30 | 26.7% |
| BRIDGE (100 Handheld + 81 Partial Teleop) | 22.00/30 | 50.0% |
| BRIDGE (100 Handheld + 200 Partial Teleop) | 27.00/30 | 73.3% |
| Base Policy (Full Teleop, 60 demos) | 23.75/30 | 63.3% |
| Base Policy (Full Teleop, 120 demos) | 29.00/30 | 93.3% |
handheld를 100개에서 328개로 세 배 넘게 늘려도 26.7%에 그칩니다. 반면 같은 100개 기저에 부분 원격조작 81개만 붙이면 50.0%, 200개를 붙이면 73.3%입니다.
원문 그림 7이 이 대비를 곡선으로 보여줍니다. 동일한 100개 기저 정책에서 출발할 때 handheld를 120개 넘게 추가해도 개선은 미미한 반면, 부분 원격조작을 더하면 성공률이 70%를 넘어섭니다.
주된 실패 원인이 UMI 통상 동작의 커버리지 부족이 아니라 접촉 구간에서 궤적을 제대로 못 좇는 데 있다는 뜻입니다. 관측된 행동을 아무리 많이 모아도, 로봇이 접촉 아래에서 정확히 따라갈 수 없는 행동이기는 마찬가지입니다.
시각 표현 쪽 절제 실험도 함께 실렸습니다. 전체 원격조작 60개로 학습할 때 CLS 토큰만 쓰면 43.3%, 공간 토큰을 쓰면 63.3%이고, 120개에서는 60.0% 대 93.3%로 벌어집니다. 정밀 삽입에 필요한 국소 기하 정보를 앞단에서 버리지 않는 것이 데이터 효율에 그대로 이어집니다.
교차 로봇 전이도 시험했습니다. Franka Emika A에서 93.3%였던 파이프 삽입 정책을 Franka Emika B로 옮기자 3.3%로 무너집니다. 여기에 B 로봇에서 15분 동안 지원 시연 50개를 모아 붙이자 BRIDGE가 10점 만점에 7.00점(완전 삽입 3회, 부분 삽입 4회)을 냈습니다. 예비 결과지만, 전체 원격조작을 다시 모으지 않고 handheld 데이터를 재활용해 교차 로봇 성능을 되살리는 값싼 경로가 있다는 뜻입니다.
9. 저자가 밝힌 한계
첫째, 실험실에서 모은 handheld 데이터는 대규모 야외 시연으로 학습한 정책의 일반화 잠재력을 낮춰 잡을 수 있습니다. 원격조작 정책이 이 평가에서는 최고지만, 저자들은 그런 정책이 분포 밖 환경에 취약하리라고 봅니다.
둘째, 지원 데이터가 필요한 국면을 찾는 방식이 아직 경험에 기댑니다. 자동화하려면 형식화가 필요합니다.
셋째, 하드 스위칭이 경계 민감성과 제어 불연속을 만듭니다. 기준 궤적을 조율하거나 수동성(passivity)을 고려한 평활화가 있어야 합니다.
넷째, 지원 영역마다 별도 정제 헤드를 두는 구조는 해석하기는 좋지만 접촉 국면이 여러 개인 장기 과제로는 잘 늘어나지 않을 수 있습니다.
규모 실험이 드러낸 구조적 한계도 있습니다. 지원 전문가는 기저 정책이 로봇을 접촉 영역 가까이 데려온 뒤에야 호출되므로, 전체 성능이 기저 궤적의 품질에 병목됩니다. 초기 파지가 나쁘거나 접근 자세가 어색하면 지원 전문가는 더 어려운 상태에서 복구해야 합니다.
10. 정리 — 계보에서 BRIDGE의 자리
이 계보의 대부분은 handheld 수집을 더 멀리, 더 싸게, 더 많이 밀어붙이는 방향이었습니다. BRIDGE는 반대쪽에서 옵니다. handheld 데이터가 어디까지 유효한지를 물리적으로 규정합니다.
- 개념적 기여는 행동 유효성입니다. 관측된 행동은 오차에 관대한 자유공간에서는 충분하지만, 힘에 민감한 국면에서는 원하는 행동이 있어야 합니다.
- 근거는 실측입니다. 접촉 중 최대 간극 53 mm, 유도 접촉력 약 53 N이라는 숫자가 관측 궤적은 명령 궤적이 아니라는 것을 증명합니다.
- 반전은 단순 혼합의 실패입니다. 도르래에서 0%, 배터리에서 0.0%. 좋은 데이터 두 종류를 그냥 합치면 더 나빠집니다.
- 처방은 상태 기반 게이트입니다. 두 지도를 분리된 헤드에 두고 상태에 따라 넘깁니다.
그래서 결론은 handheld냐 teleop이냐가 아니라 분업입니다. 싸고 확장 가능한 handheld가 과제의 뼈대를 배우고, 비싸고 느린 teleop은 관측 라벨로는 원리적으로 채울 수 없는 접촉 병목에만 들어갑니다. 경로 길이의 15% 미만에 원격조작을 몰아 격차의 79%를 회수한다는 결과가 그 분업의 효율을 보여줍니다.
원조 UMI 논문해석이 "로봇 없이 모으기"를 열었다면, BRIDGE는 그 문장에 조건절을 답니다. 로봇 없이 모으되, 로봇이 아니면 알 수 없는 것이 남는 구간이 있고 그 구간은 따로 처리해야 한다는 것입니다. 접촉을 계보 안으로 처음 끌어들인 exUMI와 함께 읽으면 이 계보가 접촉이라는 문제를 어떻게 좁혀 왔는지가 선명해집니다.