UMI 계보 - 전체 목차18편

논문해석 - UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data

들어가며

지금까지 이 계보를 따라오면서 본 것은 전부 더 잘 모으는 방법이었습니다. 원조 UMI가 로봇 없이 시연을 모으는 길을 열었고, FastUMI가 그 설치 문턱을 낮췄고, exUMI가 촉각을, MV-UMI가 3인칭 시점을, Mobile UMI가 이동을 더했습니다. RwoR는 집게조차 내려놓았고, 농업용 저가 하드웨어는 과수원까지 나갔으며, 그리퍼 설계 연구는 손가락 모양이 데이터를 바꾼다는 것을 사람 대상으로 재봤습니다.

가지가 이만큼 뻗으면 자연히 따라오는 질문이 있습니다. 그래서 이 중에 어느 정책이 더 나으냐는 것입니다. 그런데 여기에 답할 방법이 없었습니다. 팀마다 로봇이 다르고, 카메라 위치가 다르고, 물체를 다시 놓는 절차가 다르고, 채점 기준이 다릅니다. 이런 상태에서 나온 성공률 차이는 모델이 잘해서인지 평가 환경이 후해서인지 가릴 수가 없습니다.

UMI-Bench 1.0은 그 구멍을 정면으로 메웁니다. 저자들 말로는 UMI 기반 조작 모델의 실세계 평가만을 겨냥해 만든 첫 벤치마크입니다. 계보에 센서나 마운트를 하나 더 붙이는 논문이 아니라, 계보 전체를 재는 자를 만드는 논문입니다. 분야가 이런 것을 만들기 시작했다는 것 자체가 성숙 신호입니다.

📄 UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data — Shi Jin, Yuntian Wang, Yuhui Duan, Di Wu, Gaoqi Dong, Xiaohang Liu, Xiaotong Li, Hongfei Jia, Zehao Zhang, Tianyu Wang, Zhongjie Jia, Yuanqi Yao, Chenjia Bai, Zhaxizhuoma, Siao Liu, Nieqing Cao, Jin Wang, Chao Yu, Yan Ding (총 19인) / Soochow University · Lumos Robotics · Fudan University · Shanghai Jiao Tong University 외, 2026-06-09, cs.RO, arxiv 식별자 2606.10382

저자 명단에 Zhaxizhuoma와 Zhongjie Jia, Tianyu Wang, Nieqing Cao가 보입니다. 2편에서 다룬 FastUMI를 만든 사람들입니다. 수집 도구를 만든 팀이 이번에는 그 도구로 모은 데이터로 학습한 정책을 재는 자를 만들었습니다.

초록 요약

학습된 조작 정책이 잘 다듬어진 시연 바깥에서도 버티는지는 결국 실로봇 평가(real-robot evaluation)로만 알 수 있습니다. UMI 계열에서는 이 필요가 특히 절박합니다. 이쪽 정책의 성능은 손목 시점 관측과 행동 표현, 데이터 수집, 물리 배포가 서로 맞물린 결과라서, 한 군데만 달라져도 숫자가 흔들리기 때문입니다. 앞선 실세계 벤치마크들도 나름의 진전을 냈지만 UMI 특유의 이 데이터-배포 구도를 겨냥해 설계되지는 않았습니다. UMI-Bench 1.0은 UMI 계열 조작 정책을 같은 방식으로 재는 로컬 우선(local-first) 실로봇 벤치마크입니다. 데이터 수집과 장면 리셋(scene reset), 정책 실행, 결과 로깅, 과제 요인 분석(task-factor analysis)을 하나의 프로토콜 안에 나란히 놓습니다. 평가 과정 전체를 다시 돌려볼 수 있고 나중에 감사(auditable)할 수 있게 만들어, UMI로 학습한 정책이 실제 물리 조작으로 얼마나 일반화되는지 재는 시험대를 제공합니다.


1. 문제 — 제각각인 실로봇 평가

시뮬레이션과 오프라인 지표는 개발 중 신호로는 쓸 만하지만 접촉 동역학과 센싱 잡음, 타이밍 변동, 조작자마다 다른 습관까지 담지는 못합니다. 그래서 실로봇 평가가 필요한데, 그 실로봇 평가가 팀마다 제각각이면 문제가 원점으로 돌아옵니다.

논문은 어긋남이 어디서 오는지 세 지점을 짚습니다.

  • 하드웨어와 절차의 차이 — 하드웨어, 카메라, 리셋 절차, 행동 인터페이스가 팀마다 다르면 성능 차이가 모델 능력이 아니라 평가 변동을 비출 수 있습니다.
  • 말로만 적힌 장면 조건 — 장면을 비공식적으로만 적어 두면 실패 분석이 물체 수준 일반화와 배치 변화, 공간 추론, 실행 불안정을 갈라내지 못합니다.
  • 따로 노는 수집과 평가 — 데이터 수집과 평가를 따로 규정해 두면 학습 분포와 시험 분포가 어떤 관계인지 끝까지 불투명하게 남습니다.

RoboChallenge, RoboArena, ManipArena 같은 실기 벤치마크가 앞서 있었지만 UMI 데이터를 중심에 놓고 설계되지는 않았습니다. UMI 데이터는 손목 시점 관측과 행동 표현, 몸체(embodiment), 장면 리셋, 정책 실행이 단단히 엮인 배포 지향 인터페이스를 축으로 짜입니다. 그러니 UMI 정책을 재는 벤치마크라면 과제를 끝냈는지만 볼 게 아니라, 수집에서 배포까지 이어지는 파이프라인 전체가 실세계에서 재현되는지를 봐야 합니다.

그림 1 — UMI-Bench 1.0 전체 개요

그림 1 — 표준 데이터 수집 작업대와 시연 샘플을 실세계 평가 작업대로 잇고, 4개 단일팔 과제와 6개 양팔 과제에 걸쳐 다시 돌려볼 수 있는 실기 롤아웃(rollout)을 만들어냅니다.


2. 전체 그림 — 수집에서 채점까지 하나의 프로토콜

UMI-Bench의 주장은 데이터 수집과 장면 규격, 평가 에피소드, 채점이 서로 다른 네 가지 일이 아니라 하나의 규격이라는 것입니다. 단순한 데이터셋 공개와 갈라지는 지점도 여기입니다.

그림 2 — 데이터에서 평가까지의 파이프라인

그림 2 — 표준 UMI 데이터 수집, 구조화된 벤치마크 메타데이터, 10개 과제 묶음, 통합 학습 저장소, 기준 정책, 그리고 성공·진행도·과제별·일반화 진단을 담은 실세계 평가가 하나로 이어집니다.

이 흐름을 단계로 펴면 이렇습니다.

설계 요구사항은 셋입니다. 관측 인터페이스와 행동 공간, 데이터 스키마, 평가 러너가 UMI 정책을 학습할 때의 가정과 어긋나지 않아야 하고, 다른 기관이 그대로 다시 세울 수 있을 만큼 하드웨어 구성과 작업 공간, 리셋 절차, 에피소드 메타데이터, 채점 규약이 적혀 있어야 하며, 성공 여부만이 아니라 어떤 과제 요인과 분포 이동이 실패에 기여했는지까지 드러나야 합니다.


3. 표준 작업대 — 재현의 물리적 조건

재현할 수 있다는 말은 결국 물리적 규격을 다 적어 놓았다는 뜻입니다. 논문은 부록 A에 작업대 명세를 통째로 실었습니다.

구성 요소규격
매니퓰레이터6자유도 URDF와 파이썬 SDK가 공개된 FastTouch 탁상형 팔
제어 루프경유점(waypoint) 궤적을 내부적으로 400 Hz로 샘플링, 집게 명령·상태는 5 ms 주기
평가용 손목 시점 센싱손목 RGB 카메라 1280×1280, 100 FPS. 정책 입력은 224×224로 축소, 로봇 상태는 기본 30 Hz 로깅
위치 기준과 리셋1.2 m × 1.0 m × 0.75 m 고정 탁자, 같은 크기의 아크릴 격자판, 5 cm × 5 cm 칸

격자판이 재미있습니다. 탁자 위에 투명 아크릴판을 얹고 5 cm 칸을 인쇄해 물체를 늘 그 위에 놓습니다. 다만 이 격자는 조작자용이지 정책용이 아닙니다. 논문은 격자가 리셋을 일관되게 만들 만큼은 보이되 손목 카메라가 안정적으로 읽어낸다고 가정하지는 않는다고 못 박습니다. 사람이 장면을 똑같이 되돌리려고 그은 눈금이지, 정책이 읽는 시각 마커가 아닙니다.

평가 에피소드는 리셋 이미지 한 장과 구조화된 장면 JSON 파일로 규정됩니다. 장면 JSON에는 과제 식별자, 물체 식별자, 범주, 외형, 재질, 탁상 마커 위치, 자세, 목표 영역, 분할(split)이 들어갑니다. 참조 이미지로 장면을 되돌리던 기존 방식 위에 분포 메타데이터를 명시적으로 얹은 것이 차이인데, 그 덕에 물체 분할별로, 배치 분할별로, 요인별로, 부분 목표별로 성능을 쪼개 볼 수 있습니다.


4. 데이터 수집 — FastUMI Pro와 여섯 단계 검수

수집 도구는 FastUMI Pro입니다. RGB와 비행시간(Time-of-Flight, TOF), 관성 측정 장치(Inertial Measurement Unit, IMU), 집게, 공간 궤적 스트림을 기록합니다. 한 세션이 벤치마크 저장소에 받아들여지려면 여섯 단계를 통과해야 합니다.

단계내용
초기화SDK와 ROS 환경 구성, 장치 연결, 드라이버 실행. 다중 장치 세션은 USB 대역폭 설정 선행
스트림 점검자세·RGB·TOF·IMU·집게 스트림 확인. 기준은 자세 또는 IMU 500 Hz, RGB 60 Hz, TOF 30 Hz
보정과 리셋카메라·로봇 좌표계 확인, 과제·에피소드 메타데이터 선택, 리셋 이미지와 탁상 마커로 장면 복원
기록손목 시점 영상, 타임스탬프, 집게 상태, 공간 궤적, 장면 메타데이터, 실패 메모, 품질 플래그 저장
품질 관리스트림 완결성·영상 판독성·타임스탬프 일관성·과제 규칙 준수 확인. 모호한 세션은 내보내기 전에 표시
내보내기HDF5 또는 LeRobot 호환 파일로 변환, 단일·양팔 배치 자동 감지

내보낸 데이터의 상태·행동 벡터는 팔 하나당 8차원 [x,y,z,qx,qy,qz,qw,clamp][x, y, z, q_x, q_y, q_z, q_w, \text{clamp}] 이고, 60 fps 원본 스트림은 요청한 20·30·60 Hz 학습 주파수에 맞춰집니다. 양팔 세션은 왼손과 오른손 폴더를 따로 두되 팔 하나의 구조는 같습니다.


5. 과제 묶음 — 단일팔 4개 + 양팔 6개

첫 릴리스에 담긴 과제는 탁상 조작 10개입니다.

ID과제시연 수평가 수기술 유형목표
T1Sequential Object Stacking단일3,00050공간 정렬목표 매트 위에 바구니 3개 쌓기
T2Articulated Container Manipulation단일1,99150관절체 조작쓰레기봉투를 상자에 넣고 뚜껑 닫기
T3Tool-Mediated Stamping단일2,99650도구 매개 접촉잉크패드로 카드에 도장 찍기
T4Precision Slot Insertion단일2,00150정밀 삽입리모컨을 거치대 슬롯에 꽂기
T5Bimanual Material Pouring양팔1,60050양팔 협응콩을 받는 바구니에 붓기
T6Bimanual Packing and Transport양팔1,60050협동 운반물건을 담고 바구니를 목표 구역으로 운반
T7Dynamic Pick-and-Place양팔2,01250동적 파지회전 턴테이블에서 캔을 집어 매트에 놓기
T8Category Sorting and Placement양팔1,60050의미 접지마작 타일 4개를 맞는 바구니로 분류
T9Long-Horizon Rearrangement양팔1,60050장기 계획컵·캔·빵을 목표 위치에 배열
T10Deformable Object Folding양팔1,60050변형체 조작바지를 목표 형태로 접기

과제당 1,600~3,000개, 합쳐 약 2만 개 시연입니다. 양팔 과제 6개는 한 팔이 물체를 잡아 고정하고 다른 팔이 마무리하는 식으로 역할 분담과 타이밍을 요구합니다. 단일팔 집기-놓기나 도구 사용, 삽입만 봐서는 드러나지 않는 실패 양상을 노린 배치입니다.

그림 4 — 과제와 변형(variant) 커버리지

그림 4 — 10개 과제 묶음에 걸친 변형 분포와, 데이터 수집·평가에 쓰인 실제 장면 예시를 함께 보여줍니다.


6. 일반화 설계 — 두 축으로 쪼갠 미지 조건

이 벤치마크에서 가장 실용적인 대목입니다. 미지 조건(unseen condition)을 뭉뚱그리지 않고 요인 둘로만 쪼갭니다.

  • 요인 A — 처음 보는 물체 개체, 외형, 범주, 조합. 색·재질·크기·질감 변화가 여기 속합니다.
  • 요인 B — 처음 보는 위치, 배치, 자세, 과제 동역학. 큰 위치 이동, 조밀한 배치, 목표 영역 변경, 방해물 추가, 새 초기 방향, 기울어진 자세가 여기 속합니다.

이 둘의 곱집합이 네 칸을 만듭니다. Seen/Seen, Seen/Unseen, Unseen/Seen, Unseen/Unseen. 과제마다 두 축이 무엇인지 구체적으로 지정됩니다.

과제물체·범주 이동 (요인 A)배치·동작 이동 (요인 B)
T1바구니 외형쌓는 위치
T2봉투 외형물체 위치
T3도장·잉크·종이 외형도장 찍는 위치
T4리모컨·거치대 외형삽입 위치
T5바구니·콩 외형바구니·컵 위치
T6포장 물체 외형상자 위치
T7캔·목표 매트 외형턴테이블 속도
T8마작 범주 조합놓는 위치
T9탁상 물체 외형놓는 위치
T10바지 외형초기 위치

각 과제는 50회 롤아웃 예산을 네 칸에 나눠 씁니다. 예를 들어 T1은 9/21·6/14, T3은 20/10·14/6, T9는 17/8·17/8 식입니다. 그리고 어떤 방법이든 똑같은 에피소드 목록으로 평가받습니다.

일반화 격차는 Δgen=SseenSunseen\Delta_{gen} = S_{seen} - S_{unseen} 로 정의하고 요인 A와 요인 B를 각각 따로 계산합니다. 물체나 외형이 바뀌어서 실패한 것인지, 공간이나 기하, 동역학이 바뀌어서 실패한 것인지 갈라 보려는 것입니다.


7. 지표 — 따로 보는 성공률과 진행도

주 지표는 둘입니다. 완전 성공률(Full Success Rate, FSR)은 전체 과제 기준을 만족한 에피소드의 비율이고, 진행도 점수(Progress Score)는 0~100 척도의 부분 점수입니다. 완료 시간이나 재시도 횟수, 실패 이벤트 수, 행동 길이, 실행 스텝 수는 첫 릴리스에서 공식 지표로 보고하지 않습니다.

채점 규약에서 눈여겨볼 대목은 롤아웃이 끝난 시점의 마지막 안정 물리 상태만 본다는 것입니다. 중간에 파지를 한 번 놓쳤더라도 관측 자세로 돌아와 예산 안에 과제를 끝냈다면 마지막에 완료된 부분 목표대로 점수를 줍니다. 반대로 물체를 엉뚱한 대상이나 엉뚱한 층, 불안정한 형태로 놓았거나 이후 동작 때문에 쓰러지거나 유효 영역을 벗어나면 배치 점수를 주지 않습니다.

그림 15 — 최종 상태 채점 예시

그림 15 — 상자 운반과 천 접기에서 유효한 최종 자세와 무효한 최종 자세를 3인칭 시점으로 대비해 보여줍니다. 완전 성공 라벨과 부분 진행도 점수 모두 같은 최종 상태 규약을 씁니다.

에피소드 최대 스텝 예산은 T1부터 T10까지 각각 1000, 1200, 1000, 800, 1200, 900, 1000, 1000, 1800, 1000 스텝입니다. 정책은 저수준 명령을 하나씩 내는 대신 행동 묶음(action chunk) 단위로 실행됩니다. 추론 한 번이 경유점 궤적을 내놓고 로봇 SDK가 그것을 따라갑니다.


8. 실험 — 세 모델, 1500회 실기 롤아웃

평가 대상은 π0\pi_0, π0.5\pi_{0.5}, DreamZero 셋입니다. 10개 과제 × 50 에피소드 × 3 모델, 곧 1500회 실세계 롤아웃입니다.

10개 과제 평균 Overall Score는 π0.5\pi_{0.5} 가 55.84로 가장 높고, π0\pi_0 가 48.90, DreamZero가 40.59입니다. π0.5\pi_{0.5} 의 우위는 특정 과제에 몰려 있지 않습니다. 10개 중 6개에서 1위이고 단일팔과 양팔 양쪽에 걸칩니다. π0\pi_0 는 단일팔 배치 과제인 T1과 T2에서 가장 강하고, DreamZero는 T3·T6에서 겨뤄 볼 만하지만 평균에서는 뒤집니다.

가장 어려운 과제는 T3과 T9였고, 세 모델 모두 FSR 0%였습니다. T3은 애매한 손목 단일 시점만 보고 다단계 진행 상태를 계속 추정해야 하는 것이 문제이고, T9은 긴 재배열 과정에서 오차가 쌓여 초기의 작은 편차가 마지막 배치의 좁은 공간 허용 오차를 못 맞추는 것이 문제입니다. 같은 0%라도 무너진 이유가 다릅니다.

요인별 성능 하락

조건별 평균 점수는 이렇게 움직입니다.

조건평균 진행도 점수
Seen/Seen59.62
요인 A 이동53.45
요인 B 이동45.33
A+B 결합 이동40.19

공간이 바뀔 때(요인 B) 떨어지는 폭이 물체가 바뀔 때(요인 A)보다 큽니다. 지금 정책들은 학습 분포와 평가 분포가 맞아떨어질 때는 실력을 상당히 유지하지만, 과제와 관련된 기하나 동역학이 바뀌면 여전히 시연에 맞춰 굳은 동작 사전(motion prior)에 기댄다는 뜻입니다. 배포 시점에 과제 관련 기하를 다시 찾아내는 능력이 모자랍니다.

이 경향이 특히 뚜렷한 곳은 T5·T6·T8입니다. 예를 들어 π0\pi_0 는 T5에서 Seen/Seen의 86.67에서 위치 이동 조건의 22.81로 떨어집니다.

그림 8 — T5 양팔 재료 붓기 롤아웃 히트맵

그림 8 — 히트맵 칸은 실제 바구니와 계량컵 배치이며, 각 항목은 롤아웃 ID와 진행도 점수를 보여줍니다.

그림 10 — T7 동적 집기-놓기 롤아웃 히트맵

그림 10 — 평가한 턴테이블 속도와 물체 외형 조건을 패널로 나누어 보여줍니다.

그림 12 — T9 장기 재배열 롤아웃 히트맵

그림 12 — 과제별 배치 격자 조건 블록을 패널로 나누고, 각 항목은 롤아웃 ID와 진행도 점수를 보여줍니다.

Seen/Seen 칸은 표준 UMI 수집 격자의 중앙부와 그대로 겹치므로, 저자들은 이 열을 학습 재현 기준선(training-reproduction baseline)으로 읽어도 된다고 말합니다. 평균 59.62가 조건이 맞아떨어질 때의 실력이고, 결합 이동 평균 40.19는 분포가 기록된 커버리지 밖으로 나갔을 때 잃는 양입니다.

표준 프로토콜이 드러낸 것들

집계 성공률만 봐서는 안 보이던 것들이 요인별로 쪼개니 나옵니다.

T1에서는 진행도와 성공이 어긋납니다. π0\pi_0 는 Overall Score 75.00에 FSR 34.00%, π0.5\pi_{0.5} 는 Overall Score 70.90에 FSR 14.00%입니다. 부분 진행도가 비슷해도 끝까지 해내는 신뢰도는 다를 수 있다는 뜻입니다. π0.5\pi_{0.5} 는 중간 쌓기 단계까지는 자주 가지만 최종 안정성과 정렬 기준을 덜 만족합니다. 진행도와 FSR을 따로 보고하는 이유가 여기 있습니다.

DreamZero는 성적이 갈립니다. 평균은 뒤지지만 T3에서 Overall Score 34.30, T6에서 72.50으로 1위이고, T6의 FSR 52.00%는 모든 모델과 과제 조합을 통틀어 최고입니다. 반대로 T5·T7·T9에서는 약합니다. T7 부진의 후보로 논문이 드는 것은 추론 지연입니다. NVIDIA A100 한 장에서 π0.5\pi_{0.5} 가 219.3 ms, π0\pi_0 가 198.8 ms인데 DreamZero는 A100 두 장을 쓰고도 1630.0 ms입니다. 움직이는 표적을 폐루프로 좇아야 하는 과제에 특히 불리한 숫자입니다.

T10은 두 요인에 고르게 민감합니다. 격자 배치 과제들이 요인 B 쪽으로 쏠린 것과 달리 T10은 모델 평균 요인 A 하락 16.28, 요인 B 하락 16.17로 거의 같고, 결합 이동 하락은 23.11입니다. 바지 외형을 바꾸든 초기 위치를 바꾸든 파지 선택과 천 정렬, 접기 실행이 똑같이 흔들립니다. 그래서 저자들은 T10을 공간 강건성이 아니라 변형체 실행 강건성 전반을 재는 탐침으로 씁니다.


9. 벤치마크의 자리 — 원격 플랫폼과 데이터셋 공개 사이

논문은 자기 위치를 두 방향으로 갈라 설명합니다. 원격 로봇 플랫폼은 공용 기계를 여럿이 쓰게 하는 것이 주 목적인데, UMI-Bench는 그것을 대체하려는 게 아니라 특정 데이터·배포 패러다임에 맞는 재현 가능한 로컬 평가를 겨냥합니다. 팀이 정책을 다시 학습하고, 통제된 교란 아래 시험하고, 실패를 들여다보고, 수집 전략을 고치는 순환에 맞는 도구입니다.

데이터셋만 공개하는 것과도 다릅니다. 수집과 장면 규격, 평가 에피소드, 채점을 한 프로토콜의 부분으로 취급합니다. UMI 계열 정책의 성능이 손목 시점 관측과 행동 묶음, 물리적 장면 복원이 맞물린 결과이니, 그 맞물림을 메타데이터와 결과 패키지에 드러내 뜯어볼 수 있게 만드는 것이 핵심입니다.

공개 예정 항목에도 그 성격이 그대로 드러납니다. 벤치마크 프로토콜, 에피소드 규격, 장면 메타데이터, 채점 루브릭, 평가 러너, 기준 체크포인트와 로그, 롤아웃 감사 패키지입니다.

원문 그림 3(능력별 Overall Score 레이더 차트와 일반화 격차 막대 그래프)은 arxiv HTML 판에서 벡터 도형으로 그려져 이미지 파일로 존재하지 않아 싣지 못했습니다. 해당 수치는 위 표와 본문으로 옮겼습니다.


10. 저자가 밝힌 한계

첫째는 범위입니다. 탁상 조작에 국한되고, 이동 조작이나 넓은 작업 공간, 더 복잡한 장기 시나리오는 아직 다루지 않습니다.

둘째는 데이터 규모입니다. 약 2만 시연은 대형 로봇 데이터셋에 대면 여전히 적습니다.

셋째는 실세계 평가에 남는 변동입니다. 조작자의 리셋 편차, 보정 표류(calibration drift), 조명 변화, 하드웨어 타이밍 효과가 그대로 남습니다. 프로토콜을 아무리 조여도 물리 세계는 완전히 고정되지 않습니다.


11. 정리 — 계보에서 UMI-Bench의 자리

앞선 열일곱 편이 어떻게 모을 것인가를 물었다면, UMI-Bench는 처음으로 그렇게 모아 만든 정책을 어떻게 잴 것인가를 묻습니다.

  • 로컬 우선 실로봇 프로토콜이 수집·리셋·실행·로깅·채점을 하나로 묶습니다.
  • 10개 과제, 약 2만 시연, 과제당 50 에피소드가 첫 릴리스의 실체입니다.
  • 요인 A와 요인 B라는 두 축이 왜 실패했는지를 물체 문제와 공간 문제로 갈라 줍니다.
  • 1500회 실기 롤아웃이 지금 정책들의 공간 이동 취약성을 숫자로 확인시켜 줍니다.

FastUMI를 만든 사람들이 이번에는 자를 만들었다는 점이 이 논문의 성격을 잘 보여줍니다. 계보가 도구를 만드는 단계를 지나 비교 가능성을 요구하는 단계로 들어섰다는 신호입니다. 자를 만드는 논문은 새 능력을 보태지 않습니다. 대신 앞으로 나올 논문들이 같은 조건에서 자기 성능을 말하게 만듭니다.

계보의 출발점이 궁금하다면 원조 UMI 논문해석으로, 이 벤치마크가 수집 도구로 채택한 FastUMI 계열이 궁금하다면 FastUMI 논문해석으로 돌아가면 됩니다.