WAM 계보 - 전체 목차

WAM의 정의

세계-행동 모델(World Action Model, WAM)은 카메라 영상·로봇 상태·언어 지시를 받아, 로봇이 할 행동과 그 행동으로 바뀔 장면의 미래 영상을 한 생성 모델에서 함께 예측하는 정책입니다. DreamZero가 이 이름을 붙였고, Cosmos 3의 정책 변형과 GigaWorld-Policy 등이 같은 방식을 따릅니다.

VLA 계보의 모델이 시각-언어 모델의 지식을 로봇 제어로 옮긴다면, WAM은 대규모 영상으로 배운 "장면이 어떻게 움직이는가"에 대한 지식을 옮깁니다. 영상까지 생성하므로 적은 행동 데이터로도 잘 일반화하는 대신, 토큰 열이 길어 느리고 무겁다는 약점이 있습니다.

계보의 분기점

  • 영상 생성 후 행동 복원 → 텍스트 조건 영상 생성기와 역동역학 모델을 이은 UniPi
  • 두 단계를 한 모델로 → 미래 프레임과 행동을 함께 예측하는 GR-1·GR-2·Cosmos Policy·DreamZero
  • 영상 합성을 건너뛰기 → 영상 모델의 잠재 특징에서 행동을 뽑는 영상-행동 모델(VAM) mimic-video
  • 영상까지 예측하면 느리다 → 영상과 행동을 떼지 않은 채 증류로 VLA 속도에 다가간 FLUX 3 Action

읽는 순서

확산 모델과 flow matching이 낯설다면 VLA 선행 연구의 확산 모델·flow matching 편을 먼저 읽기를 권합니다. 비교 대상으로 자주 나오는 π0.5는 VLA 계보 7편에서 다룹니다.

각 글은 논문 원본 그림을 싣고, 수치는 원문 값을 그대로 옮겼습니다.