2026년 9월 14일VLA 선행 연구논문해석 - Flow Matching for Generative Modeling잡음 분포를 데이터 분포로 옮기는 벡터장을 시뮬레이션 없이 회귀로 학습하는 Flow Matching과, 곧은 직선 경로를 만드는 최적 수송 경로를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Diffusion Policy: Visuomotor Policy Learning via Action Diffusion카메라 영상을 조건으로 잡음에서 로봇 행동 묶음을 반복해서 복원하는 확산 정책을 제안하고, 시뮬레이션과 실물 로봇 과제에서 기존 행동 복제 방법보다 평균 46.9% 높은 성능을 보고한 Diffusion Policy를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware약 2만 달러짜리 양팔 원격조작 장치 ALOHA로 시연을 모으고, 행동 100걸음을 한 번에 예측하는 ACT(Action Chunking with Transformers)로 배터리 끼우기·컵 뚜껑 열기 같은 정밀 양팔 과제를 50번의 시연만으로 학습한 논문을 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구VLA 선행 연구 - 전체 목차VLA 모델이 가져다 쓰는 Transformer와 LLM, 시각-언어 모델, VLA 이전의 로봇 학습, 연속 행동 생성 모델의 출발점 논문을 VLA 계보보다 먼저 읽도록 정리한 시리즈입니다.
2026년 9월 14일VLA논문해석 - RT-1: Robotics Transformer for Real-World Control at Scale로봇 13대로 17개월 동안 모은 13만 개 시연을 35M 파라미터 Transformer 하나에 담아, 700개가 넘는 언어 지시를 초당 3번 실행하게 만든 RT-1을 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA논문해석 - RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control로봇 행동을 텍스트 토큰으로 바꿔 거대 시각-언어 모델이 직접 내뱉게 하고, 웹 데이터와 로봇 데이터를 함께 미세조정해 "VLA"라는 이름을 처음 붙인 RT-2를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA논문해석 - Open X-Embodiment: Robotic Learning Datasets and RT-X Models21개 기관이 가진 로봇 데이터 60개를 한 형식으로 모아 22종 로봇, 100만 개가 넘는 궤적의 데이터셋을 만들고, 여러 로봇 데이터로 함께 학습한 RT-1-X와 RT-2-X가 한 로봇 데이터만 쓴 모델보다 나은지를 실험한 Open X-Embodiment를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA논문해석 - OpenVLA: An Open-Source Vision-Language-Action Model공개 VLM인 Prismatic-7B를 Open X-Embodiment 로봇 궤적 97만 개로 미세조정해 55B RT-2-X보다 높은 성공률을 내고, 가중치·코드·미세조정 방법까지 공개한 7B VLA인 OpenVLA를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA논문해석 - π0: A Vision-Language-Action Flow Model for General Robot Control3B 시각-언어 모델 PaliGemma에 300M 행동 전문가를 붙여 50걸음 행동 묶음을 flow matching으로 생성하고, 로봇 7종·약 1만 시간 데이터로 사전학습한 뒤 빨래 개기·상자 조립 같은 긴 과제에 사후학습한 π0를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA논문해석 - FAST: Efficient Action Tokenization for Vision-Language-Action Models로봇 행동 묶음을 이산 코사인 변환과 바이트 쌍 부호화로 압축해 토큰 수를 줄이고, 자기회귀 VLA가 50Hz 양팔 조작까지 학습하게 만든 FAST와 범용 토크나이저 FAST+, π0-FAST를 원본 그림과 함께 풀어봅니다.