2026년 9월 14일VLA 선행 연구논문해석 - Attention Is All You Need순환 신경망 없이 주의(attention) 연산만으로 문장을 읽고 생성하는 Transformer를 처음 제안한 논문을, 토큰과 임베딩부터 질의·키·값, 다중 헤드 주의, 위치 부호화까지 원본 그림과 함께 차례로 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Language Models are Few-Shot Learners1750억 파라미터 언어 모델 GPT-3를 미세조정 없이 예시 몇 개만 입력에 넣어 여러 과제에 쓰고, 모델 크기에 따라 이 능력이 어떻게 달라지는지 잰 논문을 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale이미지를 16 × 16 패치로 잘라 토큰열로 만들고, 합성곱 없이 표준 Transformer 부호기만으로 분류해 대규모 사전학습에서 합성곱 신경망을 앞선 Vision Transformer(ViT)를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Learning Transferable Visual Models From Natural Language Supervision인터넷에서 모은 이미지-텍스트 4억 쌍으로 이미지 부호기와 텍스트 부호기를 대조 학습해, 클래스 이름을 문장으로 적기만 하면 추가 학습 없이 분류기가 되는 CLIP을 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Visual Instruction Tuning텍스트만 읽는 GPT-4로 이미지 설명을 대화·상세 설명·추론 문답 15만 8천 건으로 바꾸고, CLIP 시각 부호기와 Vicuna 언어 모델을 선형 투영 층 하나로 연결해 이미지를 보고 지시를 따르는 LLaVA를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning100개 조작 과제의 시연 25,877개와 사람 영상 18,726개로 언어 문장이나 사람 영상에 조건화된 정책을 학습해, 한 번도 시연하지 않은 과제를 수행하게 만든 BC-Z를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Do As I Can, Not As I Say: Grounding Language in Robotic Affordances대규모 언어 모델이 매긴 "이 기술이 지시에 쓸모 있는가"의 확률과 가치 함수가 매긴 "지금 이 기술이 성공하는가"의 확률을 곱해 다음 기술을 고르고, 101개 주방 지시를 실물 로봇으로 수행한 SayCan을 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - A Generalist Agent텍스트·이미지·관절 값·버튼 입력을 전부 하나의 토큰열로 바꿔 1.2B 파라미터 Transformer 하나로 Atari, 이미지 캡션, 대화, 실물 로봇 블록 쌓기까지 수행하게 만든 Gato를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - PaLM-E: An Embodied Multimodal Language Model이미지·상태·3D 장면 표현을 언어 모델의 단어 임베딩 공간에 넣어 텍스트와 섞은 "멀티모달 문장"으로 학습하고, 한 모델로 세 가지 로봇 환경의 계획과 일반 시각-언어 과제를 함께 푼 PaLM-E를 원본 그림과 함께 풀어봅니다.
2026년 9월 14일VLA 선행 연구논문해석 - Denoising Diffusion Probabilistic Models데이터에 가우시안 노이즈를 1000단계에 걸쳐 섞고, 각 단계에서 섞인 노이즈를 맞히도록 학습한 신경망으로 순수 노이즈에서 이미지를 거꾸로 만들어 CIFAR10 FID 3.17을 기록한 DDPM을 원본 그림과 함께 풀어봅니다.