이런 분들이 찾고 있어요
이 레슨과 관련된 학습 키워드
AI를 아는 것에서, 풀 수 있는 것으로
이 레슨과 관련된 학습 키워드
2023년, 스탠포드 연구팀은 ALOHA라는 양팔 로봇에 단 50회의 인간 시연만으로 젓가락 사용법을 가르쳤습니다. 로봇은 새우를 집어 그릇에 옮기고, 작은 블록을 정밀하게 쌓았습니다. 보상 함수를 설계하지 않았고, 물리 모델을 프로그래밍하지도 않았습니다. 오직 "사람이 하는 것을 보고 따라 하기"만으로 학습한 것입니다.
이것이 모방학습(Imitation Learning, IL)의 핵심 아이디어입니다. 강화학습이 "시행착오를 통해 보상을 최대화하라"는 접근이라면, 모방학습은 "전문가의 행동을 관찰하고 그대로 재현하라"는 접근입니다. 수학적으로 보면, 강화학습은 보상 함수 R(s,a)를 최대화하지만 모방학습은 전문가 정책 π*와의 차이를 최소화합니다.
왜 로봇공학에서 모방학습이 주목받는가? 세 가지 이유가 있습니다. 첫째, 보상 설계의 어려움. "깔끔하게 옷을 개라"라는 과제의 보상 함수를 수학적으로 정의하는 것은 극도로 어렵습니다. 둘째, 샘플 효율성. 강화학습은 수백만 번의 시행착오가 필요하지만, 모방학습은 수십~수백 회의 시연이면 충분할 수 있습니다.
실제 로봇에서 데이터를 모으는 비용을 생각하면 결정적 차이입니다. 셋째, 안전성. 전문가 시연 데이터를 먼저 학습하므로, 처음부터 극단적인 행동을 시도하는 강화학습의 위험을 피할 수 있습니다.
이번 레슨에서는 모방학습의 전체 파이프라인을 탐구합니다.
데이터를 어떻게 수집하고(텔레오퍼레이션), 가장 단순한 방법(Behavioral Cloning)의 한계를 어떻게 극복하며(DAgger, ACT), 최신 생성 모델(Diffusion Policy)이 어떻게 혁신을 가져오는지 — 모방학습이 로봇을 가르치는 가장 실용적인 방법으로 자리잡은 과정을 따라갑니다.