이런 분들이 찾고 있어요
이 레슨과 관련된 학습 키워드
AI를 아는 것에서, 풀 수 있는 것으로
이 레슨과 관련된 학습 키워드
2016년, 구글 딥마인드는 시뮬레이션 환경에서 가상 에이전트가 스스로 걷기, 달리기, 장애물 넘기를 학습하는 영상을 공개했습니다. 프로그래머가 "다리를 이렇게 움직여라"라고 지시한 적이 없습니다. 에이전트는 오직 "앞으로 빨리 가면 보상을 준다"는 신호 하나로, 수만 번의 넘어짐을 거쳐 자연스러운 보행 패턴을 스스로 발견했습니다.
이것이 로봇 강화학습(RL for Robotics)의 핵심 아이디어입니다.
전통적 로봇 제어는 수학적 모델을 먼저 만들고, 그 모델에 맞는 컨트롤러를 설계합니다. 관절의 질량, 마찰계수, 관성 모멘트를 정밀하게 측정하고, 이를 기반으로 PID나 모델 예측 제어(MPC)를 구현합니다. 이 접근은 잘 정의된 환경에서는 매우 효과적이지만, 세 가지 근본적 한계가 있습니다.
첫째, 모델링의 한계. 현실 세계의 마찰, 변형, 접촉 역학을 완벽히 수학적으로 기술하는 것은 사실상 불가능합니다. 둘째, 적응의 한계. 로봇 다리가 마모되거나, 지형이 바뀌거나, 부하가 달라지면 컨트롤러를 다시 튜닝해야 합니다.
셋째, 복잡 행동의 한계. "울퉁불퉁한 바위 위를 뛰어넘어라"라는 과제의 최적 제어를 수식으로 도출하기란 극도로 어렵습니다.
강화학습은 이 세 가지 한계를 근본적으로 우회합니다. 모델을 명시적으로 만들지 않고, 경험(데이터)으로부터 직접 제어 정책을 학습합니다. 환경이 변해도 추가 경험을 통해 자동으로 적응하며, 복잡한 행동도 보상 신호만 있으면 시행착오를 통해 발견할 수 있습니다.
이번 레슨에서는 로봇 RL의 핵심 알고리즘(PPO, SAC), 보상 설계, 시뮬레이션-현실 전이, 그리고 최신 실전 사례를 체계적으로 탐구합니다.