왜 World Model인가? — 행동 전에 결과를 상상하다
사람은 컵을 잡기 전에 손의 궤적과 접촉 결과를 머릿속에서 시뮬레이션합니다. 넘어질 것 같으면 경로를 바꾸고, 무거우면 힘을 더 주죠. 이처럼 행동의 결과를 사전에 예측하는 능력이 지능의 핵심입니다.
Model-Free RL의 한계
기존 모델 프리 강화학습(Model-Free RL)은 환경에서 직접 수천~수만 번 시행착오를 거쳐야 합니다.
- 물리 로봇에서 10,000번 실행 → 수백 시간 소요, 하드웨어 마모
- 위험한 행동도 실제로 실행해야 학습 → 안전 문제
- 환경이 바뀌면 처음부터 다시 학습 → 일반화 불가
World Model의 해법
World Model은 환경의 dynamics를 학습한 내부 시뮬레이터입니다.
관측(observation) → 잠재 상태(latent state) → 다음 상태 예측(prediction) → 보상 추정(reward)
이 과정을 머릿속에서 수행하므로 실제 환경 없이도 수천 번 "상상"으로 연습할 수 있습니다.
핵심 비유: 체스 챔피언
체스 고수는 말을 옮기기 전에 5~10수 앞을 내다봅니다. World Model은 로봇에게 이 능력을 부여합니다. 단, 체스와 달리 물리 세계는 연속적이고 확률적이라는 도전이 있습니다.
Yann LeCun의 JEPA 제안 (2022)
LeCun은 "A Path Towards Autonomous Machine Intelligence"에서 World Model을 AGI의 핵심 모듈로 제안했습니다. 관측 → 잠재 표현 → 예측의 구조가 동물 뇌의 전두엽-해마 상호작용과 유사하다는 점이 근거입니다.