4- 시뮬레이터에서 성공률 99%를 찍은 정책이 실물 로봇에 그대로 올라가면 성공률이 0~30%대로 붕괴하는 일이 흔하다. 이 낙차를 현실 격차(Reality Gap) 혹은 Sim-to-Real Gap이라 부른다.
5What — 격차는 정확히 어디에서 벌어지는가
6- 동역학 불일치: 마찰계수, 질량·관성, 관절 마찰/백래시, 액추에이터 토크 곡선이 실제와 다르다. 시뮬레이터는 대개 이상적인 강체·이상적인 모터를 가정한다.
7- 지각 불일치: 렌더링된 이미지와 실제 카메라 이미지가 다르다(조명, 모션 블러, 노이즈, 렌즈 왜곡, 도메인 텍스처).
8- 시간 불일치: 실물에는 센서 지연, 통신 지터, 제어 주기 흔들림이 있으나 시뮬레이터는 지연 0을 기본값으로 둔다.
9- 모델링되지 않은 현상: 케이블이 끌리는 힘, 부품 마모, 바닥의 미세 경사, 물체의 변형 — 시뮬레이터의 상태 변수에 아예 존재하지 않는 항들이다.
10구체적 실패 사례 1 — OpenAI Dactyl (로봇 손 큐브 조작)
11- 무작위화 없이 단일 시뮬레이터 파라미터로만 학습한 정책은 실물 Shadow Hand에서 큐브를 몇 초 만에 떨어뜨렸다. 손가락 끝 마찰과 큐브 무게중심이 시뮬레이터 값과 조금만 어긋나도 파지 전략 전체가 무너지기 때문이다.
12- 반대로 물리·시각 파라미터를 대량 무작위화하자 동일 알고리즘이 실물에서 연속 회전 수십 회를 달성했다 (OpenAI et al., 2019, Learning Dexterous In-Hand Manipulation). 즉 격차의 원인은 알고리즘이 아니라 학습 분포였다.
13구체적 실패 사례 2 — 사족보행의 미끄러짐
14- 시뮬레이터의 기본 마찰계수(예: \mu = 1.0)에서 학습한 보행 정책은, 실제 매끈한 대리석 바닥(\mu \approx 0.3)에서 지지발이 미끄러지며 곧바로 넘어진다.
15- 또한 이상적 토크 모터를 가정하면 정책이 물리적으로 낼 수 없는 고주파 토크를 요구하게 되어, 실물에서는 진동(chattering)과 과열로 이어진다. 이 문제를 액추에이터 응답을 신경망으로 학습해 시뮬레이터에 삽입함으로써 해결한 사례가 ANYmal 연구다 (Hwangbo et al., 2019, Science Robotics).
16Why — 왜 이것이 '마지막 병목'인가
171. 실물 데이터는 비싸다: 강화학습이 요구하는 수천만~수십억 스텝을 실물에서 모으는 것은 시간·마모·안전 측면에서 불가능에 가깝다. 그래서 학습은 시뮬레이터에서 할 수밖에 없고, 배포는 실물에서 해야 한다. 이 비대칭이 격차를 구조적으로 만든다.
182. 안전 비용이 비대칭이다: 디지털 AI의 실패는 잘못된 문장이지만, 피지컬 AI의 실패는 파손·낙상·인명 위험이다. 실패를 '평균 성능'으로 뭉갤 수 없고 최악 케이스를 관리해야 한다.
193. 롱테일이 성능을 지배한다: 실환경 조건은 롱테일 분포다. 평균 조건에서의 99%보다, 드물지만 반드시 일어나는 꼬리 조건에서의 강건성이 상용화 여부를 가른다.
204. 디버깅이 불가능에 가깝다: 실물 실패는 재현이 어렵고 관측이 부분적이다. 따라서 '실패 후 고치기'가 아니라 학습 단계에서 격차를 미리 흡수하는 설계가 필요하다.
21격차의 수학적 얼굴
22- 시뮬레이터와 실물은 상태전이 분포가 다른 두 MDP다: p_{sim}(s'|s,a) \neq p_{real}(s'|s,a).
23- 두 환경에서의 기대 리턴 차이는 전이 분포의 거리로 상한이 잡힌다 (simulation lemma, Kearns & Singh, 2002).
33- 최초 제안은 시각 랜덤화 (Tobin et al., 2017), 동역학 랜덤화로의 확장은 (Peng et al., 2018)이다.
34- (b) 분포를 맞춘다 — 시스템 식별: 실물에서 소량의 궤적을 모아 p(\xi) 자체를 실물 쪽으로 당긴다 (SimOpt, Chebotar et al., 2019).
35- (c) 실행 중 적응한다 — 온라인 적응: 최근 관측 이력에서 잠재 파라미터를 추정해 정책을 즉시 보정한다 (RMA, Kumar et al., 2021).
36이 레슨의 범위 — 다른 개론 레슨과 무엇이 다른가
37- 이 레슨은 '피지컬 AI란 무엇인가'나 '물리 엔진은 어떻게 동작하는가'를 반복하지 않는다.
38- 대신 도메인 랜덤화의 수학적 정식화(랜덤화된 MDP, 강건/최악 케이스 목적함수, 왜 랜덤화가 암묵적 정규화로 작동하는가)와 최신 변형(자동 커리큘럼형 ADR, 적대적 랜덤화, 실물 데이터로 분포를 갱신하는 폐루프 방식)에 집중한다.
39- 실전 관점에서는 '무엇을 얼마나 랜덤화할 것인가'라는 범위 설계 문제가 핵심이며, 너무 좁으면 실물에서 깨지고 너무 넓으면 정책이 지나치게 보수적으로 수렴해 성능이 떨어진다는 트레이드오프를 정량적으로 다룬다 (Muratore et al., 2022, Robot Learning from Randomized Simulations 서베이).
40체크포인트
41- 시뮬레이션 성공률은 상한이 아니라 후보 자격일 뿐이다.
42- 격차의 비용은 에피소드 길이에 대해 제곱으로 커진다 → 짧은 태스크보다 장시간 조작·보행에서 훨씬 치명적이다.
43- 다음 블록에서는 이 격차를 '분포 이동' 문제로 정식화하고, 도메인 랜덤화가 그 이동을 어떻게 흡수하는지 수식으로 유도한다.