2What — 손실함수는 '채점표'다
3- 손실함수(loss function): 모델이 내놓은 답이 정답에서 얼마나 틀렸는지를 숫자 하나로 매기는 채점표.
4- 학습이란? 이 점수(=벌점)를 가장 작게 만드는 설정값을 찾아가는 과정. 벌점이 낮을수록 좋은 모델.
5- 자주 쓰는 두 가지
6 1. MSE(평균제곱오차, Mean Squared Error) — "정답과 예측의 차이를 제곱해서 평균"
7 2. CE(크로스엔트로피, Cross Entropy) — "정답 항목에 매긴 확률이 낮을수록 큰 벌점"
8L_{MSE} = (y - \hat{y})^2, \quad L_{CE} = -\log p(\text{정답})
9- 여기서 y는 실제 정답, \hat{y}는 모델의 예측값, p(\text{정답})은 모델이 정답에 부여한 확률이다.
10Why — 왜 하필 이 공식들일까? (핵심)
11- 교과서에서 "분류엔 CE, 회귀엔 MSE"라고 외우게 되지만, 이건 암기 사항이 아니라 결과물이다.
12- 한 문장 정리: 손실함수를 최소화하는 것 = 내가 관측한 데이터가 나올 확률을 가장 높게 만드는 답을 찾는 것.
13- 이 아이디어를 최대가능도추정(MLE, Maximum Likelihood Estimation)이라고 부른다. 피셔가 정리한 통계학의 고전 원리다 (Fisher, 1922).
14\theta_{MLE} = \arg\max_{\theta} \; p(\text{데이터} \mid \theta)
15- 비유: 범인을 찾는 형사. "이 증거들이 가장 자연스럽게 설명되는 시나리오"를 고르는 것. 모델 학습도 똑같다.
16- 그래서 어떤 확률 가정을 하느냐에 따라 손실함수의 얼굴이 바뀐다. 손실함수를 고르는 순간, 나는 이미 "데이터의 오차가 이렇게 생겼을 것"이라고 선언한 셈이다.
17How — 가정 → 손실함수 대응표
18- 정답이 '카테고리'일 때(고양이/개/새) → 각 항목에 확률을 나눠주는 가정(베르누이·카테고리 분포) → 나오는 벌점이 바로 크로스엔트로피.
19- 정답이 '연속된 숫자'이고 오차가 종 모양으로 퍼질 때(가우시안 가정) → 나오는 벌점이 MSE. 최소제곱법이 정규분포 가정에서 나온다는 사실은 200년 넘은 결과다 (Gauss, 1809).
20- 오차에 튀는 값(이상치)이 자주 섞일 때 → 종 모양 대신 꼬리가 두꺼운 가정(라플라스 분포) → MAE(절댓값 오차). 둘을 섞은 절충안이 Huber 손실이다 (Huber, 1964).
21- 현대 딥러닝 교재도 "오늘날 손실함수 대부분은 음의 로그가능도(negative log-likelihood)의 다른 표현일 뿐"이라고 정리한다 (Goodfellow, Bengio, Courville, 2016).
22MAP — 사전 지식까지 넣으면 '정규화'가 된다
23- MLE는 데이터만 본다. 여기에 "설정값이 지나치게 커지진 않을 것"이라는 사전 믿음을 더한 것이 MAP(최대사후확률, Maximum A Posteriori).
24\theta_{MAP} = \arg\max_{\theta} \; p(\text{데이터} \mid \theta) \, p(\theta)
25- p(\theta)가 사전 믿음. 이 한 항이 실무에서 흔히 쓰는 L2 정규화(weight decay)와 정확히 같은 역할을 한다 (Bishop, 2006).
26- 즉 "손실에 페널티 항을 하나 더 붙였다"는 것도 사실은 가정을 하나 더 선언한 것이다.
27실제 현장에서는
28- 이미지 분류기(사진이 고양이인지 개인지): 정답이 카테고리 → 크로스엔트로피.
29- 로봇 센서값 예측(팔 관절 각도, 거리 센서 값): 정답이 연속 숫자이고 잡음이 대체로 종 모양 → MSE.
30- 주가·수요 예측: 가끔 폭등·폭락 같은 튀는 값이 섞임 → MSE는 그 한 점에 끌려다님 → MAE나 Huber가 안전.
31한 줄 요약
32- 손실함수는 임의로 정한 공식이 아니라 "내 데이터의 오차가 어떻게 생겼다고 믿는가"의 번역본이다.
33- 그래서 성능이 이상할 때 물어야 할 질문은 "손실을 바꿔볼까?"가 아니라 "내 가정이 이 데이터에 맞나?"이다.