기댓값과 손실함수 계산하는 실제 예시와 수식

기댓값(Expected Value)과 손실함수(Loss Function)는 머신러닝 모델의 예측 성능을 정량화하고 최적화하는 데 사용되는 핵심 개념입니다. 기댓값은 확률분포 하에서의 평균적인 예측치를 의미하며, 손실함수는 예측값과 실제값 간의 차이를 정량화한 함수입니다.

기댓값의 정의 및 수식

확률변수 \(X\)의 기댓값은 다음과 같이 정의됩니다:

\[ \mathbb{E}[X] = \int_{-\infty}^{\infty} x \cdot f_X(x)\, dx \]

또는 이산 확률의 경우:

\[ \mathbb{E}[X] = \sum_{i=1}^{n} x_i \cdot P(x_i) \]

예시: 주사위 눈의 기댓값

공정한 6면체 주사위를 던질 때 기댓값은:

\[ \mathbb{E}[X] = \sum_{i=1}^{6} i \cdot \frac{1}{6} = \frac{1+2+3+4+5+6}{6} = 3.5 \]

손실함수의 정의 및 수식

1. 평균 제곱 오차 (Mean Squared Error, MSE)

가장 널리 쓰이는 회귀용 손실 함수입니다.

\[ \text{MSE} = \frac{1}{n} \sum_{i=1}^n (y_i – \hat{y}_i)^2 \]

예시:

실제값: \( y = [3, 5, 2] \), 예측값: \( \hat{y} = [2.5, 5.5, 2] \)

\[ \text{MSE} = \frac{1}{3} \left((3 – 2.5)^2 + (5 – 5.5)^2 + (2 – 2)^2\right) = \frac{1}{3}(0.25 + 0.25 + 0) = 0.167 \]

2. 평균 절댓값 오차 (Mean Absolute Error, MAE)

\[ \text{MAE} = \frac{1}{n} \sum_{i=1}^n |y_i – \hat{y}_i| \]

3. 크로스 엔트로피 손실 (Cross-Entropy Loss)

이진 분류에서 사용되는 손실 함수입니다:

\[ L = -\frac{1}{n} \sum_{i=1}^{n} \left[ y_i \log(\hat{y}_i) + (1 – y_i)\log(1 – \hat{y}_i) \right] \]

예시:

실제값: \( y = 1 \), 예측값: \( \hat{y} = 0.9 \)

\[ L = -[1 \cdot \log(0.9) + 0 \cdot \log(0.1)] = -\log(0.9) \approx 0.105 \]

결론

기댓값은 불확실성 아래 평균적인 결과를 추정하는 데 쓰이고, 손실함수는 예측의 정확도를 수치화하여 경사하강법 등 최적화 기법으로 활용됩니다. MSE, MAE, Cross-Entropy 등 다양한 손실 함수는 문제 유형에 따라 선택되며, 실제 데이터를 기반으로 계산되어 모델의 학습 방향을 결정합니다.