통계는 데이터를 수집, 분석, 해석하는 학문으로, 평균, 분산, 표준편차부터 표본, 신뢰구간, 정규분포까지 다양한 수학적 공식들이 사용됩니다. 이번 글에서는 통계 관련 공식들을 개념별로 정리하여 쉽게 활용할 수 있도록 구성했습니다.
1. 평균 (Mean)
데이터 \( x_1, x_2, \ldots, x_n \)의 산술평균: \[ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i \]
2. 중앙값과 최빈값
- 중앙값 (Median): 데이터를 크기순으로 정렬했을 때 중앙에 위치한 값
- 최빈값 (Mode): 가장 많이 나타나는 값
3. 분산 (Variance)과 표준편차 (Standard Deviation)
- 모집단 분산: \( \sigma^2 = \frac{1}{N} \sum_{i=1}^{N} (x_i – \mu)^2 \)
- 표본 분산: \( s^2 = \frac{1}{n – 1} \sum_{i=1}^{n} (x_i – \bar{x})^2 \)
- 표준편차: \( \sigma = \sqrt{\sigma^2}, \quad s = \sqrt{s^2} \)
4. 범위와 사분위수
- 범위 (Range): 최대값 – 최소값
- IQR (사분위 범위): \( Q_3 – Q_1 \)
5. z-점수 (표준화)
\[ z = \frac{x – \mu}{\sigma} \] → 데이터가 평균에서 얼마나 떨어져 있는지를 나타냄
6. 표본 평균의 분포
표본 평균 \( \bar{x} \)의 표준편차 (표준오차): \[ \text{SE} = \frac{\sigma}{\sqrt{n}} \]
표본 수가 충분히 크면 중심극한정리에 따라 정규분포를 따른다고 간주함.
7. 신뢰구간 (Confidence Interval)
신뢰수준 95%일 때: \[ \bar{x} \pm z^* \cdot \frac{\sigma}{\sqrt{n}} \] (\( z^* \)는 신뢰수준에 따른 임계값, 예: 95% → 1.96)
8. 정규분포 (Normal Distribution)
정규분포의 확률밀도함수: \[ f(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x – \mu)^2}{2\sigma^2}} \]
평균 \( \mu \), 표준편차 \( \sigma \)를 가지며 종 모양의 대칭 분포
9. 상관계수 (Correlation Coefficient)
두 변수 X, Y 사이의 선형 상관관계 측정: \[ r = \frac{\sum (x_i – \bar{x})(y_i – \bar{y})}{\sqrt{\sum (x_i – \bar{x})^2 \sum (y_i – \bar{y})^2}} \]
-1 ≤ r ≤ 1 범위이며, r이 1 또는 -1에 가까울수록 강한 선형 관계
결론
통계 공식 핵심 요약:
- 평균: \( \bar{x} = \frac{\sum x_i}{n} \)
- 분산: \( \sigma^2, \; s^2 \), 표준편차: \( \sigma, s \)
- z-점수: \( z = \frac{x – \mu}{\sigma} \)
- 표본 평균의 표준오차: \( \frac{\sigma}{\sqrt{n}} \)
- 신뢰구간: \( \bar{x} \pm z^* \cdot \frac{\sigma}{\sqrt{n}} \)
- 정규분포 함수와 상관계수 공식
통계의 기본 개념과 공식을 이해하면 데이터 분석 능력이 향상되며, 과학적 의사결정에도 유용하게 활용할 수 있습니다.