분산의 정의 알아보기

분산(variance)은 통계학과 확률론에서 데이터나 확률변수가 평균으로부터 얼마나 퍼져 있는지를 나타내는 지표입니다. 이는 데이터의 흩어짐 정도, 즉 변동성을 정량적으로 측정할 수 있는 핵심적인 개념입니다. 본 글에서는 분산의 정의, 수학적 표현, 계산 방법, 그리고 의미를 설명합니다.

1. 분산의 수학적 정의

확률변수 \( X \)의 분산은 기대값(평균) \( \mu = E[X] \)을 기준으로 한 제곱 편차의 기대값으로 정의됩니다:

\[ \text{Var}(X) = E[(X – \mu)^2] \]

이는 확률변수가 평균에서 얼마나 떨어져 있는지를 평균적으로 계산한 값입니다.

2. 분산의 공식 (전개 형태)

분산은 다음과 같이 전개된 형태로도 표현할 수 있습니다:

\[ \text{Var}(X) = E[X^2] – (E[X])^2 \]

이 공식은 계산에 유용하며, 특히 표본 데이터를 사용할 때 자주 활용됩니다.

3. 표본 데이터에서의 분산

표본 데이터 \( x_1, x_2, …, x_n \)이 주어졌을 때, 표본분산은 다음과 같이 계산됩니다:

\[ s^2 = \frac{1}{n – 1} \sum_{i=1}^n (x_i – \bar{x})^2 \]

여기서 \( \bar{x} \)는 표본 평균이며, 분모에 \( n – 1 \)을 사용하는 이유는 표본 평균을 기준으로 분산을 추정할 때 발생하는 편향을 보정하기 위해서입니다.

4. 분산의 단위와 의미

분산은 원래 데이터 단위의 제곱 단위를 갖습니다. 예를 들어, 키(cm)의 분산은 \( \text{cm}^2 \) 단위를 가지며, 이 때문에 직관성이 떨어질 수 있습니다. 이를 해결하기 위해 분산의 제곱근인 표준편차(standard deviation)를 사용하기도 합니다.

분산은 다음과 같은 특징을 가집니다:

  • 분산이 작을수록 데이터가 평균에 가까이 몰려 있음
  • 분산이 클수록 데이터가 평균에서 멀리 퍼져 있음

5. 분산의 성질

  • \( \text{Var}(aX + b) = a^2 \text{Var}(X) \): 선형변환에서의 성질
  • \( \text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) \) (독립일 때)

결론

정의
분산은 평균으로부터의 제곱 편차의 기대값으로, 데이터의 흩어짐 정도를 정량화합니다.

공식
\( E[(X – \mu)^2] = E[X^2] – (E[X])^2 \) 형태로 계산 효율을 높일 수 있습니다.

표본에서의 적용
\( n – 1 \)로 나누어 불편추정량으로 사용하며, 통계적 신뢰성을 확보합니다.

의미
데이터의 변동성을 수치로 표현하며, 표준편차와 함께 직관적 해석에 활용됩니다.

분산은 통계 분석과 확률 모델링에서 필수적인 요소로, 데이터의 신뢰성과 예측 가능성을 이해하는 데 있어 핵심적인 역할을 합니다.