엑셀의 표준편차 함수를 이용한 데이터 해석 및 의사결정

엑셀의 표준편차 함수를 이용한 데이터 해석 및 의사결정

1. 표준편차

업무에서 엑셀을 사용하여 각종 자료들을 처리하는 과정에서, 통상 중간 수준의 값을 알기 위해, 평균(average)을 계산하거나, 데이터들의 간격이 어느 한쪽으로 편재되어 있는 경우에는 평균 대신 중간값(Median) 을 계산하게 된다. 다만, 데이터의 수가 충분히 크거나(>30) 하는 경우에는 median과 average가 거의 수렴하기도 한다.

그런데, 이러한 평균값은 데이터들의 가장 중간 부분의 대표적인 값이 얼마인가를 나타내주기는 하지만, 데이터 집단에서, 각각의 데이터들이 얼마나 크게 퍼져 있는지를 나타내주지는 못한다.

다음과 같이 평균은 같은 50이라 하더라도, 각각의 데이터가 분포되어 있는 형태는 아주 달라서, 각 데이터 그룹의 의미와, 이러한 데이터에 대응하는 것이 달라야 하기 때문이다. 결과적으로 나는 데이터들의 중간값이 얼마이고, 대략 어느 정도 범위로 중간값으로부터 나머지 데이터들이 위치하는지를 알고 싶은데, 평균(average)나 중간값(median)만으로는 이를 알 수 없는 것이다.

평균이 모두 50인 서로 다른 데이터 그룹의 예

이러한 경우에, 적용할 수 있는 개념이 다음과 같은 수식으로 정의되는 표준편차(standard deviation)이다. 통계학에서는 표준편차를 다음과 같이 시그마로 표기한다. 참고로 표준편차를 계산하는 수식은 다소 복잡한데, 이를 외울 필요는 없다. 엑셀에서 간단한 계산 방법을 제공하기 때문이다. (자세한 수식과 손으로 하는 계산을 위해서는 통계학 교과서를 참조하기 바란다.)

2. 68-95-99.7 법칙

정말 기억해야 할 것은 통계학에서 “68-95-99.7의 법칙”이라고 알려진 경험법칙인데,

즉, 정규분포를 따르는 데이터들의 집단에서 경험적으로 데이터들이 다음과 같이 분포한다는 법칙이다.

* 평균치로부터 표준편차를 더하거나 뺀 구간에 전체 데이터들의 68%가 포함되며,

* 평균치로부터 표준편차의 2배를 더하거나 뺀 구간에 전체 데이터들의 95%가 포함되며,

* 평균치로부터 표준편차의 3배를 더하거나 뺀 구간에 전체 데이터들의 99.7%가 포함된다

참고로, 많이 들어보았을 식스시그마라는 품질관리 개념도, 이의 확장판으로서, 평균에서 표준편차의 6배까지에 해당하는 제품군들이 품질관리 범위에 들어오도록, 제품 품질을 균일하게 관리하자는 개념이다. 참고로 표준편차의 6배(식스 시그마)를 벗어나는 부분은 약 3 ppm 정도이다. 즉 품질관리를 강화해서 정해진 품질관리 범위로 전체 생산품 중의 3ppm(백만 개중 약 3개)만 제외한 모든 제품이 품질 수준을 충족하게 하자는 개념인 것이다.

그만큼 표준편차는 데이터 그룹의 의미를 해석하는 데 있어서 중요한 의미를 가지며, 데이터를 기반으로 하는 의사결정에서 고려할 중요 요소이다.

3. 모집단 표준편차 vs. 표본 표준편차

그런데 여기서 참고로 알고 가야 할 지식이 있다.

위에서 표준편차의 정의를 설명하면서, 정규분포를 따르는 조사대상 그룹 전체에 대해 표준편차를 계산하는 것을 모집단 표준편차(population standard deviation)이라 하고, 다음과 같은 수식으로 계산한다.

그러나, 만일 전체 데이터의 수가 10-20개 정도라면 이들 데이터 모두를 일일이 조사하는 것이 문제가 없는 경우가 많으나, 조사대상 전체에 대하여 데이터를 얻을 수 없는 경우들도 있다. 예를 들면 다음과 같은 경우들이다.

* 조사대상이 너무나 숫자가 많은 경우

* 파괴성 품질 검사처럼 조사 비용이나 조사 대가가 너무 커서 전체를 조사할 수 없는 경우

이런 경우에는 전체를 대상으로 데이터를 얻을 수 없고, 일부 Sample 을 대상으로 데이터를 조사하고 전체 그룹이라면 어떠했을지를 추정하게 된다. 이처럼 일부 표본을 대상으로 하는 표준편차를 표본표준편차(sample standard deviation)이라고 한다. 수식 내 나누어주는 값이 n-1로 모집단 표준편차 계산과 약간 차이가 있다.

4. 엑셀의 표준편차 함수

엑셀에서는 다음과 같이 표준편차 함수들을 제공한다.

1) 표본 표준편차 계산 : STDEV 또는 STDEV.S

* 현재 두 개 모두 사용 – 과거 STDEV로 제공되던 것을 새로운 이름인 STDEV.S로 변경 중

* 내부적인 수식 계산에서 “n-1″을 수식에 이용

2) 모 표준편차 계산 : STDEVP 또는 STDEVP

* 현재 두 개 모두 사용 – 과거 STDEVP로 제공되던 것을 새로운 이름인 STDEV.P로 변경 중임

* 내부적인 수식 계산에서 “n”을 수식에 이용

5. 계산 사례

유리컵을 생산하는 공장에서 다음과 같이 강도에 대한 품질검사를 하는 경우에,

번호

1

2

3

4

5

6

7

8

9

10

강도

1345

1301

1368

1322

1310

1370

1318

1350

1303

1299

1) 만일 수많은 생산품 중에 단지 10개를 임의로 선택해 검사한 것이라면

—> 표본 표준편차 계산 : STDEV 또는 STDEV.S로 계산

* 계산식은 =stddev.s(데이터 범위)

* 계산 결과 : 27.46

2) 만일 이 공장에서는 단지 10개만을 생산한 것이고, 이 전체를 검사한 것이라면

–> 모 표준편차 계산 : STDEVP 또는 STDEVP

* 계산식은 =stddev.p(데이터 범위)

* 계산 결과 : 26.05