본문 바로가기

끄적끄적

통계학 정복 - 1. 데이터의 이해

데이터의 이해

데이터 분석을 처음 시작하면 머신러닝이나 인공지능 모델부터 떠올리는 경우가 많다. 하지만 좋은 모델을 만드는 것보다 먼저 해야 할 일은 데이터를 제대로 이해하는 것이다. 데이터가 어떤 형태인지, 얼마나 퍼져 있는지, 특정 값이 전체를 왜곡하고 있지는 않은지 파악하지 못하면 아무리 복잡한 분석 기법을 사용해도 잘못된 결론에 도달할 수 있다.

이번 글에서는 데이터의 종류부터 도수분포표와 히스토그램, 대표값, 산포도, Boxplot, 왜도와 첨도까지 데이터 분석의 가장 기초가 되는 개념들을 살펴본다.


1. 글의 목적

데이터를 분석하기 전에 가장 먼저 해야 하는 일은 데이터를 이해하는 것이다. 같은 평균을 가진 데이터라도 분포가 다를 수 있고, 같은 개수의 데이터라도 종류에 따라 적용할 수 있는 분석 방법은 달라진다. 이번 글에서는 통계학에서 가장 먼저 배우는 핵심 개념들을 이해하고, 실제 제조업과 데이터 분석에서 어떻게 활용되는지 함께 살펴본다.


2. 왜 통계가 필요한가?

데이터는 단순한 숫자의 나열이 아니다. 수많은 관측값 속에는 일정한 패턴과 의미가 숨어 있으며, 통계는 이러한 패턴을 객관적인 수치로 표현하는 도구이다. 데이터를 통계적으로 분석하면 복잡한 현상도 비교하고 설명할 수 있으며, 감이나 경험이 아닌 근거를 기반으로 의사결정을 내릴 수 있다.

예를 들어 생산 현장에서 "요즘 B라인에서 불량이 많이 발생하는 것 같다."라는 의견이 나왔다고 가정해보자. 실제 데이터를 분석해보면 B라인 전체의 불량률은 다른 라인과 큰 차이가 없고 특정 시간대에만 일시적으로 증가했을 수도 있다. 또는 작업자의 문제가 아니라 설비 노후화나 원자재 품질이 원인일 수도 있다.

통계는 직관을 확인하는 과정이 아니라 데이터를 통해 사실을 검증하는 과정이다.

 


3. 통계는 실제 산업에서 어떻게 활용될까?

통계는 제조업, 반도체, 자동차, 화학공정 등 거의 모든 산업에서 활용된다. 데이터를 요약하는 것뿐 아니라 품질을 평가하고, 공정을 개선하며, 미래를 예측하는 데에도 사용된다.

분석 목적 활용 사례 통계 기법
현재 상태 파악 교대조별 생산량 비교 평균, 중앙값, 히스토그램
품질 안정성 확인 공정별 두께 편차 비교 표준편차, Boxplot
불량 원인 분석 공정 변경 전후 불량률 비교 t-검정
품질 예측 온도와 제품 품질의 관계 분석 회귀분석

 

최근에는 머신러닝과 인공지능 모델 역시 이러한 통계 개념을 기반으로 데이터를 학습한다. 결국 데이터를 잘 이해하는 것이 좋은 모델을 만드는 첫걸음이다.

4. 데이터의 종류

데이터는 크게 수치형 데이터범주형 데이터로 구분된다. 데이터를 어떤 종류로 분류하느냐에 따라 사용할 수 있는 통계 기법과 시각화 방법이 달라진다.

분류 설명 제조업 예시
이산형 셀 수 있는 데이터 불량품 개수, 가동 중단 횟수
연속형 측정되는 데이터 온도, 압력, 두께, 가공 시간
순서형 순서는 있지만 간격 의미는 없음 품질 등급, 위험 등급
명목형 단순한 분류 설비 ID, 부품 종류

 

예를 들어 웨이퍼의 두께는 연속형 데이터이며, 설비 번호는 명목형 데이터이다. 두 데이터는 모두 중요하지만 분석 방법은 서로 다르다.


5. 도수분포표와 히스토그램

데이터가 많아질수록 숫자만 나열해서는 특징을 파악하기 어렵다. 이때 사용하는 것이 도수분포표와 히스토그램이다.

도수는 특정 구간에 포함된 데이터의 개수이며, 상대도수는 전체에서 차지하는 비율이다. 누적도수는 이전 구간까지의 도수를 계속 더한 값을 의미한다.

도수분포표를 만들기 위해서는 데이터를 일정한 구간으로 나눈 뒤 각 구간의 데이터 개수를 계산한다. 이를 막대그래프로 표현한 것이 히스토그램이다.

히스토그램은 데이터가 어느 구간에 집중되어 있는지, 한쪽으로 치우쳐 있는지 등을 한눈에 확인할 수 있기 때문에 데이터 분석에서 가장 많이 사용하는 시각화 방법이다.


6. 대표값(평균, 중앙값, 최빈값)

대표값은 많은 데이터를 하나의 숫자로 요약하는 방법이다.

대표값 특징 적합한 상황
평균(Mean) 전체 평균 데이터가 고르게 분포할 때
중앙값(Median) 가운데 위치한 값 이상치가 존재할 때
최빈값(Mode) 가장 많이 등장한 값 범주형 데이터

 

평균은 가장 많이 사용하는 대표값이지만 이상치의 영향을 크게 받는다.

대표적인 사례가 미국 농구선수 마이클 조던이다. 지리학과 졸업생이었던 마이클 조던의 엄청난 연봉 때문에 해당 학과 졸업생들의 평균 초봉은 매우 높게 계산되었다. 하지만 대부분의 졸업생은 평균과 전혀 다른 연봉을 받고 있었다.

평균 하나만 보면 데이터를 오해할 수 있으므로 중앙값도 함께 확인하는 것이 중요하다.

우리나라에서 발표하는 중위소득 역시 평균이 아닌 중앙값을 사용하는 대표적인 사례이다.


7. 산포도와 Boxplot

평균이 같다고 해서 데이터의 특성이 같은 것은 아니다. 평균이 동일하더라도 데이터가 얼마나 퍼져 있는지는 완전히 다를 수 있다.

개념 설명
편차 평균에서 얼마나 떨어져 있는지
분산 편차를 제곱한 후 평균낸 값
표준편차 분산의 제곱근으로 실제 단위를 유지
변동계수(CV) 표준편차를 평균으로 나눈 값

 

표준편차가 작으면 데이터가 평균 주변에 모여 있고, 크면 데이터가 넓게 퍼져 있다는 의미이다.

Boxplot은 중앙값, 사분위수, 이상치를 하나의 그래프로 표현한다. 특히 IQR(사분위 범위)을 이용하여 이상치를 찾는 방법은 데이터 전처리에서 매우 자주 사용된다.

 


8. 왜도와 첨도

데이터를 이해하려면 평균과 표준편차뿐 아니라 분포의 모양도 확인해야 한다.

왜도(Skewness)는 데이터가 어느 방향으로 치우쳐 있는지를 나타낸다. 왜도가 0이면 좌우 대칭이며, 양수이면 오른쪽으로 긴 꼬리를, 음수이면 왼쪽으로 긴 꼬리를 가진다.

첨도(Kurtosis)는 분포가 얼마나 뾰족하거나 평평한지를 나타낸다. 첨도가 높으면 평균 주변에 데이터가 많이 모여 있고, 낮으면 전체적으로 넓게 퍼져 있는 형태를 가진다.


9. 정규분포

정규분포는 통계학에서 가장 중요한 분포이다. 평균을 중심으로 좌우가 대칭인 종(Bell) 모양을 가지며 자연현상, 제조공정, 시험 성적, 센서 데이터 등 다양한 데이터에서 자주 나타난다.

평균은 분포의 중심을 결정하고, 분산은 데이터가 얼마나 넓게 퍼져 있는지를 결정한다. 평균이 0이고 분산이 1인 경우를 표준정규분포라고 한다.

많은 통계 분석과 머신러닝 알고리즘은 데이터가 정규분포를 따른다는 가정을 기반으로 설계되어 있다.


10. 핵심 개념 정리

용어 정의 핵심 포인트
수치형 데이터 숫자로 표현되는 데이터 이산형과 연속형으로 구분
범주형 데이터 분류를 위한 데이터 명목형과 순서형으로 구분
히스토그램 분포를 시각화한 그래프 데이터의 형태를 파악
평균 전체 평균값 이상치의 영향을 크게 받음
중앙값 가운데 위치한 값 이상치에 강함
표준편차 데이터의 퍼짐 정도 변동성을 가장 많이 표현
Boxplot 분포와 이상치를 함께 표현 EDA에서 가장 많이 사용
왜도 분포의 치우침 좌우 비대칭 정도 확인
첨도 분포의 뾰족한 정도 분포 모양 비교
정규분포 좌우 대칭의 종 모양 분포 통계와 머신러닝의 기본 분포

이번 글 핵심 개념

  • 데이터의 종류에 따라 분석 방법이 달라진다.
    데이터는 수치형과 범주형으로 구분되며, 데이터의 특성을 올바르게 파악해야 적절한 통계 기법과 시각화 방법을 선택할 수 있다.
  • 평균만으로는 데이터를 설명할 수 없다.
    평균은 이상치의 영향을 크게 받을 수 있으므로 중앙값과 표준편차를 함께 확인해야 데이터의 중심과 변동성을 정확하게 이해할 수 있다.
  • 데이터의 분포를 이해하는 것이 분석의 시작이다.
    히스토그램과 Boxplot으로 데이터의 분포와 이상치를 확인하고, 왜도와 첨도를 함께 해석해야 신뢰할 수 있는 데이터 분석과 머신러닝 모델을 만들 수 있다.

12. 참고문헌

  • 손보미 튜터님 강의자료 
  • James, G., Witten, D., Hastie, T., Tibshirani, R. An Introduction to Statistical Learning.
  • Montgomery, D. C. Introduction to Statistical Quality Control.
  • NumPy Documentation
  • pandas Documentation