확률분포와 정규분포 기반 품질관리
데이터 분석편에서 평균과 표준편차를 이해했다면, 다음 단계는 데이터가 어떤 확률적 구조를 가지는지 이해하는 것이다. 제조업에서 측정되는 길이, 온도, 압력, 결함 수와 같은 데이터는 우연히 발생하는 값처럼 보이지만, 충분히 많이 관측하면 일정한 분포 형태를 보인다. 이번 글에서는 확률변수와 확률분포의 기본 개념을 정리하고, 정규분포를 기반으로 품질관리에서 자주 사용하는 Cp, Cpk, Z-score를 해석하는 방법까지 살펴본다.
📚 목차
1. 글의 목적
이 글의 목적은 확률분포를 단순한 수학 개념이 아니라 실제 데이터 분석과 품질관리에서 활용되는 도구로 이해하는 것이다. 특히 제조업에서는 제품의 치수, 무게, 온도, 압력처럼 연속적으로 측정되는 품질 특성이 많기 때문에 정규분포와 표준편차 기반 해석이 매우 중요하다. 또한 공정이 규격 안에서 안정적으로 운영되는지 판단하기 위해 Cp와 Cpk 같은 공정능력지수를 함께 이해해야 한다.
2. 확률변수
확률변수(Random Variable)는 어떤 시행의 결과를 숫자로 표현한 변수이다. 예를 들어 동전 2개를 던졌을 때 가능한 결과는 HH, HT, TH, TT이다. 이때 앞면이 나온 개수를 값으로 정하면 0, 1, 2라는 숫자로 결과를 표현할 수 있다. 즉, 확률변수는 불확실한 사건을 분석 가능한 숫자로 바꾸는 역할을 한다.
| 구분 | 설명 | 제조업 예시 |
|---|---|---|
| 이산형 확률변수 | 셀 수 있는 값을 가짐 | 하루 불량품 개수, 설비 고장 횟수 |
| 연속형 확률변수 | 연속적인 실수값을 가짐 | 제품 길이, 온도, 압력, 무게 |
제조업에서는 특정 공정에서 하루 동안 발생한 결함 수는 이산형 확률변수이고, 제품의 길이나 표면 거칠기처럼 측정 장비로 얻는 값은 연속형 확률변수이다. 이 구분은 이후 어떤 확률분포를 사용할지 결정하는 기준이 된다.

3. 확률분포
확률분포(Probability Distribution)는 확률변수가 어떤 값을 가질 가능성이 얼마나 되는지를 정리한 규칙이다. 이산형 데이터에서는 각 값이 나올 확률을 표로 정리할 수 있으며, 모든 확률의 합은 반드시 1이 되어야 한다.
| 결함 수 | 0개 | 1개 | 2개 | 3개 |
|---|---|---|---|---|
| 확률 | 0.2 | 0.3 | 0.4 | 0.1 |
위 표는 결함 수라는 확률변수가 가질 수 있는 값과 그 확률을 나타낸다. 예를 들어 결함이 2개 발생할 확률이 0.4라면, 같은 조건의 생산이 반복될 때 결함 2개가 가장 자주 나타날 가능성이 높다는 뜻이다.
확률분포는 데이터가 어떤 값 주변에 자주 나타나는지, 극단적인 값이 얼마나 드문지를 설명하는 도구이다.
4. PMF와 PDF
확률분포는 확률변수가 이산형인지 연속형인지에 따라 표현 방식이 달라진다. 이산형 확률변수에는 확률질량함수(PMF)를 사용하고, 연속형 확률변수에는 확률밀도함수(PDF)를 사용한다.
| 구분 | PMF | |
|---|---|---|
| 대상 | 이산형 확률변수 | 연속형 확률변수 |
| 확률 해석 | 특정 값이 나올 확률 | 특정 구간에 포함될 확률 |
| 예시 | 불량품 개수, 주사위 눈 | 길이, 무게, 온도 |
PMF에서는 결함 수가 정확히 2개일 확률처럼 특정 값의 확률을 직접 계산할 수 있다. 반면 PDF에서는 제품 길이가 정확히 100.0000mm일 확률은 수학적으로 0에 가깝다. 연속형 데이터는 가능한 값이 무한히 많기 때문이다.
따라서 연속형 데이터에서는 특정 값이 아니라 구간을 기준으로 확률을 해석한다. 예를 들어 제품 길이가 99mm에서 101mm 사이에 들어올 확률은 PDF 곡선 아래의 해당 구간 면적으로 계산한다. 이 면적이 바로 확률이며, 품질관리에서 말하는 불량률도 결국 규격 밖에 해당하는 면적을 의미한다.

5. 대표적인 확률분포
데이터의 특성에 따라 자주 사용되는 확률분포가 다르다. 제조업에서는 불량 여부, 결함 수, 제품 치수처럼 데이터 형태가 다양하기 때문에 상황에 맞는 분포를 선택해야 한다.
| 분포 | 설명 | 활용 예시 |
|---|---|---|
| 베르누이 분포 | 성공 또는 실패처럼 결과가 2개인 분포 | 제품 합격/불합격 |
| 이항분포 | n번 시행 중 성공 횟수의 분포 | 샘플 검사 중 불량품 개수 |
| 포아송분포 | 일정 시간이나 공간에서 발생하는 사건 수의 분포 | 시간당 설비 고장 수, 하루 결함 건수 |
| 정규분포 | 평균을 중심으로 좌우 대칭인 연속형 분포 | 제품 길이, 무게, 온도, 압력 |
예를 들어 검사한 제품 100개 중 불량품이 몇 개인지 알고 싶다면 이항분포가 적합하다. 하루 평균 2건의 결함이 발생하는 공정에서 특정 날짜의 결함 수를 분석하고 싶다면 포아송분포를 사용할 수 있다. 반면 제품 길이나 무게처럼 평균 주변에 값이 몰리는 연속형 품질 특성은 정규분포로 해석하는 경우가 많다.
6. 정규분포와 품질관리
정규분포(Normal Distribution)는 평균을 중심으로 좌우가 대칭인 종 모양의 분포이다. 정규분포는 평균 μ와 표준편차 σ로 정의된다. 평균은 분포의 중심을 결정하고, 표준편차는 데이터가 평균을 기준으로 얼마나 퍼져 있는지를 결정한다.
제조업에서 제품의 길이, 무게, 온도, 압력 같은 품질 특성은 보통 목표값 주변에서 작은 변동을 보인다. 이때 값들이 평균 주변에 많이 몰리고 극단적인 값은 드물게 나타난다면 정규분포를 가정해 품질을 관리할 수 있다.
| 범위 | 포함되는 데이터 비율 | 의미 |
|---|---|---|
| 평균 ± 1σ | 약 68.3% | 대부분의 일반적인 변동 |
| 평균 ± 2σ | 약 95.4% | 넓은 범위의 정상 변동 |
| 평균 ± 3σ | 약 99.7% | 관리 가능한 대부분의 데이터 |
이 특성을 68-95-99.7 법칙 또는 3시그마 법칙이라고 한다. 품질관리에서는 평균에서 멀리 떨어진 값일수록 이상 상황일 가능성이 높다고 판단한다.
식스시그마(Six Sigma)는 공정의 산포를 매우 작게 관리하여 거의 모든 제품이 규격 안에 들어오도록 하는 품질관리 방법이다. 일반적으로 매우 높은 품질 수준을 요구하는 제조 현장에서 사용되며, 불량률을 극도로 낮추는 것을 목표로 한다.

7. Cp와 Cpk
제조업에서는 제품이 고객이 요구한 규격 안에서 안정적으로 생산되는지가 중요하다. 이때 사용하는 대표적인 지표가 Cp와 Cpk이다.
Cp(Process Capability Index)는 공정의 산포가 규격 폭에 비해 얼마나 작은지를 나타낸다. 즉, 공정이 얼마나 정밀하게 생산되고 있는지를 보는 지표이다. Cp가 높을수록 데이터가 좁게 모여 있어 공정 변동이 작다는 의미이다.
하지만 Cp는 공정 평균이 규격 중심에 있는지는 고려하지 않는다. 공정의 산포가 작더라도 평균이 한쪽 규격에 가까우면 불량이 발생할 수 있다.
Cpk(Process Capability Performance)는 공정의 산포뿐 아니라 평균이 규격 중심에서 얼마나 치우쳐 있는지도 함께 고려한다. 따라서 실제 품질 수준을 판단할 때는 Cp보다 Cpk가 더 현실적인 지표가 된다.
| 상황 | 해석 |
|---|---|
| Cp 높음, Cpk 높음 | 산포가 작고 평균도 규격 중심에 가까운 안정 공정 |
| Cp 높음, Cpk 낮음 | 정밀하지만 평균이 한쪽으로 치우친 공정 |
| Cp 낮음 | 공정 변동이 커서 규격을 벗어날 위험이 큰 공정 |
| Cp ≈ Cpk | 공정 평균이 규격 중앙에 잘 위치한 상태 |
일반적으로 Cp 또는 Cpk가 1보다 작으면 불량 위험이 높은 공정으로 해석하고, 1.33 이상이면 비교적 안정적인 공정으로 본다. 2.0 이상은 매우 우수한 수준으로, 식스시그마 수준의 공정 능력에 가깝다고 볼 수 있다.
Cp는 공정의 퍼짐을 보고, Cpk는 퍼짐과 중심 위치를 함께 본다.
8. Z-score와 표준화
Z-score는 어떤 값이 평균으로부터 표준편차 몇 개만큼 떨어져 있는지를 나타내는 값이다. 예를 들어 Z-score가 2라면 해당 값은 평균보다 표준편차 2개만큼 큰 위치에 있다는 의미이다.
Z-score를 사용하면 단위가 다른 변수도 같은 기준으로 비교할 수 있다. 예를 들어 온도, 습도, 압력, 진동값은 단위가 모두 다르지만, 각각을 Z-score로 변환하면 평균 0, 표준편차 1의 동일한 스케일에서 비교할 수 있다.
| 구분 | 정규화 | 표준화 |
|---|---|---|
| 변환 기준 | 최솟값과 최댓값 | 평균과 표준편차 |
| 결과 범위 | 보통 0~1 | 평균 0, 표준편차 1 |
| 특징 | 범위를 맞추는 데 유리 | 통계적 해석에 유리 |
| 주의점 | 이상치에 민감 | 정규분포 기반 해석에 적합 |
정규화는 센서 데이터를 0~1 범위로 압축해 대시보드에 표시할 때 유용하다. 반면 표준화는 여러 품질 지표를 하나의 머신러닝 모델에 입력하거나 다변량 공정관리를 수행할 때 자주 사용된다.
9. 이상치 탐지
이상치(Outlier)는 전체 데이터의 일반적인 패턴에서 크게 벗어난 값이다. 이상치는 평균과 표준편차를 왜곡하고, 모델 학습 결과에도 큰 영향을 줄 수 있기 때문에 데이터 분석 전에 반드시 확인해야 한다.
대표적인 이상치 탐지 방법은 IQR 방식과 Z-score 방식이다. IQR 방식은 사분위 범위를 기준으로 너무 작거나 큰 값을 찾는 방법이며, Z-score 방식은 평균에서 표준편차 기준으로 얼마나 멀리 떨어져 있는지를 확인하는 방법이다.
| 방법 | 기준 | 활용 상황 |
|---|---|---|
| IQR 방식 | Q1 - 1.5×IQR 미만 또는 Q3 + 1.5×IQR 초과 | 분포 형태가 정규분포가 아닐 때도 활용 가능 |
| Z-score 방식 | |Z| > 3 | 정규분포를 가정할 수 있을 때 유용 |
제조 현장에서 온도나 압력 값이 갑자기 크게 벗어난다면 단순한 데이터 오류일 수도 있지만, 설비 이상이나 공정 조건 변화의 신호일 수도 있다. 따라서 이상치 탐지는 데이터 전처리뿐 아니라 예지보전과 품질 모니터링에서도 중요한 역할을 한다.
10. 핵심 개념 정리
| 용어 | 정의 | 핵심 포인트 |
|---|---|---|
| 확률변수 | 시행 결과를 숫자로 표현한 변수 | 이산형과 연속형으로 구분 |
| 확률분포 | 확률변수가 가질 값과 확률의 규칙 | 모든 확률의 합은 1 |
| PMF | 이산형 확률변수의 확률 함수 | 특정 값의 확률을 계산 |
| 연속형 확률변수의 밀도 함수 | 구간의 면적이 확률 | |
| 정규분포 | 평균 중심의 좌우 대칭 분포 | 품질관리의 기본 가정 |
| Cp | 공정 산포가 규격 대비 얼마나 작은지 나타내는 지표 | 공정의 정밀도 확인 |
| Cpk | 공정 산포와 평균 치우침을 함께 반영한 지표 | 실제 품질 수준 판단에 유용 |
| Z-score | 평균으로부터 표준편차 몇 개만큼 떨어져 있는지 나타내는 값 | 이상치 탐지와 표준화에 활용 |
| 정규화 | 데이터 범위를 0~1 등 일정 범위로 변환 | 대시보드나 거리 기반 모델에 활용 |
| 표준화 | 평균 0, 표준편차 1로 변환 | 통계 기반 분석과 머신러닝에 활용 |
11. 이번 글 핵심 개념
- 확률분포는 데이터의 발생 패턴을 설명하는 기본 도구이다.
확률변수는 불확실한 결과를 수치로 표현한 것이며, 확률분포는 각 값이 나타날 가능성을 나타낸다. 이산형 데이터는 PMF, 연속형 데이터는 PDF를 이용해 해석한다. - 정규분포는 제조업 품질관리의 핵심 기준이다.
평균과 표준편차를 이용해 데이터의 정상 범위를 해석할 수 있으며, 68-95-99.7 법칙과 식스시그마 역시 정규분포를 기반으로 품질 수준을 평가한다. - Cp, Cpk, Z-score는 공정의 품질을 평가하는 대표적인 지표이다.
Cp와 Cpk는 공정의 안정성과 중심 위치를 평가하고, Z-score는 이상치 탐지와 데이터 표준화, 머신러닝 전처리 과정에서 중요한 역할을 한다.
12. 참고문헌
- 손보미 튜터님 강의자료
- Montgomery, D. C. Introduction to Statistical Quality Control.
- James, G., Witten, D., Hastie, T., Tibshirani, R. An Introduction to Statistical Learning.
- Devore, J. L. Probability and Statistics for Engineering and the Sciences.
- NumPy Documentation
- SciPy Documentation
'끄적끄적' 카테고리의 다른 글
| Tebleau 마스터_1 (기초 시각화) (1) | 2026.07.15 |
|---|---|
| 평가지표 정리 (0) | 2026.07.08 |
| Pipeline.. 너 뭐세요? (0) | 2026.07.07 |
| 반도체 스터디 2회차 내용 정리 (0) | 2026.07.02 |
| 통계학 정복 - 1. 데이터의 이해 (0) | 2026.07.01 |