[CAST 통계 스터디] 1강. 통계의 기본 개념과 시뮬레이션에서 왜 필요한가
1. 학습 목적
CAST Express를 이용한 여객 예측관리 시뮬레이션에서는 단순히 “평균값”만 사용하는 것이 아니라, 실제 공항에서 발생하는 여객의 다양한 행동과 처리시간을 확률과 분포로 표현해야 한다.
이번 1강에서는 통계의 가장 기본적인 개념을 이해하고, 이것이 CAST 시뮬레이션에서 왜 필요한지를 정리한다.
CAST 모형설계서에서는 실제 공항 데이터를 바탕으로 가상 여객을 생성하고, 서비스 시간과 여객 분포를 반영한 뒤 반복 시뮬레이션을 수행하여 대기시간과 혼잡도를 분석하도록 구성되어 있다. :chatgpt-content-reference{index="1"} :chatgpt-content-reference{index="2"}
2. 통계란 무엇인가
통계는 쉽게 말하면:
많은 데이터를 보고 전체적인 특징과 불확실성을 이해하는 방법
이다.
예를 들어 승객 한 명의 보안검색 시간이 42초라는 사실보다 중요한 것은 다음과 같은 질문이다.
- 보안검색은 평균적으로 몇 초가 걸리는가?
- 대부분의 승객은 어느 정도 시간 안에 처리되는가?
- 아주 오래 걸리는 승객은 얼마나 존재하는가?
- 오전과 오후의 처리시간 차이가 있는가?
- 특정 시간대에 혼잡이 얼마나 발생할 가능성이 있는가?
즉 통계는 단순히 숫자를 계산하는 것이 아니라, 데이터 속에서 패턴을 찾고 미래 상황을 예측하기 위한 기초 도구라고 볼 수 있다.
3. 평균값만 보면 안 되는 이유
체크인 처리시간이 다음과 같다고 가정한다.
60, 90, 120, 150, 180초
평균은:
(60 + 90 + 120 + 150 + 180) ÷ 5 = 120초
이다.
하지만 실제 승객이 모두 120초에 처리되는 것은 아니다.
어떤 승객은 60초 만에 끝나고, 어떤 승객은 180초가 걸린다.
즉 평균값 하나만으로는 실제 상황을 충분히 설명할 수 없다.
CAST 시뮬레이션에서는 이런 차이를 표현하기 위해 **분포(Distribution)**라는 개념이 중요하다.
4. 평균 Mean
평균은 가장 기본적인 대표값이다.
예:
60, 90, 120, 150, 180
평균:
120
평균은 전체적인 수준을 빠르게 파악하는 데 좋다.
CAST에서 예를 들면:
- 평균 Check-in Service Time
- 평균 Waiting Time
- 평균 Walking Speed
- 평균 Queue Length
등에 활용할 수 있다.
하지만 평균에는 약점이 있다.
예를 들어:
60, 70, 80, 90, 600
의 평균은:
180초
이다.
하지만 5명 중 4명은 60~90초에 처리되었다.
600초짜리 한 건 때문에 평균이 크게 올라갔다.
이런 경우 평균만 보면 실제 상황을 잘못 이해할 수 있다.
5. 중앙값 Median
중앙값은 데이터를 순서대로 정렬했을 때 가운데에 위치하는 값이다.
예:
60, 70, 80, 90, 600
중앙값은:
80초
이다.
위 데이터의 경우:
- 평균: 180초
- 중앙값: 80초
으로 큰 차이가 발생한다.
이 차이를 통해:
일부 매우 큰 값이 평균을 끌어올리고 있다
는 사실을 알 수 있다.
공항 데이터에서는 특수수하물, 추가검색, 서류 확인 등의 이유로 이런 현상이 자주 발생할 수 있다.
6. 최빈값 Mode
최빈값은 가장 자주 나타나는 값이다.
예:
60, 60, 70, 80, 90
최빈값은:
60초
이다.
실제 연속형 데이터에서는 특정 값 하나보다 구간으로 보는 경우가 많다.
예:
| 처리시간 | 승객 수 |
|---|---|
| 0~60초 | 120명 |
| 61~120초 | 430명 |
| 121~180초 | 250명 |
| 181초 이상 | 80명 |
이 경우 가장 많이 나타나는 구간은:
61~120초
이다.
7. 분포 Distribution
분포는 데이터가 전체적으로 어떻게 퍼져 있는지를 나타낸다.
예를 들어 평균이 같은 두 보안검색대가 있다고 가정한다.
A 검색대
95, 100, 100, 100, 105
평균:
100초
B 검색대
20, 50, 100, 150, 180
평균:
100초
두 검색대의 평균은 동일하다.
하지만 A는 매우 안정적이고, B는 승객마다 처리시간 차이가 크다.
즉 평균은 같아도 분포는 완전히 다르다.
시뮬레이션에서는 이 차이가 대기열과 혼잡도에 큰 영향을 준다.
8. 산포 Dispersion
산포는 데이터가 평균을 중심으로 얼마나 퍼져 있는지를 나타낸다.
대표적인 지표는:
- 분산 Variance
- 표준편차 Standard Deviation
이다.
특히 표준편차는 CAST 시뮬레이션에서 매우 중요하다.
예:
경우 A
평균 Service Time = 60초
표준편차 = 5초
대부분:
55~65초
근처에 몰릴 가능성이 높다.
경우 B
평균 Service Time = 60초
표준편차 = 40초
처리시간이:
20, 35, 70, 110, 150초
처럼 크게 달라질 수 있다.
평균은 같아도 B의 경우 긴 처리시간 승객이 연속적으로 발생하면서 Queue가 급격히 증가할 수 있다.
9. 확률 Probability
확률은:
특정 일이 발생할 가능성
을 의미한다.
예를 들어 실제 데이터를 분석한 결과:
- 일반 체크인: 60%
- Self Check-in: 40%
라면 새로운 가상 승객을 생성할 때 이 비율을 반영할 수 있다.
모형설계서에서도 여객 분포 비율의 예로 셀프 체크인 40%, 카운터 60%를 제시하고 있다. :chatgpt-content-reference{index="3"}
가상 승객 10,000명을 생성하면 대략:
- 일반 체크인 약 6,000명
- Self Check-in 약 4,000명
이 생성된다.
다만 난수를 사용하는 시뮬레이션에서는 매번 정확히 같은 숫자가 나오지는 않는다.
예:
1회차6,032 / 3,968
2회차5,981 / 4,019
3회차6,061 / 3,939
처럼 조금씩 달라질 수 있다.
10. 왜 시뮬레이션을 여러 번 반복하는가
CAST 시뮬레이션은 한 번만 실행해서 결과를 판단하면 안 된다.
같은 조건에서도 확률적 요소 때문에 결과가 조금씩 달라질 수 있기 때문이다.
예를 들어 10회 실행한 보안검색 평균 대기시간이:
7.8, 8.2, 9.1, 7.5, 8.4, 8.0, 8.7, 7.9, 9.0, 8.1분
이라고 가정한다.
이때 중요한 것은:
특정 한 번의 결과가 9.1분이었다
가 아니라,
평균적으로 약 8분대이며, 조건에 따라 7~9분 정도의 변동이 발생한다
고 보는 것이다.
모형설계서에서도 시뮬레이션을 수십~수백 번 반복 수행하여 평균 대기시간과 최악의 혼잡 상황을 도출하도록 되어 있다. :chatgpt-content-reference{index="4"}
11. 이상치 Outlier
이상치는 일반적인 데이터 패턴에서 크게 벗어난 값이다.
예:
60, 70, 80, 90, 600
에서 600은 이상치로 의심할 수 있다.
하지만 이상치는 무조건 삭제하면 안 된다.
왜냐하면 600초가:
- 데이터 오류일 수도 있고
- 실제 추가검색
- 서류 문제
- 특수수하물
때문에 발생한 정상적인 희귀 사례일 수도 있기 때문이다.
따라서 실무에서는:
이상치 발견 → 원인 확인 → 오류인지 실제 희귀 상황인지 판단
의 절차가 필요하다.
12. CAST 시뮬레이션과 통계의 관계
통계와 CAST의 관계를 단순화하면 다음과 같다.
실제 데이터
예:
45초, 51초, 58초, 72초, 110초...
↓
통계 분석
- 평균
- 중앙값
- 표준편차
- 분포
- 이상치
↓
CAST 입력 파라미터
예:
Security Service Time = 특정 확률분포
↓
가상 여객 생성
Passenger 1 → 52초
Passenger 2 → 81초
Passenger 3 → 47초
Passenger 4 → 119초
↓
반복 시뮬레이션
↓
결과 분석
- 평균 대기시간
- 최대 대기시간
- Queue Length
- Peak Time
↓
실제 공항 데이터와 비교
↓
Calibration
설계서에서도 시뮬레이션 결과를 실제 공항 통계와 비교하고, 차이가 있으면 도착분포나 처리속도를 보정하도록 되어 있다. :chatgpt-content-reference{index="5"}
13. 이번 강의 핵심 용어
| 용어 | 의미 |
|---|---|
| 평균 Mean | 전체 데이터의 대표적인 수준 |
| 중앙값 Median | 정렬했을 때 가운데 값 |
| 최빈값 Mode | 가장 자주 나타나는 값 |
| 분포 Distribution | 값들이 전체적으로 어떻게 퍼져 있는가 |
| 분산 Variance | 데이터의 퍼짐 정도 |
| 표준편차 Standard Deviation | 평균 주변에서 얼마나 흔들리는지 |
| 확률 Probability | 특정 일이 발생할 가능성 |
| 이상치 Outlier | 일반적인 패턴에서 크게 벗어난 값 |
| 반복 시뮬레이션 | 우연한 한 번의 결과가 아닌 전체적인 결과 범위를 보기 위한 수행 |
14. 핵심 정리
이번 강의에서 가장 중요한 내용은 다음 세 가지다.
첫째,
평균값 하나만으로 현실을 설명할 수 없다.
둘째,
시뮬레이션에서는 데이터의 분포와 변동성이 중요하다.
셋째,
CAST 결과는 한 번의 실행값이 아니라 반복 실행을 통해 평균과 범위를 해석해야 한다.
결국 통계는 CAST를 사용하기 위한 별도의 이론이 아니라,
현실의 공항 데이터를 CAST가 이해할 수 있는 형태로 바꾸고, CAST의 결과가 현실과 얼마나 비슷한지를 검증하기 위한 언어
라고 이해하면 된다.
다음 학습
2강: 확률분포
다음 내용에서는 다음 개념을 학습한다.
- 정규분포 Normal Distribution
- 로그정규분포 Log-normal Distribution
- 감마분포 Gamma Distribution
- Beta Distribution
- Bimodal Distribution
- Percentile
- 실제 데이터에 어떤 분포를 적용할 것인지 판단하는 방법
특히 체크인, 보안검색, 출국심사 등 Service Time을 왜 단일 평균값이 아니라 확률분포로 표현해야 하는지를 중심으로 학습한다.