7 days ago
#8 [CAST 통계 스터디] 6강. 시계열과 예측 이해하기
7 days ago
Tasks

[CAST 통계 스터디] 6강. 시계열과 예측 이해하기

1. 학습 목적

공항 운영 데이터는 단순한 숫자 집합이 아니라 시간 순서에 따라 변화하는 데이터가 많다.

예를 들어 다음과 같은 값들은 모두 시간의 흐름에 따라 의미가 달라진다.

  • 시간대별 Passenger Count
  • Queue Length
  • Waiting Time
  • 항공편 출도착 수
  • Check-in Passenger Show-up
  • Security Entry Count
  • Service Time 변화

CAST 모형설계서에서도 Time-Series & Continuous Data Processing, Reporting Time & Back-calculation, Service Time Delta Analysis를 별도 처리 항목으로 두고 있으며, 시뮬레이션 결과도 10분 간격의 Interval 데이터로 관리하도록 구성되어 있다. :chatgpt-content-reference{index="1"} :chatgpt-content-reference{index="2"}

이번 강의에서는 다음을 이해하는 것이 목적이다.

  • 시계열 데이터란 무엇인가
  • Trend와 Seasonality는 무엇인가
  • Lag와 자기상관은 왜 중요한가
  • Moving Average와 Rolling Window는 어떻게 사용하는가
  • Reporting Time과 시계열 분석은 어떻게 연결되는가
  • Forecasting과 Simulation은 어떻게 다른가
  • CAST 예측관리에서 두 개념을 어떻게 함께 사용할 것인가

2. 시계열 Time Series이란

시계열은:

시간 순서대로 관측된 데이터

를 의미한다.

예를 들어 보안검색 대기시간이 다음과 같다고 가정한다.

시간대기시간
07:003분
07:104분
07:205분
07:308분
07:4012분
07:5015분

이 데이터에서는 단순히:

3, 4, 5, 8, 12, 15

라는 숫자보다:

언제 그 값이 발생했는가

가 더 중요하다.

시간 순서를 섞으면 데이터의 의미가 크게 달라질 수 있다.


3. 일반 데이터와 시계열 데이터의 차이

일반 데이터에서는 값들의 크기나 분포 자체가 중요하다.

예:

3, 5, 8, 12, 15

하지만 시계열에서는:

  • 07:00 → 3분
  • 07:10 → 5분
  • 07:20 → 8분
  • 07:30 → 12분
  • 07:40 → 15분

처럼 시간 순서와 변화 방향이 중요하다.

즉:

시계열에서는 값뿐 아니라 시간도 하나의 중요한 변수이다.


4. Trend 추세

Trend는:

장기간에 걸쳐 데이터가 증가하거나 감소하는 방향

이다.

예를 들어 월별 여객 수가 다음과 같다고 한다.

월여객 수
1월580만
2월590만
3월610만
4월630만
5월650만

전체적으로 증가하고 있다.

이런 흐름을 상승 Trend라고 볼 수 있다.

공항에서는 다음과 같은 장기 추세를 분석할 수 있다.

  • 연도별 여객 증가
  • 국제선 수요 증가
  • 특정 터미널 이용 비중 변화
  • 자동화 시설 이용률 증가

5. Seasonality 계절성

Seasonality는:

일정한 주기로 반복되는 패턴

을 의미한다.

이름 때문에 계절만 생각하기 쉽지만, 시계열 분석에서 계절성은 훨씬 넓은 의미로 사용한다.

예:

  • 여름휴가철 여객 증가
  • 명절 여객 증가
  • 주말 국제선 수요 증가
  • 월요일 오전 특정 패턴
  • 매일 07~09시 출발편 집중

즉:

  • 시간 단위
  • 일 단위
  • 주 단위
  • 월 단위
  • 계절 단위

의 반복 패턴이 모두 Seasonality가 될 수 있다.


6. 공항에서는 시간대 패턴이 중요하다

하루 전체 여객 수만 보면 실제 혼잡을 제대로 이해하기 어렵다.

예를 들어 하루 보안검색 이용객이 24,000명이라고 한다.

단순 평균은:

24,000 / 24 = 시간당 1,000명

이다.

하지만 실제로는 다음과 같을 수 있다.

시간대여객 수
05~06시300명
07~08시2,200명
08~09시2,800명
14~15시600명

따라서:

하루 총량보다 시간대별 여객 분포가 혼잡 예측에 더 중요할 수 있다.


7. Interval 데이터

공항 혼잡을 분석할 때 데이터를 어느 시간 단위로 나눌지도 중요하다.

모형설계서에서는 CAST 결과를 10분 간격 Interval 데이터로 관리하도록 되어 있다. :chatgpt-content-reference{index="3"}

예를 들어 08:00~09:00의 평균 대기시간이 8분이라고 하더라도 실제로는 다음과 같을 수 있다.

시간대기시간
08:004분
08:105분
08:207분
08:3010분
08:4014분
08:508분

1시간 평균만 보면 Peak인 14분을 놓치게 된다.

따라서 혼잡 분석에서는 짧은 Interval 데이터가 중요하다.


8. Lag

Lag는:

현재보다 이전 시점의 값

을 의미한다.

10분 간격 데이터를 사용하는 경우:

  • Lag 1 = 10분 전
  • Lag 2 = 20분 전
  • Lag 3 = 30분 전
  • Lag 6 = 1시간 전

이다.

예를 들어 현재 시간이 09:00이면:

  • Lag 1 → 08:50
  • Lag 2 → 08:40
  • Lag 3 → 08:30

의 데이터를 의미한다.


9. Lag가 중요한 이유

공항 혼잡은 각 시점이 완전히 독립적으로 발생하지 않는다.

예:

08:30 Queue = 120명
08:40 Queue = 160명
08:50 Queue = 210명

이라면 09:00에도 높은 Queue가 이어질 가능성이 있다.

즉:

현재 상태를 예측할 때 직전 상태가 중요한 정보가 된다.

이것이 Lag를 사용하는 이유이다.


10. 자기상관 Autocorrelation

자기상관은:

현재 값과 과거 값 사이에 어느 정도 관계가 있는가

를 의미한다.

예를 들어:

08:50의 대기시간이 높으면 09:00의 대기시간도 높은 경향이 있다.

면 자기상관이 있다고 볼 수 있다.

Queue처럼 누적되는 데이터는 강한 자기상관을 가질 가능성이 있다.

개념적으로 다음과 같은 관계를 생각할 수 있다.

현재 Queue

이전 Queue
+
새로 들어온 여객
-
처리된 여객

즉 이전 상태가 현재 상태에 직접 영향을 준다.


11. Moving Average 이동평균

시간대별 데이터는 순간적인 변동이 많을 수 있다.

예:

5, 7, 6, 12, 8, 11, 10, 9

이럴 때 이동평균을 사용하면 큰 흐름을 파악하기 쉬워진다.

예를 들어 3개 구간 이동평균은:

첫 번째 구간:

(5 + 7 + 6) / 3 = 6

다음 구간:

(7 + 6 + 12) / 3 = 8.33

다음 구간:

(6 + 12 + 8) / 3 = 8.67

처럼 계산한다.


12. 이동평균을 사용하는 이유

이동평균의 목적은:

순간적인 Noise를 줄이고 데이터의 전체적인 변화 방향을 보기 위함

이다.

공항 운영에서는 다음 데이터에 활용할 수 있다.

  • Passenger Count
  • Queue Length
  • Waiting Time
  • Service Time

예를 들어 특정 10분 값 하나가 갑자기 증가한 것보다:

최근 30분 평균 Queue가 계속 증가하고 있는가?

를 보는 것이 운영 판단에 더 유용할 수 있다.


13. Rolling Window

Rolling Window는:

최근 일정 시간 구간만 계속 이동시키면서 통계를 계산하는 방법

이다.

예를 들어 10분 간격 데이터에서 최근 6개 구간을 분석하면:

6 × 10분 = 최근 1시간

이다.

시간이 흐르면 분석 범위도 같이 움직인다.

08:00 기준:

07:00~08:00

08:10 기준:

07:10~08:10

08:20 기준:

07:20~08:20

이런 식이다.


14. Rolling Window에서 계산할 수 있는 값

Rolling Window 안에서 다음 값을 계산할 수 있다.

  • 평균 Queue
  • 최대 Queue
  • 평균 Waiting Time
  • 최대 Waiting Time
  • 표준편차
  • Passenger Inflow
  • Queue 증가율

예:

최근 30분 평균 Queue = 150명
최근 30분 최대 Queue = 230명
최근 30분 Queue 증가율 = +35%

이런 값은 실시간 혼잡 상태를 판단하는 데 유용하다.


15. 전일·전주 동일시간 비교

시계열 예측에서는 과거의 동일 시간대 데이터도 중요한 기준이 된다.

예를 들어 오늘 월요일 08:00 상황을 예측할 때:

  • 어제 08:00
  • 지난주 월요일 08:00
  • 2주 전 월요일 08:00
  • 최근 4주 월요일 08:00

등을 비교할 수 있다.

특히 공항처럼 반복적인 운항패턴이 존재하는 환경에서는 같은 요일·시간대가 유용한 비교 기준이 될 수 있다.


16. 왜 동일시간대 비교가 중요한가

예를 들어:

어제 하루 평균 대기시간은 5분이었다.

보다:

최근 4주 월요일 08:00~09:00 평균 대기시간은 12분이었다.

가 오늘 월요일 08시 상황을 예측하는 데 더 유용할 수 있다.

공항 운영에는:

  • 시간대별 항공편 집중
  • 항공사별 운항패턴
  • 요일별 수요

같은 반복 패턴이 있기 때문이다.


17. Reporting Time

모형설계서에서는 Reporting Time & Back-calculation을 별도 데이터 처리 항목으로 정의하고 있다. :chatgpt-content-reference{index="4"}

Reporting Time은 여객이 항공편 출발시간을 기준으로 특정 시설에 언제 나타나는지를 분석하는 데 중요하다.

예를 들어 항공편 출발시간 STD가:

10:00

이고 승객이 보안검색장에 나타난 시간이:

08:20

이라면:

출발 100분 전에 보안검색장에 나타남

으로 계산할 수 있다.


18. Back-calculation 시간 역산

Back-calculation은 출발시간을 기준으로 과거 시간을 역산하는 것이다.

예:

Flight Departure:

10:00

Security Entry:

08:30

이면:

출발 90분 전

Check-in:

07:50

이면:

출발 130분 전

이다.

많은 승객의 데이터를 분석하면 다음과 같은 Show-up Distribution을 만들 수 있다.

출발까지 남은 시간출현 비율
180분 전5%
150분 전15%
120분 전30%
90분 전35%
60분 전15%

이 분포는 CAST에서 가상 여객의 출현시각을 생성하는 데 활용할 수 있다.


19. 시계열 예측의 기본 구조

미래 상황을 예측할 때는 크게 세 가지를 볼 수 있다.

① 현재 상태

현재 Queue는 얼마인가?

② 과거 패턴

비슷한 요일과 시간대에는 얼마나 혼잡했는가?

③ 향후 수요

앞으로 몇 명의 승객이 들어올 것인가?

이를 단순화하면:

미래 Queue

현재 Queue
+
향후 Passenger Inflow
-
향후 Processing Capacity

와 같은 구조로 생각할 수 있다.


20. 단순 Queue 예측 예시

현재 08:00 Queue가 100명이라고 가정한다.

앞으로 10분 동안 예상되는 여객 유입:

300명

10분 동안 처리 가능한 여객:

250명

이라면:

100 + 300 - 250 = 150명

즉 08:10 Queue는 약 150명으로 증가할 수 있다.

실제 CAST에서는 여기에:

  • Passenger Type
  • Service Time
  • Facility Open/Close
  • Route
  • Distribution
  • Resource Allocation

등을 추가로 반영한다.


21. Trend + Seasonality + Noise

시계열 데이터는 크게 다음 요소가 결합된 것으로 생각할 수 있다.

Trend

장기간의 증가 또는 감소 방향

예:

매년 공항 여객 증가

Seasonality

반복되는 패턴

예:

여름휴가, 명절, 주말, 아침 출발 Peak

Noise

규칙적으로 설명하기 어려운 변동

예:

항공편 지연, 시스템 장애, 단체여객의 갑작스러운 도착

따라서:

실제 시계열 = Trend + Seasonality + 불규칙한 변동

으로 생각할 수 있다.


22. Noise

Noise는:

기존 패턴만으로 설명하거나 예측하기 어려운 불규칙한 변화

이다.

공항에서는 다음이 Noise 또는 비정상적 변화의 원인이 될 수 있다.

  • 기상 악화
  • 항공편 지연
  • 시스템 장애
  • 장비 장애
  • 갑작스러운 단체여객 도착
  • 보안절차 변경

Noise를 완벽하게 없애거나 예측하기는 어렵다.

따라서 예측결과를 하나의 확정값보다 범위와 가능성으로 해석하는 것이 중요하다.


23. Forecasting과 Simulation의 차이

두 개념은 구분해서 이해해야 한다.

Forecasting 예측

과거 및 현재 데이터를 이용해 미래 입력값을 예측한다.

예:

09:00 보안검색 진입 여객은 약 2,300명

Simulation 시뮬레이션

예측된 입력과 운영조건을 이용하여 결과를 계산한다.

예:

여객 2,300명에 검색대 8개를 운영하면 평균 대기시간은 약 12분

즉:

Forecasting은 앞으로 무엇이 들어오는가를 예측하고,
Simulation은 그것이 들어왔을 때 어떤 일이 발생하는가를 계산한다.


24. CAST 예측관리의 이상적인 구조

예측관리 관점에서는 다음 구조로 볼 수 있다.

실제 운영 데이터

  • 과거 Passenger Count
  • Reporting Time
  • Queue
  • Waiting Time
  • Flight Schedule

↓

Forecasting Layer

  • Passenger Demand Forecast
  • Reporting Time Forecast
  • Flight Concentration Forecast

↓

CAST Simulation Layer

  • Facility Capacity
  • Service Time
  • Passenger Flow
  • Resource Allocation

↓

Prediction Result

  • Waiting Time
  • Queue Length
  • Congestion Level
  • Peak Time

즉:

미래 수요 예측 + CAST 시뮬레이션

의 결합 구조이다.


25. 시간 해상도 Granularity

시계열 데이터를 몇 분 단위로 분석할 것인지도 중요하다.

예:

  • 1분
  • 5분
  • 10분
  • 30분
  • 1시간

너무 짧게 보면:

  • Noise가 증가
  • 데이터량 증가
  • 순간적인 변동에 민감

해질 수 있다.

반대로 너무 길게 보면:

  • Peak가 평균에 묻힘
  • 혼잡 발생시점을 놓침

문제가 발생할 수 있다.

따라서 업무 목적에 적절한 시간 해상도를 선택해야 한다.


26. Peak Time

공항 운영에서는 평균뿐 아니라 Peak를 보는 것이 중요하다.

예:

평균 Queue = 150명

이라도:

08:40 Peak Queue = 420명

일 수 있다.

이 경우 실제 운영에서는 08:40 전후에 자원을 집중할 필요가 있다.

따라서 시계열 혼잡 분석에서는 다음을 함께 확인하는 것이 좋다.

  • Peak Value
  • Peak Time
  • Peak Duration

예:

08:30~09:00 약 30분간 혼잡 지속

과 같이 표현할 수 있다.


27. Forecast Horizon

Forecast Horizon은:

현재 시점에서 얼마나 먼 미래까지 예측하는가

를 의미한다.

예:

  • 10분 후
  • 30분 후
  • 1시간 후
  • 3시간 후
  • 24시간 후

일반적으로 미래가 멀어질수록 불확실성은 증가한다.

따라서 예측 목적에 따라 Horizon을 다르게 설정하는 것이 좋다.


28. 공항 운영에서 Forecast Horizon 예시

10~30분

현장 즉시 대응

예:

  • 보안검색대 추가 오픈
  • 직원 재배치

1~3시간

단기 운영계획

예:

  • 검색대 운영대수 조정
  • 출국장 운영계획 변경

24시간

일일 운영계획

예:

  • Flight Schedule 기반 자원계획
  • 시간대별 운영인력 계획

예측시간에 따라 활용 목적이 다르다.


29. 과거 데이터만 사용하면 안 되는 이유

지난주 월요일 08:00 대기시간이 10분이었다고 해서 오늘도 반드시 10분인 것은 아니다.

오늘은 다음 조건이 다를 수 있다.

  • Flight Schedule
  • Passenger Count
  • 대형 항공기 운항 여부
  • Facility Open Count
  • Service Time
  • 장애 발생 여부

따라서 예측에서는:

Historical Pattern

+

Current Condition

+

Future Schedule

을 함께 고려하는 것이 중요하다.


30. CAST 예측관리에 필요한 시간정보

예를 들어 09:00 혼잡을 예측한다고 가정한다.

과거정보

지난 비슷한 요일·시간대의 혼잡 패턴

현재정보

08:30 현재 Queue Length

미래정보

08:30~09:00 예상 Passenger Show-up

Capacity 정보

08:30~09:00 운영 예정 검색대 수

를 함께 봐야 한다.

이렇게 해야 단순한 과거 반복이 아닌 현재 조건을 반영한 예측이 가능하다.


31. CAST 프로젝트 적용 흐름

전체 과정을 정리하면 다음과 같다.

실제 시계열 데이터 수집

↓

시간 단위 정규화

↓

Trend 확인

↓

Seasonality 확인

↓

Lag / 자기상관 분석

↓

Moving Average / Rolling 분석

↓

Reporting Time 분석

↓

Passenger Show-up Forecast

↓

Future Passenger Demand 생성

↓

CAST Simulation

↓

Waiting Time / Queue / Peak Time 예측

↓

실제 결과와 비교

↓

Calibration

이런 구조로 발전시킬 수 있다.


32. 이번 강의 핵심 용어

용어의미CAST 적용
Time Series시간 순서가 존재하는 데이터Queue, Waiting Time
Trend장기 증가·감소 추세장기 수요 변화
Seasonality일정 주기로 반복되는 패턴요일·시간대 패턴
Interval일정 시간 단위 데이터10분 단위 결과
Lag이전 시점 값단기 예측
Autocorrelation현재와 과거 값의 관계Queue 지속성 분석
Moving Average최근 값들의 평균Noise 완화
Rolling Window이동하는 시간구간 분석최근 혼잡상태
Reporting Time출발시간 대비 시설 출현시간Passenger Generation
Back-calculation기준시간에서 과거시간 역산Show-up 분석
Forecast Horizon예측할 미래 범위30분/3시간/24시간
Peak Time최고 혼잡 발생시점운영 대응

33. 핵심 정리

이번 강의에서 가장 중요한 내용은 다음과 같다.

첫째,

공항 데이터에서는 값 자체뿐 아니라 언제 발생했는지가 중요하다.

둘째,

하루 평균보다 10분·30분 단위 변화가 혼잡관리에는 더 중요한 경우가 많다.

셋째,

현재 Queue와 Waiting Time은 직전 시점의 영향을 받기 때문에 Lag가 중요한 예측변수가 된다.

넷째,

시계열에는 Trend, Seasonality, Noise가 함께 존재한다.

다섯째,

미래 예측에는 과거 패턴만이 아니라 현재 상태와 미래 Flight Schedule도 함께 사용해야 한다.

그리고 이번 강의에서 가장 중요한 구분은 다음과 같다.

Forecasting은 “앞으로 몇 명이 들어올 것인가”를 예측하고,
CAST Simulation은 “그 여객이 들어왔을 때 공항에서 어떤 일이 발생할 것인가”를 계산한다.

따라서 여객 예측관리는 단순히 CAST를 실행하는 것보다:

Forecasting + Simulation

구조로 이해하는 것이 중요하다.


다음 학습

7강: 예측 정확도와 오차 측정

다음 내용에서는 다음 개념을 학습한다.

  • Error
  • Absolute Error
  • Percentage Error
  • MAE
  • RMSE
  • MAPE
  • Bias
  • Over-prediction
  • Under-prediction

특히 CAST 모형설계서의 Validation 및 Calibration 과정에서:

실제 대기시간과 CAST 시뮬레이션 결과가 얼마나 비슷한가?

를 어떤 통계 지표로 판단할 것인지 학습한다.

Comment 0

Add a comment