Skip to content

[DATA] rolling window 없이 고정 시점 라벨링 데이터셋 생성 및 성능 비교 #28

Description

@PRAHE

목적

현재 파이프라인(build_h_datasets.py)은 기준 시점 T에서
이후 H개월 내 상폐 여부로 라벨을 부여하는 rolling window 방식을 사용합니다.

이 이슈는 rolling window를 사용하지 않은 고정 시점 라벨링 방식으로
데이터셋을 별도 생성하고, 두 방식의 모델 성능을 비교하기 위한 작업입니다.


배경

rolling window 방식이 성능에 실제로 기여하는지 확인이 필요합니다.
현재는 H 방식만 실험하고 있어 라벨링 방식 자체의 영향을 분리할 수 없습니다.

비교 실험을 위해 다음 조건을 고정합니다.

  • 동일한 원천 데이터 (combined_raw.csv)
  • 동일한 전처리 파이프라인 (Preprocessor)
  • 동일한 time split (2015~2022 / 2023 / 2024)
  • 동일한 실험 설정 (baseline / exp-A / exp-B / exp-C)

라벨링 방식만 다르게 하여 성능 차이의 원인을 라벨링으로 귀속시킵니다.


라벨링 방식 정의

H 방식 (기존)
기준 시점 T에서 이후 H개월 내 상폐가 발생하면 label=1.
같은 상폐기업의 여러 분기가 양성이 될 수 있음.

N 방식 (이번 이슈)
상폐 연도에서 정확히 N년 전 연도의 행에만 label=1.
N=1이면 상폐 직전 연도의 Q1/H1/Q3/ANNUAL 행이 양성.


예상 결과

rolling window가 실제로 유효하다면 H 방식이 N 방식보다
일관되게 높은 성능을 보일 것으로 예상됩니다.
차이가 없다면 더 단순한 N 방식으로 실험 구조를 간소화할 수 있습니다.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions