목적
현재 파이프라인(build_h_datasets.py)은 기준 시점 T에서
이후 H개월 내 상폐 여부로 라벨을 부여하는 rolling window 방식을 사용합니다.
이 이슈는 rolling window를 사용하지 않은 고정 시점 라벨링 방식으로
데이터셋을 별도 생성하고, 두 방식의 모델 성능을 비교하기 위한 작업입니다.
배경
rolling window 방식이 성능에 실제로 기여하는지 확인이 필요합니다.
현재는 H 방식만 실험하고 있어 라벨링 방식 자체의 영향을 분리할 수 없습니다.
비교 실험을 위해 다음 조건을 고정합니다.
- 동일한 원천 데이터 (
combined_raw.csv)
- 동일한 전처리 파이프라인 (
Preprocessor)
- 동일한 time split (2015~2022 / 2023 / 2024)
- 동일한 실험 설정 (baseline / exp-A / exp-B / exp-C)
라벨링 방식만 다르게 하여 성능 차이의 원인을 라벨링으로 귀속시킵니다.
라벨링 방식 정의
H 방식 (기존)
기준 시점 T에서 이후 H개월 내 상폐가 발생하면 label=1.
같은 상폐기업의 여러 분기가 양성이 될 수 있음.
N 방식 (이번 이슈)
상폐 연도에서 정확히 N년 전 연도의 행에만 label=1.
N=1이면 상폐 직전 연도의 Q1/H1/Q3/ANNUAL 행이 양성.
예상 결과
rolling window가 실제로 유효하다면 H 방식이 N 방식보다
일관되게 높은 성능을 보일 것으로 예상됩니다.
차이가 없다면 더 단순한 N 방식으로 실험 구조를 간소화할 수 있습니다.
목적
현재 파이프라인(
build_h_datasets.py)은 기준 시점 T에서이후 H개월 내 상폐 여부로 라벨을 부여하는 rolling window 방식을 사용합니다.
이 이슈는 rolling window를 사용하지 않은 고정 시점 라벨링 방식으로
데이터셋을 별도 생성하고, 두 방식의 모델 성능을 비교하기 위한 작업입니다.
배경
rolling window 방식이 성능에 실제로 기여하는지 확인이 필요합니다.
현재는 H 방식만 실험하고 있어 라벨링 방식 자체의 영향을 분리할 수 없습니다.
비교 실험을 위해 다음 조건을 고정합니다.
combined_raw.csv)Preprocessor)라벨링 방식만 다르게 하여 성능 차이의 원인을 라벨링으로 귀속시킵니다.
라벨링 방식 정의
H 방식 (기존)
기준 시점 T에서 이후 H개월 내 상폐가 발생하면 label=1.
같은 상폐기업의 여러 분기가 양성이 될 수 있음.
N 방식 (이번 이슈)
상폐 연도에서 정확히 N년 전 연도의 행에만 label=1.
N=1이면 상폐 직전 연도의 Q1/H1/Q3/ANNUAL 행이 양성.
예상 결과
rolling window가 실제로 유효하다면 H 방식이 N 방식보다
일관되게 높은 성능을 보일 것으로 예상됩니다.
차이가 없다면 더 단순한 N 방식으로 실험 구조를 간소화할 수 있습니다.