프로젝트 배경
1) 문제점 - 질병과 사고 모두 연령, 운전 빈도, 직업 같은 교란 요인의 영향을 받습니다. - 불균형한 사고 데이터에서 정확도만 높이면 대부분을 무사고로 예측하는 무의미한 모델이 될 수 있습니다. - 약 30만 건의 불균형 데이터, 민감한 건강정보와 공정성, 상관관계와 인과관계의 구분이라는 제약이 있었습니다. 2) 프로젝트 목표 - 해석 가능한 기준 모델과 비선형 모델을 병렬 비교하는 것이 목
프로젝트 성과
약 30만 건 데이터 분석
대규모 운전 기록 데이터 정제 및 분석
3개 모델 병렬 비교
로지스틱 회귀·Random Forest·XGBoost 비교로 편향 검토
핵심 기능
진행 단계
대규모 데이터 정제
2024.03.
약 30만 건 운전 기록 데이터 정리
프로젝트 상세
1) 포트폴리오 소개 리스크 애널리틱스 카테고리의 운전자 위험도 분석으로, 안전교육 기관과 정책 연구자를 메인 타깃으로 합니다. 누가 사고를 낼 것인지 단정하는 모델이 아니라, 예방 교육과 정책 연구에서 추가 확인이 필요한 위험 신호를 정량화하는 분석으로 정의했습니다. 2) 작업 범위 약 30만 건 규모의 대용량 표 데이터 정제, 로지스틱 회귀·Random Forest·XGBoost 3개 모델 비교와







