프로젝트 배경
1) 문제점 - 필요한 데이터가 여러 소스에 흩어져 있고 형식이 제각각 - 수기 수집은 느리고 최신성 유지가 어려움 - 중복·누락으로 데이터 품질이 떨어짐 2) 목표 - 다중 소스를 주기적으로 자동 수집 - 정규화·중복 제거로 품질 확보 - 검색 가능한 형태로 인덱싱 3) 주안점 - 소스별 파싱 안정성(차단/오류 대응) - 정규화/중복 제거 정확도 - 대량 데이터 인덱싱 성능
프로젝트 성과
대량 데이터 처리
수만 건 규모 데이터 수집·인덱싱
데이터 품질
정규화·중복 제거로 검색 가능한 단일 데이터셋 확보
핵심 기능
진행 단계
소스 분석·설계
2026.02.
소스별 구조 분석, 수집/정규화 정책 정의(문서 공유)
프로젝트 상세
1) 포트폴리오 소개 여러 포털·소스에 흩어진 데이터를 주기적으로 자동 수집해, 하나의 검색 가능한 데이터셋으로 통합하는 크롤링·인덱싱 시스템입니다. 다중 소스에서 데이터를 수집하고 서로 다른 형식을 정규화하며, 중복을 제거하고 검색에 맞게 인덱싱했습니다. 2) 작업 범위 - 소스별 구조 분석 및 수집·정규화 정책 설계 - 다중 소스 크롤러/파서 개발, 정규화·중복 제거 파이프라인 구축 - 검색







