프로젝트 배경
국가별 문화 이미지 50,000장을 수집할 때 단순 다운로드만으로는 저작권·출처·중복·AI 생성 의심·문화 부적합 이미지를 설명할 수 없습니다. 따라서 이미지 파일과 함께 추적 가능한 manifest와 검수 대기열을 만드는 것을 목표로 했습니다.
프로젝트 성과
후보 메타데이터 126건 구조화
5개국·25개 검색 그룹에서 원본 페이지와 라이선스를 추적하고, 누락 37건과 정확 중복 12건을 자동 제외했습니다.
핵심 기능
진행 단계
수집·검증 파이프라인 구현
2026.07
공개 API 수집 → 라이선스 검증 → 해시 중복 제거 → 사람 검수 대기열 → 국가별 납품 구조로 구성했습니다.
프로젝트 상세
Wikimedia Commons 공식 API를 이용해 미국·일본·스페인·인도네시아·프랑스의 문화 이미지 후보를 수집하고, 원본 페이지·작가·라이선스 URL·검색어·파일 해시를 행 단위로 추적하는 Python 데이터 QA 파이프라인을 구현했습니다. 25개 검색 그룹에서 후보 126건을 확보한 뒤 라이선스 메타데이터가 부족한 37건을 자동 제외하고, 동일 파일 해시 12건을 중복 제외했습니다. 나머지 77건은 자






