프로젝트 배경
AI 모델 학습에는 국가별 고유 문화를 담은 실제 촬영 이미지가 대량으로 필요했습니다. 하지만 인터넷 수집에는 세 가지 위험이 있었습니다. ⦁ AI가 생성한 가짜 이미지가 섞여 학습 정확도를 떨어뜨리고, ⦁ 동일·유사 이미지 중복이 데이터 편향을 만들며, ⦁ 출처·라이선스가 불분명하면 저작권 분쟁으로 이어집니다. 그래서 '많이' 모으는 것보다 '정확하고 안전하게' 모으는 파이프라인이 핵심이었습니다
프로젝트 성과
목표 수량 100% 확보
5개국 × 10,000장, 총 50,000장을 목표대로 확보했습니다.
종교·정치·젠더·의식주 4개 문화 카테고리를 고르게 채웠습니다.
종교·정치·젠더·의식주 4개 문화 카테고리를 고르게 채웠습니다.
AI 생성 이미지 정밀 배제
메타데이터·분류기·아티팩트 분석을 앙상블해
가짜 이미지 8,742장을 배제, 판별 정확도 98.6%를 달성했습니다.
가짜 이미지 8,742장을 배제, 판별 정확도 98.6%를 달성했습니다.
중복 제거로 데이터 다양성 확보
perceptual hash와 FAISS 근접 탐색으로 중복 3,906장을 제거,
유니크율 92.97%의 편향 낮은 데이터셋을 만들었습니다.
유니크율 92.97%의 편향 낮은 데이터셋을 만들었습니다.
저작권 100% 클린 데이터셋
재사용 허용 라이선스만 수집하고 워터마크·출처불명 3,411장을 차단해
상업적 이용 허가 기준 100% 적합 데이터셋을 확보했습니다.
상업적 이용 허가 기준 100% 적합 데이터셋을 확보했습니다.
재현 가능한 납품물 구성
이미지와 함께 크롤러 소스코드, 필드 11종 매니페스트,
SHA-256 체크섬을 제공해 출처·과정을 검증할 수 있게 했습니다.
SHA-256 체크섬을 제공해 출처·과정을 검증할 수 있게 했습니다.
핵심 기능
진행 단계
수집 기획 & 기준 합의
2026.01.
메타데이터·분류기·아티팩트 분석을 앙상블해
가짜 이미지 8,742장을 배제, 판별 정확도 98.6%를 달성했습니다.
가짜 이미지 8,742장을 배제, 판별 정확도 98.6%를 달성했습니다.
프로젝트 상세
AI 모델 학습에 쓰일 5개국 문화 실사 이미지를 웹 크롤링으로 대규모 수집하고, AI 생성 이미지·중복·무관·저작권 문제 이미지를 걸러내 신뢰할 수 있는 학습 데이터셋 5만 장으로 정제·납품했습니다.







