안녕하세요.
담당 매니저 김수민입니다.
기간제(상주) 프로젝트 희망 근무 시작일을
등록해 주시면, 파트너님의 일정에 맞는
적합한 프로젝트를 추천해 드려요.
플러스
문화 실사 이미지 데이터셋 구축
개발 · 디자인 · 기획
웹 · 안드로이드 · iOS · PC프로그램
AI 모델 구축
프로젝트 배경
AI 모델 학습에는 국가별 고유 문화를 담은 실제 촬영 이미지가 대량으로 필요했습니다. 하지만 인터넷 수집에는 세 가지 위험이 있었습니다. ⦁ AI가 생성한 가짜 이미지가 섞여 학습 정확도를 떨어뜨리고, ⦁ 동일·유사 이미지 중복이 데이터 편향을 만들며, ⦁ 출처·라이선스가 불분명하면 저작권 분쟁으로 이어집니다. 그래서 '많이' 모으는 것보다 '정확하고 안전하게' 모으는 파이프라인이 핵심이었습니다
프로젝트 성과
목표 수량 100% 확보
5개국 × 10,000장, 총 50,000장을 목표대로 확보했습니다.
종교·정치·젠더·의식주 4개 문화 카테고리를 고르게 채웠습니다.
AI 생성 이미지 정밀 배제
메타데이터·분류기·아티팩트 분석을 앙상블해
가짜 이미지 8,742장을 배제, 판별 정확도 98.6%를 달성했습니다.
중복 제거로 데이터 다양성 확보
perceptual hash와 FAISS 근접 탐색으로 중복 3,906장을 제거,
유니크율 92.97%의 편향 낮은 데이터셋을 만들었습니다.
저작권 100% 클린 데이터셋
재사용 허용 라이선스만 수집하고 워터마크·출처불명 3,411장을 차단해
상업적 이용 허가 기준 100% 적합 데이터셋을 확보했습니다.
재현 가능한 납품물 구성
이미지와 함께 크롤러 소스코드, 필드 11종 매니페스트,
SHA-256 체크섬을 제공해 출처·과정을 검증할 수 있게 했습니다.
핵심 기능
중복 제거로 데이터 다양성 확보
perceptual hash와 FAISS 근접 탐색으로 중복 3,906장을 제거,
유니크율 92.97%의 편향 낮은 데이터셋을 만들었습니다.
진행 단계
수집 기획 & 기준 합의
2026.01.
메타데이터·분류기·아티팩트 분석을 앙상블해
가짜 이미지 8,742장을 배제, 판별 정확도 98.6%를 달성했습니다.
프로젝트 상세
AI 모델 학습에 쓰일 5개국 문화 실사 이미지를 웹 크롤링으로 대규모 수집하고, AI 생성 이미지·중복·무관·저작권 문제 이미지를 걸러내 신뢰할 수 있는 학습 데이터셋 5만 장으로 정제·납품했습니다.

비슷한 프로젝트를 준비 중이라면?
위시켓 매니저와 상담하세요.

참여 개발사와 미팅 연결

프로젝트 1:1 컨설팅 제공

무료로 프로젝트 등록하기

작업한 파트너 프로필 보기

pm******
개발 · 법인사업자

프로젝트 정보

참여 기간
2026.01. ~ 2026.03.
참여율
참여율이 100%인 프로젝트는 해당 파트너님이 온전히 작업한 결과물입니다.
외부 공동 작업의 경우 기여도에 따라 참여율이 달라지며 역할, 프로젝트 설명을 통해 업무 분야 및 참여 범위를 확인할 수 있습니다.
100%
관련 기술
scrapy
ClipReport
OpenCV
requests
Python