프로젝트 배경
네이버 cbox5 댓글 API 역공학, X GraphQL SearchTimeline 파싱, 에펨코리아 200페이지 전수 스캔 등 7개 플랫폼의 크롤링 방어 구조를 각각 분석하고, 수집 원본 1,732건 정제 1,112건 납품, 7컬럼 CSV·수집경로 명세서·소스코드 포함 4종 산출물까지 사전 구현했습니다. 노이즈 제거 29.7%, 잔류 노이즈 0%, X 4계정 로테이션 실증 등 실제 운영 시나리오 5가지를 검
프로젝트 성과
수집 원본 1,732건 → 정제 1,112건 납품
노이즈 제거 29.7%, 중복 제거 6.1%를 거쳐 100건 샘플 검증 잔류 노이즈 0% 달성. 학술 연구 품질 기준 충족
7개 플랫폼 크롤러 전수 구축
네이버 뉴스·유튜브·네이버 블로그·다음 블로그·에펨코리아·디시인사이드·X — 플랫폼별 방어 구조에 맞는 최적 접근법 적용
X 4계정 로테이션 실증
rate-limit 자동 감지 → 15분 쿨다운 → 재시도 구조. 오판 0회, 네트워크 오류 자동 복구 2회 실측 확인
4종 산출물 패키징 완료
CSV + 수집경로 명세서(채널별 경로·건수·소요시간) + 키워드 마스터 로그 + 소스코드 ZIP 전체 이관 가능
핵심 기능
진행 단계
1단계: 플랫폼 구조 분석
2026.05.
7개 플랫폼 크롤링 방어 역공학 — cbox5 API, GraphQL SearchTimeline, Cloudflare bypass 전략 수립
프로젝트 상세
국내 주요 패션 브랜드 14개의 소셜 미디어·커뮤니티 반응을 29개월 시계열로 수집하고, 학술 연구 품질에 맞게 정제하는 데이터 파이프라인을 구축했습니다. 네이버 뉴스·유튜브·네이버 블로그·다음 블로그·에펨코리아·디시인사이드·X 7개 플랫폼을 단일 파이프라인으로 수집합니다. 각 플랫폼의 크롤링 방어 구조를 역공학하여 플랫폼별 최적 접근법을 적용했습니다. 네이버 뉴스는 cbox5 댓글 API를 직접 파싱하







