프로젝트 배경
[문제점] 외부 커뮤니티 콘텐츠 수집 프로젝트는 크롤러를 돌리는 것보다 "합법적인 선"을 어디에 긋는지가 어렵다. 1시간 주기 자동 수집은 반복적·체계적 수집에 해당하고, 링크아웃과 요약은 위험도가 서로 다르며, robots.txt는 지킬 의무가 없는 대신 지킨 기록이 나중에 설명의 재료가 된다. 그런데 이 판단들은 보통 코드 안에 흩어져 있어 발주자도 개발자도 나중에 확인할 수 없다. [목표] 수집 정책(
프로젝트 성과
단일 데이터 엔진
원본 24 · 회원 14 · 사용자 글 12 전량을 엔진 하나에서 파생(화면별 목데이터 0건)
초기 배치 · forum-a
요청 9 · 적재 6 · robots 차단 3건 미요청 · 평균 간격 2,061 ms · 준수율 100%
초기 배치 · board-b
robots.txt 404 · 요청 12 · 적재 9 · 준수율 "판정 불가" · 두 타겟 합산 피드 27건
위험 조합 전환
요청 16 · 429 4건 · 백오프 1,000→8,000 ms · 준수율 75%(금지 경로 3건 요청)
자체 검증
111건 통과(엔진 51 + 렌더 43 + 디자인 17) · 360/768/1280 가로 오버플로 0
핵심 기능
진행 단계
기획
2026.07.
공고 요구 36건을 커버리지 매트릭스로 판정하고 4화면으로 수렴, 시그니처를 "설정이 로그를 바꾼다"로 확정
프로젝트 상세
본 프로젝트는 역량 증명을 위해 자체 기획·개발한 데모입니다. 클라이언트 수주·납품 실적이 아닙니다. 수집 대상으로 등장하는 사이트는 실존하지 않는 가상 코드네임(forum-a·board-b)이며 robots.txt도 이 데모를 위해 창작한 것입니다. 실제 커뮤니티를 수집한 결과가 아닙니다. 본 데모는 정적 단일 페이지 (HTML + 단일 데이터 모듈)이며 실제 구축 스택(크롤러 프로세스·API 서버·D







