프로젝트 배경
1) 문제점 - 공공 입찰정보는 기관마다 다른 사이트에 흩어져 있고, 공개 API가 있는 곳은 일부뿐입니다 - 로그인 방식과 첨부파일 받는 방법이 기관마다 달라, 한 번 만들어 두면 끝나는 일이 아닙니다 - 수집이 멈춰도 아무도 모르는 것이 가장 큰 사고입니다 2) 목표 - 35곳이 각자 사정으로 바뀌어도 매일 같은 시각에 데이터가 들어와 있게 한다 - 문제가 생기면 사람이 눈치채기 전에 화면에
프로젝트 성과
35개 사이트 무인 수집
하루 수천 건이 사람 손 없이 들어옵니다. 사이트가 개편되면 그 수집기만 고치면 되도록 분리해 두었습니다.
수집 중단을 그날 안에 발견
사이트별 마지막 수집 시각을 5분마다 갱신해 늦어지면 색으로 드러나고, 실패한 작업은 실행 이력에 남습니다.
11년째 이어 온 파이프라인
2015년에 시작해 지금까지 같은 구조 위에 수집처를 늘려 오고 있습니다.
핵심 기능
진행 단계
수집 파이프라인 구축
2015.11.
첫 기관 수집기와 공고 저장 구조를 만들고, 주기 실행과 중복 판정 규칙을 정했습니다.
프로젝트 상세
[프로젝트 개요] 전국 공공기관의 입찰공고와 개찰결과를 모아 오는 수집 서버입니다. 2015년부터 돌려 왔고 지금은 35곳에서 받아 옵니다. 나라장터처럼 공개 API가 있는 곳도 있지만 대부분은 화면을 열어 읽어야 하고, 기관마다 로그인 방식과 첨부파일 내려받는 방법이 제각각입니다. 이 일의 어려움은 한 사이트를 뚫는 것이 아니라, 35곳이 각자 사정으로 바뀌는데도 매일 같은 시각에 데이터가 들어와 있게 만







