프로젝트 배경
문제점 - 국내외 다수 축산 데이터 소스의 수집 로직이 개별 스크립트로 분산되어 재사용·표준이 없고 유지보수 비용이 높음 - 배치 실패나 데이터 정체가 알림 없이 방치되면 하류 지수·예측·자산평가까지 오염 - 창고 재고 상품명이 자유 텍스트(기호·약어·브랜드 혼재)라 표준 속성이 없어 집계·검색·분석 불가 프로젝트 목표 - 통합 오케스트레이션: 수집·ETL·예측을 표준 3계층 DAG 프레임워크로
프로젝트 성과
39개 프로덕션 DAG 통합 운영
USDA·EKAPE·관세청 등 28개+ 외부 소스를 수집·ETL·예측하는 39개 DAG를 3계층 표준 패턴으로 통합 오케스트레이션.
재고 상품명 자동 재분류 모델
창고 재고 자유 텍스트 상품명을 규칙+ML+ref 제약 하이브리드로 8개 속성(축종·부위·브랜드·원산지 등)에 자동 분류.
성능 기반 모델 자동 선택
속성별로 SGD·Logistic·SVC 3개 분류기를 GridSearchCV 5-fold로 탐색해 CV 정확도 최고 모델을 자동 채택.
자기개선 피드백 루프
추론 신뢰도로 고신뢰 예측은 학습셋 자동 편입, 동의어 자동발견으로 규칙 커버리지를 확장하는 순환 개선 구조.
데이터 품질 자동 검증
CV 불변식 가드와 freshness 체크로 값 오염·데이터 정체를 자동 감지해 Slack 경보, 조용한 장애를 가시화.
핵심 기능
진행 단계
플랫폼 기반 구축
2026.01.
psycopg3 커넥션 풀·공통 DB 유틸(upsert COPY+ON CONFLICT), Slack 실패 알림 플러그인, 3계층 DAG 프레임워크 정립
프로젝트 상세
1) 포트폴리오 소개: 서비스의 메인 타깃과 카테고리 등을 포함한 간략한 소개 M사는 USDA(미국)·MLA(호주)·EKAPE(한국 축평원)·관세청·YahooFinance 등 국내외 축산 시장 데이터를 기반으로 거래지수, 가격 예측, 자산평가(CV) 등을 운영합니다. 초기에는 소스별 수집 로직이 개별 스크립트로 분산되어 재사용과 표준이 없었고, 배치 실패나 데이터 정체가 조용히 방치되면 하류의 지수·예측·평







