프로젝트 배경
a■ 문제 상황 - 마케팅알이 담당자가 매일 수신 연동 데이터를 수거워 모은 뒤 수작업으로 분류하는 방식 운영 - 멀티 소스(EC, 뉴스, SNS) 데이터를 통합 수집하는 도구 부재 - 수집 이후 분류·분석·리포트 작성에 평균 3시간 소요 → 실시간 대응 열윏 ■ 프로젝트 목표 - 멀티 소스 자동 크롤링 시스템 구축으로 수집 시간 무인화 - LLM 기반 AI 에이전트가 데이터 분류·분석·리포트를
프로젝트 성과
AI 에이전트 데이터 처리 속도 40배 향상
수작업 3시간 소요 분류·분석 작업을 AI 에이전트가 5분 내 자동 완료. 월 1,500만 건 데이터 처리량 달성.
AI 자동 분류 정확도 94.7% 달성
LangChain 기반 멀티스텝 에이전트가 수집된 문서를 자동 분류하여 94.7%의 정확도를 달성.
핵심 기능
진행 단계
요구사항 분석 및 아키텍쳐 설계
2024.03.
수집 소스 선정, 크롤링 대상 결정, AI 에이전트 파이프라인 설계, DB 스키마 설계
프로젝트 상세
■ 프로젝트 개요 국내 주요 이커머스 플랫폼, 뉴스 포털, SNS 등 멀티 소스에서 일 50만 건 이상의 데이터를 자동 수집하고, LLM 기반 AI 에이전트가 이를 실시간으로 분류·분석·리포트까지 처리하는 풀파이프라인 시스템을 구축했습니다. ■ 기술적 구현 내용 1) 크롤링 인프라 구성 - Scrapy + Playwright 조합으로 정적/동적 페이지 모두 대응 - 봇 감지 우회를 위한 프록시 로







