프로젝트 배경
기존 특허 검색 서비스는 대규모 특허 데이터 기준 검색 Recall이 낮고, 벡터 적재 시 Milvus 메모리 사용량과 로딩 시간이 운영 병목으로 작용했습니다. 검색 품질을 높이면서도 운영 비용을 줄이기 위해 청킹, 임베딩, 인덱스, 평가 체계를 함께 개선해야 했습니다.
프로젝트 성과
Recall@500 81.19% 및 RAM 26배 절감
Gemini 임베딩과 Milvus MMap 최적화로 검색 품질과 운영 자원 효율을 함께 개선했습니다.
핵심 기능
진행 단계
데이터 분석 및 실험 파이프라인 구축
2025.12
원천 데이터 기준을 정리하고 청킹, 임베딩, 적재, 평가 흐름을 버전별로 추적했습니다.
프로젝트 상세
운영 중인 특허 벡터 검색 서비스의 검색 품질과 운영 효율을 개선하기 위해 23년치 특허 데이터를 대상으로 청킹 전략, 임베딩 모델, Milvus 인덱스 구조, OCR 기반 멀티모달 확장 가능성을 실험·검증한 프로젝트입니다. 기존 검색 품질 문제를 해결하기 위해 원천 데이터 구조를 먼저 분석하고 doc_id, section, chunk_uid, embedding_dim 등 추적 기준을 통일했습니다. 이후






