프로젝트 배경
문제 - 공식 문서 기반 RAG 챗봇의 품질을 고치려 할 때 진짜 어려움은 모델 선택이 아니라 세 군데에서 생깁니다. 첫째, 답이 안 나오는 이유가 검색 쪽인지 생성 쪽인지 나뉘어 있지 않으면 무엇을 고쳐도 개선을 확인할 수 없습니다. 둘째, 법령과 정책은 시간 축이 붙어 있어 옛 문서와 새 문서가 같은 항목에 다른 값을 말합니다. 셋째, 비슷한 이름의 다른 제도가 상위에 섞이면 답변은 그럴듯한데 대상이 틀립
프로젝트 성과
언어별 지표와 인용 정합성과 보류 성능의 개선 전후 비교
정적 목업이 아닙니다. 도메인 단위 시험 53건과 실제 브라우저 클릭 E2E 108건(PC 1440, 태블릿 768, 모바일 390 세 폭)을 통과했고, 기하와 대비 검사 21개 조합에서 화면 밖
핵심 기능
진행 단계
레퍼런스 실측과 파이프라인 설계와 화면 구현과 회귀 검증
2026.08.
검색 실패와 답변 실패를 나눠서 진단 — 답이 제대로 안 나오는 이유는 크게 둘로 갈립니다. 관련 있는 공식 문서가 애초에 검색되지 않는 것과, 검색은 됐는데 그 문서가 답변 내용을 뒷받침하지 못하
프로젝트 상세
공식 자료 기반 RAG 챗봇에서 관련 문서가 검색되지 않는 문제와 검색된 출처가 답변을 뒷받침하지 못하는 문제를 분리해 진단하고 개선한 작업입니다. 개선 전후 비교, 검색 후보와 재정렬, 답변 근거와 최신성, 상태기계와 장애 처리, 평가 대시보드, 회귀와 잔여 실패, 21일 계획과 범위까지 일곱 화면으로 구성했습니다. 4개 언어 평가셋으로 개선 전후를 비교하고, 근거가 부족하거나 출처가 충돌하거나 최신성이 확







