프로젝트 배경
1) 문제점 - 사용자 질문을 10개 카테고리로 자동 분류하는 기능이 외부 유료 API(gpt-4o)로 동작 중이었고, 분류 품질에 대한 체감 불만이 있었음 - 다만 "체감"일 뿐 근거가 없었음. 얼마나 틀리는지, 무엇 때문에 틀리는지 아무도 숫자로 답할 수 없는 상태 - 호출량이 늘수록 비용도 함께 늘어나는 구조 2) 프로젝트 목표 - 먼저 측정: 운영과 동일한 조건에서 현재 정확도가 몇 %인지
프로젝트 성과
홀드아웃 정답률 73.1% (gpt-4o는 44.0%)
동일한 홀드아웃 2,821건, 동일한 채점 코드로 나란히 측정한 결과입니다.
판정 정책으로 기준선 대비 +6.3%p
무대응 기준선 68.3%를 74.6%로. 부트스트랩 하한 +4.5%p, 이득이 없을 확률 0%.
분류 p95 678ms
프론트엔드 2,500ms 예산 안에 여유 있게 진입. p50은 533ms입니다.
호출 비용 1,000건당 $0
기존 gpt-4o 경로는 1,000건당 $0.672. 로컬 하드웨어라 호출 비용이 발생하지 않습니다.
백그라운드 작업 고정 평가 16/16
검수·태깅·요약·번역·임베딩·리서치 6종 전항목 통과, 케이스당 약 3.6초.
핵심 기능
진행 단계
측정 환경 구축 — 홀드아웃 2,821건 확보, 카테고리 ID 매핑 검증
2026.07.
운영 DB에서 홀드아웃을 뽑고 카테고리 ID 매핑을 검증했습니다. 결과보다 측정 설계를 먼저 고정했습니다.
프로젝트 상세
[한 줄 요약] 외부 LLM API 비용을 줄여 달라는 요청에서 시작했지만, 측정해 보니 진짜 문제는 비용이 아니라 정확도였습니다. 사내 데이터로 파인튜닝한 8B 모델이 동일한 홀드아웃 2,821건에서 gpt-4o를 73.1% 대 44.0%로 앞섰고, 호출 비용은 0원, p95 응답은 678ms입니다. [왜 시작했는가] 사용자가 올린 질문을 10개 카테고리 중 하나로 자동 분류하는 기능이 gpt-4o







