안녕하세요.
담당 매니저 김수민입니다.
기간제(상주) 프로젝트 희망 근무 시작일을
등록해 주시면, 파트너님의 일정에 맞는
적합한 프로젝트를 추천해 드려요.
플러스
사내 LLM 플랫폼 - 파인튜닝 모델로 gpt-4o를 이긴 온프레미스 AI 인프라
개발 · 기획
웹 · 기타
Gen AI 서비스, AI 모델 구축, 머신러닝ㆍ딥러닝
프로젝트 배경
1) 문제점 - 사용자 질문을 10개 카테고리로 자동 분류하는 기능이 외부 유료 API(gpt-4o)로 동작 중이었고, 분류 품질에 대한 체감 불만이 있었음 - 다만 "체감"일 뿐 근거가 없었음. 얼마나 틀리는지, 무엇 때문에 틀리는지 아무도 숫자로 답할 수 없는 상태 - 호출량이 늘수록 비용도 함께 늘어나는 구조 2) 프로젝트 목표 - 먼저 측정: 운영과 동일한 조건에서 현재 정확도가 몇 %인지
프로젝트 성과
홀드아웃 정답률 73.1% (gpt-4o는 44.0%)
동일한 홀드아웃 2,821건, 동일한 채점 코드로 나란히 측정한 결과입니다.
판정 정책으로 기준선 대비 +6.3%p
무대응 기준선 68.3%를 74.6%로. 부트스트랩 하한 +4.5%p, 이득이 없을 확률 0%.
분류 p95 678ms
프론트엔드 2,500ms 예산 안에 여유 있게 진입. p50은 533ms입니다.
호출 비용 1,000건당 $0
기존 gpt-4o 경로는 1,000건당 $0.672. 로컬 하드웨어라 호출 비용이 발생하지 않습니다.
백그라운드 작업 고정 평가 16/16
검수·태깅·요약·번역·임베딩·리서치 6종 전항목 통과, 케이스당 약 3.6초.
핵심 기능
동일 조건 벤치마크
같은 홀드아웃 2,821건, 같은 채점 코드로 gpt-4o와 파인튜닝 8B를 나란히 측정했습니다. 73.1% 대 44.0%.
진행 단계
측정 환경 구축 — 홀드아웃 2,821건 확보, 카테고리 ID 매핑 검증
2026.07.
운영 DB에서 홀드아웃을 뽑고 카테고리 ID 매핑을 검증했습니다. 결과보다 측정 설계를 먼저 고정했습니다.
프로젝트 상세
[한 줄 요약] 외부 LLM API 비용을 줄여 달라는 요청에서 시작했지만, 측정해 보니 진짜 문제는 비용이 아니라 정확도였습니다. 사내 데이터로 파인튜닝한 8B 모델이 동일한 홀드아웃 2,821건에서 gpt-4o를 73.1% 대 44.0%로 앞섰고, 호출 비용은 0원, p95 응답은 678ms입니다. [왜 시작했는가] 사용자가 올린 질문을 10개 카테고리 중 하나로 자동 분류하는 기능이 gpt-4o

비슷한 프로젝트를 준비 중이라면?
위시켓 매니저와 상담하세요.

참여 개발사와 미팅 연결

프로젝트 1:1 컨설팅 제공

무료로 프로젝트 등록하기

작업한 파트너 프로필 보기

al******
개발 · 팀

프로젝트 정보

참여 기간
2026.07. ~ 2026.08.
참여율
참여율이 100%인 프로젝트는 해당 파트너님이 온전히 작업한 결과물입니다.
외부 공동 작업의 경우 기여도에 따라 참여율이 달라지며 역할, 프로젝트 설명을 통해 업무 분야 및 참여 범위를 확인할 수 있습니다.
100%
고객사
사내 프로젝트
역할
AI 엔지니어 (데이터셋 · 파인튜닝 · 평가 설계 · 서빙 · 연동 스펙 · 프론트엔드)
관련 기술
Linux
자연어처리
머신러닝
TypeScript
Spring Boot
Java
RAG
next.js
MySQL
Nginx
Python
Docker
Git
파인튜닝
restful api
딥러닝
LLMops
ollama
LLM
React