프로젝트 배경
**1) 문제점** GPU 추론 최적화·파인튜닝 모델 서빙 역량을 증명할 실측 기반 포트폴리오가 없었습니다. 클라우드 GPU 대여 비용 없이, 보유 중인 데스크탑 GPU(RTX 5090, 32GB VRAM)로 직접 계측하고 증명할 방법이 필요했습니다. **2) 프로젝트 목표** 배칭 없는 순차 서빙(GPU 락 직렬화)을 BEFORE 상태로 의도적으로 재현하고, 서빙 엔진만 vLLM으로 교체하는 최소
프로젝트 성과
처리량 17배 증가
동시 사용자 20명 부하 기준 60초간 처리 요청 수가 23건에서 397건으로 약 17배 늘었다.
p95 지연시간 96.2% 단축
p95 응답 지연시간이 50,000ms에서 1,900ms로 96.2% 감소했다.
큐 대기시간 100% 제거
GPU 직렬화 락 제거로 평균 큐 대기시간이 26,549ms에서 0ms로 완전히 사라졌다.
p50 지연시간 94.5% 단축
p50 응답 지연시간이 29,000ms에서 1,600ms로 94.5% 감소했다.
핵심 기능
진행 단계
실험 설계
2026.07.
BEFORE/AFTER 비교로 개선 요인을 분리 증명하기 위한 실험 설계와 아키텍처를 수립했다.
프로젝트 상세
**1) 포트폴리오 소개** GPU 추론 서빙 성능 최적화 실증 PoC입니다. AI 인프라·백엔드 성능 개선이 필요한 팀을 대상으로, 애플리케이션 레벨 GPU 락(직렬화) 제거와 vLLM continuous batching 전환만으로 처리량 17배, p95 지연시간 96.2% 단축을 RTX 5090 데스크탑 GPU에서 직접 실측해 증명했습니다. **2) 작업 범위** 기획(BEFORE/AFTER 비교







