안녕하세요.
담당 매니저 김수민입니다.
기간제(상주) 프로젝트 희망 근무 시작일을
등록해 주시면, 파트너님의 일정에 맞는
적합한 프로젝트를 추천해 드려요.
플러스
GPU 추론 프로파일링 & 최적화 데모
개발 · 기획
통계ㆍ대시보드, AI 모델 구축, 기타
프로젝트 배경
**1) 문제점** GPU 추론 최적화·파인튜닝 모델 서빙 역량을 증명할 실측 기반 포트폴리오가 없었습니다. 클라우드 GPU 대여 비용 없이, 보유 중인 데스크탑 GPU(RTX 5090, 32GB VRAM)로 직접 계측하고 증명할 방법이 필요했습니다. **2) 프로젝트 목표** 배칭 없는 순차 서빙(GPU 락 직렬화)을 BEFORE 상태로 의도적으로 재현하고, 서빙 엔진만 vLLM으로 교체하는 최소
프로젝트 성과
처리량 17배 증가
동시 사용자 20명 부하 기준 60초간 처리 요청 수가 23건에서 397건으로 약 17배 늘었다.
p95 지연시간 96.2% 단축
p95 응답 지연시간이 50,000ms에서 1,900ms로 96.2% 감소했다.
큐 대기시간 100% 제거
GPU 직렬화 락 제거로 평균 큐 대기시간이 26,549ms에서 0ms로 완전히 사라졌다.
p50 지연시간 94.5% 단축
p50 응답 지연시간이 29,000ms에서 1,600ms로 94.5% 감소했다.
핵심 기능
Before/After 실측 비교 아키텍처
GPU 락 유무만 다른 두 서빙 엔진을 구성해 다른 요인 없이 순수한 성능 차이를 비교할 수 있다.
진행 단계
실험 설계
2026.07.
BEFORE/AFTER 비교로 개선 요인을 분리 증명하기 위한 실험 설계와 아키텍처를 수립했다.
프로젝트 상세
**1) 포트폴리오 소개** GPU 추론 서빙 성능 최적화 실증 PoC입니다. AI 인프라·백엔드 성능 개선이 필요한 팀을 대상으로, 애플리케이션 레벨 GPU 락(직렬화) 제거와 vLLM continuous batching 전환만으로 처리량 17배, p95 지연시간 96.2% 단축을 RTX 5090 데스크탑 GPU에서 직접 실측해 증명했습니다. **2) 작업 범위** 기획(BEFORE/AFTER 비교

비슷한 프로젝트를 준비 중이라면?
위시켓 매니저와 상담하세요.

참여 개발사와 미팅 연결

프로젝트 1:1 컨설팅 제공

무료로 프로젝트 등록하기

작업한 파트너 프로필 보기

at******
개발 · 개인

프로젝트 정보

참여 기간
2026.07. ~ 2026.07.
참여율
참여율이 100%인 프로젝트는 해당 파트너님이 온전히 작업한 결과물입니다.
외부 공동 작업의 경우 기여도에 따라 참여율이 달라지며 역할, 프로젝트 설명을 통해 업무 분야 및 참여 범위를 확인할 수 있습니다.
100%
고객사
개인 프로젝트
역할
기획·개발·운영 총괄 (1인 풀스택)
관련 기술
huggingface transformers
vllm
locust
fastapi
WSL2
PyTorch
cuda
Python
chart.js