프로젝트 배경
1) 문제점 - 편·장 단위 수동 제작 병목 - LLM·TTS·이미지 도구가 흩어짐 - 기본 TTS는 톤이 들쭉날쭉해 채널 보이스로 쓰기 어려움 2) 프로젝트 목표 - 보이스 클론·파인튜닝으로 내레이션 톤 통일 - LLM+TTS+이미지를 하나의 배치 파이프라인으로 통합 - 실패·품질 이슈만 재실행 3) 주안점 - 파인튜닝 TTS 실운영 - 단계별 JSON으로 상태·스킵·감사
프로젝트 성과
TTS 보이스 클론·파인튜닝
클론 스피커 기반 파인튜닝 모델을 파이프라인에 적용해 장·편 단위 내레이션 톤을 고정
LLM API 실운영
Ollama HTTP API로 장면·썸네일 등 생성 단계를 배치에 내장해 반복 운영
다단계 오케스트레이션
텍스트→음성·영상 완성을 JSON 단계로 나눠 재실행·스킵·배치가 가능하게 구성
핵심 기능
진행 단계
파이프라인 설계
2025.01.
단계·JSON 산출물·LLM/TTS/이미지 연동 구조 정의
프로젝트 상세
1) 포트폴리오 소개 - 원문/스크립트 → 장면·프롬프트 → TTS(보이스 클론) → 이미지·영상 → 자막·썸네일까지 자동화 - 로컬 LLM(Ollama) + 파인튜닝 TTS 모델을 HTTP로 묶어 장(챕터) 단위 배치 운영 2) 작업 범위 - 파이프라인 단계·JSON 산출물 설계 - LLM API·프롬프트 연동 - TTS 서버 연동, 보이스 클론·파인튜닝 모델 적용, 줄 단위 재생성·QA -







