프로젝트 배경
1) 문제점 - 예술과 기술 교차 영역에서 이론적 어휘가 실제 담화에서 어떻게 작동하는지에 대한 대규모 정량적 분석이 부재 - 기존 연구는 소규모 정성 분석에 의존하여 재현성과 일반화가 제한적 - 대규모 코퍼스(62,400건)를 처리할 수 있는 자동화된 NLP 파이프라인이 없었음 - 클라우드 API 기반 LLM 사용 시 비용과 데이터 프라이버시 문제 발생 2) 프로젝트 목표 - 13개 코퍼스, 62
프로젝트 성과
Nature 계열 학술지 단독 저자 투고
Humanities and Social Sciences Communications에 단독 저자 연구논문 투고, 현재 심사 중
62,400건 대규모 코퍼스 처리 파이프라인 구축
13개 코퍼스에 대해 전처리, LLM 추론, 통계 분석, 시각화까지 자동화된 파이프라인 완성
핵심 기능
진행 단계
연구 설계
2025.09.
연구 문제 정의, 13개 코퍼스 선정 및 수집(62,400건), 4단계 분석 방법론 설계
프로젝트 상세
62,400건의 문서를 분석하는 end-to-end 자연어 처리 파이프라인을 단독으로 설계 및 구현한 연구 프로젝트입니다. 배경: 예술 및 기술 분야의 13개 코퍼스에서 특정 이론적 어휘가 어떻게 활용되는지를 4단계 계산적 분석 방법론으로 규명하는 것이 목표였습니다. 기술 스택 및 구현: - vLLM을 자체 호스팅하여 LLM 추론 환경 구축 (클라우드 API 의존 없이 로컬 GPU 환경에서 운영) -






