프로젝트 배경
1) 문제점 - 법령·예규·판례와 실무 노트가 여러 위치에 분산되어 근거 검색과 재사용에 시간이 소요됨 - 같은 쟁점의 중복 노트와 적용연도 차이로 최신 근거와 정본을 구분하기 어려움 - 상담·신고·감사 산출물을 만들 때 자료요청, 근거 확인, 검토 승인 절차가 반복됨 2) 프로젝트 목표 - 공식 원문을 문서 ID와 출처·수집시점 기준으로 구조화 - 질문에서 공식 원문, 쟁점 정본, 검토 큐까지
프로젝트 성과
국세법령정보시스템 원문 138,230건 구조화
문서 ID 전수 발견과 재개 가능한 배치 수집으로 세법해석례 원문 노트 138,230건 및 검색 인덱스를 구축했습니다.
153,121개 지식노트 표준화 기반 구축
회계·세무·감사 노트를 7개 메타데이터 키와 source_status 체계로 관리해 검색·정본화·검토 큐를 연결했습니다.
자동화·검증 스크립트 1,248개 운영
수집, OCR, 링크·frontmatter 검사, 근거 상태 및 승인 게이트를 반복 실행 가능한 Python 스크립트로 구성했습니다.
핵심 기능
진행 단계
요구사항 및 운영 규칙 설계
2026.06
회계·세무·감사 자료를 공식 원문, 실무 정본, 검토 큐로 나누고 7개 메타데이터 키와 폴더 체계를 정의했습니다.
프로젝트 상세
1) 포트폴리오 소개 회계·세무·감사 실무에서 공식 근거를 찾고, 판단 노트를 정본화하고, 사람 검토까지 연결하기 위해 구축한 개인용 내부 업무시스템입니다. 공식 원문과 실무 노트를 분리해 저장하고 상담·신고·감사·콘텐츠 업무에서 재사용할 수 있도록 설계했습니다. 2) 작업 범위 및 기술환경 - Python 기반 공식자료 수집·정규화·검색 인덱스 구축 - PDF 텍스트 추출과 OCR 필요 문






