Development of a Quasi-Identifier Risk Contribution Assessment Framework Based on Natural Language Processing: Focusing on Korean Legal Judgments
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340065991
교육부
한국연구재단
광주과학기술원
최시은
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
광주광역시 북구
정보/통신 > 정보이론 > 프로그래밍 언어/자연어 처리
한국어 이혼 사건 1심 판결문을 대상으로, 준식별자의 재식별 위험 기여도를 0~3단계로 판단할 수 있는 정량적 평가 프레임워크를 설계한다. 이를 판결문에 적용한 파일럿 주석 데이터셋을 구축하고, 문맥 정보와 서열 구조를 반영한 예측 실험을 통해 해당 프레임워크의 활용 가능성을 검증한다.
이혼 사건 1심 판결문을 수집한 뒤 문장 단위 전처리와 후보 준식별자 스팬 추출을 수행한다. 이후 지역, 직업, 관계, 기관 등 범주를 정의하고, 각 스팬에 대해 0~3점의 서열형 위험도 주석 가이드라인을 설계하여 파일럿 데이터를 구축한다. 이어서 KLUE-RoBERTa, SBERT 기반 환경에서 스팬 단독 입력과 문맥 포함 입력, 명목형 분류와 서열형 분...
본 연구는 한국어 판결문에서 준식별자의 식별 위험 기여도를 평가하기 위한 정량적 평가 프레임워크와 파일럿 데이터를 제시함으로써, 기존의 식별자 탐지 중심 비식별화 연구를 확장하는 기초자료가 될 수 있다. 특히 판결문 공개 전 우선적으로 검토해야 할 표현과 위험 수준을 구체화할 수 있어 실무적 효용성이 높다. 나아가 본 연구는 법률 전반 및 타 산업 분야의 ...