Speaker identity unlearning for AR-TTS using contrastive decoding
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066075
교육부
한국연구재단
성균관대학교
김효은
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
서울특별시 종로구
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 text-to-speech(TTS) 시스템에서 신원 보호가 필요한 특정 화자의 정체성이 합성 음성에 발현되지 않도록 선택적으로 억제하는 AR-TTS 기반 음성 생성 기술을 개발하는 데 있다. 구체적으로는 forget speaker에 대해서만 화자 특성의 재현을 억제하면서도, retain speaker 및 일반 화자 조건에서는 기존의 ...
본 연구에서는 먼저 codec token 기반 AR-TTS 모델을 기준 모델로 설정하고, forget speaker와 retain speaker를 구분한 실험 환경을 구축하여 데이터 전처리, 화자 조건 구성, baseline 성능 측정을 수행한다. 이후 frozen teacher 모델로부터 retain speaker 조건과 forget speaker 조건에...
... selective unlearning을 보다 정교하게 구현하는 방법론적 기반을 마련할 수 있다. 나아가 본 연구의 성과는 음성합성에 머무르지 않고 음성 인식, 음성 변환, 화자 적응, 개인정보 보호형 음성 인터페이스 등 다양한 음성 인공지능 분야로 확장될 수 있으며, 생성형 음성 AI의 안전성과 신뢰성을 높이는 기술적·학술적 기반으로 활용될 것으로 기대된다.