Expressive Singing Voice Synthesis via Conditional Flow Matching
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066213
교육부
한국연구재단
광주과학기술원
창길현
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
광주광역시 북구
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 Conditional Flow Matching(CFM)을 노래 음성 합성(SVS) 음향 모델에 통합하여, 기존 Diffusion 기반 모델의 두 가지 핵심 한계를 동시에 극복하는 표현력 있는 SVS 시스템을 개발하는 것이다. 첫째, DDPM 기반 모델(DiffSinger 등)은 수백 스텝의 denoising 과정이 요구되어 실시간 응...
본 연구는 CFM 기반 음향 모델과 마이크로 타이밍 편차 예측 모듈(MTP)의 두 핵심 모듈을 설계·통합하는 방식으로 진행된다. 첫째, CFM 기반 음향 모델에서는 cVAE 인코더로 추출한 사후 잠재 변수를 목표 분포로 설정하고, OT-CFM 벡터 필드를 학습하여 사전 잠재 변수에서 사후 분포로의 최적 수송 경로를 추론 시 ODE로 적분한다. FM-Sing...
본 연구의 성과는 학술적, 산업적, 기술 파급 세 가지 측면에서 활용될 수 있다. 학술적으로는 OT-CFM과 마이크로 타이밍 편차 모델링을 결합한 새로운 SVS 프레임워크를 Interspeech, ICASSP, ISMIR 등 음성 및 음악 정보 검색 분야 주요 국제 학회에 발표하여 관련 연구 커뮤니티의 발전에 기여한다. 특히 SVS 도메인에서 충분히 탐구되...