Multimodal Context-Aware Proactive Conversational AI with User Personalization
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구B)
2026년
2710113547
과학기술정보통신부
한국연구재단
중앙대학교
김지훈
3명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2029.08.31
6,289만원
6,289만원
응용연구
대학
서울특별시 동작구
정보/통신 > 정보이론 > 인공지능
... 기술, (4) 시스템의 범용성·강건성 확보를 위한 500시간 이상의 실환경 시·청각 통합 데이터셋 구축을 최종 목표로 함.정량적 목표로 음성인식 단어 오류율(WER) 9.9% 이하, 의도 ... 확보함. 본 연구를 통해 수동적 단일 모달 AI에서 능동적 멀티모달 AI로의 패러다임 전환을 선도하고, 글로벌 빅테크에 종속되지 않는 독자적 차세대 대화형 AI 원천 기술을 확보함.
본 연구는 4개 워크패키지(WP)로 체계적으로 수행함.[WP1] 대규모 멀티모달 데이터셋 구축: 1차년도에 텍스트 기반 대화 데이터를 활용한 합성 시·청각 데이터를 우선 구축하여 파이프라인을 신속히 검증하고, 2차년도에 YouTube 등 오픈소스 비디오 플랫폼 기반 실환경 데이터로 확장함. UTMOS(음성 품질)·FID(영상 품질)·LSE-C(시·청각 동기화) ...
[활용계획] 본 과제에서 구축한 시·청각 통합 데이터셋을 오픈소스로 공개하여 후속 연구의 토대를 마련하고 멀티모달 대화형 AI 생태계를 활성화함. 핵심 요소 기술(멀티모달 상황 이해, ... 선도하고, 독자적 연구 성과 창출을 통해 글로벌 연구 흐름을 주도함.(경제·산업적 측면) 글로벌 빅테크 주도의 대화형 AI 시장에서 독자적 기술 경쟁력을 확보하여 기술 종속을 탈피함. 초개인화 ...