Research and Development of Multi-Modal AI-Based Audio-visual Convergence ASR and Intelligent Caption Normalization System
K-Culture글로벌스타트업육성기술개발(R&D) · 글로벌 K-Culture 스타트업 혁신성장 기술개발
2026년
2370000493
문화체육관광부
한국콘텐츠진흥원
주식회사 브레인벤쳐스
김원회
7명
2026.06.01 ~ 2026.11.30
2026.06.01 ~ 2028.12.31
5,000만원
7,000만원
응용연구
중소기업
경기도 성남시
정보/통신 > 정보이론 > 인공지능
본 연구개발의 최종 목표는 글로벌 K-콘텐츠 확산에 발맞춰 예능과 같은 방송 특유의 소음(Babble noise, BGM 등) 및 돌발 시각 연출 환경에서도 높은 인식률과 실무 효율성을 보장하는 멀티모달 AI 기반 시청각 융합(AVSR) 및 지능형 자막 정규화 시스템을 개발하고 상용화하는 데 있습니다. 이를 위해 1단계 기획 및 검증 과제에서는 기존 오디오...
데이터셋 구축 및 고도화 공정에서는 AI-Hub의 고품질 입모양-음성 데이터를 확보하여 학습의 원천 기반을 마련합니다. 특히 실제 방송 환경의 가혹한 제작 조건을 완벽히 모사하기 위해 단순 소음뿐만 아니라 다화자 중첩 소음, BGM, 촬영 현장의 소음 등을 단계별로 정교하게 합성하는 고도화된 데이터 증강(Data Augmentation) 기법을 적용하고 있습니다. ...
본 과제를 통해 개발된 성과물은 멀티모달 융합이라는 압도적인 기술적 해자(Moat)를 바탕으로 초기 국내 B2B 시장 선점을 거쳐 글로벌 플랫폼 및 B2C 크리에이터 생태계로 단계적 사업화를 강력하게 추진합니다. [성과 활용 계획] 초기 사업화 단계에서는 미디어 산업의 핵심 거점인 고양시 일산 지사에 기구축한 B2B 네트워크를 적극 활용합니다. 대형 방송사 및 ...