High-Dimensional Semantic Inference and Multimodal Representation Learning of Long-Form Videos toward Innovation in the Digital Media Industry
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(전략형)
2026년
2710111941
과학기술정보통신부
한국연구재단
이화여자대학교
강제원
14명
2026.09.01 ~ 2027.08.31
2025.09.01 ~ 2028.08.31
2.0억원
2.0억원
기초연구
대학
서울특별시 서대문구
정보/통신 > 디지털 방송·콘텐츠 > 디지털방송 단말
본 연구는 시간 및 공간적으로 변화가 큰 대용량 롱폼 비디오에 대해 고차원 의미 추론이 가능한 멀티모달 표현 학습 모델을 개발함으로써 실감형 미디어, 콘텐츠의 장기 맥락 이해와 입체 공간 분석에 관한 핵심 원천 기술을 확보하고 디지털 미디어, 콘텐츠 산업 분야 생산성 증대를 위해 연구 성과를 응용 확산하는 것을 목표로 함.
... 비효율성을 개선하여 기존 AI 기술이 공간 및 시간적으로 중복성이 대단히 큰 비디오 특성을 학습하는데 한계가 있었던 점을 해결하고자 함.2. 입체 공간 비디오-언어 가이드 멀티모달 인공지능 모델 개발- 입체 공간에 시각 정보 외 텍스트 등 서로 다른 모달리티가 가지는 특성을 결합하여 맥락적으로 더 깊은 이해를 제공하는 입체 공간 비디오-언어 가이드 멀티모달 인공지능 모델을 개발하여, ...
1. 원천기술 개발에 관한 효과 - 본 연구 결과로 장기 맥락을 이해하는 인공지능 비디오 이해 모델은 멀티모달 간 의미 연결 강화를 통해 고차원의 시맨틱 추론을 수행하고 공동 표현 공간에서 통합 분석하여 장면의 맥락·의도·감정 등을 파악하는 데 중요하게 사용되며, 국가 간 경쟁이 심화되고 있는 거대멀티모달 AI모델, 피지컬 AI 모델 원천기술 확보에 관한 성과를 ...