Development of AI Technology for Deep Long-form Video Understanding Based on Narrative Structures
이공학학술연구기반구축(R&D) · 기본연구B(포용형)
2026년
2340064086
교육부
한국연구재단
서울대학교산학협력단
오유리
1명
2026.09.01 ~ 2027.02.28
2026.09.01 ~ 2029.08.31
3,000만원
3,000만원
응용연구
대학
서울특별시 관악구
정보/통신 > 정보이론 > 인공지능
기존 비디오 분석 기술이 막대한 연산 비용과 데이터셋의 한계로 인해 수초 내외의 짧은 클립에서 객체나 행동을 분류하는 수준에 머물렀던 점을 개선하여, 장편 영상의 복잡한 서사 구조와 사건 간의 인과관계를 인간 수준으로 심층 이해하는 차세대 멀티모달 AI 핵심 기술을 개발하는 것이 최종 목표임. 단순히 현재 화면에 무엇이 나타나는지 묘사하는 단계를 넘어 사건의 ...
1차년도에는 서사 구조가 뚜렷하고 복선이나 인물 간 상호작용이 풍부한 영화, 드라마, 다큐멘터리 등을 중심으로 장편 비디오 이해를 위한 대규모 벤치마크 데이터셋을 구축함. 인간의 영상 인지 프로세스를 모사하여 영상을 'Shot-Scene-Event-Story'로 이어지는 계층적 구조로 자동 라벨링하는 프레임워크를 제안하며, 음성 인식(ASR), 인물 식별, 행동 ...
... 예상됨. 사회적으로는 오디오와 비디오 두 영역의 전문성을 모두 갖춘 희소성 있는 멀티모달 AI 전문가를 양성하여 국가 AI 연구 생태계의 기술 리더십 확보에 기여함. 궁극적으로 글로벌 빅테크가 주도하는 비디오 이해 분야에서 독창적인 시청각 통합 모델링 기법을 제시함으로써 국가적 차원의 기술 주권을 확보하고 세계적인 학문적 영향력을 확대할 수 있을 것으로 기대됨.