Dual-Query Cross-Modal Relation Alignment for Visually Grounded Video Question Answering
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340065804
교육부
한국연구재단
경희대학교산학협력단
김민수
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
개발연구
대학
경기도 용인시
사회과학 > 교육학 > 컴퓨터
본 연구의 최종목표는 질문과 영상 간의 교차모달 관계를 정교하게 반영하여, 질문에 대한 정답 예측과 그 근거가 되는 시간 구간 grounding을 동시에 수행할 수 있는 시각적 근거 기반 Grounded Video Question Answering 모델을 개발하는 데 있다. 기존 Grounded Video Question Answering 연구는 질문의 언...
본 연구는 기존 grounded Video Question Answering 방법의 핵심 한계인 단일 query 기반 grounding 구조의 한계와 GT-free 환경에서의 supervision 부족 문제를 해결하기 위해 단계적인 연구를 수행하고자 한다. 먼저, 질문과 영상 간 관계를 보다 정교하게 반영하기 위하여 질문을 anchor query와 main...
... 시간적 맥락에 기반하여 답변하도록 유도함으로써, 보다 신뢰 가능하고 설명 가능한 멀티모달 인공지능 모델 설계에 기여할 수 있을 것으로 기대된다. 이는 최근 인공지능 기술에서 중요성이 더욱 커지고 ... 있다.본 연구결과는 향후 비디오 이해, 영상 기반 질의응답, 비디오 검색, 멀티모달 에이전트, 지능형 영상 분석 시스템 등 설명가능성과 신뢰성이 중요한 다양한 응용 분야로 확장될 수 있을 것으로 ...