Zero-shot Image Captioning via High-Quality Data Synthesis with Diffusion Models
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066318
교육부
한국연구재단
한양대학교산학협력단
안예빈
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
서울특별시 성동구
정보/통신 > 정보이론 > 인공지능
... 도구, 이미지 검색 및 관리, CCTV 모니터링 효율 향상 등 다양한 분야에서 활용되고 있다. 그러나 고성능 캡셔닝 모델을 학습하기 위해서는 양질의 이미지-텍스트 쌍으로 구성된 대규모 데이터셋이 필수적이며, 이러한 데이터셋을 구축하는 데에는 막대한 비용, 시간, 인적 자원이 소요된다는 한계가 잇다. 이를 해결하기 위해 텍스트 전용 (Text-Only) 데이터만을 활용하여 확산 ...
... 1단계에서는 확산 모델이 복합 문장의 의미를 온전히 보존하면서도 시각적으로 정교한 이미지를 생성할 수 있도록 하는 어텐션 강화 기법을 연구한다. 일반적으로 MS-COCO와 같은 대표적 데이터셋은 하나의 이미지에 5개의 서로 다른 캡션이 매핑되어 동일한 장면을 다양한 관점에서 기술하고 있다. 기존 방법론은 이 캡션들을 개별적으로 이미지화하여 의미적 중복과 비효율을 초래했으나, ...
... compositional 이미지 생성 기법은 제로샷 이미지 캡셔닝뿐 아니라, 이미지-텍스트 쌍 데이터 구축이 어려운 다양한 멀티모달 과제에 범용적으로 활용될 수 있다. 구체적으로, 시각적 질의응답(Visual ... 수 있다. 또한 시각장애인 보조 시스템에서 이미지를 자동으로 설명하는 기능, 온라인 콘텐츠 플랫폼에서의 자동 설명 생성, 전자상거래 상품 이미지에 대한 설명문 자동화, CCTV 영상 모니터링 ...