Dual Codebook-based Visual Tokenizer for Complementing Lost Information in Visual Representations
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340065967
교육부
한국연구재단
한양대학교 에리카캠퍼스
김아름
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
경기도 안산시
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 기존 모델의 표현이 잘 보존하는 의미 정보를 유지하면서도, 시각적 세부 정보의 손실을 보완할 수 있는 dual codebook 기반 시각 토크나이저를 설계하는 것이다. 구체적으로는 기존 semantic representation이 학습 과정에서 놓치기 쉬운 세부 정보를 residual representation으로 분리해 보존함으로써...
본 연구는 SigLIP2 기반 시각 표현을 활용하여, 의미 정보는 유지하면서도 기존 semantic representation만으로 충분히 설명되지 않는 시각적 세부 정보를 함께 담을 수 있는 dual codebook 구조를 설계하고, 각 codebook의 역할과 활용 가능성을 분석하는 것을 중심으로 수행된다.(1) SigLIP2 기반 시각 표현 추출 및 ...
본 연구는 기존 semantic representation이 충분히 담아내지 못한 시각적 세부 정보를 residual codebook으로 보완함으로써, 기존 방식이 다루기 어려웠던 세밀한 시각 문제에 접근한다는 점에서 학술적 의의를 가진다. 또한 의미 정보와 이를 보완하는 시각 정보를 분리하여 구조화함으로써, 시각 표현의 내부 정보 구조를 보다 명확히 분석...