Multi-Stage Token and KV Cache Compression and FPGA-based Hardware Acceleration Technology Development for High-Resolution VLMs
이공학학술연구기반구축(R&D) · 박사과정생연구장려금지원
2026년
2340053618
교육부
한국연구재단
서울과학기술대학교산학협력단
이길하
1명
2026.03.01 ~ 2027.02.28
2025.09.01 ~ 2027.08.31
2,500만원
2,500만원
응용연구
대학
서울특별시 노원구
전기/전자 > 반도체 소자·회로 > SoC
본 연구는 Vision-Language Model(VLM)의 추론 효율을 극대화하기 위한 세 가지 주요 기술을 중심으로 구성된다. 첫째, VLM에서 사용되는 Vision Transformer(ViT)의 시각 토큰 중 중요도가 낮거나 중복되는 토큰을 선별적으로 제거하고, 유사한 토큰을 병합함으로써 LLM에 입력되는 시퀀스 길이를 효과적으로 줄인다. 이를 통해...
본 연구는 Vision-Language Model(VLM)의 연산 효율성과 메모리 최적화를 위해 소프트웨어와 하드웨어 측면에서 통합적인 기술 개발을 수행한다. 먼저 소프트웨어 측면에서는 ViT와 LLM의 토큰 및 KV 캐시에 대한 중요도를 정량화하는 기법을 개발한다. 이를 위해 ViT의 이미지 패치별 시각적 콘텐츠 중요도를 측정할 수 있는 메트릭을 구현하여...
... 부담이 큰 고해상도 VLM을 모바일 엣지 디바이스나 저전력 환경에서도 안정적으로 구동할 수 있도록 지원하는 하드웨어-소프트웨어 통합 솔루션으로 활용될 수 있다. 이러한 기술은 기존의 클라우드 기반 AI 처리 방식에 대한 의존도를 줄이면서, 엣지 AI 시스템의 자율성과 실시간성을 크게 향상시킬 수 있다.이와 더불어, 제안된 기술은 특정 모델이나 아키텍처에 종속되지 않고 기존 VLM에 ...