KeyVLM: Spatio-Temporal Keypoint Quantization based Vision Language Model
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(전략형)
2026년
2710111544
과학기술정보통신부
한국연구재단
인하대학교
이우기
7명
2026.09.01 ~ 2027.08.31
2025.09.01 ~ 2028.08.31
2.0억원
2.0억원
기초연구
대학
인천광역시 남구
정보/통신 > 정보이론 > 인공지능
... VLM 아키텍처와 결합함으로써 기존 대비 수백 배 압축된 입력과 낮은 연산 자원으로도 고성능 추론이 가능한 모델을 설계한다. 이를 통해 Gloss-Free 수어 번역, 3D 포즈 생성, 행동 예측 등 다양한 응용에서 실효성을 검증하고, 궁극적으로는 모바일 및 엣지 환경에서 실시간으로 작동하는 인간 중심 AI 시스템을 실현하는 것이 본 연구의 궁극적 지향점이다.
... 학습 안정성과 성능을 확보한다. 둘째, 인간 중심 AI 응용을 위한 KeyVLM의 활용이다. 여기에는 텍스트 기반 3D 포즈 생성, 행동 인식·예측, Gloss-Free 수어 번역 및 생성 시스템 개발이 포함되며, 각 응용별로 데이터 처리부터 모델 구현, 사용자 평가까지 전주기적 실증을 수행한다. 이 모든 과정은 멀티모달 융합 구조, 모델 경량화, 학습 효율성 극대화라는 일관된 ...
... BLEU 점수 20 이상, 행동 인식 mAP 75% 이상 등의 정량적 지표 달성이 기대된다. 또한 Gloss-Free 기반 수어 처리, 의미 기반 포즈 생성 등 고도화된 기능을 갖춘 데모 시스템을 개발하고, 사용자 평가를 통해 기술의 실용성과 사회적 수용성까지 검증한다. 최종적으로 학술적·산업적 성과로 이어질 수 있는 데이터셋, 공개 모델, 논문, 특허, 응용 서비스 기반까지 확보하는 것을 ...