Hardware-Aware Speculative Decoding for On-Device LLM Acceleration on Mobile NPUs
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구B)
2026년
2710113072
과학기술정보통신부
한국연구재단
인하대학교
이어진
4명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
6,380만원
6,380만원
기초연구
대학
인천광역시 남구
정보/통신 > 정보이론 > 인공지능
본 연구는 모바일 NPU 환경에서 LLM speculative decoding의 구조적 비효율을 완화하여, LLM 추론의 throughput 향상과 latency 감소를 동시에 달성할 수 있는 모바일 NPU 특화 speculative decoding 기술 개발을 목표로 함. 이를 위해, draft 단계의 GEMV 중심 연산으로 인한 NPU 활용률 저하를 완...
- 본 연구는 선행연구를 통해 확보한 모바일 NPU 기반 LLM 추론 병목 분석 결과를 출발점으로 하여, 1년 동안 모바일 NPU 추론 특성의 확장 분석, 검색 보조형 draft 생성 구조 설계, 그리고 Snapdragon NPU 기반 구현 및 성능 검증의 단계로 수행됨.- 사전연구 및 준비현황: 본 연구팀은 선행연구를 통해 퀄컴 Snapdragon[20]...
... 향상-모바일 AI 반도체/시스템 SW: Batching이 어려운 환경에서 draft 단계의 낮은 NPU 활용률을 완화하는 runtime 최적화 기술로 활용-프라이버시, 저지연 응용: 클라우드 의존도를 줄여 개인정보 보호 및 네트워크 지연 최소화-연구 및 교육 분야: mobile LLM 추론, AI 가속기 활용 최적화 연구 및 대학원 교육에 활용또한 기술/산업/학술적 측면으로 아래와 ...