HW-SW Co-design for LLM Inference Acceleration via Sparse Attention Head Prediction
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066365
교육부
한국연구재단
서울시립대학교
이준헌
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
서울특별시 동대문구
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 LLM inference 과정에서 발생하는 Multi-head Attention의 구조적 비효율을 하드웨어-소프트웨어 공동 설계 관점에서 해결하는 end-to-end 최적화 프레임워크를 개발하는 것이다. 현재 Transformer 기반 모델은 입력 토큰과 무관하게 모든 Attention head의 weight를 메모리에서 로드하고 동일하게 ...
본 연구는 HAP와 SPE 두 핵심 모듈의 설계·구현·통합 검증을 4단계로 진행한다.1단계(1~3개월)에서는 PyTorch hook을 활용하여 LLaMA-7B, Mistral-7B 등의 모델에서 layer·head별 attention weight magnitude를 수집하고, 입력 도메인(QA, 코드, 요약)별 activation 패턴 분포를 분석한다. t...
본 연구의 성과는 학문적·기술적·산업적 측면에서 다음과 같이 활용될 것으로 기대된다.학문적 측면에서, inference-time 동적 head activation 예측(HAP)과 GPU prefetch 스케줄러 연동(SPE)을 통합한 end-to-end HW-SW 공동 최적화 프레임워크를 최초로 제시한다. 기존 연구들은 학습 시점 head pruning(M...