Optimization of CXL-SSD Utilization in Sparse Attention-based LLM Serving Systems
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340065905
교육부
한국연구재단
서강대학교
김민지
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
응용연구
대학
서울특별시 마포구
정보/통신 > 소프트웨어 > 임베디드 S/W
Sparse Attention 기반 LLM 서빙 환경에서 발생하는 KV Cache의 메모리 병목과 데이터 이동 지연 문제를 해결하기 위해, CXL-SSD를 활용한 KV Cache 관리 구조를 설계하고 최적화하는 것을 최종 목표로 한다. 이를 통해 long-context 환경에서도 안정적인 성능을 유지할 수 있는 고효율 LLM 서빙 시스템을 구현하고자 한다.
본 연구는 Sparse Attention 기반 LLM 서빙 시스템에서 KV Cache의 저장 및 활용 과정에서 발생하는 메모리 병목 문제를 해결하기 위해 CXL-SSD를 활용한 계층적 관리 구조를 설계하는 것을 목표로 한다. 세부 목표는 크게 세가지이다. 첫째, KV Cache의 저장 시점과 배치 전략을 분석하여 불필요한 저장 비용을 줄이고 cache hi...
본 연구를 통해 제안하는 KV Cache 관리 및 데이터 이동 최적화 기법은 LLM 서빙 과정에서 발생하는 메모리 병목을 완화하고 데이터 이동 비용을 줄여, 추론 지연을 감소시키는 데 기여할 수 있다. 특히 CXL 기반 메모리 확장 환경에서 효율적인 KV Cache 관리 구조를 제시함으로써, 향후 대규모 AI 서비스에서 요구되는 고성능·저지연 서빙 시스템 ...