Semantic-Aware In-Situ KV Cache Selection and Recomputation for LLM Acceleration
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구B)
2026년
2710113617
과학기술정보통신부
한국연구재단
한양대학교산학협력단
조인순
2명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2029.08.31
6,324만원
6,324만원
기초연구
대학
서울특별시 성동구
사회과학 > 교육학 > 컴퓨터
본 연구는 재사용 캐시 선별 시, 의미론적 선별이 어려울 뿐 아니라, 선별과 같은 부차적인 연산에 GPU가 동원되는 비효율적 자원 사용 문제를 근본적으로 해결하고자 한다. 이를 위해 데이터 이동 경로(GPU ↔ 시스템 메모리) 상에 가속기가 내장된 CXL 메모리를 배치하고, Prefill 단계의 데이터 방출 시점에는 재사용성 선별(Tagging)을, 디코드...
이러한 목표를 달성하기 위해 최신 KV 캐시 재사용 기술이 적용된 EPIC 시스템을 기반으로 데이터 파이프라인을 재설계하고, 512개의 RISC-V 코어가 내장된 CXL 메모리에 In-Situ 태깅 및 재계산 통합 엔진을 구현한다. 최종 성과물은 CXL 가속 엔진과 [GPU ↔ CXL ↔ 호스트 메모리] 전 구간이 유기적인 데이터 파이프라인으로 결합한 「S...
1) 연구과제의 활용방안본 연구진은 연구 수행을 위해 512-코어 매니코어 IP가 집적된 CXL 가속기 프로토타입과 최신 GPU 서버를 사용하며, 소프트웨어 스택으로는 LLM 추론 분야의 표준인 vLLM 기반의 EPIC 시스템을 고도화하여 사용할 계획이다. 본 연구는 기술적 난도가 높을 뿐 아니라, 실제 Llama-3, Mixtral 등 산업 표준 모델을 통해 ...