Adaptive KV Restoration for Memory-Efficient Long-Context LLM Inference
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구A)
2026년
2710114173
과학기술정보통신부
한국연구재단
숙명여자대학교산학협력단
신승준
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2028.08.31
4,529만원
4,529만원
기초연구
대학
서울특별시 용산구
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 장문 LLM 추론에서 KV cache 절감 이후 발생하는 정보 손실을 진단·복원·제어하는 원리를 규명하고, 이를 위한 적응형 KV 복원 기술을 개발하는 것이다. 장문 LLM 추론에서는 문맥 길이에 비례해 증가하는 KV cache가 GPU 메모리 사용량과 동시 처리량을 제한하는 핵심 병목으로 작용한다. 기존 KV pruning, evi...
1년차에는 restore query 기반 restore KV 생성 원리를 검증한다. Restore query token은 prefill 단계에서 context token과 함께 입력되어 각 layer의 key/value projection을 통해 layer-wise restore KV를 생성한다. 이후 원래 context KV는 선택된 pruning/evi...
본 연구의 성과는 장문 QA, RAG, 코드 이해, repository QA, 문서 분석, 다중 턴 에이전트 등 장문 LLM 응용에 활용될 수 있다. 줄어든 KV memory budget 안에서도 긴 문서의 핵심 근거 정보를 유지함으로써, 질의응답 비용을 낮추고 검색된 다수 문서나 다중 파일 문맥을 더 효율적으로 처리할 수 있다. 서버 기반 LLM 추론 환...