Input-Aware Dynamic Model Compression for Efficient Generative AI Inference
개인기초연구(과기정통부)(R&D) · 우수연구-세종과학펠로우십(복귀·유치트랙)
2026년
2710111948
과학기술정보통신부
한국연구재단
한국과학기술원
전강은
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2031.08.31
1.2억원
1.2억원
응용연구
대학
대전광역시 유성구
정보/통신 > 정보이론 > 인공지능
최근 대규모 언어 모델(LLM)을 포함한 생성형 인공지능은 높은 성능에도 불구하고, 막대한 연산량과 에너지 소모로 인해 추론 비용이 매우 큰 것으로 알려져 있음. 특히 추론 중심 모델(Reasoning Model)과 에이전트형 인공지능(Agentic AI)은 복잡한 의사결정과 장기적 상호작용을 수행하는 특성으로 인해 기존 생성형 모델보다 훨씬 높은 연산 비...
본 연구는 5년의 연구 기간 동안 생성형 인공지능 모델의 추론 효율 문제를 해결하기 위해, 정적 모델 압축 기법의 구조적 한계를 극복하는 동적 모델 압축 기반 추론 체계를 확립하는 것을 최종 목표로 함. 특히, 실제 서비스 환경에서 다양한 입력·태스크 조건과 하드웨어 환경에 유연하게 대응 가능한 실사용 지향 고효율 추론 기술을 확보하고자 함. 이를 위해 본...
) 연구개발성과 활용방안● 본 연구에서 제안하는 입력 인지형 동적 모델 압축 기법은 연산 자원이 제한적인 엣지 디바이스에 국한되지 않고, 서버 및 클라우드 환경에서도 적용 가능한 범용 기술로서, 대규모 언어 모델(LLM), 추론 중심 모델(reasoning model), 에이전트형 인공지능(agentic AI), 확산 모델(diffusion model) 등 다양한 ...