Large Language Model Memory Compression and Development of Variable-Format Arithmetic
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066014
교육부
한국연구재단
건국대학교
태원영
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
서울특별시 광진구
전기/전자 > 반도체 소자·회로 > SoC
본 연구의 최종목표는 거대언어모델(LLM)의 추론 과정에서 발생하는 높은 메모리 요구량과 연산 비효율 문제를 해결하기 위하여, 사후양자화(Post-Training Quantization) 기반의 메모리 압축 기법과 이를 효과적으로 처리할 수 있는 가변 포맷 연산 구조를 통합 설계하는 데 있다. 최근 생성형 AI와 LLM은 파라미터 수의 대규모 확장에 따라 ...
... 연구는 LLM의 대규모 추론 과정에서 문제가 되는 외부 메모리 접근 비용과 연산 자원 소모를 줄이기 위해, 사후양자화 기반 메모리 압축과 가변 포맷 연산 구조를 함께 개발하는 하드웨어-소프트웨어 통합 연구로 수행된다. 연구의 전체 흐름은 크게 알고리즘 검증, 하드웨어 설계, 고주파수 설계 검증, 칩 측정의 4단계로 구성된다. 1단계에서는 LLM 워크로드를 분석하고, 실제 추론 환경에서 ...
본 연구의 성과는 우선 거대언어모델 추론 과정에서 요구되는 메모리 저장량과 외부 메모리 접근량을 크게 줄일 수 있는 고효율 메모리 압축 기술로 활용될 수 있다. 최근 AI 모델은 규모 확장에 따라 학습 비용뿐 아니라 추론 비용과 메모리 수요도 빠르게 증가하고 있으며, 이러한 문제는 데이터센터 기반 AI 서비스뿐 아니라 개인 기기에서 AI를 실행하고자 하는 ...