Integrated Quantization-Pruning for Memory and Computation Optimization of Large Language Models
이공학학술연구기반구축(R&D) · 박사과정생연구장려금지원
2026년
2340053531
교육부
한국연구재단
서울과학기술대학교산학협력단
최다훈
1명
2026.03.01 ~ 2026.08.31
2025.09.01 ~ 2026.08.31
1,250만원
1,250만원
응용연구
대학
서울특별시 노원구
정보/통신 > 정보이론 > 인공지능
- 본 연구개발과제에 참여하는 연구자는 박사과정 동안, LLM을 엣지 디바이스에 효과적으로 배포하기 위한 핵심 기술로서, 양자화와 프루닝을 통합한 경량화 알고리즘을 구현(그림 1)하고자 하며, 이를 실제 하드웨어 환경에 적용하기 위해 FPGA 기반 가속기 설계를 통한 HW/SW 공동 최적화(HW/SW co-design)을 목표로 설정함. - 궁극적으로는 ...
■ [이상치 완화를 위한 Dithering 기반 양자화 알고리즘 개발]● 4-bit 양자화에서는 outlier 값이 quantization grid 경계를 초과할 가능성이 높아져 표현력 손실 및 성능 저하로 이어짐.● 이를 해결하기 위해, log-scale 도메인에서 weight 분포와 projection error를 분석하고, 이상치 구간에서의 오차를 완...
... quantization의 정밀 제어가 가능한 구조이므로, 향후 FPGA, ASIC, NPU 등 하드웨어 연동 설계 시 유용한 최적화 단위로 적용 가능.- 딥러닝 응용 서비스의 추론 비용 절감■ 클라우드 기반 LLM API, 스마트폰 기반 음성/텍스트 인터페이스 등에서 운영비용 감소와 사용자 응답시간 개선 효과 기대. [기대효과]- 사회적 기대효과 [친환경 AI 기술 실현]■ 연산 효율 ...