Large Language Model Accelerator Design through On-Chip Weight Reconstruction
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066616
교육부
한국연구재단
건국대학교
손주형
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
서울특별시 광진구
전기/전자 > 반도체 소자·회로 > SoC
본 연구의 최종 목표는 on-device 환경에서 생성형 AI를 저전력·고효율로 추론할 수 있는 AI 가속기 구조를 제안하는 것이다. 이를 위해 최신 대규모 언어모델에서 활용되는 MoE 구조의 한계로 작용하는 외부 메모리 접근을 줄이고, 일부 expert weight만 on-chip에 저장한 뒤 나머지 weight는 칩 내부에서 생성하여 활용하는 구조를 설...
최근 Mixtral, DeepSeek-V3와 같은 최신 대규모 언어 모델들은 연산량은 줄이면서 성능을 높이기 위해 MoE(Mixture of Expert) 구조를 사용한다. MoE는 전체 weight를 불러오는 기존 대규모 언어 모델과 달리, 라우터가 입력토큰을 분석해 해당 입력토큰마다 필요한 expert weight만 불러오게 된다. 이 방식을 적용하면 ...
... 높일 수 있는 구조를 제시함으로써, 향후 모바일 기기, 스마트 디바이스, 로봇, 자율주행 시스템 등 실시간 AI 처리가 요구되는 다양한 응용 분야에 적용될 수 있을 것으로 기대된다. 또한 ... 서버 의존도를 낮추고 단말 내부에서의 효율적 추론 가능성을 높임으로써 에너지 효율 향상과 개인정보 보호 강화에 기여할 수 있다. 나아가 on-device 환경에 적합한 AI 가속기 구조를 제안함으로써, ...