Efficient and Scalable Generative AI Serving with Hierarchical Edge-Server Cooperative Inference
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구A)
2026년
2710113932
과학기술정보통신부
한국연구재단
아주대학교산학협력단
오영환
5명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2030.08.31
4,560만원
4,560만원
기초연구
대학
경기도 수원시
정보/통신 > 정보이론 > 오퍼레이팅 시스템
... 생성형 AI 서비스를 단독으로 안정적으로 실행하기 어렵다.본 연구의 최종 목표는 생성형 AI 추론 서비스를 단일 엣지 디바이스 또는 단일 서버의 최적화 문제가 아니라, 엣지-로컬 서버-클라우드가 계층적으로 협력하는 동적 시스템 최적화 문제로 재정의하고, 이를 위한 하드웨어 및 시스템 소프트웨어 원천기술을 개발하는 것이다. 이를 위해 생성형 AI 추론의 출력 길이 변동성, 동적 ...
... early-exit 등 생성형 AI 추론의 동적 특성이 지연시간, 메모리 사용량, 전력 소모, 데이터 이동량에 미치는 영향을 정량적으로 분석한다. 이를 바탕으로 엣지 디바이스, 로컬 서버, 클라우드 GPU 서버의 연산 성능, 메모리 용량, 네트워크 지연을 반영한 경량 성능 예측 모델을 개발한다.(2) 엣지-서버 다계층 협력 스케줄링 알고리즘 설계요청별 지연 민감도, 예상 출력 길이, 데이터 민감도, ...
... 최적화 문제로 정식화한다는 점에서 의의가 있다. 특히 출력 길이 변동성, KV cache 누적, 실행 상태 이동, 네트워크 변동성, 계층별 자원 제약을 통합적으로 고려함으로써, 향후 엣지-클라우드 AI 시스템 연구의 새로운 문제 정의와 평가 기준을 제시할 수 있다.기술적으로는 고비용 클라우드 서버에 집중되는 생성형 AI 추론 부하를 엣지 및 로컬 서버와 분산 처리함으로써 추론 비용과 ...