Development of Resource Management Platformfor Providing Vertical AI Services
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(전략형)
2026년
2710111994
과학기술정보통신부
한국연구재단
고려대학교
유헌창
8명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2029.08.31
1.9억원
1.9억원
개발연구
대학
서울특별시 성북구
정보/통신 > 정보통신 융합 서비스 > 정보통신 융합 컴퓨팅 플랫폼 기술
... 어댑터를 함께 운영하는 환경을 포함함- 사용자 응답 스트리밍 경로: 추론 클러스터에서 생성된 토큰을 사용자에게 순차적으로 전달하는 경로로, 후속 토큰 간 전달 지연, 네트워크 손실, 클라이언트 버퍼 상태가 사용자 체감 품질(QoE)에 직접적인 영향을 미침- 통합 자원관리 Control Plane: 학습 클러스터와 추론 클러스터, 사용자 응답 스트리밍 경로의 GPU, 메모리, 요청 ...
... 오버헤드를 최소화하는 저지연 어댑터 관리 기법 개발3. 사용자 체감 품질 향상을 위한 LMM 토큰 스트리밍 제어 기법 개발- 사용자 소비 속도에 맞는 안정적 토큰 공급을 위해, 토큰 전달 지연과 클라이언트 버퍼 고갈 위험을 반영한 QoE 여유도를 산출하고, 이에 따라 디코드 실행 우선순위와 토큰 공급 속도를 조정하는 토큰 페이싱(pacing) 기법 개발- 첫 토큰 응답성과 후속 토큰 ...
... 사용자 체감 품질 중심의 AI 서비스 운영 기술로 확장할 수 있음2. 경제·산업적 측면- LMM 학습·파인튜닝 과정에서 GPU 활용률을 높이고 메모리 병목을 완화함으로써, 추가 GPU 증설 부담, 클라우드 GPU 사용 시간, 모델 개발 비용을 절감하는 데 기여할 수 있음- 다중 도메인 특화 AI 서비스 환경에서 어댑터 적재·전환 지연, GPU 메모리 경쟁, 요청 간 간섭을 완화함으로써, ...