KV-Cache-Friendly Asynchronous LLM Inferenceon Heterogeneous Distributed GPU Infrastructure
투·융자연계기술개발(R&D) · 투·융자연계기술개발사업(스케일업 팁스_일반형)
2026년
2420033614
중소벤처기업부
중소기업기술정보진흥원
데이터얼라이언스(주)
이광범
13명
2026.07.01 ~ 2026.12.31
2026.07.01 ~ 2029.06.30
3.3억원
4.4억원
개발연구
중소기업
부산광역시 남구
정보/통신 > 정보통신 융합 서비스 > 달리 분류되지 않는 정보통신 융합 서비스
... 과제의 최종 목표는 이종 분산 GPU 환경에서 KV-cache 친화적 비동기 LLM 추론 솔루션을 개발하여 LLM 추론 처리를 효율화함으로써, AI 서비스 운영자의 추론 비용 절감, 클라우드 운영자의 자원 활용 효율화, 최종 사용자의 성능 향상을 동시에 달성하는 것이다.이를 위해 1) KV-cache 친화적 비동기 추론 엔진(예: vLLM·SGLang 등)을 코드 수정 없이 사이드카 ...
본 과제는 산업 표준화로 여겨지는(de-facto standard) vLLM·SGLang 등을 사용하는 AI 서비스에서 추론 API 사용 시, 비동기 & 배치 처리를 함으로써 KV-cache 적중을 극대화하는 솔루션을 개발하고자 한다. 이 때 해당 솔루션의 활용성을 높이기 위해 AI 서비스의 비즈니스 코드 수정 없이 Seamless하게 사용될 수 있게끔 개...
... 상용화하여 시장 적용·검증을 수행하고, 마지막 차년도에는 gcube 2.0으로 완전 상용화한다. Track II는 미들웨어·솔루션으로 패키징해 라이선스 사업화한다. ETRI·한국자동차연구원·네이버클라우드·FPT Smart Cloud와의 협업으로 sovereign LLM 추론 인프라를 실증하고 초기 판매하며, 토큰 사용량 증가에 따른 기존 gcube 매출 증가와 완전 상용화 후 솔루션 판매를 ...