Scalable LLM inference system for lookup-augmented models
중소기업기술혁신개발(R&D) · ★중소기업기술혁신개발사업(글로벌선도기술개발_글로벌협력형)
2026년
2420033895
중소벤처기업부
중소기업기술정보진흥원
(주) 디노티시아
김현진
3명
2026.07.01 ~ 2026.12.31
2026.07.01 ~ 2026.12.31
1.1억원
1.3억원
개발연구
중소기업
서울특별시 서초구
정보/통신 > 정보이론 > 인공지능
... 설계에서 CPU-GPU 이기종 시스템 설계로 추론 인프라의 패러다임을 전환하고, 이를 실제 데이터 센터 환경에 즉시 적용 가능한 수준으로 구현하고자 함1. 조(Trillion) 단위 모델의 ... 확장성을 검증 및 상용 패키징 완료4. 글로벌 기술 표준 선점 및 산업 경쟁력 강화- 글로벌 빅테크가 주도하는 룩업 증강 아키텍처의 표준이 형성되기 전, 최신 하드웨어(CXL, AMX, IAA)를 ...
- (CPU-GPU 협력적 연산) 인텔 AMX 가속기를 활용하여 룩업 이후의 연산을 CPU에서 처리함으로써 CPU와 GPU 사이의 데이터 전송 병목을 근본적으로 해결하는 이기종 연산 분할 기술 설계- (룩업 인식 요청 라우팅) 요청된 토큰의 분포를 분석하여 유사한 룩업 데이터를 필요로 하는 요청들을 동일한 GPU로 할당함으로써, 중복된 임베딩 전송을 방지하고 ...
... 대규모 AI 서비스 운영사의 인프라 구축 솔루션으로 활용할 계획임[기대 효과]- 고가의 메모리 의존도를 낮춰 데이터 센터 규모의 인프라 구축 비용(TCO)을 크게 절감할 수 있으며, 사용자 체감 지연 시간을 최소화하여 서비스 품질 유지 가능- 글로벌 빅테크가 주도하는 룩업 증강 아키텍처 시장에서 핵심 인프라 기술을 선점하고, 국내 AI 산업 전반의 비용 경쟁력을 높여 ...