Accelerating Speech Models for Low Latency Speech Generation and Streaming Understanding
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구B)
2026년
2710114455
과학기술정보통신부
한국연구재단
경희대학교산학협력단
박세진
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2028.08.31
6,419만원
6,419만원
기초연구
대학
경기도 용인시
정보/통신 > 정보이론 > 인공지능
본 연구의 최종목표는 자기회귀 기반 음성 언어 모델(Spoken Language Model, SLM)이 갖는 구조적 한계인 ① 응답 생성 지연, ② 순차 생성에 따른 오류 누적 및 노출 편향을 해결하기 위해, 음성 도메인에 특화된 저지연 비자기회귀 추론 패러다임과 효율적 음성 입력 이해 원천기술을 정립하는 것이다. 기존 SLM은 이전 토큰을 조건으로 다음 ...
...Whisper-LLaMA 계열 LLM과 speech-text interleaved decoding 방식으로 미세 조정 학습(LoRA-finetune)한다. 학습에는 Librilight, GigaSpeech, LibriSpeech, FLEURS 등 확보 완료된 총 7만 시간 규모 음성 데이터를 활용하며, 지연, 음질, 일관성 평가를 결합하여 모델을 검증한다.
... 제시한다. 이는 텍스트 중심 LLM 가속화 연구를 음성 도메인으로 확장하고, 음성의 계층적 표현, 낮은 정보 밀도라는 특성을 반영한 원천기술이라는 점에서 차별성이 크다. 산업적으로는 글로벌 빅테크 중심으로 빠르게 발전하는 음성 멀티모달 AI 시장에 대응할 수 있는 국내 독자 저지연 음성 AI 기반기술을 확보하고, 공개 모델·데모를 통해 후속 연구 및 산학협력으로 확산할 수 있다. ...