바이트댄스가 음성과 영상, 텍스트를 하나의 모델에서 동시에 처리하는 전이중(Full-Duplex) 멀티모달 대형언어모델(LLM) '시드리얼타임(SeedRealtime)'을 출시했다. 기존 음성 AI가 질문과 답변을 차례로 처리하는 방식에 머물렀다면, 시드리얼타임은 주변 환경을 실시간으로 이해하고 적절한 시점에 먼저 말을 거는 능동형 AI를 구현한 것이 특징이다.
바이트댄스는 5일(현지시간) 시드리얼타임이 통합 아키텍처를 기반으로 음성·영상·텍스트를 동시에 처리해 '보고, 듣고, 말하는' 자연스러운 상호작용을 제공한다고 밝혔다.
음성인식