A Multi Co-Viewer Agent Framework Based on Vision-Language Models
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(유형A)
2026년
2710111454
과학기술정보통신부
한국연구재단
한양대학교에리카산학협력단
고민삼
2명
2026.09.01 ~ 2027.08.31
2025.09.01 ~ 2027.08.31
6,409만원
6,409만원
기초연구
대학
경기도 안산시
정보/통신 > 정보이론 > 인공지능
... 시청자들이 채팅방에서 어울리는 것과 유사한 몰입형 경험을 제공할 수 있어야 한다. 이를 위해 1차년도에는 먼저 유튜브 라이브, 네이버 스포츠 오픈톡 등에서 수집한 실시간 멀티모달 데이터를 기반으로, 영상-채팅 간 정합 관계를 학습하는 비전-언어 반응 생성 모델을 개발한다. 이때 반응 생성은 단순한 캡션 설명이 아니라, 시청자 페르소나에 따른 말투, 감정, 어휘 선택을 반영한 ...
... 에이전트 시스템 확장의 두 단계로 구성된다.[1차년도] 단일 Co-Viewer 에이전트 구현 1차년도에는 유튜브 실시간 중계와 네이버 스포츠 오픈톡 등에서 수집한 스포츠 중계 기반 영상-채팅 데이터를 정제·구축한다. 각 채팅 메시지는 시간, 발화자 ID, 영상 구간, 반응 유형 등의 메타 정보를 포함하며, 시청 장면과 시청자 반응 간 정합성을 학습할 수 있는 멀티모달 학습 데이터셋으로 ...
... 산업적 측면에서, 본 과제의 결과물은 스포츠, 예능, 라이브 방송 등 실시간 콘텐츠 기반 플랫폼에 손쉽게 도입 가능하다. 특히 유튜브 라이브, 트위치, OTT 스트리밍 환경에서는 시청자 참여와 ... 분야에서 후속 연구 기반을 제공할 수 있다. 또한 본 연구를 통해 구축되는 영상-채팅 정합 데이터셋, 페르소나 유형별 반응 샘플, 다중 에이전트 상호작용 로그 등은 향후 연구자에게 공개 가능한 ...