Multimodal 3D Spatial Perception and Situational Understanding with Spatial Audio
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066146
교육부
한국연구재단
한국과학기술원
정진우
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
대전광역시 유성구
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 시각 정보, 언어 지시 그리고 공간 오디오(Spatial Audio)를 통합적으로 처리하여 3차원 환경에서의 고도화된 공간 인식 및 상황 이해가 가능한 멀티모달 인공지능 모델을 구축하는 것입니다. 인간은 시야가 확보되지 않은 상황에서도 소리의 방향, 거리 등을 통해 주변 환경을 입체적으로 이해하지만, 현재의 멀티모달 AI는 대부분 단...
... Spatial Description: 인지된 정보를 바탕으로 현재 상황을 텍스트로 설명하거나, 상황에 적합한 로봇의 행동 지시를 생성하는 상위 수준의 추론 능력을 평가합니다. 이는 단순히 학습된 데이터를 기반으로 동작하는 것이 아닌 Reasoning 결과를 효과적으로 평가합니다.(2) 3D Audio-Visual Scene Benchmark 구축약 14만 개의 객체와 3,100개의 ...
... 환경을 효과적으로 이해하고, 시야 밖의 음향 정보에 대한 추론 능력을 통해 정밀한 환경 인식과 의사결정을 수행할 수 있습니다. 특히, 연구실 보유 4족 보행 로봇 및 Franka 로봇 플랫폼을 활용하여 실제 환경에서의 적용 가능성을 검증할 계획입니다. 자율주행 측면에서는 기존 센서 체계를 보완하여 사각지대 위험 상황 인지 능력을 향상시킬 수 있으며, 공간 오디오 기반의 상호작용 ...