Active Learning-Based Action Space Optimization forCausal Multi-Armed Bandits under Incomplete Information
이공학학술연구기반구축(R&D) · 박사과정생연구장려금지원
2026년
2340065226
교육부
한국연구재단
서울대학교
박민우
1명
2026.09.01 ~ 2027.02.28
2026.09.01 ~ 2027.08.31
1,250만원
1,250만원
기초연구
대학
서울특별시 관악구
수학 > 응용수학 > 인공지능수학/데이터사이언스수학
본 연구에서는 환경을 표현하는 인과 그래프에 대한 사전 지식이 없는 상황에서도, 에이전트가 환경과의 상호작용을 통해 추상화된 인과 구조를 학습하고, 이를 바탕으로 행동반경최적화(Action Space Optimization; 이하 ASO)를 수행하는 CMAB알고리즘을 개발한다. 구조 학습과 최적화 과정을 반복적으로 수행함으로써, 전역적으로 최적의 정책에 수...
개발과제내용. 본 연구는 에이전트에게 외부에서 제공되어야 하는 인과 그래프 정보의 양을 단계적으로 축소해 나가는 방식을 통해, 궁극적으로는 인과 그래프에 대한 정보가 전혀 없는 환경에서도 능동적으로 작동 가능한 CMAB 알고리즘을 개발하는 것을 목표로 한다. 이를 위해 정보 가정 수준에 따른 단계적 연구 수행 체계를 설계하고, 각 단계에서의 이론적 정당성(...
... 기반의 의사결정 시스템뿐 아니라, 인과 추론과 결합된 새로운 형태의 기계학습 알고리즘 개발에도 기여할 수 있으며, 향후 자율주행, 로보틱스, 스마트 헬스케어와 같은 고신뢰 의사결정이 요구되는 분야에까지 파급력을 미칠 수 있다. 이를 통해 본 연구는 이론적 기여를 넘어서, 실질적인 문제 해결 역량을 갖춘 범용적 인공지능 시스템의 구현에 기여할 것으로 기대된다.