Unsupervised Environment Design for Improving Generalization in Reinforcement Learning
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340056049
교육부
한국연구재단
광주과학기술원
임재균
1명
2026.03.01 ~ 2026.08.31
2025.09.01 ~ 2026.08.31
600만원
600만원
기초연구
대학
광주광역시 북구
정보/통신 > 정보이론 > 인공지능
강화학습 에이전트가 다양한 환경 변화에 적응하면서도 일관된 성능을 유지할 수 있도록, 일반화 성능을 향상시키는 학습 구조 설계를 목표로 합니다. 이를 위해 학습에 도움이 되는 환경을 자동으로 구성하는 비지도 환경 설계(Unsupervised Environment Design, UED) 프레임워크를 활용하며, 환경의 구조적 특성과 태스크 간 관계성을 반영한 ...
(1) 환경 구조 정보를 반영한 정교한 난이도 추정 지표 도입강화학습에서 regret은 에이전트가 얻은 수익(Return)과 해당 환경에서의 최적 수익 간의 차이를 의미하며, 해당 태스크의 난이도를 측정하는 주요 지표로 활용됩니다 [4-10]. 하지만 실제 환경에서는 최적 수익을 알 수 없어 regret을 직접 계산하기 어려우므로, 기존 연구들은 양의 가치...
(1) 정교한 난이도 지표기존 양의 가치 손실(PVL), 최대 몬테카를로(MaxMC) 등 단순 regret 근사 지표의 한계를 극복하고, 가치 함수 예측 오차(Value Error)와 상태 변화 예측 오차(Transition Prediction Error)를 결합한 새로운 난이도 지표를 제시하여, 더 정확하고 풍부한 정보를 기반으로 환경 난이도를 측정하고,...