Tractable Preference-Based Reinforcement Learning with NonlinearRewards, Ranking Feedback, and Realistic Choice Models
개인기초연구(과기정통부)(R&D) · 우수연구-세종과학펠로우십(국외연수트랙)
2026년
2710113276
과학기술정보통신부
한국연구재단
서울대학교산학협력단
이중규
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
7,350만원
7,350만원
기초연구
대학
서울특별시 관악구
수학 > 응용수학 > 인공지능수학/데이터사이언스수학
... 보장을 동시에 만족하는 선호기반 강화학습(PbRL) 이론 및 알고리즘을 확립하는 것임. 기존의 쌍대 비교 중심 PbRL 한계를 넘어 순위 기반 다중 선택지 피드백과 현실적인 선택모형을 포괄하는 일반적 학습 프레임워크를 구축하고, 이를 통해 인간 선호 정렬이 핵심인 대규모 인공지능 시스템(RLHF, 추천 시스템 등)에 적용 가능한 이론적 기반을 마련하고자 함.
... 기반 다중 선택지 피드백을 활용하는 PbRL 프레임워크를 구축하고, 선택지 수가 증가할수록 정보 활용도가 향상되는 샘플 효율적 학습 방법을 이론적·실증적으로 규명함. 셋째, 무관한 대안의 ... nested logit 등 현실적인 선택모형을 PbRL에 통합하고, 해당 설정에서도 유효한 성능 보장과 실제 응용 환경(추천 시스템, 대규모 언어모델 정렬 등)에서의 효과를 검증함.
... 작용하는 다양한 인공지능 응용 분야에 폭넓게 활용될 수 있을 것으로 기대됨. 비선형 보상 및 순위 기반 피드백을 고려한 선호기반 강화학습 알고리즘은 대규모 언어모델 정렬(RLHF), 추천 시스템, 온라인 의사결정 및 자동화 시스템 등에서 제한된 인간 피드백 환경 하에서도 높은 학습 효율과 안정성을 제공할 수 있음. 또한 현실적인 선택모형을 통합한 본 연구의 이론적 결과는 실제 사용자 ...