Task-Adaptive Post-Training Principles for sLLMs: Comparing SFT and DPO with FFN-Based Structural Analysis
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구A)
2026년
2710114182
과학기술정보통신부
한국연구재단
한국외국어대학교연구산학협력단
최재걸
3명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2029.08.31
4,517만원
4,517만원
기초연구
대학
경기도 용인시
정보/통신 > 정보이론 > 인공지능
소형 거대언어모델(sLLM)의 태스크 적응형 사후학습 원리를 규명하고, 태스크 특성에 따라 지도 미세조정(SFT)과 직접 선호 최적화(DPO)를 선택·적용하는 기준을 확립한다. 지식 기반 질의응답, 검색 연계 질의응답, 근거 기반 응답 생성, 지시따르기 등 대표 태스크군에서 사후학습 효과를 체계적으로 비교하고, 답변(answer)과 인용(citation) ...
1차년도에는 기반 모형(Base), 지도 미세조정(SFT), 표준 직접 선호 최적화(DPO), 제안 직접 선호 최적화(DPO)를 동일 조건에서 비교하여 정확도(accuracy), 근거 충실성(faithfulness), 일관성(consistency), 선호도 정렬(preference alignment), 형식 준수율을 평가하고, 환각, 근거 불일치, 형식 오...
소형 거대언어모델(sLLM)의 사후학습 효과를 단순한 성능 비교 수준을 넘어 구조적으로 설명할 수 있는 분석 체계를 확보하고, 태스크 특성에 따른 지도 미세조정(SFT)과 직접 선호 최적화(DPO)의 적용 기준을 제시한다. 또한 답변(answer)·인용(citation) 등 응답 구성요소별 오류를 반영한 제안 직접 선호 최적화(DPO)의 가능성을 검증함으로...