Mechanistic Interpretability-Based Uncertainty Quantificationfor Trustworthy Large Language Models
이공학학술연구기반구축(R&D) · 박사과정생연구장려금지원
2026년
2340065631
교육부
한국연구재단
포항공과대학교
정진석
1명
2026.09.01 ~ 2027.02.28
2026.09.01 ~ 2027.08.31
1,250만원
1,250만원
기초연구
대학
경상북도 포항시
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 대규모 언어모델(LLM)의 최종 출력 결과(output-level) 중심의 기존 불확실성 정량화 방식을 넘어, 트랜스포머 구조 등 모델 내부 메커니즘의 활성화(activation) 정보를 활용한 내부 수준(internal-level)의 불확실성 정량화 체계를 구축하는 데 있다. 이를 통해 LLM 응답의 신뢰도를 보다 정밀하고 설명 가...
본 연구는 대규모 언어모델(LLM)의 내부 메커니즘을 해석하여 응답의 불확실성을 구조적으로 정량화하는 방법론을 개발하는 것을 주요 내용으로 한다. 이를 위해 먼저 번역, 요약 등 과제 수행 과정에서 활성화되는 어텐션 헤드를 분석하여, 특정 내부 활성 패턴과 불확실한 출력 간의 연관성을 규명하고자 한다. 다음으로 이러한 내부 활성 정보를 활용하여 베이지안 추...
... 기반 불확실성 정량화 기법은 대규모 언어모델(LLM)의 신뢰성 평가 체계를 고도화하고, 고위험 분야에서의 응답 필터링 및 안전성 검토에 활용될 수 있다. 또한 설명 가능하고 책임 있는 인공지능 개발을 위한 핵심 기반 기술로서 학계와 산업계 전반에 적용될 수 있으며, 향후 신뢰가능한 인공지능 개발과 활용을 위한 핵심 평가기술로 확장되어, 학술적·산업적 측면에서 활용도가 높은 연구성과로 ...