Mechanistic Interpretability for Value Assessment in LLMs: Analysis and Alignment of Self-Reporting Mechanisms
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340066593
교육부
한국연구재단
서울대학교산학협력단
임성집
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
서울특별시 관악구
정보/통신 > 정보이론 > 인공지능
본 연구는 언어모델의 가치관 평가 방법론으로 널리 활용되는 자기보고 방식의 신뢰성을 공학적으로 검증하고, 이를 실질적으로 개선하는 정렬 알고리즘을 개발하는 것을 최종 목표로 한다.현재 언어모델 심리측정학 분야는 인간 대상 심리검사에서 착안한 자기보고 방식에 의존하여 모델의 가치관을 평가한다. 이 방식은 모델에게 특정 가치관이 담긴 발화를 제시하고, 리커트 ...
본 연구는 언어모델의 자기보고 신뢰성 문제를 순차적으로 탐구하는 세 단계로 구성된다.첫 번째 단계에서는 언어모델의 자기보고 점수와 발화 생성 확률 사이의 상관관계를 정량적으로 분석하여 신뢰성을 평가한다. 구체적으로, 가치관 평가 데이터셋의 각 문항에 대해 모델이 선택한 리커트 척도 점수와, 해당 응답 발화를 모델이 자유 생성할 확률을 각각 측정한다. 이후 ...
본 연구의 성과는 학술적·사회적 두 차원에서 광범위하게 활용될 수 있다.학술적 측면에서, 본 연구는 언어모델 심리측정학 분야에 방법론적 전환점을 제공한다. 기존의 자기보고 기반 가치관 평가는 점수의 표면적 결과만을 해석하는 데 그쳤으나, 본 연구는 점수가 산출되는 내부 과정을 기계적 해석 방법론으로 규명함으로써 평가 결과에 대한 공학적 근거를 마련한다. 이...