Language-Invariant and Language-Specific Circuits in Multilingual LLMs: A Unified Mechanistic Interpretability of Reasoning, Safety, and Continual Learning
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(전략형)
2026년
2710113071
과학기술정보통신부
한국연구재단
서강대학교
이화란
7명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2029.08.31
2.0억원
2.0억원
기초연구
대학
서울특별시 마포구
정보/통신 > 정보이론 > 인공지능
다국어 대형언어모델(LLM)의 세 가지 핵심 능력(추론, 안전성 정렬, 지식 보존)이 모델 내부에서 언어-불변 회로(language-invariant circuit)와 언어-특이 회로(language-specific circuit)의 합성으로 구현되는지를 회로 수준에서 규명하고, 두 회로의 분리·상호작용·차등 동역학을 통합적으로 설명하는 다국어 LLM 분석...
본 연구는 메커니즘 해석(mechanistic interpretability) 도구를 다국어 환경으로 체계적으로 확장하여, 다국어 LLM의 내부 회로를 언어-불변 회로와 언어-특이 회로로 분리하고 그 상호작용을 인과적으로 규명한다. - 1차년도에는 다국어 회로 분석 인프라를 구축하고 reasoning 모델의 chain-of-thought가 어떤 언어로 진행...
다국어 회로 분석 오픈소스 툴킷과 데이터셋 공개를 통해 후속 연구의 표준 프레임을 제공하고, 한국어 AI 안전성의 기초과학적 토대를 구축한다. 회로 인식 미세조정 원리는 다국어 모델 학습의 데이터·에너지 효율 향상에 기여하며, 한국어 AI 거버넌스 정책 수립의 과학적 근거로 활용된다. 또한 다국어 NLP·안전성·메커니즘 해석 융합 인재를 양성하여 국내 AI...