Multifaceted and Efficient Capability Diagnosis for Large Language Models
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구B)
2026년
2710113783
과학기술정보통신부
한국연구재단
한국외국어대학교연구산학협력단
최승택
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2029.08.31
6,402만원
6,402만원
기초연구
대학
경기도 용인시
정보/통신 > 정보이론 > 인공지능
본 연구의 최종목표는 거대언어모델의 능력을 실제 배포 환경의 다양한 맥락 조건에서 분해하여 추정하고, 최소한의 관측만으로 신뢰할 수 있는 맥락별 성능 진단 결과를 산출하는 통합 평가 방법론을 정립하는 것이다. 기존 LLM 평가는 단일 벤치마크 점수와 리더보드 순위에 의존하여, 프롬프트, 검색 증강, 출력 형식, 도구 조건, 에이전트 실행 상태 등 맥락 변화...
본 연구는 3년간 측정 기반 구축, 잠재변수 분해 모델 정립, 적응형 진단 및 개선 루프 구축의 단계로 수행된다. 1년차에는 전통 벤치마크와 에이전트 태스크를 함께 표현할 수 있는 공통 맥락 스키마를 정의하고, 프롬프트, 검색 증강, 출력 형식, 도구 조건, 태스크 명세, 실행 기록 등에서 맥락 변수를 생성 또는 추출한다. 이를 바탕으로 모델×문항×맥락 응...
본 연구의 주요 성과는 맥락별 응답 행렬 데이터셋, 맥락 생성 및 추출 도구, 맥락 인식 IRT 추정 알고리즘, 적응형 평가 프로토콜, 공개 진단 파이프라인이다. 핵심 산출물은 윤리 및 라이선스 조건을 준수하는 범위에서 HuggingFace와 GitHub에 공개하여, LLM 개발 및 평가 연구자가 자신의 모델에 대해 최소 관측으로 맥락별 성능 진단 결과를 ...