Difficulty-Conditional Analysis of Discriminative Limits for Reliable Automated Evaluation by Large Language Models
이공학학술연구기반구축(R&D) · 석사과정생연구장려금지원
2026년
2340065898
교육부
한국연구재단
울산과학기술원
김혜성
1명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
1,200만원
1,200만원
기초연구
대학
울산광역시 울주군
정보/통신 > 정보이론 > 인공지능
본 연구는 LLM-as-a-Judge 환경에서 비교 난이도에 따라 judge의 판정 신뢰도가 어떻게 변화하는지를 정량적으로 분석하고, 자동 판정이 유효한 구간과 인간 검증이 필요한 구간의 경계인 변별 한계를 도출하는 것을 목표로 한다. 또한 Chatbot Arena Elo 점수 차이와 인간 판정 불일치율을 결합한 난이도 축을 바탕으로, 프롬프트 조건과 ju...
1. 비교 난이도 축 구성1.1 MT-Bench 및 Arena-Hard에서 모델 쌍별 응답 비교 데이터와 인간 판정 결과 수집1.2 Chatbot Arena Elo 점수 차이와 인간 판정 불일치율을 결합한 연속형 난이도 지표 설계1.3 비교쌍별 난이도 분포 분석 및 재현 가능한 실험 환경 구축2. 조건부 신뢰도 측정 체계 설계2.1 judge별 인간 판정 ...
1. LLM 자동 평가의 신뢰성 분석 체계 제안1.1 평균 일치율 중심 평가를 넘어 난이도 조건부 신뢰도 평가 관점 제시1.2 자동 판정 가능 구간과 인간 검증 필요 구간을 구분하는 분석 틀 마련1.3 judge의 변별 한계를 정량적으로 비교할 수 있는 기반 확보2. 프롬프트와 judge 선택의 실무적 기준 마련2.1 프롬프트 조건 변화에 따른 판정 불안정...