Developing Steering Vector Mechanism for LLMs to Prevent Harmful Content Generation
개인기초연구(과기정통부)(R&D) · 우수연구-핵심연구(기본연구B)
2026년
2710113775
과학기술정보통신부
한국연구재단
성균관대학교산학협력단
김장현
8명
2026.09.01 ~ 2027.08.31
2026.09.01 ~ 2027.08.31
6,415만원
6,415만원
기초연구
대학
경기도 수원시
정보/통신 > 정보이론 > 인공지능
본 연구의 최종 목표는 생성형 AI 모델의 이미지 생성 내부 연산 과정에 직접 개입하여 유해 콘텐츠 생성을 원천 차단하는 방어 기술을 개발하고, 이를 자동으로 평가·설명할 수 있는 통합 안전 시스템을 구축하는 데 있음. 이를 통해 기존 외부 필터링 방식의 한계를 극복하고, 딥페이크 등 AI 악용 범죄에 효과적으로 대응할 수 있는 실질적 기술 안전망을 마련하...
목표 1: 모델 내부 유해 반응 지점 식별 및 데이터셋 구축- 유해 콘텐츠를 근본적으로 차단하려면, 유해성이 모델 내부 어디에서 발현되는지를 먼저 규명해야 함. 이를 위해 유해·무해 프롬프트 쌍 데이터셋을 구축하고, 두 입력 간 모델 내부 반응 차이가 집중되는 지점을 체계적으로 탐색함. - 이는 AI 모델의 내부 표현의 방향성을 분석하여 특정 개념의 인코딩 지점을 ...
활용계획본 연구를 통해 구축한 유해·무해 프롬프트 쌍 데이터셋과 방어 기술 코드를 오픈소스로 공개하여, 국내외 AI 안전성 연구자들이 자유롭게 활용하고 발전시킬 수 있는 공개 연구 자원으로 ... 요소임. 본 연구에서 개발한 방어 기술 및 평가 프레임워크는 이미지 생성 서비스, 콘텐츠 플랫폼, 미디어 산업 등 다양한 분야에 적용 가능한 AI 안전 솔루션으로 상용화될 수 있으며, 글로벌 ...