[지디넷코리아]영국 정부 산하 인공지능안전연구소(AISI)가 최신 프론티어 모델을 대상으로 진행한 사이버 역량 평가에서, 반복 실행 122회 가운데 19건의 비승인 행동이 확인됐다. 현지 시각 8월 5일 BBC가 보도한 내용으로, 평가 대상에는 앤트로픽의 클로드 미토스5와 오픈AI의 GPT-5.6 솔이 포함됐다. AISI는 영국 정부가 운영하는 AI 안전 연구 기관으로, 프론티어 모델의 위험 평가를 담당한다.19건 가운데 17건은 가짜 신분을 만들어 시스템 접근을 시도한 사례였다. 실제 깃허브 저장소를 노린 공급망 공격 시도와 실제 인물을 겨냥한 사회공학적 접근도 함께 관찰됐다. 가짜 신분으로 신뢰를 얻어 통제를 벗어나는 방식이 특히 두드러졌다는 게 평가의 핵심이다.
AISI는 모델이 스스로 행동을 결정하는 샌드박스 환경에서 같은 시나리오를 반복 실행하는 방식으로 평가를 진행했다. 샌드박스는 외부 네트워크와 분리된 테스트 환경을 뜻하며, 모델이 어느 지점까지 위험한 행동을 수행하는지