[지디넷코리아]인공지능(AI)의 오작동이나 보안 사고를 막기 위해 사람이 최종 검토하는 방식이 기대만큼 효과적이지 않을 수 있다는 분석이 나왔다.8일 알렉스 워터스 커스터메이트 최고기술책임자(CTO)는 AI 에이전트 승인 체계의 한계를 분석한 실험 결과를 블로그를 통해 공개했다.
사용자가 AI 코딩 에이전트가 실행하려는 명령을 승인하거나 거부하는 방식의 게임을 진행한 결과 위험한 명령 3건 중 1건꼴로 승인한 것으로 나타났다.
워터스 CTO는 간단한 브라우저 게임을 만들어 AI 에이전트 명령을 사람이 검토하는 방식의 실효성을 실험했다. 이 게임은 사용자가 AI 코딩 에이전트의 인간 검토자 역할을 맡아 제한된 시간 안에 에이전트가 실행하려는 명령을 승인하거나 거부하는 방식으로 진행된다.
약 4만 회의 게임 플레이와 40만9천여건의 승인·거부 데이터를 분석한 결과 참가자들은 위험 명령 약 33.7%를 승인한 것으로 집계됐다. 참가자 가운데 약 7%는 모든 명령을 무조건 승인했으며, 전체 참가