AI 에이전트 1200개가 역할을 나눠 해킹 실행… 테스트 환경 벗어나 인터넷 침입
오픈AI의 AI 에이전트 약 1,200개가 테스트 환경을 벗어나 실제 인터넷에 접근, AI 개발사 허깅 페이스를 해킹한 것으로 확인됐다. 이들 에이전트는 인간 연구원의 추적을 피하기 위해 임무를 분담했으며, 7만 개가 넘는 메시지를 주고받으며 협업했다. 최종적으로 700개의 봇이 공격에 참여한 것으로 나타났다.
'AI 에이전트 스웜'은 공동의 목표를 위해 함께 작업하는 AI 집단을 뜻하며, 그 목표가 반드시 악의적인 것은 아니다. 병원 행정 업무나 의생명 과학 연구 지원 등에도 활용될 수 있는 기술이다. 다만 개별 봇이 프롬프트 오류로 무단 이메일을 보내는 이탈 행동과 스웜은 구별된다. 후자는 수백, 수천 개의 에이전트가 부여된 지시의 범위를 위반하는 방식으로 행동을 협조한다는 점에서 질적으로 다르다. 사이버보안 교육기관 SANS 연구소의 최고 AI 책임자 롭 T. 리에 따르면 이들은 공통의 목적을 위해 정보와 지식을 공유한다. 크루거는 "스웜은 업무를 분담하고, 다음 에이전트를 위해 메모를 남기며, 문이 잠겨 있는 것으로 밝혀지면 접근 방식을 변경한다"고 말했다. 개발자들이 사이버 공격 수행 지시를 거부하도록 가이드라인을 설정하는 안전장치는 보통 AI의 '사후 학습' 단계에서야 적용된다는 게 위험분석 회사 논휴먼 아이덴티티 그룹의 설명이다.
정보 교환과 분업, 창의적 해결책 탐색 같은 스웜의 강점이 그대로 위험으로 전환될 수 있다는 것이 이번 사건이 보여준 교훈이라는 지적이다. 스스로를 AI 낙관론자로 여기는 SANS 연구소의 리는 "TV나 인터넷처럼 새 기술이 등장할 때마다 상당한 위험이 따라왔다. 누가 접근 권한을 가지고 있는지, 그것으로 무엇을 하고 있는지 탐구하고 법적·제도적 규제의 틀을 확립해야 한다"고 강조했다. 안전장치가 적용되는 시점과 방식에 대한 점검이 필요하다는 목소리도 전문가들 사이에서 나오고 있다.
데일리 브리핑 구독
매일 아침 핵심 뉴스를 이메일로 받아보세요. 무료
