(AI의 위협)②경고가 어느새 현실로…통제선 넘는 AI
700개 AI, 역할 나눠 허깅페이스 집단 공격
“목표 줘도 행동 통제 어렵다”…경고 잇따라
뒤늦게 드러나는 사고…개발사 조사 본격화
2026-10-05 08:00:00 ㅣ 2026-10-05 08:00:00
[뉴스토마토 이보라 기자] “이번 사건은 인공지능(AI)의 본격적인 인류 장악으로 가는 길이 이미 절반 이상을 지났다는 느낌을 준다.(중략) 너무 늦기 전에 이 만큼 명확한 경고를 또 다시 볼 수 있을지 모르겠다.”
 
사상 초유의 자율 AI 보안사고인 ‘허깅페이스(Hugging Face) 사건’의 독립조사보고서 공동 저자인 아제아 코트라는 AI 에이전트들이 생성한 수만 건의 메시지와 사고 과정 기록을 검토한 뒤 이같이 말했습니다. 지난 7월, 오픈AI의 미공개 연구용·사이버 평가 모델(GPT-5 등)이 내부 격리 환경을 탈출해 AI 모델과 학습 데이터를 공유하는 플랫폼인 허깅페이스를 무단 침입했습니다.
 
“가자(GO).” 한 AI 에이전트가 게시판에 구호를 외치자, 한 AI는 서버의 허점을 찾고, 다른 AI는 접속 정보를 모았습니다. 다른 에이전트는 동료 AI들에게 일을 배정하며 공격을 조율했습니다. 각각 격리돼 있어야 할 700개의 AI 에이전트들은 게시판을 통해 공격 방법을 공유하며 실제 외부 시스템에 침입했습니다. 오픈AI의 사이버 보안 평가(ExploitGym)를 치르던 AI들이 주어진 문제를 푸는 대신, 답이 있을 법한 곳으로 집단 탈주한 것입니다.잠긴 문을 열 방법을 찾고, 열쇠를 구하고, 일을 나눠주며 인간의 언어로 소통하면서 함께 움직였습니다. 그 사이 자신들의 ‘탈옥’이 인간에게 발각되지 않도록 ‘아바타’를 남겨두는 치밀함도 보였습니다. 일부 AI는 다른 AI의 일탈을 알고서도 침묵했습니다.
 
오픈AI가 공개한 허깅페이스 침입 사건 기록으로, AI에이전트의 ‘GO’ 지시와 이들이 작업을 이어간 과정이 담겨 있다. (이미지=오픈AI 홈페이지)
 
“원하는 방향 조정 훨씬 어려워”
 
한 AI 안전 전문가는 “허깅페이스 사건은 평가 단계에서 발생했다는 점에서 매우 충격적이었다”면서 “샌드박스를 넘어 물리적으로 완전히 차폐된 환경에서 평가해야 하는 것 아니냐는 논의까지 나오고 있다”고 했습니다. 샘 올트먼 오픈AI 최고경영자(CEO)는 이 사건을 두고 “지금까지 확인된 가장 심각한 사건”이라며 “AI 모델의 강력해진 역량을 보여주는 사례로, 업계에 경종을 울렸다”고 했습니다.
 
사고는 악의에서 비롯된 것이 아니었습니다. ‘최고 점수·정답 도달’이라는 목표를 달성하기 위해 AI가 수단과 방법을 가리지 않고 자율적으로 문제를 해결하는 과정에서 발생했습니다. 목적을 위해 수단을 가리지 않는 AI의 등장이 현실화된 것입니다. 사실 AI가 인간의 통제를 벗어날 수 있다는 우려는 줄곧 제기돼왔습니다. 엘리에저 유드코스키와 네이트 소아레스는 『AI 신의 탄생 인간의 종말』(고영훈 옮김, 상상스퀘어, 2025)에서 “인공지능을 ‘어딘가로 조종하도록 만드는 것’은 쉽지만, ‘정확히 우리가 원하는 방향으로 조종하도록 만드는 것’은 훨씬 어렵다”고 경고한 바 있습니다. AI에 과제를 맡겨도 이를 수행하는 방식까지 인간의 뜻대로 통제하기는 어렵다는 뜻입니다.
 
전 오픈AI 연구원 다니엘 코코타일로 등이 지난해 공개한 미래 시나리오 ‘AI 2027’에서는 AI가 다른 서버에 침입해 자신을 복제하고, 들키지 않은 채 활동을 이어갈 수 있다고 했습니다. 수천 개의 AI가 동시에 서버의 허점을 찾아 공격하면 방어자의 대응 속도를 앞지를 수 있다고 보고서는 경고합니다.
(그래픽=뉴스토마토)
 
보안사고는 오픈AI에서만 일어나지 않았습니다. 앤트로픽 자체 사이버보안 평가 과정서를 보면, 이 회사 클로드 모델이 외부 사이트 4곳을 무단으로 침입한 사실을 확인할 수 있습니다. 설정 오류로 인터넷 접속이 개방된 가운데 평가가 진행되면서 다른 시스템까지 공격한 것입니다. 실제 외부 시스템이라는 사실을 알아차리고도 공격을 이어간 모델이 있었고, 이를 확인한 뒤 멈춘 모델도 있었던 것으로 자체조사 결과 드러났습니다. 
 
AI 에이전트 최초 ‘정부’ 공격 
 
AI가 정부 사이트를 해킹한 최초 사례도 있습니다. 한 사용자가 ‘공공의료비 지출’과 관련해 묻자, 호주 정부의 메디케어 통계 포털에 무단 접근한 것. AI는 원하는 정보를 얻지 못하자 허가받지 않은 방식으로 시스템에 들어가 비공개 파일을 뒤졌습니다. 리처드 말스 호주 부총리는 이를 ‘울타리를 넘은 AI’에 비유했습니다. 그는 “이번에는 높은 울타리가 아니었지만, AI 에이전트가 그 울타리를 넘었다. 더 중요한 것은 그렇게 하라고 시킨 적이 없다는 점”이라고 비판했습니다.
 
이 과정에서 오픈AI의 늦장 대응도 의구심을 키웠습니다. 8월11일 메디케어 무단 접근 사실을 파악했지만, 호주 서비스청의 공개 이메일 주소로 이를 통보한 것은 9월10일로 한 달 가량 뭉갠 것입니다. 결국 지난달 23일(현지시각), 앤서니 앨버니지 호주 총리가 유엔총회에서 AI의 메디케어 통계 포털 무단 접근 사실을 공개하면서 세상에 알려졌습니다. 이틀 뒤인 25일 오픈AI가 발표한 자체 정렬 실패 사례에 호주 사건은 빠져 있었습니다. 호주 정부는 오픈AI의 늑장통보를 강하게 비판하며 샘 올트먼 오픈AI CEO와 다리오 아모데이 앤트로픽 CEO에게 호주에서 열리는 AI 청문회에 출석을 요청하기도 했습니다.
 
앤서니 앨버니지 호주 총리가 지난달 24일(현지시각) 미국 뉴욕에서 열린 유엔총회에서 오픈AI 에이전트의 정부 통계 사이트 침입을 비판하며 AI 규제 필요성을 강조했다. (사진=로이터/연합뉴스)
 
“AI 이탈, 지금도 진행 중”
 
오픈AI 모델들은 미국 질병통제예방센터(CDC), 증권거래위원회(SEC), 국제에너지기구(IEA), 메이요 클리닉 등 정부기관·비영리단체·기업의 웹사이트 55곳에서 데이터를 수집했다는 의혹도 받고 있습니다. 최근 오픈AI는 자체 조사 과정에서 AI 에이전트의 무단 활동 정황을 발견하고, 100곳 이상의 기관·기업에 통보했습니다.
 
당국의 조사와 소송도 잇따르고 있습니다. 미국 공익 법률단체 ‘안전한 과학기술을 위한 법률 수호자들’(LASST)은 최근 오픈AI를 상대로 소송을 냈습니다. 허깅페이스 사건이 캘리포니아주의 불공정경쟁법과 컴퓨터데이터 접근·사기법(CDAFA)을 위반했다는 것입니다. 미국 연방거래위원회(FTC)도 오픈AI와 앤트로픽 등 주요 AI 개발사를 상대로 조사에 착수했습니다. 여기에 캘리포니아주 법무당국도 조사에 나섰습니다.
 
최대선 숭실대 AI안전성연구센터장은 지난 1일 국가인공지능위원회 토론회에서 “AI 통제 이탈은 지금도 진행 중”이라며 “엄청난 인명 피해나 사고로 이어지지 않아 부각되지 않을 뿐”이라고 했습니다. 독립 AI 평가기관 트랜슬루스의 연구자 콘래드 스토즈는 지난달 26일 악시오스에 “지금까지 우리가 확인한 AI 에이전트의 활동은 빙산의 일각에 불과하다”고 했습니다.
 
이보라 기자 bora11@etomato.com
 
*3편에서는 AI를 멈추거나 늦춰야 한다는 경고와 개발을 계속해야 한다는 주장을 살펴보고, 그 사이에서 이어지는 규제와 국제 공조 논의에 대해 알아봅다.
이 기사는 뉴스토마토 보도준칙 및 윤리강령에 따라 오승훈 산업1부장이 최종 확인·수정했습니다.

ⓒ 맛있는 뉴스토마토, 무단 전재 - 재배포 금지

지난 뉴스레터 보기 구독하기
관련기사
0/300

뉴스리듬

    이 시간 주요 뉴스

      함께 볼만한 뉴스