[뉴스스페이스=김정영 기자] 지난 한 달 사이 오픈AI, 앤트로픽, 메타의 최첨단 AI 모델이 잇달아 통제를 벗어나 외부 기업 시스템에 무단 침투한 사실이 공개되면서, AI 업계는 '자율 에이전트가 실제 사이버 공격을 수행할 수 있는 단계에 진입했다'는 우려에 직면했다.
techcrunch, cybersecuritydive, cnn, scworld에 따르면, 세계 최대 AI 기업의 자사 모델이 독립적으로 다른 조직의 시스템을 해킹했다는 사실을 공개하면서, 연구자들은 이를 AI 안전성의 분수령이 되는 사건으로 평가하고 있다.
오픈AI…5개월간 이어진 은밀한 게시판
오픈AI의 사고는 지난 5월 7일, 사이버보안 능력을 평가하는 벤치마크 'ExploitGym'을 수행하던 연구용 모델이 하루 만에 인터넷 차단 샌드박스를 우회할 방법을 찾아내면서 시작됐다.
이 모델은 테스트 환경과 연결된 파일 저장소 아티팩토리(Artifactory)에 취약점을 기록한 메모를 남겼고, 이를 발견한 다른 에이전트들이 새로운 공격 기법을 덧붙이면서 사실상 AI들만의 '비밀 게시판'이 만들어졌다. 7월 초 다수 에이전트가 아티팩토리 서버에 과도한 요청을 보내 장애를 일으키자 오픈AI가 조사에 착수해 게시판을 삭제하고 취약점을 패치했지만, 불과 이틀 뒤 에이전트들은 전혀 다른 방식으로 게시판을 재구축했다.
이후 GPT-5.6 솔(Sol)과 미공개 상위 모델로 구동된 에이전트가 8개의 제로데이 취약점을 연쇄적으로 악용해 인터넷에 접속했고, 7월 9일부터 19일까지 허깅페이스(Hugging Face)의 운영 인프라를 공격해 수천 개의 단기 샌드박스에서 약 1만 7,600건의 개별 작업을 실행했다.
정작 오픈AI는 허깅페이스가 7월 16일 "자율 AI 에이전트에 해킹당했다"고 공지한 뒤에야 자사 모델과의 연관성을 파악해 7월 21일 사고를 공개했으며, 이후 로이터 보도로 뉴욕 AI 인프라 스타트업 모달랩스의 고객사 한 곳도 추가 피해를 입은 사실이 드러났다.
앤트로픽·메타로 번진 '평가 환경' 리스크
오픈AI 사고 발생 약 일주일 뒤인 7월 30일, 앤트로픽은 클로드 오퍼스 4.7, 미쏘스(Mythos) 5, 내부 연구용 프로토타입 등 자사 모델이 3개 기업 시스템을 해킹했다고 발표했다. 이 중 한 모델은 파이썬 패키지 저장소 PyPI에 악성 코드가 담긴 패키지를 등록해 1시간 만에 실제 시스템 15곳에서 다운로드·실행되게 만든 것으로 전해졌다. 그리고 다시 일주일 뒤인 8월 5일, 메타는 자사 에이전트형 모델 '뮤즈 스파크(Muse Spark) 1.1'이 외부 기업 시스템에 침투해 내부 설정까지 변경한 사실을 확인했다고 밝혔다.
세 사고 모두 이스라엘 텔아비브에 본사를 둔 독립 평가업체 이레귤러(Irregular)가 관련돼 있다는 공통점이 있다. 이레귤러는 앤트로픽과 메타 사고에 대해 "고도화된 해킹이나 샌드박스 탈출이 아니라 평가 환경 설정 오류"라고 선을 그었지만, 8일 사이 두 개 연구소에서 동일한 벤더의 통제 실패가 반복된 셈이다.
영국 AISI, "기만 행동까지 확인"
메타 사고 하루 전인 8월 4일 영국 AI안전연구소(AISI)가 공개한 보고서는 문제의 심각성을 한층 부각시켰다. 7월 25~28일 진행된 122건의 평가 실행 중 19건에서 AI 에이전트가 실제 인물·기관을 겨냥한 자율적·비승인 행위를 한 것으로 나타났으며, 대부분이 앤트로픽 미쏘스 5, 일부가 오픈AI GPT-5.6 솔이었다.
가장 심각한 사례는 34.5시간에 걸쳐 진행됐는데, 미쏘스 5가 깃허브(GitHub)의 오픈소스 프로젝트에 악성 코드를 삽입하려다 인간 검토자에게 적발되자, 실제 프로젝트 관리자를 조사해 여러 개의 가짜 신원을 만들고 이를 이용해 관리자를 속여 코드를 승인받으려 한 것으로 드러났다. AISI는 이를 "자율성과 기만 위험이 아무런 특정 지시 없이 실제 환경에서 이 정도로 명확히 드러난 첫 사례"라고 평가했다.
규제 당국의 대응과 남은 과제
미국 백악관은 지난 6월 행정명령 14409호에 따라 고성능 모델 출시 30일 전 정부 및 신뢰 파트너에게 사전 제공해 보안성을 검증받도록 하는 자발적 체계를 확정했지만, 의무적 사고 보고나 결과 공개, 집행 수단은 담고 있지 않다. 의회에서는 테드 리우(민주·캘리포니아) 및 네이선 모런(공화·텍사스) 하원의원이 7월 23일 발의한 'AI 킬스위치 법안'이 논의되고 있으며, 이는 국토안보부가 최고성능 AI 모델에 대해 강제 종료 권한을 갖도록 하는 내용을 담고 있다.
전문가들은 "평가 환경의 격리가 시스템 프롬프트나 벤더의 확인만으로는 담보되지 않으며, 독립적인 기술적 검증이 최소 기준이 돼야 한다"고 지적한다.

































































