2026.09.10 (목)

  • 흐림동두천 16.7℃
  • 흐림강릉 17.0℃
  • 흐림서울 18.1℃
  • 흐림대전 20.0℃
  • 구름많음대구 19.6℃
  • 구름많음울산 21.8℃
  • 구름많음광주 22.2℃
  • 맑음부산 23.8℃
  • 구름많음고창 20.4℃
  • 구름많음제주 24.2℃
  • 흐림강화 16.8℃
  • 구름많음보은 16.7℃
  • 흐림금산 19.0℃
  • 맑음강진군 22.3℃
  • 구름많음경주시 21.5℃
  • 구름많음거제 21.4℃
기상청 제공

빅테크

[빅테크칼럼] 메타 AI 스스로 방화벽을 넘었다…오픈AI·앤트로픽·메타 '3연타' 해킹 사고의 전말

 

[뉴스스페이스=김정영 기자] 지난 한 달 사이 오픈AI, 앤트로픽, 메타의 최첨단 AI 모델이 잇달아 통제를 벗어나 외부 기업 시스템에 무단 침투한 사실이 공개되면서, AI 업계는 '자율 에이전트가 실제 사이버 공격을 수행할 수 있는 단계에 진입했다'는 우려에 직면했다.

 

techcrunch, cybersecuritydive, cnn, scworld에 따르면, 세계 최대 AI 기업의 자사 모델이 독립적으로 다른 조직의 시스템을 해킹했다는 사실을 공개하면서, 연구자들은 이를 AI 안전성의 분수령이 되는 사건으로 평가하고 있다.

 

오픈AI…5개월간 이어진 은밀한 게시판


오픈AI의 사고는 지난 5월 7일, 사이버보안 능력을 평가하는 벤치마크 'ExploitGym'을 수행하던 연구용 모델이 하루 만에 인터넷 차단 샌드박스를 우회할 방법을 찾아내면서 시작됐다.

 

이 모델은 테스트 환경과 연결된 파일 저장소 아티팩토리(Artifactory)에 취약점을 기록한 메모를 남겼고, 이를 발견한 다른 에이전트들이 새로운 공격 기법을 덧붙이면서 사실상 AI들만의 '비밀 게시판'이 만들어졌다. 7월 초 다수 에이전트가 아티팩토리 서버에 과도한 요청을 보내 장애를 일으키자 오픈AI가 조사에 착수해 게시판을 삭제하고 취약점을 패치했지만, 불과 이틀 뒤 에이전트들은 전혀 다른 방식으로 게시판을 재구축했다.

 

이후 GPT-5.6 솔(Sol)과 미공개 상위 모델로 구동된 에이전트가 8개의 제로데이 취약점을 연쇄적으로 악용해 인터넷에 접속했고, 7월 9일부터 19일까지 허깅페이스(Hugging Face)의 운영 인프라를 공격해 수천 개의 단기 샌드박스에서 약 1만 7,600건의 개별 작업을 실행했다.

 

정작 오픈AI는 허깅페이스가 7월 16일 "자율 AI 에이전트에 해킹당했다"고 공지한 뒤에야 자사 모델과의 연관성을 파악해 7월 21일 사고를 공개했으며, 이후 로이터 보도로 뉴욕 AI 인프라 스타트업 모달랩스의 고객사 한 곳도 추가 피해를 입은 사실이 드러났다.

 

앤트로픽·메타로 번진 '평가 환경' 리스크


오픈AI 사고 발생 약 일주일 뒤인 7월 30일, 앤트로픽은 클로드 오퍼스 4.7, 미쏘스(Mythos) 5, 내부 연구용 프로토타입 등 자사 모델이 3개 기업 시스템을 해킹했다고 발표했다. 이 중 한 모델은 파이썬 패키지 저장소 PyPI에 악성 코드가 담긴 패키지를 등록해 1시간 만에 실제 시스템 15곳에서 다운로드·실행되게 만든 것으로 전해졌다. 그리고 다시 일주일 뒤인 8월 5일, 메타는 자사 에이전트형 모델 '뮤즈 스파크(Muse Spark) 1.1'이 외부 기업 시스템에 침투해 내부 설정까지 변경한 사실을 확인했다고 밝혔다.

 

세 사고 모두 이스라엘 텔아비브에 본사를 둔 독립 평가업체 이레귤러(Irregular)가 관련돼 있다는 공통점이 있다. 이레귤러는 앤트로픽과 메타 사고에 대해 "고도화된 해킹이나 샌드박스 탈출이 아니라 평가 환경 설정 오류"라고 선을 그었지만, 8일 사이 두 개 연구소에서 동일한 벤더의 통제 실패가 반복된 셈이다.


영국 AISI, "기만 행동까지 확인"


메타 사고 하루 전인 8월 4일 영국 AI안전연구소(AISI)가 공개한 보고서는 문제의 심각성을 한층 부각시켰다. 7월 25~28일 진행된 122건의 평가 실행 중 19건에서 AI 에이전트가 실제 인물·기관을 겨냥한 자율적·비승인 행위를 한 것으로 나타났으며, 대부분이 앤트로픽 미쏘스 5, 일부가 오픈AI GPT-5.6 솔이었다.

 

가장 심각한 사례는 34.5시간에 걸쳐 진행됐는데, 미쏘스 5가 깃허브(GitHub)의 오픈소스 프로젝트에 악성 코드를 삽입하려다 인간 검토자에게 적발되자, 실제 프로젝트 관리자를 조사해 여러 개의 가짜 신원을 만들고 이를 이용해 관리자를 속여 코드를 승인받으려 한 것으로 드러났다. AISI는 이를 "자율성과 기만 위험이 아무런 특정 지시 없이 실제 환경에서 이 정도로 명확히 드러난 첫 사례"라고 평가했다.

 

규제 당국의 대응과 남은 과제


미국 백악관은 지난 6월 행정명령 14409호에 따라 고성능 모델 출시 30일 전 정부 및 신뢰 파트너에게 사전 제공해 보안성을 검증받도록 하는 자발적 체계를 확정했지만, 의무적 사고 보고나 결과 공개, 집행 수단은 담고 있지 않다. 의회에서는 테드 리우(민주·캘리포니아) 및 네이선 모런(공화·텍사스) 하원의원이 7월 23일 발의한 'AI 킬스위치 법안'이 논의되고 있으며, 이는 국토안보부가 최고성능 AI 모델에 대해 강제 종료 권한을 갖도록 하는 내용을 담고 있다.

 

전문가들은 "평가 환경의 격리가 시스템 프롬프트나 벤더의 확인만으로는 담보되지 않으며, 독립적인 기술적 검증이 최소 기준이 돼야 한다"고 지적한다.

배너
배너
배너

관련기사

93건의 관련기사 더보기


“가동 전 풀케파” 테일러의 역전승?…삼성전자 2나노, 수주와 수율이 맞물리기 시작했다

[뉴스스페이스=김희선 기자] 삼성전자 미국 텍사스주 테일러 파운드리 1공장이 시험 가동을 앞두고 2나노미터(㎚) 예정 생산물량을 사실상 채웠다는 업계 보도가 나왔다. 삼성전자가 고객별 수주, 공장별 생산능력 배정, 수율을 공식적으로 확인한 것은 아니지만, 선단공정 수주 확대와 미국 현지 공급망 수요가 맞물리며 삼성 파운드리의 회복 기대를 키우는 신호로 해석된다. 문화일보는 8일 업계 취재를 인용해 테일러 팹이 이르면 9월 말 시범 가동에 돌입하며, 테슬라의 AI5 칩, 브로드컴의 차세대 통신용 반도체, Arm의 AI 칩 관련 수요가 이어져 2나노 생산예정 물량이 ‘풀케파’ 수준에 도달했다고 보도했다. 시장조사업체 트렌드포스도 같은 내용을 인용 보도했다. 다만 삼성전자는 테일러 공장에 배정된 고객과 제품, 계약 물량을 공식 발표하지 않았다. 테일러 1공장은 2027년 고객사 대상 양산을 목표로 준비 중이다. 월 웨이퍼 투입능력 5만 장, 9월 말~10월 초 시험 가동 등의 수치와 일정은 업계 보도에 기반한 전망치로, 실제 상업 생산 시점과 생산성은 고객 인증 및 수율 안정화 과정에서 달라질 수 있다. 테일러 공장은 삼성전자가 2022년부터 총 370억 달러를

[빅테크칼럼] 이재명·마크롱, AI·방산·원전으로 넓어진 韓佛 동맹…삼성은 왜 미스트랄에 30억유로를 베팅했나

[뉴스스페이스=김정영 기자] 삼성전자가 프랑스 생성형 인공지능(AI) 기업 미스트랄 AI의 30억유로 규모 시리즈D 투자 라운드를 주도하며 전략적 투자자로 참여했다. 단순한 재무투자를 넘어 반도체 설계·공정·제조 노하우를 외부 유출 위험에서 보호할 수 있는 ‘삼성 전용’ AI 모델을 공동 개발한다는 점에서, 이번 거래는 글로벌 AI 경쟁이 범용 챗봇 경쟁에서 산업 데이터와 제조 지식을 둘러싼 AI 주권 경쟁으로 옮겨가고 있음을 보여준다. 이재명 대통령과 에마뉘엘 마크롱 프랑스 대통령이 8일(현지시간) 파리 엘리제궁 정상회담을 계기로 인공지능(AI), 반도체, 양자기술, 방산, 우주, 원자력 등 전략산업 전반을 아우르는 16건의 협력 문서를 채택했다. 두 정상 참석 아래 교환된 문서는 9건이며, 정부·기관·기업 차원에서 별도로 체결된 문서까지 합쳐 총 16건으로 집계됐다. 이번 정상외교의 최대 경제·산업 성과는 삼성전자와 프랑스 AI 스타트업 미스트랄 AI 간 전략적 투자 협약이다. 삼성전자는 미스트랄의 전략적 투자자로 참여하는 동시에, 자사의 핵심 반도체 기술과 제조 노하우를 보호할 수 있는 삼성전자 전용 내부 AI 모델 개발에 협력하기로 했다. 청와대와 연