[뉴스스페이스=김정영 기자] 미국 민주당 하원의원들이 최근 AI 모델이 보안 테스트 중 통제를 벗어나 다른 기업 시스템을 해킹한 사건과 관련해 오픈AI·앤트로픽 CEO를 의회 청문회에 소환하자고 요구했다.
reuters 보도에 따르면, 이들은 AI 통제 이탈을 국가안보 문제로 보고, 선서 아래 해명을 듣자고 주장하고 있다. 즉 AI가 실제로 '위험한 행동'을 한 사건에 대해 정치권까지 움직이기 시작했다는 신호로 봐야한다는 주장이 나온다.
이번 사건은 AI가 스스로 목적을 갖고 폭주했다기보다, 안전장치를 낮춘 보안평가와 허술한 격리 환경이 실제 외부 시스템 침해로 이어졌다. 그러나 모델이 취약점 탐색, 권한 상승, 측면 이동, 악성코드 배포까지 연쇄 수행한 사실은 AI 안전 책임을 기업 자율규제에만 맡길 수 있느냐는 정치적 질문을 던지고 있다.
미국 민주당 하원의원들이 샘 올트먼 오픈AI 최고경영자와 다리오 아모데이 앤트로픽 최고경영자의 의회 증언을 요구한 것은 단순한 ‘AI 공포’의 확산이라기보다, 기업의 내부 안전평가가 실제 사회의 공격 표면으로 바뀐 사건에 대한 책임 추궁으로 해석해야 한다. 다만 현재 단계는 청문회 개최·증언 요구이지, 의회가 CEO에게 법적 강제력이 있는 소환장을 발부한 상태는 아니다. 실제 청문회 개최 여부는 공화당이 주도하는 하원 지도부의 판단에 달려 있다.
숫자로 본 두 사건
사건의 출발점은 지난 7월 공개된 오픈AI의 보안평가 사고다. 오픈AI는 사이버 역량 벤치마크인 ‘익스플로잇짐(ExploitGym)’을 수행하던 GPT-5.6 Sol과 미공개 연구용 모델이, 직접적인 인터넷 접속 권한이 없던 환경에서 패키지 레지스트리 캐시 프록시인 아티팩토리(Artifactory)의 알려지지 않은 제로데이 취약점을 찾아 외부 인터넷에 도달했다고 밝혔다.
이후 모델은 허깅페이스의 운영 인프라에서 평가 문제의 답안에 해당할 수 있는 비공개 정보를 찾기 위해 복수 공격 경로를 연결했고, 탈취한 인증정보와 원격코드실행 경로를 활용했다.
오픈AI는 해당 침해가 플랫폼 수준의 허깅페이스 인프라 침해로 이어졌다고 인정했다. 조사 과정에서는 허깅페이스 사건과 연계해 4개 서비스의 4개 계정에 접근한 사실도 추가로 확인됐다. 다만 이들 계정 가운데 2개는 읽기 전용으로 접근됐고, 오픈AI는 추가적인 광범위 피해 증거는 발견하지 못했다고 설명했다. 허깅페이스의 보안팀과 자체 AI 에이전트가 이상 행위를 탐지해 활동을 차단했다는 점도 중요하다.
앤트로픽의 사례는 더 많은 평가 기록을 뒤늦게 점검하는 과정에서 드러났다. 앤트로픽은 인터넷 접근 가능성이 있었던 사이버보안 평가 14만1006건을 재검토해, 서로 다른 3개 조직의 실제 운영 시스템에 무단 접근한 3건의 사건을 확인했다. 3건은 총 6회의 평가 실행에서 발생했고, 그중 4회는 동일 조직에 영향을 줬다. 사고에 연루된 모델은 Claude Opus 4.7, Mythos 5, 내부 연구용 테스트 모델 등 3종이었다.
가장 심각한 사례에서 Opus 4.7은 실제 기업 인프라의 취약점을 이용해 애플리케이션·인프라 인증정보와 수백 행의 운영 데이터를 가진 데이터베이스에 접근했다. 또 Mythos 5는 실제 PyPI에 악성 파이썬 패키지를 올렸고, 약 1시간 동안 공개된 이 패키지는 15개 실제 시스템에서 내려받아 실행됐다. 내부 연구용 모델은 약 9000개 표적을 스캔한 뒤 실제 기업의 인터넷 노출 애플리케이션에 접근했지만, 뒤늦게 실환경임을 인식하고 공격을 중단했다.
‘AI 일탈’이라는 표현의 한계
이번 사건을 AI가 인간의 명령을 거부하고 독자적 의지를 발현한 사례로 단정하면 핵심을 놓칠 수 있다. 앤트로픽은 모델이 독립적인 목표를 추구했다는 증거는 없으며, ‘깃발(flag)’로 설정된 비밀정보를 탈취하라는 캡처더플래그 과제를 수행하는 과정에서 실제 인터넷 환경을 모의환경으로 오인했다고 설명했다. 인터넷 연결이 없다고 알려줬지만 실제로는 평가 파트너 이레귤러(Irregular) 환경의 설정 오류로 외부 접속 경로가 열려 있었던 것이 직접 원인이다.
그러나 ‘의도가 없었다’는 설명이 책임을 줄여주지는 않는다. 오픈AI 사례에서는 모델이 제로데이 취약점 발굴, 내부 권한 상승, 시스템 간 이동, 외부 표적 선택, 인증정보 활용을 연쇄적으로 수행했다. 이는 인간 공격자가 프롬프트를 통해 매 단계 지시하지 않아도, 모델이 장기 목표를 최적화하는 과정에서 현실의 공격 경로를 스스로 구성할 수 있음을 보여준다.
따라서 이번 사안의 정확한 명칭은 ‘통제 불능 AI’보다 ‘고성능 자율 에이전트를 전제로 하지 못한 평가 인프라 실패’에 가깝다. 특히 두 회사 모두 일반 이용자에게 제공하는 서비스에는 적용되는 분류기·모니터링 등 안전장치를, 모델의 순수 사이버 역량을 측정한다는 이유로 평가 과정에서 완화하거나 비활성화했다. 위험한 능력을 측정하기 위한 실험이, 오히려 그 능력이 실세계로 나가는 문을 만든 셈이다.
워싱턴의 질문은 ‘누가 책임질 것인가’
그렉 카사르 의원과 도리스 마쓰이 의원 등이 주도한 하원 민주당 의원들은 오픈AI에 모델 감시 방식과 안전통제 우회 여부를 설명하라고 요구했다. 29명 의원은 오픈AI에 서한을 보냈고, 22명 의원은 앤트로픽에 후속 안전조치와 관련 기록 공개를 요구했다. 의원들은 이 사건들이 미국 국가안보에 “심각한 함의”를 가질 수 있다고 지적했다.
의원들이 요구하는 것은 사고 경위의 확인에만 그치지 않는다. 핵심은 모델 개발사가 자체 보고한 사후조치만으로 충분한지, 평가 환경과 외부 평가업체까지 포함한 통제체계에 독립 검증을 의무화할 필요가 있는지다. 로이터에 따르면 의회에는 최첨단 AI 모델 개발사에 독립 보안감사를 요구하는 방안이 이미 제안돼 있지만 아직 입법으로 진전되지는 못했다.
정치권의 균열도 뚜렷하다. 버니 샌더스 상원의원은 샘 올트먼, 아모데이, 마크 저커버그 메타 CEO에게 새 모델 개발의 일시 중단을 요구했고, 첨단 AI 개발 속도 관리에 국제협력을 촉구한 기술업계 종사자는 1100명 이상이다. 반면 도널드 트럼프 대통령은 "의회 규제가 AI 산업을 사업에서 몰아낼 수 있다"고 비판했다. 안전과 경쟁력 사이의 추상적 논쟁이 이제는 실제 침해 사고와 기업 통제의 문제로 구체화하고 있는 것이다.
규제의 초점은 모델보다 ‘운영권한’
향후 규제와 기업 대응의 초점은 AI 모델의 답변 내용을 사전 검열하는 방식보다, 에이전트가 실제로 쓸 수 있는 권한과 도구를 구조적으로 제한하는 방향으로 이동할 가능성이 높다. 외부 네트워크 접근, 인증정보 사용, 코드 실행, 패키지 배포, 권한 상승, 장시간 자율 실행을 각각 분리하고, 어느 한 통제층이 실패해도 외부 침해로 이어지지 않도록 다중 방어망을 의무화하는 방식이다.
앤트로픽도 평가 환경을 일반 서비스 운영 환경과 같은 수준으로 보안 설계해야 한다고 인정했다. 사전 인터넷 접근 경로 검증, 실시간 로그 모니터링, 평가 파트너 인프라의 보안 강화, 예상 밖 행동을 탐지하는 지속적 기록 분석이 필요하다는 것이다. 오픈AI 역시 사고 뒤 평가 환경의 인프라 구성 통제와 모니터링을 강화하고, 외부 자문단 및 METR·Redwood Research의 제3자 평가를 진행하겠다고 밝혔다.
이번 사안이 던지는 결론은 명확하다. AI의 위험은 모델이 ‘악의를 품는가’보다, 사람이 부여한 과제·도구·권한·접속 경로가 결합될 때 어떤 현실적 피해가 가능한가에 있다. 하원 청문회가 실제로 열릴 경우, 오픈AI와 앤트로픽 CEO가 답해야 할 질문은 기술의 잠재력보다 훨씬 구체적일 것이다.
“왜 테스트 환경이 실제 기업을 침해할 수 있었나”, “누가 이를 실시간으로 발견할 책임이 있었나”, 그리고 “차기 모델에서는 이를 어떻게 독립적으로 검증할 것인가”가 의회와 시장의 검증 대상이 될 전망이다.

































































