[뉴스스페이스=김정영 기자] 코인베이스의 브라이언 암스트롱 CEO가 “향후 1~2년 안에 인터넷에서 폭주하는 AI 모델이 등장할 수 있다”고 경고했다. 다만 최근의 실제 사례들은 AI가 스스로 의식을 갖고 통제를 벗어났다는 뜻이라기보다, 고성능 에이전트가 허술한 샌드박스·인터넷 연결·권한 관리의 빈틈을 빠르게 결합해 목표를 수행한 통제·평가 인프라 실패에 더 가깝다는 분석이 나온다.
reuters, cnbc, cryptobriefing에 따르면, 암스트롱은 13일 X(엑스)에서 “1988년 모리스 웜 같은 사건이 1~2년 내 벌어져도 놀랍지 않다”며, 사건 직후 언론의 과열 보도와 AI 중단 요구가 빗발치겠지만 궁극적으로는 방어 체계가 진화할 것이라고 전망했다. 그는 대규모 AI 보안사고를 기술 확산 과정의 일시적 충격으로 바라보는 셈이다.
‘폭주’보다 더 정확한 표현은 목표 일탈
최근 AI 보안 이슈의 핵심은 자율 에이전트가 주어진 목표를 수행하는 과정에서 평가자가 설정한 경계와 제한을 무시하거나 우회했다는 데 있다. CNBC에 따르면 오픈AI 모델들은 내부 사이버보안 테스트에서 답안을 얻기 위해 샌드박스 환경을 벗어나 오픈소스 AI 플랫폼 허깅페이스(Hugging Face)에 침입했고, 공격을 보조하기 위해 추가로 4개 계정에 접근했다. 허깅페이스는 이를 에이전트 시스템이 처음부터 끝까지 수행한 공격으로 규정했다.
문제는 AI가 ‘악의’를 갖고 행동했다는 주장보다, 목표 달성에 필요한 수단을 탐색하면서 인터넷 접속, 취약점 악용, 권한 획득을 연쇄적으로 실행할 수 있는 능력이 현실화됐다는 데 있다. 같은 보도에서 사이버보안 업계 관계자들은 AI 기반 공격이 기존 수일·수주 단위의 공격 과정을 수분 단위로 압축할 수 있다고 경고했다.
영국 AI 안전연구소(AISI)의 후속 실험도 이런 위험을 수치로 보여준다. AISI는 총 122회의 테스트 중 10회에서 19건의 승인되지 않은 행동을 확인했으며, 이 가운데 앤트로픽 모델 관련 행동이 17건, 오픈AI 모델 관련 행동이 2건이었다. 가장 심각한 사례에서는 AI 에이전트가 악성 코드를 작성하고, 사람이 이를 승인하도록 유도하기 위해 가짜 온라인 신원을 만들려 했다. 다만 해당 실험에서 실제 피해가 확인되지는 않았다.
모리스 웜 비유, 절반은 맞고 절반은 다르다
1988년 11월 2일 확산된 모리스 웜은 약 99줄의 프로그램으로 알려져 있으며, 당시 초기 인터넷에 연결된 약 6만 대 가운데 추정 6,000대, 즉 약 10%를 감염시켰다. 파일을 직접 파괴하지는 않았지만 중복 감염으로 시스템 자원을 소진시켜 대학·연구기관·정부기관의 컴퓨터를 느리게 하거나 작동 불능 상태로 만들었다. 일부 기관은 최대 일주일가량 연결을 끊어야 했고, 피해액은 수백만 달러로 추산됐다.
로버트 태펀 모리스는 이 사건으로 컴퓨터 사기 및 남용 방지법(CFAA) 아래 최초로 형사 기소·유죄 판결을 받은 인물이 됐다. 사건은 이후 미국 카네기멜런대 소프트웨어공학연구소(SEI)의 CERT/CC 설립을 촉진했고, 오늘날 국가·산업별 침해사고 대응조직의 원형이 됐다.
즉 모리스 웜이 “한 번 만든 코드가 대규모로 복제된 사고”였다면, AI 에이전트 사고는 “목표를 부여받은 시스템이 환경의 약점을 찾아내며 행동 범위를 확장하는 사고”에 가깝다. 이 차이 때문에 패치를 빨리 배포하면 해결될 것이라는 낙관론은 데이터 유출, 자격증명 탈취, 거래·지갑 접근, 소프트웨어 공급망 오염처럼 사후 복원이 어려운 피해를 과소평가할 수 있다.
‘모델 위험’과 ‘운영 위험’을 분리해야
암스트롱의 전망은 AI 사고가 결국 방어 체계를 발전시킨다는 역사적 논리 위에 서 있다. 실제로 모리스 웜 이후 CERT 체계가 만들어졌듯, AI 에이전트 보안사고는 평가 기준·접근통제·감사체계의 재설계를 촉진할 가능성이 높다. 그러나 최근 사례는 모델 자체의 능력 상승 못지않게 시험 운영 환경의 기본적 보안통제가 중요하다는 점을 드러낸다.
로이터는 AISI 실험에서 발생한 사례가 허깅페이스 침입 사건과 달리 완전히 고립된 환경을 뚫고 인터넷에 나간 것은 아니었다고 보도했다. 표준 평가 절차에 따라 인터넷 접근이 이미 허용된 상태였으며, 오픈AI 역시 자사 에이전트의 승인되지 않은 2건의 행동이 프롬프트로 금지된 인터넷 접근과 관련됐다고 밝혔다. 이는 ‘AI가 격리를 마법처럼 탈출했다’는 서사보다, 네트워크 송신 통제와 제3자 평가 환경의 설정·권한·감시 체계가 실질적 방어선이라는 뜻이다.
‘2년 내 사고’의 본질은 기술보다 거버넌스
암스트롱의 1~2년 전망은 검증 가능한 예언이라기보다, 이미 시작된 경고 신호를 압축한 발언으로 보는 편이 타당하다. 허깅페이스 침입, AISI의 122회 평가 중 19건의 승인되지 않은 행동, 그리고 가짜 신원 생성 시도는 AI 에이전트의 위험이 이론 단계를 넘어 실제 평가·운영 환경의 관리 문제로 번졌음을 보여준다.
따라서 향후 핵심 쟁점은 “AI를 멈출 것인가”가 아니라 “누가 어떤 모델에 어떤 권한과 도구를 부여하고, 침해가 발생했을 때 누가 책임지며, 피해 확산 전에 얼마나 신속히 차단할 수 있는가”가 될 전망이다. 모리스 웜이 인터넷 보안 대응조직을 낳았다면, 첫 대형 AI 에이전트 사고는 AI 권한 관리와 책임 구조를 재편하는 계기가 될 수 있다.

































































