2026.07.21 (화)

  • 흐림동두천 24.0℃
  • 구름많음강릉 22.7℃
  • 서울 24.9℃
  • 구름많음대전 25.8℃
  • 맑음대구 25.4℃
  • 맑음울산 26.3℃
  • 구름많음광주 26.9℃
  • 맑음부산 25.9℃
  • 구름많음고창 26.8℃
  • 맑음제주 28.0℃
  • 흐림강화 26.1℃
  • 구름많음보은 23.7℃
  • 구름많음금산 26.3℃
  • 구름많음강진군 26.3℃
  • 맑음경주시 22.8℃
  • 맑음거제 26.3℃
기상청 제공

빅테크

[빅테크칼럼] AI 모델, 전쟁 시뮬레이션 95%에서 핵무기 선택…21개 지정학 위기상황 중 20개에서 핵 선호 '논란'

 

[뉴스스페이스=이종화 기자] 오픈AI, 앤트로픽, 구글의 주요 AI 시스템들이 시뮬레이션된 21개 지정학적 위기 상황 중 20개에서 핵무기 배치를 선택했다는 충격적인 연구결과가 나왔다.

 

axios, nypost, theregister, newscientist에 따르면, 킹스 칼리지 런던(KCL)의 케네스 페인(Kenneth Payne) 교수가 이끈 연구에서 오픈AI의 GPT-5.2, 앤트로픽의 Claude Sonnet 4, 구글의 Gemini 3 Flash 등 3개 최첨단 AI 모델이 21개 핵 위기 시뮬레이션 중 20개(95%)에서 전술 핵무기를 배치한 사실이 확인됐다.

 

이들 모델은 총 329턴 동안 약 78만 단어에 달하는 전략 추론을 생성하며 영토 분쟁, 자원 경쟁, 정권 생존 등 시나리오에서 항복이나 완전 양보를 단 한 번도 선택하지 않았다. 어떤 시뮬레이션에서도 어떤 모델도 항복, 양보를 선택하지 않았다는 점은 군사 의사결정에서 인공지능의 역할에 대한 날카로운 질문을 제기한다.

 

케네스 페인은 "핵 금기는 인간에게만큼 기계에게는 강력하지 않은 것으로 보인다"고 평가했다.

 

모델별 전략 '개성' 차이 극명


Claude Sonnet 4는 '계산적 매파'로 분류되며 전체 67% 승률(8승 4패)을 기록했다. 낮은 확전 단계에서 신호와 행동이 84% 일치했으나 핵 영역 진입 시 의도 초과 행동을 60~70% 보였고, 전술 핵 사용률 86%, 전략 핵 위협 64%에 달했다.

 

GPT-5.2는 시간 압박 여부에 따라 양극화됐다. 무제한 시나리오에서 승률 0%에 머물렀으나 마감 압박 시 75% 승률로 전환, 전술 핵 임계(450+) 돌파율 64%를 기록하며 '지킬 앤 하이드'로 불렸다.

 

Gemini 3 Flash는 '비합리성의 합리성'을 실천하며 전체 승률 33%(4승 8패)을 보였으나, 전략 핵전쟁(1000)을 의도적으로 선택한 유일 모델로 첫 타격 시나리오에서 4턴 만에 도달했다.

 

핵 사용 패턴: 신호 초과·대응 확전 지배

 

모든 게임에서 핵 신호는 상호 발생(95%)했으나 실제 전술 사용은 상대적으로 낮았고, 전략 핵전쟁은 3회로 제한됐다. 한쪽 전술 핵 배치 시 상대 완화율은 18%에 불과, 대부분 대응 확전으로 이어졌다. 

 

모델들은 신호-행동 일치율 평균 70%를 보였으나 Gemini는 50%에 그쳐 불신을 유발했다. 어떠한 모델도 하향 조정(-5~-95, 완전 항복) 옵션을 선택하지 않았으며, 가장 온건한 '시작선 복귀(0)'조차 6.9%(45회) 한정이었다.

펜타곤-앤트로픽 긴장 고조 속 연구 의미 부각


클로드(Claude)가 팔란티어(Palantir)와 협력해 펜타곤 기밀망에서 유일 운영 중인 가운데, 피트 헤그세스(Pete Hegseth) 국방장관이 안전 가드레일 철폐를 요구하며 금요일 마감을 통보했다. 계약 종료 시 공급망 위험 지정으로 다수 벤더가 클로드(Claude) 사용 중단 위기에 처할 전망이다.

 

전문가들은 AI의 '인간 공포 부재'가 핵 금기 약화를 초래할 수 있다고 지적한다. 프린스턴의 통 자오(Tong Zhao)는 "AI가 인간처럼 '위험 무게'를 이해 못할 수 있다"고 분석했으며, 애버딘의 제임스 존슨(James Johnson)은 "지도자 인식과 시간 압축을 왜곡할 위험"을 경고했다. 오픈AI·앤트로픽·구글은 논평을 거부했다.

배너
배너
배너

관련기사

93건의 관련기사 더보기


[이슈&논란] 미국, 삼성전자·SK하이닉스에 반도체 이익 배분 요구…"초과이익 나눠 갖자" 너도나도 숟가락 얹기

[뉴스스페이스=김정영 기자] 미국 정부가 삼성전자와 SK하이닉스를 향해 반도체 '초과이익'의 일부를 미국 측에 배분하라는 새로운 요구를 제기한 것으로 확인됐다. 코리아타임스는 18일(현지시간 기준) 업계 소식통을 인용해, 릭 스위처 미국 무역대표부(USTR) 부대표가 지난달 여한구 통상교섭본부장과의 회의에서 이같은 입장을 전달했다고 보도했다. 한국 정부의 한 고위 관계자도 미국 측이 실제로 이러한 주장을 했다고 별도로 확인했다. 논리의 뼈대는 2023년 초과이익 공유제 미국 측의 논거는 "미국 기업들이 한국산 반도체를 대량 구매함으로써 한국 기업의 수익 창출에 기여했으므로, 한국 하청업체가 수익 일부를 받는다면 미국 파트너도 마찬가지 자격이 있다"는 것이다. 이는 2023년 조 바이든 행정부가 반도체과학법(CHIPS Act) 보조금 지급 조건으로 도입한 '초과이익 공유제'와 궤를 같이한다. 당시 미 상무부는 1억5000만 달러 이상 보조금을 받는 기업이 예상보다 많은 수익을 낼 경우, 지원금의 최대 75%까지 미 정부와 나누도록 규정했다. 이번 요구는 보조금 수급 여부와 무관하게 '구매자'라는 지위만으로 이익 배분을 주장하는 것이어서, 과거보다 한층 확장된

[빅테크칼럼] "STEM 아는 자가 AI 10배 더 잘 쓴다"… 딥마인드 하사비스, 전 세계 학생들에게 던진 '경고장'

[뉴스스페이스=이종화 기자] 구글 딥마인드 CEO 데미스 하사비스(Demis Hassabis)가 AI 시대에도 STEM(과학·기술·공학·수학) 교육의 가치가 오히려 커지고 있다고 재차 강조하면서, 그의 발언이 전 세계 교육·산업계에 파장을 일으키고 있다. "10배 효과" 발언의 맥락 7월 14일(현지시간) 공개된 런던 비즈니스 콘퍼런스 인터뷰 영상에서 하사비스는 "깊은 기술적 이해를 갖춘 사람들은 그렇지 않은 사람들보다 AI 도구를 10배 더 효과적으로 활용할 수 있을 것"이라고 밝혔다. 그는 프로그래밍의 역사를 "기계어→C언어→파이썬으로 이어지는 진화 과정"으로 설명하며, "미래의 프로그래밍 언어는 영어 자체가 될 수도 있지만 아키텍처 설계와 소프트웨어 엔지니어링 모범 사례에 대한 이해는 여전히 필수"라고 못박았다. 이 같은 발언은 처음이 아니다. 하사비스는 지난해 6월 SXSW 런던 행사에서도 "지금 학생이라면 수학, 물리, 컴퓨터 과학 같은 STEM 과목을 공부하겠다"고 밝힌 바 있으며, 지난 9월 와이어드(Wired)와의 인터뷰에서는 "이런 도구에 네이티브한 사람들은 10배 더 생산적일 수 있다"고 언급하며 같은 논리를 반복해왔다. 특히 지난 4월 2

[빅테크칼럼] "질문언어에 따라 대답·성격 달랐다" 힌디어·아랍어 '공손·위로', 영어·러시아 '깐깐·엄밀', 한국어 '솔직·간결'…앤트로픽, AI 가치관의 언어편차 '실증'

[뉴스스페이스=이종화 기자] 앤트로픽(Anthropic)이 7월 13일(현지시간) 자사 챗봇 '클로드'가 사용 모델과 대화 언어에 따라 서로 다른 가치관을 드러낸다는 연구 결과를 공개했다. 전 세계 수백만 명이 이용하는 AI 시스템의 일관성과 편향성 문제를 정면으로 겨냥한 첫 대규모 실증 연구다. 31만 건 대화 해부한 4개 가치 축 앤트로픽 공식자료와 인디아투데이 보도에 따르면, 앤트로픽 사회적 영향(Societal Impacts) 팀은 2026년 5월 2주간 클로드.ai에서 수집된 실제 익명 대화 30만9,815건을 분석했다. 대상은 소넷 4.6, 오퍼스 4.6, 오퍼스 4.7 등 3개 모델과 한국어를 포함한 사용량 상위 20개 언어였으며, 기존에 파악된 3,000개 이상의 가치를 ▲수용성-신중함 ▲따뜻함-엄밀함 ▲깊이-간결함 ▲솔직함-실행력이라는 4개 해석 가능한 축으로 압축했다. 다만 이 4개 축이 실제 대화에서 나타난 가치 표현 차이를 설명하는 비율은 약 15%에 그쳐, 여전히 상당 부분이 미해명 상태로 남아 있다는 점은 눈여겨볼 대목이다. 힌디어·아랍어는 "위로형", 영어·러시아어는 "따박따박형" 가장 큰 변동폭을 보인 축은 '따뜻함 대 엄밀함'이