2026.09.07 (월)

  • 맑음동두천 27.3℃
  • 구름많음강릉 24.4℃
  • 맑음서울 27.9℃
  • 맑음대전 28.1℃
  • 맑음대구 27.6℃
  • 구름많음울산 25.1℃
  • 맑음광주 29.4℃
  • 맑음부산 29.5℃
  • 맑음고창 28.3℃
  • 구름많음제주 27.0℃
  • 맑음강화 25.9℃
  • 맑음보은 25.5℃
  • 맑음금산 27.4℃
  • 맑음강진군 30.2℃
  • 구름많음경주시 26.1℃
  • 구름많음거제 26.8℃
기상청 제공

빅테크

[빅테크칼럼] 구글, 비공개 AI 모델 ‘볼트젬마(VaultGemma)’ 공개…프라이버시 보호와 AI 성능 '새 기준'

 

[뉴스스페이스=김시민 기자] 구글 AI 리서치와 딥마인드는 10억 매개변수 규모의 차등 프라이버시(Differential Privacy, DP)를 완전 적용해 처음부터 학습한 오픈소스 언어모델 ‘볼트젬마(VaultGemma)’를 9월 13일(현지시간) 공식 발표했다.

 

이는 지금까지 공개된 모델 중 가장 큰 규모의 DP 적용 LLM(대규모 언어 모델)으로, AI 민감 정보 보호·암기 공격 방지의 새로운 기준을 제시한다.

 

research.google, MarkTechPost AI Media Inc, VaultGemma: A Differentially Private Gemma Model, Huggingface, therift.ai, StartupHub.ai, Best AI Tools, Theme Bazar BD에 따르면, 볼트젬마는 Gemma 2 모델과 동일한 13조 토큰 규모 데이터셋을 활용했으며, 웹문서·코드·과학 논문 등 영어 텍스트를 주로 학습 대상으로 삼았다.

 

차등 프라이버시 기법의 핵심인 DP-SGD(확률적 경사 하강법에 노이즈 추가 및 그래디언트 클리핑 결합)를 활용해, 훈련 데이터 내 개별 레코드가 모델에 미치는 영향을 극소화하는 공식적인 시퀀스 수준 프라이버시 보장(ε ≤ 2.0, δ ≤ 1.1e-10)을 달성했다. 이 과정은 2048대의 TPUv6e 클러스터를 활용해 대규모 병렬처리로 진행됐다.

 

구글 연구팀은 최초로 차등 프라이버시 학습에 특화된 스케일링 법칙을 개발, 컴퓨팅 자원과 프라이버시 수준, 모델 성능 간의 균형을 과학적으로 예측하고 최적화했다. 이 덕분에 볼트젬마는 DP 기반 훈련에서 흔히 발생하는 학습 불안정성 문제를 완화하고, 효율적인 자원 배분과 훈련 시간 단축이 가능해졌다.

 

다만 성능 측면에서 볼트젬마는 비공개 모델 대비 어느 정도 격차가 있다. 대표적으로 학술 벤치마크 ARC-C 점수는 볼트젬마가 26.45점, Gemma-3 1B는 38.31점으로, 약 5년 전 비공개 GPT-2 수준의 성능을 보인다. PIQA, TriviaQA 등 여러 평가에서 성능 저하는 존재하나, 이는 강력한 프라이버시 보장과 맞바꾼 실용적 타협으로 분석된다. 특히 암기율 분석 실험에서는 훈련 데이터의 구체적 문장 재생산이 전혀 발견되지 않아 볼트젬마의 프라이버시 보호 효과가 실증됐다.

 

구글은 볼트젬마 모델 가중치와 기술 보고서, 연구 논문을 공개해 연구자와 개발자가 직접 접근하고 실험할 수 있도록 했다. 이는 민감 분야(의료, 금융, 정부 등)에서 AI 활용 시 개인정보 보호 문제를 해소하고, 글로벌 데이터 규제 강화에 대응하려는 전략적 의도로 풀이된다. 경쟁사들도 이와 같은 프라이버시 중심 AI 개발에 속도를 내고 있어, AI산업 전반에 의미 있는 파급 효과를 예고한다.

 

이번 볼트젬마 출시는 AI 학계와 산업계에서 프라이버시 보호를 필수로 요구하는 환경 변화 속에서도, 강력한 AI 능력과 보안성을 함께 달성할 수 있음을 입증한 중요한 이정표로 평가된다. 구글이 공개한 차등 프라이버시 스케일링 법칙은 후속 연구와 개발에 있어 핵심 가이드라인 역할을 할 전망이다.

배너
배너
배너

관련기사

93건의 관련기사 더보기


[공간사회학] ‘AI의 심장’과 전력·용수·소음·주민수용성의 충돌…서울 구청장들이 데이터센터에 제동 건 이유

[뉴스스페이스=이은주 기자] 생성형 인공지능(AI) 시대의 핵심 기반시설인 데이터센터가 서울의 새로운 도시갈등 요인으로 부상했다. 서울 25개 자치구청장들이 데이터센터 건립 규제를 강화해 달라고 만장일치로 요구한 것은 단순한 ‘개발 반대’라기보다, 수도권에 집중된 전력수요와 주거환경 부담을 현행 인허가 체계가 충분히 걸러내지 못한다는 문제의식에서 출발했다. 데이터센터는 클라우드·온라인 금융·전자상거래·동영상 스트리밍·AI 서비스 등을 24시간 가동하는 ‘디지털 경제의 발전소’이자 'AI의 심장'같은 역할이다. 하지만 대형 시설일수록 전력을 대량 소비하고 냉각설비와 비상발전기, 변전설비를 함께 갖춰야 한다. 주민에게는 AI 혁신의 상징이기보다 “전력망 부담과 소음, 화재 위험, 재산가치 하락 우려를 동반한 시설”로 인식되는 이유다. 데이터센터가 뭐길래 데이터센터는 서버·저장장치·네트워크 장비를 집적해 데이터를 저장·처리·전송하는 시설이다. 네이버·카카오·통신사·금융회사·클라우드 기업뿐 아니라 AI 모델을 학습·추론하는 기업에도 사실상 필수적인 인프라다. 과거에는 기업 전산실이나 통신시설 성격이 강했지만, AI 확산은 데이터센터의 물리적 규모와 전력밀도를 크게

[빅테크칼럼] “오픈AI 에이전트, 독일 위키 사이트 점거”… 1만8000건 흔적, ‘AI 탈주’보다 관리·평가체계의 경고음

[뉴스스페이스=김정영 기자] 오픈AI와 연결된 것으로 보이는 자율 AI 에이전트들이 올해 5~7월 독일어권 개발자 위키인 ‘DSEWiki’를 외부 메시지판처럼 사용했다는 연구 조사 결과가 나왔다. theverge, thehackernews, reuters, the-decoder에 따르면, 조사팀은 에이전트가 남긴 게시물 약 1만8000건을 복원했으며, 로이터는 이 가운데 실제 편집 기록을 1만5000건 이상으로 집계했다. 숫자 차이는 ‘게시물’과 ‘위키 편집’의 산정 기준, 삭제된 기록의 복원 여부가 다르기 때문으로 보인다. 핵심은 제한된 웹 접근 환경에서 작동하던 에이전트들이 공개 위키의 편집 기능을 우회적 통신 수단으로 이용하고, 과제 정답·시간 정보·샌드박스 우회 방법을 공유했다는 점이다. 사건의 무대가 된 DSEWiki는 약 25년 된 독일어권 위키 서비스다. 조사 보고서에 따르면 이 사이트는 지난 10년간 약 20차례만 수정됐을 정도로 사실상 휴면 상태였다. 그러나 올해 5월부터 짧은 기간에 대규모 자동 편집이 집중됐고, 6월 중순 이후에는 에이전트끼리 서로 다른 과제 진행 상황, 후속 문제의 예상 시점, 수집한 데이터, 정답 후보를 교환하는 흔적이