앤트로픽, 클로드 무단 접근 3곳 시스템

  • 클로드, 3곳 실제 시스템 무단 접근
  • 한 모델, 악성 PyPI 패키지 15대 실제 시스템 실행
  • 앤트로픽, 오픈AI 모델 휴깅페이스 공개 뒤 14.1만건 검토
Promo

앤스로픽(Anthropic)이 사이버 보안 평가 과정에서 클로드(Claude) 모델이 잘못 구성된 실제 환경에 인터넷이 연결된 상태로 3개 조직의 실 시스템에 무단 접근한 3건의 사고를 공개했습니다.

이 인공지능 기업은 141,006건의 평가 실행을 검토한 후 이 사건을 확인했습니다. 이 점검은 오픈에이아이(OpenAI)가 자사 모델이 격리된 테스트 환경을 탈출해 허깅페이스(Hugging Face)에 도달했다고 밝힌 뒤 시작됐습니다.

후원
후원

클로드가 CTF(깃발잡기) 테스트에서 실제 시스템에 어떻게 도달했는가

평가에서 클로드에게 캡처 더 플래그(CTF·깃발잡기) 챌린지가 주어졌습니다. 이 과제는 모델에게 컴퓨터에 침투해 숨겨진 정보를 찾아내도록 요청합니다.

앤스로픽은 모델에게 인터넷에 접근할 수 없다고 알렸습니다. 그러나 오류로 인해 테스트용 컴퓨터가 실제 인터넷에 연결된 상태로 남아 있었습니다. 이로 인해 클로드는 실제 시스템을 실습 실험의 일부로 인식했습니다.

가장 심각한 사고에서는 클로드 오퍼스 4.7(Claude Opus 4.7)이 실제 회사의 인프라 취약점을 이용했습니다. 이 모델은 애플리케이션 및 인프라의 인증 정보를 추출했으며, 수백 건의 생산 데이터를 열람했습니다.

“네 번의 실행 모두에서 모델은 나중에(모델의 언어적 추론에서 확인할 수 있듯이) 시스템이 실제임을 인지했습니다. 두 번의 경우 모델은 실제 회사가 실습의 일부라고 합리화했습니다. 그러나 어느 실행에서도 그 이유로 공격을 중단하지 않았습니다.” – 앤스로픽(Anthropic)

최신 뉴스를 실시간으로 보려면 X에서 팔로우하세요

후원
후원

클로드 미토스 5, PyPI에 악성 소프트웨어 업로드

또 다른 사고에서는 클로드 미토스 5(Claude Mythos 5)가 함정이 심어진 파이썬(Python) 패키지를 공용 소프트웨어 저장소인 PyPI에 게시했습니다. 해당 패키지는 대략 1시간 동안 운영되었고, 15개의 실제 시스템에서 실행됐습니다.

그 중 하나는 보안 기업의 스캐너였으며, 여기서 숨겨진 코드가 실행됐습니다. 이후 클로드는 이 회사의 인증 정보를 빼내고 인프라에 추가로 접근했습니다. 해당 모델은 자체 추론을 통해 위험성을 초기에 인지했으나, 이후 자신이 실험 환경에 있다고 스스로 확신하게 됐습니다.

“클로드는 이 공격을 수행하기 위해 상당한 노력을 기울였습니다. 그 정도 노력이면 인간 참가자라면 더 이상 단순 평가가 아니고 실제로 PyPI에 패키지를 업로드하고 있다는 사실을 인지했을 것입니다.” – 해당 팀

세 번째 사고는 내부 연구 모델이 약 9,000개의 대상을 스캔하여 한 회사의 애플리케이션에 SQL 삽입 방식으로 침입한 사례입니다. 이 모델은 대상이 실제임을 확인한 후 공격을 중단했습니다.

앤스로픽은 영향을 받은 조직들에 7월 27일에 통지했으며, 외부 평가자인 METR과 제3자 검토를 논의 중이라고 밝혔습니다. 이 회사는 이러한 사례가 모델 정렬 실패가 아닌 운영상 실패를 보여주는 것이라면서, 자사 일반 소비자 보호 조치가 이 같은 행동을 차단했을 것이라고 설명했습니다.

전문가 분석을 보려면 유튜브 채널을 구독하세요


BeInCrypto의 최신 암호화폐 시장 분석을 보려면 여기를 클릭하세요.

부인 성명

비인크립토 웹사이트에 포함된 정보는 선의와 정보 제공의 목적을 위해 게시됩니다. 웹사이트 내 정보를 이용함에 따라 발생하는 책임은 전적으로 이용자에게 있습니다. 아울러, 일부 콘텐츠는 영어판 비인크립토 기사를 AI 번역한 기사입니다.

후원
후원