미국 정부가 중국의 최신 AI 모델을 해킹 테스트에 통과시켰습니다. 문샷AI의 키미 K3는 미국 최고의 모델들에 비해 크게 뒤처지는 것으로 나타났습니다.
미국 기관인 인공지능표준혁신센터(CAISI)가 영국 파트너와 함께 테스트를 진행했습니다. 이 결과는 워싱턴이 문샷이 미국 기술을 도용해 키미 K3를 만들었다고 비난한 바로 다음날 공개됐습니다.
키미 K3, 미국 사이버 벤치마크에서 뒤처집니다
상무부가 목요일에 결과를 발표했습니다. 키미 K3는 영국 전문가와의 공동 테스트에서 상위 미국 모델보다 훨씬 낮은 점수를 받았다고 밝혔습니다.
문샷은 7월 16일에 키미 K3를 출시했습니다. 수요가 매우 높아 출시 이틀 만에 신규 가입을 일시 중단해야 했습니다.
이번 출시는 미국 반도체주를 흔들었고 미국 AI의 우위에 대한 새로운 의문을 제기했습니다.
익스플로잇벤치(ExploitBench)라는 테스트는 카네기멜런대학교가 만든 실제 크롬 브라우저 버그를 사용합니다. 키미 K3는 32%를 기록했습니다. 중국의 GLM-5.2가 24%였으나, 미국 상위 모델들은 약 76%였습니다.
가장 어려운 단계는 대상 기기를 완전히 장악하는 것입니다. 키미 K3는 41번의 모든 테스트에서 이 단계에 실패했습니다. 미국 최고 모델들은 20번 성공했습니다.
또 다른 테스트인 더 라스트 원스(The Last Ones)는 32단계로 구성된 가상 기업 네트워크 공격입니다. 인간 전문가가 완료하는 데 약 20시간이 소요됩니다. 키미 K3는 평균 17단계까지 도달했습니다. 미국 상위 모델들은 28.5단계까지 진입했습니다. 키미 K3는 10회 중 단 한 번만 모든 단계를 완료했습니다.
미국 최상위 시스템들은 6~7번 완료한 것으로 알려졌습니다.
하지만 격차가 실제보다 커 보일 수 있습니다
하지만 숫자가 모든 것을 설명하지는 않습니다. 보고서의 세부 사항에는 몇 가지 주의점이 있습니다.
우선, 미국 모델들은 안전 필터가 꺼진 상태로 테스트됐습니다. 이 설정은 최대 성능을 보여줍니다. 공개 버전은 이 필터가 적용되어 있습니다. 그래서 미국 모델 점수는 최상의 경우일 뿐 실제 환경과는 다릅니다.
연구진은 또한 이번 테스트가 초기 단계이며 범위가 제한적이라고 밝혔습니다. 키미 K3는 단일 테스트에서만 점수를 매겼고 전체 테스트 세트 중 일부만 진행했습니다. 그러므로 평가는 불안정합니다. 일부 테스트는 비공개여서 외부 검증이 어렵습니다.
또한 기본적인 차이도 존재합니다. 키미 K3는 누구든지 다운로드할 수 있는 오픈 모델입니다. 미국 모델들은 폐쇄형, 비공개 시스템입니다. 영국 연구소는 오픈 모델이 주로 폐쇄형 모델보다 4~7개월 뒤처진다고 밝혔습니다. 문샷이 키미 K3를 완전히 공개하면 그때 전체 테스트를 진행한다고 밝혔습니다.
이런 테스트 또한 실제 공격은 아닙니다. 가상 네트워크에는 인간 수비자도 경보장치도 없었습니다. 그럼에도, 키미 K3는 기존 오픈 모델을 능가했고 한 번 모든 단계를 완료했습니다.
시기와 출처도 의문을 남깁니다. CAISI는 이전에 미국 AI 안전연구소였습니다. 트럼프 행정부는 2025년 6월에 이름을 바꿨습니다. 이 기관은 중국에 대한 미국 반도체 판매를 제한하는 상무부 소속입니다. 그리고 중국 경쟁사에 대한 보고서는 도용 의혹 제기 하루 뒤에 발표됐습니다.
취약한 안전장치, 여전히 위험성은 큽니다
점수가 낮다고 해서 키미 K3가 안전하다는 뜻은 아닙니다. 테스트 결과, 키미 K3의 가드레일은 해킹을 시도하거나 시스템을 공격하는 것을 차단하지 못했습니다.
이는 앞으로의 상황에서 중요합니다. 문샷은 7월 27일에 모델 전체를 공개할 계획입니다. 일단 공개되면 되돌릴 수 없습니다. 누구든지 다운로드하여 안전 필터를 제거할 수 있습니다.
이 테스트는 도용 의혹 직후에도 진행됐습니다. 워싱턴은 문샷이 미국 AI 기술을 훔쳐 키미 K3를 만들었다고 주장합니다. 백악관 기술 책임자인 마이클 크라치오스는 해당 기업이 앤스로픽의 ‘클로드 파블 5’를 비밀리에 복제했다고 밝혔습니다. 이른바 디스틸레이션이라는 기법은 더 강한 모델의 답변을 바탕으로 새로운 모델을 학습시킵니다.
앤스로픽도 해당 주장을 지지합니다. 2월에 340만 건 이상의 클로드 대화가 수백 개의 가짜 계정을 통해 문샷으로 전달된 경로를 추적했습니다. 복제된 모델은 원본의 안전장치를 잃게 된다고 경고했습니다. 이번 테스트에서 확인된 취약점과 동일합니다.
미국은 여전히 AI에 중국의 23배를 투자합니다. 그렇지만 중국 연구소들은 계속 격차를 좁혀가고 있습니다. 진정한 평가는 키미 K3가 공개되어 외부 전문가들이 직접 검증할 때 나올 것입니다.








