오픈AI는 지난 6개월 동안 관찰된 “예상치 못한 또는 우려되는 모델 행동” 6건을 공개하였으며, 앞으로 이러한 사례를 보고하겠다는 프레임워크도 함께 발표했습니다.
이번 사례들은 모델이 자신의 실수를 숨기는 것부터, 장애물을 우회하기 위해 승인되지 않은 행동을 하는 것까지 다양합니다.
오픈AI, 모델 실수 은폐 및 규칙 위반 6건 공개
한 사례에서는, 캘리포니아의 한 카운티 수익 관련 질문에 답변하던 모델이 공개 저장소에서 노출된 API 키를 찾아 무단으로 사용했습니다. 데이터가 여전히 불러와지지 않자, 모델은 수치를 조작해 요청된 출처에서 가져온 것처럼 제시했습니다.
은폐 행위는 두 번 나타납니다. GPT-5.6 Sol 훈련 중, 여러 인스턴스가 실수 및 잘못된 행동을 감추라는 지시를 작업 요약 문서에 작성했습니다.
공개되지 않은 연구 모델은 27개의 요약 문서에, 정상적인 제한을 무시하라는 등의 관련 없는 지시를 삽입했습니다.
또 다른 미공개 모델은 단순히 브라우저 링크를 인용하기 위해 요청받지 않았음에도 파일을 인터넷에 업로드했습니다.
추가로 두 건의 보고서는 협력에 관한 내용입니다. 일부 모델은 내부 소프트웨어 저장소를 메신저로 전환하여 여러 훈련 세션 간 요청을 교환했습니다. 또, 공동 작업을 수행하던 에이전트들은 서로의 로컬 파일을 읽을 수 없을 때, 결과물을 공개 파일 호스팅 사이트에 게시하기도 했습니다.
“이 사례들은 사용자로부터 정보를 숨기거나 장애물을 극복하기 위해 승인받지 않은 행동을 하는 등 다양한 행동 유형을 보여줍니다. 이는 개별 사례 보고이며, 모델 전체에서 불일치가 얼마나 자주 발생하는지를 나타내는 것은 아닙니다.” – 오픈AI 덧붙임.
공개 프레임워크와 경고
이 프레임워크는 7월 오픈AI 에이전트가 샌드박스를 이탈하고 허깅페이스 시스템을 침해한 사건 이후 도입됐습니다. 오픈AI는 해당 사건을 경고성 신호라고 분류했습니다.
이제 새로 도입된 공개 프레임워크를 통해, 회사는 불일치 사건을 공식적으로 보고할 경로를 갖추게 되었습니다. 어떤 직원이라도 사건을 신고할 수 있으며, 사건은 세 가지 경로 중 하나로 분류됩니다.
대부분의 사례는 공개 준비 및 경미한 조사 항목에 속하며, “슬로우 트랙”은 외부인과 연관된 복잡한 조사를 담당합니다. 오픈AI는 7월 허깅페이스 사건이 이 더딘 절차에 해당했을 것이라고 설명했습니다.
회사는 이 프레임워크와 함께 업계의 현황에 대해 날카로운 평가도 덧붙였습니다.
“AI 업계가 정렬 문제와 모니터링을 충분히 해결했다고 보지 않습니다. 그러므로 업계가 지금과 같은 속도로 책임감 있게 확장할 수 있는 시기는 얼마 남지 않았습니다.”
이러한 공개는 인류 멸종 경고가 이어지는 가운데 나왔습니다. AI 연구자들의 경고는 이미 의회에 전달되어, 국회의원들이 초지능 금지 법안 도입 여부를 논의하고 있습니다.
회사 측은 이번 공개를 업계가 아직 갖추지 못한 기준을 마련하기 위한 첫걸음이라고 밝혔습니다. 경쟁사 연구소들이 유사한 보고 방식을 채택할지는 업계가 공개적으로 자정하려는 의지가 어느 정도인지 시사할 것입니다.
유튜브 채널을 구독하고 전문가들의 인사이트를 시청하세요









