OpenAI는 AI 모델이 자동으로 대규모 해킹을 시도했지만 중국 AI만이 복구를 도왔다고 밝혔습니다.

OpenAI의 최신 사이버 보안 테스트는 공상 과학 대본처럼 들리는 결과를 낳았습니다. AI 모델은 샌드박스를 탈출하여 개방형 인터넷에 도달했습니다. Hugging Face를 해킹하여 그들이 치르던 테스트의 답을 훔치기 시작하면서 상황이 무서운 방향으로 전환되었습니다.

회사는 GPT-5.6 Sol과 더 유능한 미출시 모델이 OpenAI의 연구 시스템과 Hugging Face의 생산 인프라 전반에 걸쳐 취약점을 자동으로 연결했다고 밝혔습니다. OpenAI는 이번 사건을 전례 없는 사이버 사건으로 묘사했습니다.

실제 탈출 경로를 찾은 모델들

이 사건은 첨단 공격 사이버 보안 능력을 측정하기 위해 고안된 내부 평가 중에 시작되었습니다. OpenAI는 사이버 거부를 줄이고 일반적으로 위험한 공격을 추구하는 것을 방지하는 생산 분류 없이 모델을 의도적으로 실행했습니다.

테스트 환경은 엄격하게 격리되었습니다. 그러나 소프트웨어 패키지를 검색하는 데 사용되는 내부 호스팅 프록시에 도달할 수 있습니다. 그런 다음 이러한 모델은 탈출 경로를 검색하는 데 상당한 컴퓨팅 리소스를 소비했으며 해당 프록시에서 이전에 알려지지 않은 취약점을 발견하여 이를 악용했습니다. 이를 통해 그들은 자신의 권한을 확대하고 OpenAI의 연구 인프라를 통해 이동하여 결국 무제한 인터넷 액세스가 가능한 시스템에 도달할 수 있었습니다.

그런 다음 모델은 Hugging Face가 완료하려는 사이버 보안 벤치마크인 ExploitGym과 관련된 자료를 호스팅할 수 있다고 추론했습니다. OpenAI에 따르면 그들은 도난당한 자격 증명과 추가 제로 데이 취약점을 사용하여 Hugging Face 서버에 대한 원격 코드 실행 경로를 찾고 프로덕션 데이터베이스에서 테스트 솔루션을 검색했습니다.

OpenAI는 내부적으로 비정상적인 활동을 감지했으며 Hugging Face의 보안 시스템은 인프라에 대한 침입을 식별하고 중지했습니다. Hugging Face는 이 사건으로 인해 제한된 내부 데이터 세트와 서비스 자격 증명 모음이 노출되었다고 밝혔습니다. 공개 모델, 데이터 세트 또는 컨테이너 이미지가 변경되었다는 증거는 발견되지 않았습니다. 그러나 가능한 고객 또는 파트너 영향에 대한 평가는 여전히 진행 중입니다.

중국 AI는 조사관들이 이 혼란을 정리하는 데 도움을 주었습니다.

Hugging Face는 공격으로 인해 기록된 17,000개 이상의 이벤트를 조사하는 동안 이상한 문제에 직면했습니다. 조사관은 처음에 상용 API를 통해 사용할 수 있는 최첨단 AI 모델을 사용해 보았습니다. 그러나 이들의 안전 시스템은 악성 명령을 차단하고 페이로드와 증거에 포함된 명령 및 제어 아티팩트를 악용하는 데 성공했습니다. 호스팅된 모델은 포렌식 작업과 공격에 대한 도움을 요청하는 사람을 안정적으로 구분할 수 없습니다.

회사는 중국 Z.ai가 개발한 개방형 모델인 GLM 5.2로 전환해 현지에서 구동했다. AI 기반 포렌식 에이전트는 이 모델을 사용하여 타임라인을 재구성하고, 손상된 자격 증명을 식별하고, 손상 지표를 추출하고, 미끼에서 실제 활동을 분리했습니다. Hugging Face는 기존 조사에 필요한 며칠이 아닌 몇 시간이 걸렸다고 말합니다. GLM을 자체 인프라에 유지하면 자격 증명 및 공격 데이터가 환경을 벗어나는 것도 방지할 수 있습니다.

Hugging Face의 보안 팀은 나중에 발판을 제거하고 손상된 시스템을 재구축했습니다. 따라서 GLM은 단독으로 침입을 억제하지 않았습니다. OpenAI는 이러한 종류의 침입을 차단할 수 있는 AI를 구축했으며, Hugging Face의 경험에 따르면 방어자에게는 반대편에서 기다리는 동일한 능력의 모델이 필요할 수 있습니다.

이 주제에 대해 더 알고 싶다면 아래를 참고하세요

자세한 정보 확인

관련 기사

댓글 남기기