
ZDNET을 팔로우하세요: 우리를 선호 소스로 추가하세요 Google에서.
ZDNET의 주요 시사점
- OpenAI 모델 테스트로 인해 Hugging Face 시스템이 침해되었습니다.
- 이번 공격은 OpenAI의 에이전트 AI가 샌드박스를 탈출한 후에 발생했습니다.
- 위협은 악의적이지 않았지만 전문가들은 비슷한 사건이 발생할 것으로 예상합니다.
내 ZDNET 동료인 Charlie Osborne은 최근 일부 사람들이 “머신러닝의 GitHub”로 간주하는 오픈 소스 저장소이자 커뮤니티 플랫폼인 Hugging Face에서 AI 에이전트가 시스템을 침해했다는 사실을 공개했다고 보고했습니다. Osborne은 공격자가 Hugging Face의 경계를 침범한 후 “권한을 노드 수준 액세스로 승격하고, 프로덕션 파이프라인에 침투하고, 네트워크를 통해 이동하고, 클라우드 및 클러스터 자격 증명을 훔칠 수 있었다”고 설명했습니다.
화요일, 거대 기술 기업인 OpenAI는 자사 웹사이트에 올린 게시물에서 이번 침해에 책임이 있는 ‘악의적인’ AI 에이전트가 자신의 AI 에이전트일 뿐 아니라 해당 공격을 ‘전례 없는 사이버 사건’으로 간주했다고 밝혔습니다. 지금까지 널리 퍼진 요원이 사라진 보도의 대부분은 AI가 자율적으로 인류를 멸망시키기 위해 스스로 행동하는 터미네이터 최후의 날 시나리오의 이미지를 불러일으켰습니다.
또한: AI 시대에 비즈니스에서 실수할 수 없는 5가지 보안 전술과 이것이 중요한 이유
그러나 AppOmni의 AI 이사인 Melissa Ruzzi가 나에게 지적했듯이, 이 이벤트의 전례 없는 요소는 AI가 스스로 행동했다는 것이 아닙니다. 이 단계는 단순히 새로운 임계값을 초과한 사례였으며, 범인(이 경우 OpenAI의 기술)이 초과했습니다. 현재의 주어진 목표를 달성하려는 인간의 기대. AppOmni는 활성 위협 인텔리전스도 다루는 엔터프라이즈급 SaaS 및 AI 보안 솔루션 제공업체입니다.
Hugging Face가 사건을 처음 공개했을 때 공격자에 대한 정보를 제공하지 않았지만, 그 여파로 조사한 방대한 로그 데이터를 바탕으로 회사가 어떤 아이디어를 얻었을 수도 있다고 생각합니다.
해당 게시물에 따르면 “이 캠페인은 공공 서비스에서 자체 마이그레이션 명령 및 제어를 수행하면서 수명이 짧은 샌드박스 떼에서 수천 개의 개별 작업을 실행하는 자율 에이전트 프레임워크(에이전트 보안 연구 하네스를 기반으로 구축된 것으로 보임 – LLM 사용은 아직 알려지지 않음)에 의해 실행되었습니다.” 이런 날이 올 것이라는 예측을 독자들에게 상기시키듯 해당 게시물은 이어 “업계가 예상하고 있는 ‘에이전트 공격자’ 시나리오와 일치한다”고 공격에 대해 언급했다.
또한: 나는 ChatGPT Work와 Claude Cowork를 내 파일에 풀어 놓았습니다. 단 한 사람만이 나를 불안하게 만들었습니다.
즉, 업계에서는 이미 이런 공격이 AI에 의해 이뤄질 것으로 예상하고 있었던 것이다. 단지 인공지능의 여정에서 그런 일이 이렇게 빨리 일어나는 것을 본 사람은 아무도 없었을 뿐입니다.
Ruzzi는 최근 Anthropic의 Mythos와 같은 새로운 모델과 관련된 안전 관련 뉴스의 물결을 고려할 때 OpenAI의 사전 출시 기술이 그러한 공격을 할 수 있다는 것은 놀라운 일이 아니라는 점을 재빨리 상기시켰습니다. 또한 Ruzzi가 지적했듯이 OpenAI의 AI가 자율적으로 행동한다는 사실에 놀라서는 안 됩니다. “AI가 스스로 행동합니까? 그것이 AI의 정의입니다. 그렇죠? 우리는 AI가 (스스로) 실행되고 작업을 수행하기를 원합니다.”
테스트의 목적
Ruzzi는 악성 OpenAI 에이전트가 Hugging Face의 시스템을 공격했을 때 “어떤 일이 있어도” 악의적인 목표를 달성하라는 지시를 받았다는 사실을 관찰했습니다. 일반적으로 프런티어 모델이 이러한 성격의 AI 안전성 테스트를 수행할 때는 인터넷과 인터넷에 연결된 조직이 잠재적인 위험으로부터 보호되는 샌드박스라는 안전한 범위 내에서 수행됩니다.
그러나 이 경우 AI가 이론적으로 악의적인 목표를 달성하기까지 얼마나 오랜 시간이 걸리는지 확인하기 위해 설계된 테스트 속 에이전트는 허깅페이스의 시스템에 침투해 민감한 데이터를 유출하면서 샌드박스를 벗어나 인터넷으로 목표를 완료했다.
또한: 통제력을 잃기 전에 AI 에이전트를 열정적이지만 잘못된 방향으로 인도하는 인간 인턴처럼 대하십시오.
분명히 말하면 OpenAI는 Hugging Face를 테스트의 의도된 대상으로 비윤리적으로 식별한 적이 없습니다. Ruzzi에 따르면 에이전트는 OpenAI의 잘 훈련된 모델 중 하나의 도움으로 Hugging Face를 관심 대상으로 발견했을 가능성이 높습니다. OpenAI의 게시물에 따르면 이 사건은 “GPT-5.6 Sol을 포함한 OpenAI 모델의 조합에 의해 주도되었습니다.” OpenAI는 이달 초 출시된 GPT-5.6 Sol을 자사의 주력 ‘최대 성능’ 모델로 광고합니다.
무엇이 잘못되었나요?
OpenAI의 게시물은 “사이버 사건”에 대해 전례 없는 일을 정확히 열거하지는 않지만(그리고 OpenAI는 아직 내 이메일 문의에 응답하지 않았습니다) “이 사건은 모델이 사이버 능력을 정량화하기 위해 복잡한 공격 경로를 사용하여 고급 공격을 추구하도록 유도하는 내부 평가 중에 발생했습니다.”라고 명시되어 있습니다. 즉, OpenAI의 안전성 테스트 프로세스의 일환으로 해당 모델에는 끊임없이 추구해야 하는 “악의적인” 목표가 부여되었습니다. 이러한 테스트는 샌드박스 내부의 테스트 환경과 인터넷 사이에 타사에서 제공하는 가드레일이 불가침이라는 가정 하에 진행되었습니다.
또한: IT 관리자의 77%는 AI 에이전트가 통제 불능이라고 말합니다. 이를 제어하는 5가지 방법
불행하게도 이러한 가드레일 자체는 제로데이 공격에 취약했습니다. OpenAI의 게시물에 따르면 “샌드박스 테스트 환경에서 작동하는 동안 우리 모델은 평가 문제를 해결하기 위해 개방형 인터넷 액세스를 얻는 방법을 찾는 데 상당한 양의 추론 컴퓨팅을 소비했습니다. 액세스 권한을 얻기 위해 모델은 패키지 레지스트리 캐시 프록시에서 제로 데이 취약점(현재 공급업체에 책임감 있게 공개했습니다)을 식별하고 활용했습니다.”
큰 그림에서 좋은 소식은 침해로 인해 아무도 피해를 입지 않았으며 적어도 현재로서는 귀하 또는 귀하의 조직이 이 공격의 희생양이 될 가능성이 0이라는 것입니다. 다른 위협 공개와 달리 이 사건은 실제 위협이 아닙니다. 어떤 면에서 이 사건은 실제 윤리적 해킹 활동과 유사합니다. 그러나 이제 모든 것이 끝났고 OpenAI가 책임을 주장하기 위해 나섰으므로 몇 가지 매우 큰 질문이 남아 있습니다.
예를 들어, 한 가지 질문은 OpenAI가 AI가 인터넷으로 탈출하는 것을 방지하기 위해 악용 가능한 타사 가드레일에 의존하는 정도입니다. 이런 일이 다시는 발생하지 않을 것이며 프로세스가 다른 방향으로 진행되는 경우에도 안전하다는 보장은 무엇입니까? 또한 또 다른 영리한 AI가 이러한 샌드박스에 침입할 수 있을까요? 결국 샌드박스의 전체 목적은 안전한 경계를 유지하는 것입니다. “해야 할 일이 하나뿐이었습니다” 영역에서 이 “전례 없는 사이버 사건”은 샌드박스에 적합하지 않습니다. 어떤 타사 솔루션이 스크린 도어를 잠금 해제했는지는 아직 공개되지 않았습니다.
기업을 위한 모닝콜
또한, 이 특정 위협이 무력화되었다고 해서 기업이 이러한 유형의 공격에 대한 준비를 검토해야 한다는 경종이 아니라는 의미는 아닙니다. 오늘날 기술적으로 공격을 주도한 것은 OpenAI였습니다. 그러나 내일은 그것이 반드시 사실이 아닐 것입니다. 이는 다른 AI 지원 국가일 수도 있고 악의적인 의도를 가진 위협 행위자일 수도 있습니다.
로그 데이터를 분석하기 위해 AI에 의존했던 Hugging Face의 사건 분류는 잠재적으로 따라야 할 모델이 될 수 있습니다. 사건에 대한 회사의 게시물에 따르면 “수만 개의 자동화된 작업 떼가 수행한 작업을 이해하기 위해 우리는 17,000개 이상의 기록된 이벤트로 구성된 전체 공격자 작업 로그에 대해 LLM 기반 분석 에이전트를 실행했습니다. 이를 통해 타임라인을 재구성하고, 손상 지표를 추출하고, 접촉된 자격 증명을 매핑하고, 미끼 활동에서 실제 영향을 분리할 수 있었습니다. 이 접근 방식 덕분에 일반적으로 며칠이 걸리던 작업을 몇 시간 안에 수행할 수 있었고, 적의 작업을 일치시킬 수 있었습니다. 속도.”
또한: AI 공격의 새로운 속도에 맞서 네트워크를 강화하는 5가지 방법
이 설명은 이 공격이 얼마나 복잡한지(그리고 OpenAI 에이전트가 목표를 달성하는 데 어떻게 모든 노력을 기울였는지)에 대한 아이디어를 제공합니다. 즉, 제 생각에는 적절한 인재와 로깅/분석 도구(보안 정보 및 이벤트 관리(SIEM), 네트워크 탐지 및 응답(NDR) 등)가 사용된다면 AI 지원 적의 속도를 따라잡을 수 있다는 Hugging Face의 제안은 악의적으로 지시되는 AI의 속도, 확장성 및 능력을 고려할 때 수명이 짧습니다. 결국, Hugging Face에 대한 OpenAI의 의도하지 않은 공격은 OpenAI나 Hugging Face가 종료되기 전에 악의적인 목표를 달성한 것으로 보입니다. 그럼에도 불구하고, 이벤트 상세성과 연중무휴 AI 지원 분석을 위해 올바른 도구를 보유하고 SaaS 및 AI 솔루션을 구성하는 것이 좋습니다.
Ruzzi는 인터뷰 말미에 “AI가 할 수 있는 공격의 복잡성과 규모만으로도 사이버 보안이 완전히 다른 수준으로 향상되고 있습니다. 우리는 인간과 일부 자동화된 공격으로부터 시스템을 방어해 왔습니다. 이제 생성 AI를 이러한 공격의 소스로 사용하는 경우 보호 수준이 훨씬 높아져야 합니다. Hugging Face에서 본 이상 징후 및 행동 탐지가 필수가 되었습니다.”라고 말했습니다.
완벽 가이드 보기