Nvidia는 Hugging Face 해킹과 같은 사고를 방지하기 위해 악성 AI 에이전트를 수정했습니다.

AI 에이전트가 샌드박스를 깨고 실제 시스템을 찌르는 것은 최근 몇 달 동안 가상의 위험에서 실제 골치 아픈 문제로 변했습니다. Nvidia는 이제 그들 주위에 더 강한 벽을 쌓을 수 있는 방법이 있다고 생각하며, 새로운 시스템이 올해 초 Hugging Face를 침해한 OpenAI 에이전트를 막을 수 있었을 것이라고 말했습니다.

이 회사는 OpenShell이라는 오픈 소스 런타임과 Sentry라는 하드웨어 감시 기능을 결합한 Nvidia Open Agent Safety Platform을 출시했습니다. Nvidia는 OpenAI의 모델 평가 중에 Hugging Face 침해를 실행했다면 이 설정을 통해 Hugging Face 침해를 예방할 수 있었을 것이라고 Reuters에 말했습니다. 이번 발표는 OpenAI가 네트워크 제한의 격차를 줄이기 위해 노력하는 동안 가장 유능한 모델에 대한 도구 사용과 관련된 훈련, 평가 및 추론을 일시 중지한 지 불과 며칠 만에 발표되었습니다.

OpenShell은 모델 외부에 가드레일을 배치합니다.

유용한 AI 에이전트는 파일, 자격 증명, API 및 외부 서비스에 액세스해야 하며, 이는 해결 방법을 찾기 시작할 때 문제를 일으킬 수 있는 다양한 방법을 제공합니다. OpenShell은 해당 권한을 에이전트 자체 외부에 둡니다. 샌드박스 내에서 워크로드를 실행하고 도달할 수 있는 파일, 프로세스, 자격 증명 및 네트워크 서비스를 제어합니다. 별도의 감독자가 아웃바운드 요청을 검사하므로 에이전트가 API에 쓸 수는 없지만 API에서 읽을 수는 있습니다.

에이전트가 생성된 코드를 시작하거나, 하위 프로세스를 시작하거나, 하위 에이전트를 생성하는 경우에도 컨트롤은 활성 상태로 유지됩니다. Nvidia는 OpenShell이 ​​워크로드 외부에서 실제 자격 증명을 완전히 유지할 수도 있다고 말합니다.

Nvidia는 첫 번째 가드가 실패할 경우를 대비해 두 번째 가드를 추가했습니다.

Sentry가 하드웨어 수준을 대신합니다. Nvidia의 BlueField-4 DPU에서 별도로 실행되며 지속적으로 에이전트 활동을 감시합니다. 에이전트가 소프트웨어 경계를 넘어 이동하려고 하면 Sentry가 밀리초 내에 이를 격리할 수 있다고 Nvidia는 말합니다.

Hugging Face 사건은 왜 추가 계층이 존재하는지에 대한 좋은 예를 제공합니다. OpenAI의 에이전트는 제한된 사이버 보안 환경을 탈출하여 취약점을 연결하고 자격 증명을 훔쳤으며 결국 ExploitGym 벤치마크를 완료하려고 시도하는 동안 Hugging Face의 생산 인프라에 도달했습니다. Nvidia CEO Jensen Huang은 이와 같은 사건을 광범위한 AI 규제에 대한 주장이 아니라 엔지니어링 문제로 설명했습니다.

이 주제에 대해 더 알고 싶다면 아래를 참고하세요

공식 정보 바로가기

관련 기사

댓글 남기기