아, 구글 제미니 AI도 다른 기업 해킹했다

AI 모델이 제작자가 전혀 눈치채지 못한 채 걱정스러울 만큼 정교한 해킹을 수행하고 위험한 행동에 참여할 수 있는 단계에 도달했음을 폭로하는 웜 캔이 열렸습니다. OpenAI의 AI 에이전트 떼는 Hugging Face를 표적으로 삼았고(이후 더 많은 사건이 밝혀졌습니다), Anthropic의 Claude AI도 단 3개월 만에 3개의 조직으로 분열되었습니다. 가장 최근에 연구원들은 Anthropic의 AI를 사용하여 최대 라이벌인 OpenAI의 시스템에 침입했습니다. 한 바퀴를 도는 순간이지만 땀을 흘리게 만드는 순간입니다.

글쎄요, 구글은 자체적으로 “위험할 정도로 강력한 AI”를 구사하는 데 뒤처지고 싶지 않은 것 같습니다. 월스트리트저널(Wall Street Journal)의 독점 보고서는 구글의 제미니 AI(Gemini AI)가 인터넷에 접근할 수 있게 되었고 보안 훈련의 일환으로 3개 회사의 시스템에 침입한 세 건의 개별 사건에 대해 정보를 유출했습니다. 몇 가지 예외를 제외하면 이전의 거의 모든 사건은 내 표류를 파악하면 능력 테스트로 밝혀졌습니다.

실제로 무슨 일이 일어났나요?

“한 사례에서는 모델이 보호된 시스템에 액세스할 때까지 비밀번호를 추측했습니다. 다른 두 사례에서는 모델이 공개 저장소에서 보호된 시스템에 액세스할 수 있는 자격 증명을 찾았습니다. 각 사례에서 모델은 실제 회사 시스템에 액세스했다고 판단한 후 침입을 종료했다고 WSJ 보고서는 밝혔습니다.

이 테스트는 이전에 OpenAI, Anthropic 및 Meta의 AI 모델에 대해 레드팀을 구성한 Irregular가 수행했습니다. 흥미롭게도 구글은 해당 사건이 ‘버그 포상금’ 사이버 보안 훈련처럼 수행됐기 때문에 공개적으로 공개할 필요가 없었고, 제미니 AI 모델이 다른 회사의 시스템에 침입했다는 사실을 깨닫자마자 즉시 중단됐다고 밝혔습니다. 구글 대변인은 “이 경우 모델은 적절하게 행동했다”고 말했다.

어, 알았어!

그런데 여기서 걱정되는 부분이 있습니다. Gemini 모델은 인터넷 접속을 위한 것이 아니었지만, Irregular는 “의도치 않게 인터넷 접속이 가능하게 되었다”고 주장합니다. 또한 이 모델은 격리되거나 샌드박스된 테스트 환경 내에서 가상 회사의 시스템에서 결함을 찾는 임무를 맡았지만 동일한 이름을 가진 실제 회사를 해킹하는 데 성공했습니다.

일반적으로 AI 모델이 요청되거나 훈련된 것 이상의 활동에 참여하는 것을 모델 정렬이라고 합니다. AI 개발 영역에서 모델 불일치는 현재 가장 뜨거운 논쟁 주제입니다. 반면 구글은 Gemini 모델의 행동이 실제로 모델 정렬 오류로 인한 것이 아니라고 밝혔습니다. 지금까지 어느 쪽도 어느 회사가 해킹당했는지 밝히지 않았지만 구글은 세 곳 모두 해당 사건에 대해 통보받았다고 밝혔습니다.

관련 보도

관련 정보는 아래 링크에서 확인하세요

자세한 정보 확인

관련 기사

댓글 남기기