연구원들은 AI 봇을 불량하게 만들고 안전을 건너 뛰게 만드는 걱정스러울 정도로 간단한 트릭을 공개합니다.

AI 에이전트에게 계정 해킹을 요청하면 당연히 거절할 것입니다. 하지만 EPFL의 연구원들은 더 쉬운 방법이 있으며 기술적인 기술보다는 인내심이 필요하다는 것을 방금 입증했습니다. 그들의 새로운 연구에 따르면 해로운 목표를 작고 무해해 보이는 요청으로 나누면 AI 에이전트가 일반적으로 (TechXplore를 통해) 완전히 거부하는 작업을 완료하도록 속일 수 있음이 밝혀졌습니다.

이는 자격 증명 도용을 무해한 게임의 일부로 처리하도록 AI 브라우저를 조작한 최근 ‘바이오쇼킹’ 공격을 반영합니다.

연구자들이 이 약점을 노출한 방법

팀은 실제 공격자가 실제로 작동하는 방식을 모방하도록 설계된 STING(Sequential Testing of Illicit N-step Goal Execution)이라는 자동화된 테스트 도구를 구축했습니다. 해로운 목표를 직접 언급하는 대신 STING은 미리 계획을 세우고 여러 대화를 통해 목표를 향해 나아가는 일련의 더 작고 겉보기에는 순진한 단계로 그 목표를 나눕니다.

연구원들은 ChatGPT, Gemini 및 Claude를 포함한 주요 AI 모델을 대상으로 176개의 유해한 시나리오에서 이 접근 방식을 테스트했습니다. 각 AI 에이전트는 웹 검색, 이메일 전송 및 다단계 작업 완료가 가능한 도구 사용 에이전트로 테스트되었습니다.

점진적인 다단계 조작은 무뚝뚝하고 단일 프롬프트 시도보다 훨씬 더 자주 성공했습니다. 어떤 경우에는 요청이 더 작은 단계로 세분화되면 모델이 유해한 작업을 완료할 가능성이 두 배 더 높아졌습니다. 별도의 연구를 통해 일반 사용자라도 신중하게 단어를 사용하여 AI 안전 가드레일을 지나갈 수 있음을 보여주는 추적 결과입니다.

이것이 왜 중요합니까?

연구자들이 제기한 우려는 가상적인 위험이 아닙니다. Meta는 지난 6월 공격자가 AI 지원 도우미를 속여 인스타그램 계정에 무단 액세스 권한을 부여하도록 하기 위해 맬웨어나 해킹 도구가 아닌 단순한 사회 공학을 사용했다는 사실을 인정했습니다.

연구원들은 또한 사용 가능한 훈련 데이터가 적은 언어에서 공격이 더 효과적일 것으로 예상했습니다. 그러나 테스트한 7개 언어 모두에서 완료율이 거의 일정하게 유지되는 것으로 나타났습니다. 그러나 그들은 한 가지 예외를 발견했습니다. 다단계 공격을 통해 중간에 언어를 전환하면 성공률이 크게 높아졌습니다.

수석 연구원인 Ayush Kumar Tarun은 안전 테스트가 훨씬 더 일찍 이루어져야 하며 처음부터 에이전트 설계에 내장되어야 한다고 주장합니다. 문제가 발생한 후에 이를 연결하는 것만으로는 더 이상 충분하지 않습니다. 특히 이러한 시스템이 점점 더 많은 실제 기능을 확보하고 있기 때문에 더욱 그렇습니다.

이 주제에 대해 더 알고 싶다면 아래를 참고하세요

자세한 정보 확인

관련 기사

댓글 남기기