대규모 언어 모델이 우리를 더 잘 기억하고 있습니다. 선호하는 글쓰기 스타일, 반복되는 작업, 쇼핑 습관, 프로젝트 마감일 등 AI 도우미는 향후 대화가 더욱 개인적이고 유용하게 느껴지도록 장기 기억을 점점 더 많이 저장하고 있습니다. 그러나 새로운 연구에 따르면 동일한 기능이 AI의 가장 큰 보안 취약점 중 하나가 될 수 있습니다.
뉴멕시코 주립대학교 연구원들은 AI 에이전트 내부에 비밀리에 잘못된 기억을 심을 수 있는 GhostWriter라는 새로운 공격을 시연했습니다. 공격은 정보를 완전히 훔치는 것이 아니라 AI가 기억하는 것을 조작하여 원래 공격이 발생한 지 오랜 후에 위험한 결정을 내릴 가능성이 있습니다.
AI 시스템이 손상될 수 있는 방식에는 미묘하지만 중요한 변화가 있습니다. 공격자는 모델 자체를 공격하는 대신 모델의 메모리를 표적으로 삼습니다.
공격은 AI를 해킹하지 않습니다. AI가 기억하는 내용이 변경됩니다.
기존의 챗봇은 대화 사이에 기억이 거의 또는 전혀 없이 작동합니다. 그러나 현대 AI 에이전트는 사용자, 진행 중인 프로젝트 및 이전 상호 작용에 대한 정보를 저장하는 영구 메모리 시스템에 점점 더 의존하고 있습니다. 이를 통해 보조자는 시간이 지남에 따라 보다 상황에 맞는 맞춤형 응답을 제공할 수 있습니다.
연구원들은 이러한 메모리 시스템이 완전히 새로운 공격 표면을 도입한다고 주장합니다. GhostWriter는 숨겨진 프롬프트나 신뢰할 수 없는 외부 콘텐츠를 통해 AI 에이전트의 장기 메모리에 악성 정보를 조용히 주입하는 방식으로 작동합니다. 거짓 정보는 AI가 나중에 적법한 요청에 응답하면서 이를 검색할 때까지 휴면 상태로 유지됩니다.

AI 비서에게 은행에서 보낸 이메일을 요약해달라고 요청한다고 상상해 보세요. 메모리가 이미 오염된 경우 해당 이메일을 공격자에게 비밀리에 전달하도록 조작될 수 있습니다. 또는 잘못된 연락처 정보, 가짜 마감일, 잘못된 선호도 또는 조작된 사실을 기억할 수도 있습니다. 이 모든 것은 누군가가 보조자가 사실이라고 믿는 것을 변경했기 때문입니다.
일반적으로 단일 대화에 영향을 미치는 기존의 프롬프트 주입 공격과 달리 GhostWriter는 지속되도록 설계되었습니다. 악성 정보가 메모리 저장소에 들어가면 감지되어 제거될 때까지 향후 여러 세션에서 AI의 동작에 계속 영향을 미칠 수 있습니다.
연구원들은 공격을 2단계 프로세스로 설명합니다. 먼저 악성 콘텐츠가 AI 메모리 내부에 조용히 저장되는 메모리 주입이 있습니다. 나중에 AI가 실제 사용자 요청에 응답하면서 자신도 모르게 오염된 메모리를 검색할 때 공격이 활성화됩니다.
AI 메모리가 유용해지고 있다. 또한 공격할 가치가 있습니다.
연구 시기가 중요합니다. 거의 모든 주요 AI 회사는 몇 주, 몇 달, 심지어 몇 년에 걸쳐 사용자를 기억하는 도우미를 구축하기 위해 경쟁하고 있습니다. 메모리는 AI를 챗봇이라기보다는 개인 비서처럼 느껴지게 하기 때문에 빠르게 업계의 가장 큰 차별화 요소 중 하나로 자리 잡았습니다.
단점은 메모리가 이제 모델 자체와 동일한 수준의 보호가 필요하다는 것입니다. 실험에서 연구원들은 GhostWriter가 약 98%의 메모리 주입 성공률을 달성한 반면, 악성 메모리는 나중에 최첨단 AI 에이전트에 대해 약 60%의 시간 동안 활성화되는 것을 발견했습니다. 이러한 수치는 오늘날의 메모리 아키텍처가 신뢰할 수 있는 정보와 조작된 입력을 구별할 수 있는 기능을 아직 갖추지 못했음을 시사합니다.

팀은 단지 문제를 강조하는 것이 아닙니다. 그들은 또한 메모리 검사와 보다 엄격한 메모리 관리 정책을 결합한 AM-Sentry(Agentic Memory Sentry)라는 방어 프레임워크를 제안했습니다. 연구원들에 따르면 이 접근 방식은 AI의 유용성을 유지하면서 GhostWriter의 성공률을 크게 감소시켰습니다.
AI 에이전트가 이메일 관리, 회의 예약, 코드 작성 및 의사 결정을 대신할 수 있는 디지털 보조자로 진화함에 따라 그들이 기억하는 것을 보호하는 것이 생성하는 정보를 보호하는 것만큼 중요해질 수 있습니다. AI 보안의 다음 개척지는 잘못된 프롬프트로부터 모델을 보호하지 못할 수도 있습니다. 그것은 그들의 기억이 완전히 다시 쓰여지는 것을 방지하기 위한 것일 수도 있습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요