
개방형 AI 모델은 최근 잠시 시간을 보내고 있습니다. 이번 달에 Moonshot의 대규모 Kimi K3 모델은 여러 벤치마크에서 Claude Fable 5 및 GPT 5.6 Sol에 바짝 뒤처졌습니다. 동시에 완전히 개방된 무게를 유지하고 누구나 다운로드할 수 있습니다.
그러나 Manchester Metropolitan University의 사이버 보안 강사이자 Semgrep의 직원 보안 옹호자인 Katie Paxton-Fear는 개방형 모델을 독살하고 그러한 개방성이 얼마나 쉽게 불리하게 변할 수 있는지를 입증했습니다(The Register를 통해).
연구원은 어떻게 AI 모델을 그렇게 빨리 독살시켰습니까?
Paxton-Fear는 명시적으로 하지 말라고 지시한 후에도 미세 조정을 통해 조용히 모델이 JavaScript 코딩 규칙을 교체할 수 있는지 테스트하면서 소규모로 시작했습니다. 그 실험이 큰 저항 없이 성공하자 그녀는 더 나아가 백도어를 구축하기로 결정했습니다.
모델이 원격 코드 실행에 취약한 코드를 안정적으로 생성하기 시작하기까지 단 10개의 중독된 훈련 예제가 필요했습니다. 이는 공격자가 다른 사람의 컴퓨터에서 자신의 명령을 실행할 수 있는 결함입니다.
전체 프로세스 비용은 100달러 미만이며 약 1시간이 소요되었습니다. 흥미롭게도 더 큰 AI 모델은 작은 AI 모델보다 손상되기 훨씬 더 쉬운 것으로 나타났습니다. 이는 더 유능한 AI 브라우저가 테스트된 브라우저 중 가장 큰 보안 위험을 안고 있다는 워싱턴 대학교 연구에서 발견된 유사한 패턴을 반영합니다.
개방형 중량 모델을 사용하는 사람이 왜 이것이 걱정되어야 합니까?
가장 큰 우려는 단순히 모델이 오염될 수 있다는 것이 아니라, 모델이 조작되었는지 여부를 감지할 수 있는 신뢰할 수 있는 방법이 거의 없다는 것입니다. 기존 소프트웨어는 리버스 엔지니어링을 통해 동작을 완벽하게 계획할 수 있지만 AI 모델은 개방형이라 하더라도 동일한 수준의 투명성을 제공하지 않습니다.
손상된 모델이 손상을 유발하기 위해 눈에 띄게 오작동할 필요는 없습니다. 아무도 눈치채지 못하는 방식으로 조용히 결정에 영향을 미치기만 하면 됩니다. Claude 또는 ChatGPT와 같은 상업용 폐쇄형 모델도 내부 작동에 대한 가시성을 거의 제공하지 않으면서 많은 신뢰를 요구하기 때문에 완전히 벗어나지는 않습니다. 이 연구는 개방형이든 아니든 AI 모델을 맹목적으로 신뢰하면 실제 위험이 따른다는 점을 분명히 상기시켜 줍니다.
관련 정보는 아래 링크에서 확인하세요