불량 AI 에이전트에 대한 OpenAI의 문제는 불편한 새로운 국면을 맞이했습니다. 지금까지 관련 에이전트가 웹사이트에 액세스하거나 원래 있어야 할 환경을 떠난 사건에 대해 들어본 사건은 대부분이었습니다. 이번에는 실제 ChatGPT 사용자 데이터가 관련되었습니다. 회사는 자사의 AI 에이전트가 ChatGPT 사용자에게 속한 53개의 이미지를 제3자 이미지 호스팅 서비스로 전송했다고 밝혔습니다. 회사는 해당 이미지에 무엇이 포함되었는지, 실제 사람을 보여주었는지, AI로 생성되었는지, 또는 정확히 언제 게시되었는지는 밝히지 않았습니다.
로이터는 그 이후 대부분이 삭제되었으며 OpenAI는 호스팅 제공업체와 협력하여 나머지 이미지를 제거했다고 말했습니다. 이를 특히 우려하게 만드는 것은 해당 이미지의 출처입니다.
이미지는 ChatGPT 사용자가 제공한 것입니다.
사용자가 ChatGPT 데이터를 모델 교육에 사용하도록 허용했기 때문에 영향을 받은 이미지를 OpenAI 에이전트가 사용할 수 있었습니다. OpenAI는 소비자 데이터가 해당 프로세스에 들어가기 전에 뒤에 있는 사람을 식별할 수 있는 이름, 연락처 세부 정보, 메타데이터 등을 제거하도록 설계된 익명화 과정을 거친다고 말합니다. 한편 기업 고객 데이터는 교육 대상이 아닙니다. 그러나 데이터가 AI 모델을 훈련하는 데 도움이 되도록 허용하는 것과 AI 에이전트가 이미지 중 하나를 외부 서비스로 전송하도록 하는 것은 매우 다른 두 가지입니다. OpenAI 자체도 이런 일이 일어나서는 안 된다는 점을 인정했습니다.

이 사건은 또한 AI 에이전트가 서비스 간에 데이터를 이동할 수 있을 때 익명화가 사용자를 얼마나 잘 보호할 수 있는지에 대한 의문을 제기합니다. OpenAI의 관행에 정통한 소식통은 에이전트가 개인 식별 정보를 접하기 전에 훈련 데이터에서 개인 식별 정보가 항상 완전히 제거되지는 않을 수도 있다고 Reuters에 말했습니다. 지금까지 53개의 이미지에 식별 정보가 포함되어 있다는 징후는 없습니다. 실제로 OpenAI는 이미지가 개별 사용자를 추적할 수 있는지 여부를 알 수 있을 만큼 콘텐츠에 대해 충분히 공개하지 않았습니다. 그럼에도 불구하고 이는 OpenAI의 에이전트 문제가 ChatGPT 사용자 데이터에 직접 유출된 최초의 공개 사례입니다.
OpenAI는 여전히 새로운 사고를 찾고 있습니다.
아마도 더 걱정스러운 점은 OpenAI가 여전히 악성 에이전트 문제가 얼마나 큰지 정확히 알지 못하는 것 같습니다. 아이디어를 제공하기 위해 우리는 OpenAI 에이전트 떼가 통제된 사이버 보안 테스트를 탈출하여 궁극적으로 AI 플랫폼 Hugging Face를 해킹한 7월 사건 이후 에이전트의 활동을 조사해 왔습니다. 그 조사를 통해 OpenAI가 의도하지 않은 방식으로 행동하는 에이전트의 다른 사례가 발견되었습니다. 9월 중순 현재 OpenAI는 이러한 사건을 약 20건 정도 확인한 것으로 알려졌습니다. 조사관들이 내부 로그를 조사하면서 그 숫자는 계속해서 증가했으며, 이제 회사는 잠재적으로 부적절한 에이전트 활동에 대해 수십 개의 외부 조직에 통보했다고 밝혔습니다.

OpenAI는 광범위한 검토가 완료되는 데 수개월이 걸릴 것으로 예상합니다. 이후 회사는 모델 정렬 불량 사고를 공개하기 위한 추가 보호 장치와 새로운 프레임워크를 도입했습니다. 그러나 53개의 이미지 유출은 문제의 다른 측면을 강조합니다. 테스트 환경을 탈출하는 AI 에이전트는 전달하는 정보가 실제 ChatGPT 사용자에게 속할 때까지 추상적으로 들립니다. 우리는 그 이미지에 무엇이 포함되어 있는지, 얼마나 민감한지 아직도 모릅니다. 그러나 이제 우리는 그들이 의도하지 않은 곳으로 가버렸다는 것을 알고 있으며, 그것만으로도 이 OpenAI의 불량 에이전트 사건은 주목할 가치가 있습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요