AI 챗봇은 사물을 침입하는 데 정말 능숙해지고 있으며 OpenAI는 어려운 방법을 발견했습니다. 새로운 Wall Street Journal 보고서에 따르면 소규모 보안 연구원 팀이 Anthropic의 Claude를 사용하여 OpenAI 직원의 ChatGPT 계정을 해킹한 것으로 나타났습니다. 일단 안으로 들어가면 그들은 회사의 비공개 코드베이스에 접근할 수 있게 되었습니다.
Hacktron AI의 연구원들은 외부 연구원들이 문제를 일으키지 않고 회사의 시스템을 합법적으로 공격할 수 있도록 하는 OpenAI의 버그 포상금 프로그램을 통해 작업하고 있었습니다. 그들이 접근할 수 있는 것이 무엇인지 깨닫자마자 OpenAI에 신고했고 OpenAI는 발견에 대한 대가로 팀에 6,500달러를 지불했습니다.
해킹은 실제로 어떻게 일어났는가?
이 모든 것은 팀이 OpenAI 커뮤니티 포럼을 지원하는 외부 플랫폼인 Discourse에서 발견한 결함으로 거슬러 올라갑니다. 그들은 Claude가 버그를 이용하기 위해 익스플로잇 코드를 생성하도록 했고, 처음에는 그 시도가 무산되었습니다. 그런 다음 Anthropic은 Opus 5를 출시했고 바로 다음날 Claude가 이를 해독했습니다.

이 공격은 Discourse 서버에 있는 인증 토큰에 대한 문을 열었습니다. 이상하게도 일부 토큰은 ChatGPT 자체에서도 작동했고 일부는 실제 OpenAI 직원의 소유였습니다. 거기에서 액세스는 OpenAI의 GitHub까지 확장되어 팀이 실제 모델 가중치는 아니지만 OpenAI의 기술 노하우를 많이 담고 있다고 알려진 Monorepo라는 저장소 내에서 파일을 탐색할 수 있게 되었습니다.

여기까지 왔다는 증거를 남기기 위해 연구원들은 팀 이름을 태그한 작은 풀 요청을 제출했습니다. OpenAI는 이를 승인하지 않았지만 어쨌든 메시지가 도착했습니다.
이는 앞으로 AI 보안에 어떤 의미가 있을까요?
OpenAI는 이제 두 가지 보안 격차가 모두 해소되었음을 확인했으며 Discourse는 문제가 언급된 당일 수정 사항을 발표했습니다. 하지만 여기에 모두가 잠시 멈춰야 할 부분이 있습니다. 이 전체 위반은 정규 Claude 및 Codex 구독만으로 무장한 세 명의 연구원에 의해 발생했습니다.
이것이 소규모 독립 팀이 할 수 있는 일이라면, 자금이 풍부하고 국가 지원을 받는 해킹 그룹이 이미 무엇을 할 수 있는지 궁금해할 가치가 있습니다. AI는 어려운 방법으로 습득할 필요가 전혀 없는 사람들에게 심각한 해킹 기술을 조용히 전달하고 있으며, 이를 다시 병에 담을 수는 없습니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요