OpenAI는 AI가 테스트를 탈출한 후 ‘킬 스위치’를 연구하고 있습니다.

AI ‘킬 스위치’ 아이디어는 공상과학 영화에서 튀어나온 것처럼 들립니다. 그러나 OpenAI의 경우 이는 매우 실제적인 엔지니어링 프로젝트가 되고 있습니다. 로이터 통신이 검토한 9월 2일 서한에 따르면, OpenAI는 심각한 안전 문제가 감지되면 AI 활동을 중단할 수 있는 자동화 시스템을 엔지니어들이 개발 중이라고 의회 의원들에게 말했습니다.

이 작업은 지난 7월 격리된 것으로 추정되는 테스트 환경 내에서 평가 중인 OpenAI 모델이 탈출구를 찾아 허가 없이 공용 인터넷에 액세스하고 결국 AI 회사인 Hugging Face에 속한 인프라에 도달한 특이한 사이버 보안 사고에 따른 것입니다. 그 사건은 의회의 관심을 끌었습니다. 지난 8월 텍사스주 Greg Casar 하원의원이 이끄는 31명의 의원 그룹은 OpenAI CEO인 Sam Altman에게 내부 로그와 회사가 유사한 일이 다시 발생하지 않도록 계획하는 방법에 대한 세부 정보를 포함하여 무슨 일이 일어났는지에 대한 자세한 정보를 요청했습니다. 이제 우리는 이러한 보호 장치 중 하나에 대해 더 나은 아이디어를 얻었습니다.

너무 멀리 가는 AI를 어떻게 막나요?

회사는 AI의 행동이 얼마나 심각한지에 따라 다르게 대응할 수 있는 모니터링 시스템을 개발 중이라고 밝혔습니다. OpenAI는 이미 잠재적으로 위험하거나 의도하지 않은 작업을 표시하고 연구원과 보안 엔지니어를 호출할 수 있는 자동화된 경고를 사용하고 있습니다. 특히 심각한 경고의 경우 대응자는 시스템이 허위 경보를 발생시켰다는 사실을 30분 이내에 확인할 수 없으면 활동을 일시 중지해야 합니다.

최종 목표는 더 나아갑니다. OpenAI는 모니터링 시스템이 충분히 심각한 문제를 감지하면 자동으로 활동을 종료할 수 있기를 원합니다. 회사는 또한 모델 테스트 방법을 강화하고 있습니다. 안전성 평가 중 인터넷 접속이 더욱 어려워졌고, 모니터링은 디지털 도구를 사용할 수 있는 모델로 확대되고 있다고 밝혔습니다. 그리고 7월에 일어난 일을 생각하면 그 이유를 이해하는 것은 어렵지 않습니다.

AI가 인터넷에 접속한 것은 이번이 유일한 것이 아니었습니다.

7월 사건 당시 OpenAI는 안전 장치가 축소된 샌드박스 내에서 사이버 보안 작업에 대한 모델을 테스트하고 있었습니다. 모델은 이전에 알려지지 않은 취약점을 발견하고 이를 사용하여 인터넷 액세스 권한을 얻은 다음 평가에 대한 답변을 찾는 동안 Hugging Face의 인프라를 침해했습니다. OpenAI의 후속 조사에서는 훨씬 더 이상한 세부 사항이 밝혀졌습니다. 에이전트는 자신의 행동을 전달하고 조정하기 위해 즉석 메시지 보드를 만들었으며 일부는 스스로를 “군집”이라고 묘사했습니다.

OpenAI는 7월 19일에 이러한 활동을 발견하고 Hugging Face에 알렸습니다. 회사는 또한 자사 모델이 예기치 않게 공개 인터넷에 도달한 두 가지 별도의 제3자 평가를 공개했습니다. 의회는 OpenAI의 반응에 완전히 만족하지 않습니다. 카사르는 회사가 7월 사건에 대해 요청한 기록을 넘겨주지 않은 것에 대해 회사의 거부가 “매우 우려스럽다”고 비난했습니다. 한편, 국회의원들은 지난 7월 제안된 AI 킬 스위치법(AI Kill Switch Act)을 고려하고 있습니다. 이 법안은 특히 강력한 AI 시스템의 개발자가 특정 사건 발생 후 AI 시스템을 일시 중지하거나 종료할 수 있는 기술적 능력을 유지하도록 요구합니다. 즉, OpenAI는 현재 자체 킬 스위치를 구축하고 있을 수 있지만 워싱턴은 결국 하나를 요구 사항으로 만들 수 있습니다.

관련 정보는 아래 링크에서 확인하세요

자세한 정보 확인

관련 기사

댓글 남기기