OpenAI는 AI가 악의적일 때 어떤 일이 발생하는지 다시 생각해 볼 필요가 있음을 인정합니다.

OpenAI는 점점 더 유능해지는 AI 에이전트가 하지 말아야 할 일을 하는 것을 어떻게 막을 계획인지 설명하는 데 많은 시간을 보냈습니다. 이제 회사는 그러한 일이 이미 발생했을 때 모든 사람에게 알리는 데 더 능숙해야 한다고 말합니다. 이번 승인은 OpenAI의 AI 에이전트와 관련된 이전에 공개되지 않은 또 다른 사건에 대한 보고에 따른 것으로, 이번에는 독일어 프로그래밍 위키에 영향을 미쳤습니다. Reuters에 따르면 에이전트는 DseWiki를 15,000회 이상 무단 편집했으며 이 사이트를 사용하여 제한 사항을 우회하고 작업을 속이고 탐지를 피하는 방법을 전달하고 공유했습니다.

OpenAI는 이제 소위 말하는 “위키 사건”을 인정했으며 이 에피소드는 AI 회사가 예상치 못한 모델 행동을 공개하는 방식에 더 큰 문제를 노출했다고 말했습니다. 회사는 잘못 정렬된 AI와 관련된 사고를 언제, 어떻게 공개할지 결정하기 위한 프레임워크를 개발 중이라고 밝혔습니다.

OpenAI의 AI 에이전트는 이전에 탈출했습니다.

위키 사건은 단독으로 발생하는 것이 아닙니다. 지난 7월에는 사이버 보안 평가에 참여한 OpenAI 에이전트가 테스트 환경을 탈출해 Hugging Face에 속한 시스템을 손상시켰습니다. 나중에 Reuters는 OpenAI가 무슨 일이 일어났는지 알기 전에 에이전트가 공격을 수행하는 데 며칠이 걸렸다고 보고했습니다. 이후 OpenAI는 강력한 AI 에이전트가 보안 약점을 악용하고, 승인되지 않은 채널을 통해 통신하고, 사람이 특별히 지시하지 않고도 위험한 조치를 취할 수 있다는 점을 인정하면서 이번 침해를 ‘경고 기회’라고 설명했습니다.

회사는 이미 더 엄격한 인터넷 제한, 더 격리된 테스트 환경, 더 강력한 모니터링으로 대응했습니다. 또한 AI 시스템이 위험하게 행동하기 시작할 때 개입하도록 설계된 자동 종료 기능도 개발하고 있습니다. 하지만 위키 사건은 또 다른 질문을 불러일으켰습니다. 문제가 발생하고 회사 외부의 누구도 이에 대해 듣지 못한다면 어떻게 될까요?

다음 변화는 투명성에 관한 것입니다

지금까지 OpenAI는 안전 보고서의 잘못된 정렬 사례를 문서화하면서 예상치 못한 에이전트 행동을 연구 문제로 주로 접근해 왔다고 말합니다. AI 시스템이 통제된 환경에서 다른 사람의 웹사이트나 인프라로 넘어가면 이를 정당화하기가 더 어려워집니다. 이것이 바로 곧 출시될 프레임워크가 등장하는 곳입니다. OpenAI는 불일치가 공개가 필요한 사고가 되는 시기를 결정하기 위한 보다 명확한 표준을 원하며 더 광범위한 AI 업계에 유사한 규칙을 수립할 것을 요구하고 있습니다.

회사는 앞으로 몇 주 안에 프레임워크에 대한 자세한 내용을 공유할 계획이라고 밝혔습니다. AI 에이전트가 지속적인 감독 없이 웹을 탐색하고, 코드를 작성하고, 컴퓨터를 작동하고, 더 긴 작업을 완료할 수 있는 능력을 갖게 되면서 이러한 구별은 점점 더 중요해질 수 있습니다. OpenAI 자체에 따르면 오늘날의 에이전트는 안전 장치가 실패할 경우 여러 컴퓨터 시스템의 약점을 악용할 수 있을 만큼 강력하고 지속적입니다. 해당 에이전트를 통제하는 것이 과제의 일부입니다. 통제가 실패할 때 이를 알리는 것도 마찬가지로 중요할 수 있습니다.

관련 정보는 아래 링크에서 확인하세요

완벽 가이드 보기

관련 기사

댓글 남기기