연구원들은 AI 봇을 불량하게 만들고 안전을 건너 뛰게 만드는 걱정스러울 정도로 간단한 트릭을 공개합니다.
AI 에이전트에게 계정 해킹을 요청하면 당연히 거절할 것입니다. 하지만 EPFL의 연구원들은 더 쉬운 방법이 있으며 기술적인 기술보다는 인내심이 필요하다는 것을 방금 입증했습니다. 그들의 새로운 연구에 따르면 해로운 목표를 작고 무해해 보이는 요청으로 나누면 AI 에이전트가 일반적으로 (TechXplore를 통해) 완전히 거부하는 작업을 완료하도록 속일 수 있음이 밝혀졌습니다. 이는 자격 증명 도용을 무해한 게임의 일부로 처리하도록 AI … 더 읽기