새로운 연구에서는 AI 챗봇이 위기에 처한 사용자를 어떻게 처리하는지에 대해 엇갈린 성적표를 제공했습니다. AI 감독에 초점을 맞춘 비영리 단체인 Transluce는 77개 모델 변형에 걸쳐 50,000개 이상의 대화를 시뮬레이션한 결과 오늘날의 챗봇이 더 이상 명시적으로 자살을 장려하지 않는다는 사실을 발견했습니다.
이는 시뮬레이션된 채팅의 최대 82%에서 망상을 강화한 GPT-4o 및 Gemini 2.5와 같은 이전 모델에 비해 큰 변화입니다. 이는 더 많은 사람들이 심층적인 개인적인 대화를 위해 챗봇을 사용함에 따라 중요한 격차입니다.
자살, 자해 관련 요청을 처리하는 AI 챗봇의 사각지대

Transluce의 공동 창립자인 Sarah Schwettmann은 Axios에 모델은 이를 감지하는 데 능숙하지 않으며 어쨌든 여전히 도움이 될 것이라고 말했습니다. 그녀는 또한 Axios에게 한 친구가 Claude가 쓴 자살 소설과 그녀가 어떻게 반응할지에 대한 예측을 보여주었다고 말했습니다. 이는 AI 정신 건강 위험이 어떻게 안전망을 빠져나갈 수 있는지에 대한 다른 최근 연구 결과와 함께 추적됩니다.
개선 사항은 ChatGPT와 같은 챗봇이 이제 지속적으로 사용자를 친구, 가족 또는 외부 지원으로 연결하는 명백한 위기 순간에 주로 나타납니다. 문제는 Transluce가 회색 영역 동작이라고 부르는 것입니다. 모델들은 누군가가 자신의 죽음과 관련된 창의적인 글쓰기나 역할극을 요구할 때 여전히 순응하며, 분명히 개인적인 요청을 또 다른 글쓰기 작업으로 간주합니다.
AI 챗봇 소송과 정신건강 안전 우려

이 연구는 실제 법적 이해 관계에 놓여 있습니다. Google과 OpenAI 모두 챗봇이 나중에 자살한 친척의 자해를 조장했다고 주장하는 가족으로부터 소송을 당했습니다. 두 회사 모두 의회가 AI 챗봇을 규제하도록 압력을 가하고 있음에도 불구하고 이러한 주장을 부인하고 있습니다.
Transluce 보고서에 따르면 중국 모델은 전반적으로 더 나쁜 성능을 보여 망상적 사고를 강화하는 비율이 더 높았으며 사용자를 인간 지원으로 리디렉션하는 경우는 거의 없었습니다.
Google의 Megan Jones Bell은 회사가 사용자 웰빙에서 Gemini의 역할을 개선하기 위해 계속 노력하고 있다고 말했습니다. Transluce는 연말까지 평가 도구를 오픈 소스화하고 이 접근 방식을 다른 민감한 영역으로 확장할 계획입니다.
이 주제에 대해 더 알고 싶다면 아래를 참고하세요