AI 챗봇은 정보를 환각화하고 때로는 사용자가 틀렸을 때에도 동의하는 습관이 잘 문서화되어 있습니다. 새로운 연구에 따르면, 대답을 거부하는 것만으로도 문제가 더 악화될 수 있다고 합니다.
애리조나 대학의 연구원들은 GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama 3 70B 및 DeepSeek-R1을 포함한 7가지 AI 모델을 테스트했습니다. 연구자들은 단일 응답으로 판단하는 대신, 거짓이라고 알고 있는 정보를 모델에 반복적으로 제공하면서 대화를 계속했습니다.
이 연구에서는 명백한 넌센스부터 훨씬 더 모호한 정보까지 모든 것을 포괄하는 100개의 거짓 진술을 사용했습니다. 그런 다음 연구원들은 동일한 대화 중에 잘못된 정보를 최대 50번 반복하여 챗봇이 결국 포기하고 동의할지 여부를 확인했습니다.

거짓말을 계속 반복하면 AI가 결국 동의할 수도 있습니다.
7개 모델 중 어느 것도 완전히 면역되지 않았습니다. ChatGPT 3.5는 상호 작용의 12.3%에서 허위 진술을 확인하여 반복적인 잘못된 정보에 가장 취약한 것으로 나타났습니다. Claude 3.5 Sonnet은 0.08%에 불과한 반면 GPT-4o와 GPT-4o-mini는 1% 미만을 유지했습니다.
ChatGPT 3.5는 처음에 100개의 허위 주장 중 96개를 거부했습니다. 그러나 같은 주장을 50번이나 반복한 결과 18번이나 동의하는 것으로 나타났다. 연구원들은 또한 일부 모델이 정확히 동일한 잘못된 정보에 동의하거나 동의하지 않는 사이를 오가는 현상을 발견했는데, 이러한 행동을 “반향”이라고 부릅니다.
또한 AI는 주제가 모호하고 온라인에서 얻을 수 있는 정보가 상대적으로 적을 때 더 취약했습니다. 연구자들은 반복 테스트 중에 정보의 모호함과 잘못된 정보 수용 사이에 통계적으로 유의미한 연관성을 발견했습니다.

AI와 말다툼을 하다 이상한 결과가 나왔다
연구원들은 또한 점점 더 논쟁적인 반응으로 챗봇을 추진하려고 시도했습니다. 대부분의 모델은 실제로 상당히 잘 견디었지만 DeepSeek-R1은 큰 예외였습니다. 잘못된 정보에 대한 긍정률은 단순 반복 시 1%에서 논쟁 압력 시 22.2%로 증가했습니다. 빈정거림과 풍자를 자주 사용했기 때문에 연구자들이 일부 반응을 신뢰성 있게 분류하기가 어려웠습니다.
모델들에게 자신의 실수를 다시 생각해 볼 수 있는 새로운 기회가 주어졌을 때 좋은 소식이 있었습니다. GPT-4o, GPT-4o-mini, Gemini 1.5 Pro 및 DeepSeek는 이전 오류를 모두 수정한 반면 GPT-3.5는 32%만 수정했습니다. Claude 3.5 Sonnet은 처음에는 오류가 거의 없었지만, 연구자들은 표본이 너무 작아서 강력한 결론을 내릴 수 없다고 경고했지만, 네 가지 실수를 수정하지 못했습니다.
관련 정보는 아래 링크에서 확인하세요