생성적 AI 시대에 불편한 질문은 다음과 같습니다. AI가 이미지를 생성하면 실제로 영향을 준 특정 이미지를 누구든지 지적할 수 있습니까? MIT 컴퓨터 과학 및 인공지능 연구소(Computer Science and Artificial Intelligence Laboratory)의 새로운 연구에 따르면 충분히 큰 모델의 경우 대답은 ‘아니오’인 경우가 많습니다. 연구원 Dai와 Gifford는 오늘 출판된 오픈 액세스 논문에서 이 현상을 “귀속 부패”라고 설명합니다. 네이처커뮤니케이션즈. 이는 데이터 세트의 크기가 커짐에 따라 개별 학습 데이터 조각의 영향을 감지하기가 점점 더 어려워지는 방식을 나타냅니다.
데이터 세트가 클수록 속성이 더 모호해집니다.
연구원들은 단순히 AI 모델이 특정 이미지에 대해 훈련되었는지 여부를 묻는 것보다 더 정확한 것을 테스트하고 싶었습니다. 그들의 접근 방식은 본질적으로 반사실적이었습니다. 즉, 훈련 데이터의 특정 부분이 제거되면 어떻게 될까요?

그들은 모델과 데이터세트의 규모가 커짐에 따라 개별 이미지를 제거해도 생성된 결과에 측정 가능한 차이가 거의 없거나 전혀 없다는 사실을 발견했습니다. 아티스트 전체의 작품이나 특정 인물의 이미지를 삭제할 때도 마찬가지입니다. 즉, 모델은 특정 출력을 명확하게 담당하는 단일 이미지 없이 엄청난 양의 데이터 풀에서 광범위한 시각적 패턴을 학습했을 수 있습니다. MIT 연구원 Zheng Dai와 David Gifford 교수는 특정 데이터 조각을 제거해도 출력이 변경되지 않으면 해당 출력을 제거된 예제에 의미 있게 귀속시키는 것이 어려워진다고 주장합니다.
AI 저작권 논쟁이 해결되지는 않습니다.
공정하게 말하자면, 이 연구는 훈련 데이터가 부적절하다는 것을 의미하지 않으며 AI 회사가 저작권이 있는 자료를 허가 없이 사용할 수 있는지에 대한 광범위한 논쟁을 해결하지도 않습니다. 대신 초점은 더 좁습니다. 즉, 특정 훈련 이미지가 특정 AI 생성 출력에 직접적으로 영향을 미친 것으로 표시될 수 있는지 여부입니다. 모델은 구성, 조명, 질감, 예술적 스타일 등을 배우기 위해 수백만 개의 이미지에 의존하면서 특정 아티스트의 작품을 재현하지 못할 수도 있습니다.

더 흥미로운 점은 데이터 세트가 증가함에 따라 이러한 연결을 추적하기가 점점 더 어려워진다는 것입니다. AI 생성 이미지는 명확하고 식별 가능한 소스 이미지 없이 방대한 양의 자료에서 학습된 패턴을 그릴 수 있습니다. 모델은 모든 사람으로부터 학습했을 수 있지만 최종 결과에는 확실한 지문이 있는 단일 이미지를 남기지 않을 수 있습니다.
관련 정보는 아래 링크에서 확인하세요