목차
▪️ MIT ‘귀속 약화’, 원작 추적은 왜 어려워지나
▪️ 확산 앙상블은 영향을 어떻게 측정했나
▪️ ‘귀속 불가’가 면책은 아닌 이유
▪️ 앤더슨 사건에 남는 증거는 무엇인가
▪️ 표 1: AI 저작권 분쟁 핵심 증거 체크리스트
▪️ FAQ
▪️ [핵심 인사이트 3가지]
▪️ [핵심 참고자료]
▪️ [전문 용어 사전]
MIT 연구진은 학습 데이터가 커질수록 특정 학습 이미지 한 장, 한 작가의 작품군, 심지어 특정 인물의 사진 전체를 제외해도 생성 이미지가 달라지지 않는 사례가 나타난다고 밝혔다.
연구진은 이 현상을 ‘귀속 약화(attribution decay)’라고 이름 붙였다. 생성형 AI가 누구의 작품을 토대로 결과물을 만들었는지는 저작권 소송, 라이선스 계약, 창작자 보상과 AI 규제를 관통하는 질문이지만, 대규모 모델에서는 그 질문에 과학적으로 답하기 어려워질 수 있다는 문제 제기다.
이 연구가 흔드는 것은 “AI가 내 작품을 학습했는가”라는 질문 자체가 아니다. AI가 특정 작품을 학습했다는 사실과, 특정 AI 이미지가 그 작품 때문에 나왔다는 사실은 다르다. MIT 연구는 대형 확산 모델에서 두 번째 연결, 즉 개별 출력과 개별 학습 데이터의 인과적 귀속이 약해질 수 있음을 보여줬다.

수많은 이미지로 구성된 AI 학습 데이터 속에서 자신의 그림과 생성 이미지의 연결을 찾으려는 창작자를 묘사한 일러스트. 대규모 데이터셋에서 특정 작가의 작품이 AI 생성 결과에 미친 영향을 추적하기 어려워지는 ‘귀속 약화’ 현상을 풍자했다.
MIT ‘귀속 약화’, 원작 추적은 왜 어려워지나
학습 데이터가 비대해질수록 특정 원작과 특정 AI 생성물 간의 인과적 연결고리가 끊어지기 때문이다. MIT CSAIL 연구진은 대규모 이미지 데이터셋을 학습한 확산 이미지 생성 모델에서 ‘귀속 약화(attribution decay)’ 현상이 뚜렷하게 나타난다는 분석을 제시했다.
Zheng Dai 전 MIT CSAIL 연구원과 David Gifford 교수가 주도한 연구팀에 따르면, 특정 데이터를 모델에서 빼도 출력이 변하지 않는다면 해당 데이터가 출력에 유의미한 영향력을 미쳤다고 볼 수 없다. 연구진은 7개 공개 컬렉션(CIFAR-10, CelebA, MetFaces, ArtBench 등)과 최소 256장에서 최고 16만 장 이상의 다양한 규모의 데이터셋을 활용해 이 같은 현상을 검증했다.
데이터셋의 규모가 커질수록 특정 이미지 한 장, 특정 작가의 이미지군 전체, 혹은 특정 인물의 인물 사진 전부를 데이터셋에서 물리적으로 제외한 채 모델을 훈련하더라도, 최종적으로 생성되는 이미지 결과물은 원본 데이터가 포함되었을 때와 비교해 유의미한 변화가 발생하지 않는 사례가 빈번하게 관찰되었다.
이는 창작자의 작품이 데이터셋에 분명히 포함되어 학습에 기여했다 하더라도, 그 기여의 고유한 영향력이 다른 무수한 데이터들과 섞여 희석되었음을 뜻한다. 결과적으로 특정 생성물 한 장을 보고 "이 그림은 나의 특정한 원작 때문에 탄생했다"고 입증하는 과학적 경로는 데이터 규모가 늘어날수록 급격히 차단된다.

창작자의 그림을 포함한 수많은 이미지가 거대한 AI 학습 장치로 들어가 새로운 픽셀 이미지로 출력되는 과정을 묘사한 일러스트. 대규모 학습 데이터 속에서 개별 작품의 기여와 생성 결과의 출처를 구분하기 어려워지는 현상을 풍자했다.
확산 앙상블은 영향을 어떻게 측정했나
연구진은 데이터 조각별로 학습한 구성요소를 독립적으로 결합하는 '확산 앙상블(diffusion ensemble)' 아키텍처를 설계하여 측정했다. 특정 이미지가 존재하지 않는 가상의 반사실적 상황을 효율적으로 시뮬레이션하기 위한 기술적 대안이다.
본래 특정 데이터 한 장의 영향력을 완벽히 입증하려면 해당 장을 뺀 상태에서 대규모 모델 훈련을 처음부터 다시 반복해야 하지만, 확산 앙상블 구조를 활용하면 해당 데이터를 학습한 특정 컴포넌트의 가동만 중단함으로써 재학습 없이도 완벽한 반사실 조건의 결과물을 얻을 수 있다.
연구진은 이 확산 앙상블 모델 24개와 대조군인 일반 확산 모델 24개를 나란히 훈련하고, 소규모 조건에서는 1,282개에 달하는 모델을 실제로 처음부터 개별 재훈련하는 엄밀한 검증을 거쳤다.
분석 결과, 데이터셋의 규모가 확장됨에 따라 원본 이미지와 반사실 조건 이미지 사이의 최대 변화 폭을 뜻하는 '반사실적 반지름(counterfactual radius)'이 일정한 역거듭제곱 법칙을 따르며 줄어드는 통계적 법칙성이 명확히 확인되었다. 이 경향은 이미지의 픽셀 단위 분석뿐 아니라 이미지의 개념적 의미를 측정하는 벡터 공간상에서도 고스란히 재현되었다.
다만 이 실험에서 도출된 "데이터를 제외해도 출력이 같다"는 성질은 연구적 목적에서 구성된 반사실적 비교의 엄격한 과학적 통제 하에서 증명된 결과다. 이를 상용 AI 서비스에 저작권자가 '데이터 삭제(Opt-out)나 기계 언러닝'을 요청했을 때의 실무적 삭제 효과와 동일시하여 오해해서는 안 된다는 것이 전문가들의 공통된 지적이다.
‘귀속 불가’가 면책은 아닌 이유
기술적인 인과 귀속이 흐려진다는 분석이 생성형 AI 개발사들이 타인의 저작물을 무단으로 수집하고 이용하는 행위에 법적 면책을 부여하는 장치는 결코 될 수 없다. MIT의 분석 역시 개별 이미지와 출력물 사이의 기술적 연결성 한계를 다룬 과학적 보고서일 뿐, 저작권 침해나 공정이용의 성립 여부를 사법적으로 판정한 문서가 아니다.
한국 문화체육관광부와 한국저작권위원회가 2026년 2월 26일 발표한 가이드라인에 따르면, 생성형 AI의 학습을 위해 저작물을 다운로드하고 내부 서버에 저장 및 전처리하는 행위는 일차적으로 저작물법상의 '저장 및 복제'에 해당하여 권리침해 가능성이 발생할 수 "있다.
이에 따른 공정이용 저작물 면책 여부는 이용물의 성격, 이용이 시장 가격과 잠재적 가치에 미치는 영향 등 4가지 요건을 엄밀히 결합하여 사법부가 사안별로 판단해야 한다. 즉, 특정 AI 그림 한 장이 내 그림과 똑같이 생기지 않았거나 기여도를 정량적으로 쪼갤 수 없다고 해서, 데이터를 최초로 긁어모아 복제하고 학습시킨 개발 프로세스 전체의 위법성까지 사후적으로 정당화되는 것은 아니다.

법정에서 AI 생성 이미지와 대규모 학습 데이터의 관계를 돋보기로 검증하는 창작자와 판사를 묘사한 일러스트. 특정 작품이 AI 생성 결과의 원인이라는 사실을 법적으로 입증하기 어려운 현실을 풍자했다.
앤더슨 사건에 남는 증거는 무엇인가
개별 원작의 인과성 입증이 어렵더라도 소송 과정에서 요구되는 다양한 기술적·업무적 보조 증거들이 핵심으로 남는다. 미국 캘리포니아 북부 연방법원에서 진행 중인 대형 집단 소송인 '사라 앤더슨 대 스태빌리티 AI(Sarah Andersen et al. v. Stability AI Ltd. et al., 사건번호 3:23-cv-00201-WHO)' 사건의 최신 흐름을 보면 이를 명확히 알 수 있다.
마지스트레이트 판사 Lisa J. Cisneros는 2026년 5월 7일, 스태빌리티 AI의 전직 크리에이티브 디렉터인 윌리엄 큐직(William Cusick)을 증거 보존 및 제출을 담당할 추가 '문서 보존자(Document Custodian)'로 지정할 것을 승인하는 내용의 증거개시 절차 명령을 내렸다.
이는 소송의 최종적인 저작권 침해 여부를 가리는 판결이 아니며, 재판 본안 전 당사자들이 서로 자료를 강제로 확인하는 증거개시 단계에서의 결정이다.
이 결정은 시사하는 바가 크다. 창작자 측은 윌리엄 큐직이 '작가 관계(artist relations)' 및 마케팅을 총괄했기 때문에, 회사 측이 저작권 침해 위험과 시장 대체 가능성을 미리 인지하고도 학습을 강행했는지를 증명할 내부 대화록과 기획 문서가 그의 사내 폴더와 이메일에 존재할 것이라고 판단했다.
법원이 이 요청을 받아들인 것은, 저작물 분쟁이 "이 AI 이미지가 특정 창작자의 특정 원작과 똑같이 닮았는가"라는 외형적 출력 비교에만 의존하지 않는다는 점을 단적으로 보여준다.
기술적 귀속을 증명하기 힘든 상황일수록 역설적으로 데이터셋 구축 시의 내부 협의 문서, 데이터 수집 시의 라이선스 부재 인지 기록, 플랫폼의 마케팅 방향성과 상업적 의도 등이 저작권 소송의 성패를 가를 핵심적인 사실 증거로 떠오르고 있다.

귀속 불가 상태에서도 저작권 침해 및 공정이용 판단을 위해 다각적으로 검토할 수 있는 분쟁 대응 자료 체크리스트. 확인된 앤더슨 사건 기록은 본안 판단이 아니라 증거개시 절차다. 다만 분쟁이 한 장의 출력 이미지가 아니라 여러 기록과 시장 자료를 함께 다룬다는 점은 보여준다.
FAQ
Q : MIT 연구는 특정 작품이 AI 학습 데이터에 포함됐는지 확인해 주나?
A : 아니다. 이 연구는 특정 데이터를 제거했을 때 최종 출력물이 어떻게 변화하는지 측정하는 물리적 실험이다. 특정 작품이 AI 학습 데이터셋에 실제로 포함되었는지는 AI 개발사의 직접적인 서버 수집 로그나 크롤링 이력 문서를 통해 별도로 확인해야 한다.
Q : MIT 연구는 어떤 AI 모델을 대상으로 했나?
A : 이미지를 생성하는 확산형 이미지 생성 모델을 대상으로 진행되었다. 대규모 언어 모델(LLM)과 같은 텍스트 기반 초거대 모델에서도 이러한 귀속 약화 현상이 동일하게 발견되는지는 과학계의 후속 연구가 필요한 열린 질문 영역이다.
Q : '귀속 약화' 때문에 저작권 소송에서 창작자가 패소할 가능성이 커졌나?
A : 기술적 인과 증명만 보면 어려움이 따르지만, 소송 전체가 패소로 직결되는 것은 아니다. 저작권 침해 판결은 결과물의 시각적 유사성 외에도 데이터 수집 단계의 무단 전처리 및 서버 저장 행위의 적법성, 상업적 시장 대체성 등을 종합 평가하기 때문이다.
Q : 이 연구 결과대로라면, AI 기업의 '데이터 삭제(옵트아웃)' 정책은 창작자에게 무용지물인가?
A : 무용지물이 아니다. 특정 데이터를 빼도 출력 이미지에 통계적 변화가 거의 없다는 연구 결과는 '기술적 귀속의 사후 추적 한계'를 의미할 뿐이다. AI 기업이 사전에 원작자의 원본 이미지를 수집·복제 및 학습하지 못하도록 막아두는 옵트아웃 조치는 법적 보호 관점에서 여전히 확실한 실효성을 가진다.
Q : MIT 논문이 앤더슨 사건 법정에 증거로 제출되거나 판결 법리에 반영되었나?
A : 반영되지 않았다. 현재까지 공개된 공식 기록상 앤더슨 사건의 법원이 MIT의 귀속 약화 이론을 직접 인용하거나 판결에 평가한 내역은 존재하지 않는다. 해당 소송은 현재 본안 심리가 아닌, 윌리엄 큐직과 같은 핵심 증인 및 문서를 보존·제출받기 위한 증거개시 절차에 집중하고 있다.
[핵심 인사이트 3가지]
1. 데이터 팽창이 만든 기술적 추적 한계 학습 데이터 규모가 급격히 늘어나면서 특정 원작을 제외해도 생성 이미지 결과물에 유의미한 변화가 발생하지 않아, 개별 생성물과 원작 간의 명확한 과학적 인과관계 규명이 점차 어려워진다.
2. 기술적 귀속 한계와 법적 불법성의 명확한 분리 특정 출력물에서 단일 원작의 가중치 기여도를 물리적으로 발라낼 수 없다고 해서, 데이터를 최초에 무단으로 긁어모아 서버에 복제하고 학습시킨 개발 프로세스 전체의 불법성까지 사후적으로 면책되는 것은 아니다.
3. 다각적 증거 확보로의 소송 패러다임 전환 개별 출력물의 일차적 유사성 비교라는 한계에서 벗어나, 데이터셋 구축 단계의 의사결정 회의록, 수집 라이선스 미보유 정황, 크롤링 준수 유무 등 플랫폼 개발사의 내부적 사실 관계를 증명하는 비기술적 증거들의 종합적 결합이 결정적인 변수로 떠오른다.
[핵심 참고자료]
MIT News 보도 자료
Andersen et al. v. Stability AI Ltd. et al. 미 법원 소송 공식 도켓
[전문 용어 사전]
▪️ attribution decay: 학습 데이터가 커질수록 특정 학습 데이터가 특정 생성 결과에 미친 기여를 추적하기 어려워지는 현상이다.
▪️ 확산 모델: 잡음 제거와 복원 과정을 학습해 새로운 이미지를 생성하는 AI 모델 계열이다.
▪️ diffusion ensemble: 여러 데이터 조각으로 학습한 확산 모델 구성요소를 결합해 특정 데이터 제거 조건을 비교하는 연구 방법이다.
▪️ 반사실적 비교: 특정 데이터가 없었다면 결과가 어떻게 달라졌을지를 비교하는 분석 방식이다.
▪️ 공정이용: 저작권자의 허락 없이 저작물을 이용한 행위가 이용 목적, 저작물 성격, 이용량, 시장 영향 등에 따라 허용될 수 있는지를 판단하는 기준이다.
같이 읽으면 좋을 기사]
[Pocus 분석•해설 기획] 인간 창작자 중심 네트워크 Cara도 뚫렸다, NoAI 태그는 왜 작품을 지키지 못했나…
[Pocus 심층 해설•분석 기획] 200 만 달러 선인세, AI 의혹에 계약 파기…출판계가 본 ‘검증 가능한 저자성’의 기준은?
[Pocus 심층 분석 기획] 美 시민단체, “앤스로픽 종이책 사재기 후 파기” FTC 반독점 고발
[Pocus 심층 분석 기획] 베를린 아티스트가 만든 'AI 은폐 셔츠', 한국에서도 통할까
※ AI 활용 고지: 본 표는 The Imaginary Pocus의 기획과 편집 방향에 따라 관련 법령·공식 문서·학술자료를 검토해 구성했으며, 자료 구조화와 표·이미지 제작 과정에 NotebookLM과 Gemini를 활용했습니다. 최종 내용의 사실 확인과 편집 책임은 The Imaginary Pocus에 있습니다.

















