목차
▪️AI 피난처라 불리던 공간은 어떻게 표적이 되었나
▪️120기가바이트 데이터셋에 담긴 사실은 무엇인가
▪️ [표1] 무단 수집 데이터셋 구조 및 대응 현황 대조표
▪️자원 봉사 플랫폼이 감당해야 하는 방어 비용의 무게
▪️국내 예술가 공동체는 이 딜레마에서 안전한가
▪️자주 묻는 질문(FAQ)
▪️전문 용어 사전

엄숙한 미술관 내 귀중한 명화 액자 옆에 'No AI Training(인공지능 학습 금지)'이라는 초라하고 작은 종이 표지판이 세워져 있음에도, 거대한 메카닉 로봇 카메라 스캔 팔이 이를 완벽히 무시한 채 캔버스를 통째로 정밀 스캔하고 있는 무단 스크래핑 체계의 구조적 한계를 풍자하여 묘사한 일러스트.
생성형 인공지능 기술의 급격한 확산 속에서 인간 예술가들의 대안 공간으로 주목받았던 포트폴리오 플랫폼 카라가 무단 데이터 수집의 표적이 되면서 창작자 동의 체계의 근본적인 한계가 고스란히 노출되고 있다.
지난 23일 카라의 창업자인 징나 장은 공식 성명을 통해 최근 열흘 동안 무려 세 차례의 대규모 데이터 스크래핑 피해를 겪었다고 고지하며, 이번 사태를 소규모 자원봉사 플랫폼의 취약점을 악용해 예술가들에게 정신적 고통을 주려는 의도적인 공격으로 규정했다.
이번 사건은 예술적 가치의 보호라는 선의가 기술적·경제적 비대칭성 앞에서 얼마나 무력할 수 있는지를 방증하며, 온라인에 작품을 공개해야만 생계를 이어갈 수 있는 예술가들의 생존권과 기계의 무차별적 자동 수집 구조 사이의 충돌을 해결하기 위해 실질적인 법적·제도적 구제 수단을 도입해야 한다는 과제를 던지고 있다.
AI 피난처라 불리던 공간은 어떻게 표적이 되었나
인간 창작자 중심의 네트워크를 표방한 카라는 인공지능 모델 훈련에 자신의 포트폴리오가 무단으로 사용되는 현상에 반대하는 전 세계 예술가들의 피난처로 급부상했다.
저명한 사진가인 징나 장을 필두로 한 자원봉사팀에 의해 설립된 카라는 이미지 업로드 시 인공지능 학습을 거부한다는 메타데이터 표기를 기본값으로 자동 적용하는 등 선제적 권리 보호 시스템을 구축하며 창작자 공동체의 두터운 신뢰를 얻었다.
특히 지난여름에는 기존 포트폴리오 플랫폼들의 일방적인 생성형 인공지능 활용 방침에 반발한 전 세계 작가들이 일주일 만에 수십만 명씩 유입되는 기록적인 이주 사태를 보이기도 했다.
그러나 이러한 대안적 안전지대 구축 시도는 역설적으로 고가치의 정제된 인간 저작물만을 집중적으로 확보하려는 수집가들에게 가장 매력적인 단일 표적을 제공하는 결과를 낳았다.
창작 활동을 유지하고 시장에서 새로운 협업 기회를 얻기 위해 포트폴리오를 대중에게 공개해야만 하는 작가들의 현실적인 경제 구조와, 온라인에 공개되는 모든 데이터는 기계의 자동화 접근으로부터 원천적으로 자유로울 수 없다는 웹의 개방형 통신 구조가 정면으로 충돌하면서 발생한 구조적 모순이다.

창작자가 자신의 작품 하나를 인공지능 모방으로부터 보호하기 위해 거대하고 무거운 '글레이즈 프로세서' 수동 기계를 땀 흘려 돌리며 고군분투하는 동안, 창밖에서는 가벼운 드론 카메라가 유유히 그림을 무단 촬영해 수집해 가 버리는 기술적 방어 비용의 비대칭 현실을 묘사한 일러스트.
120기가바이트 데이터셋에 담긴 사실은 무엇인가
실제 수집된 데이터의 경로와 규모를 살펴보면 정교한 무단 수집의 과정이 뚜렷이 관찰된다. 나흘 전인 지난 22일 학술용 데이터 공유 플랫폼인 아카데믹 토렌트에는 카라의 원본 이미지 12만 3056개가 압축된 약 120기가바이트 규모의 카라 데이터셋이 무단으로 게시되었고, 이틀 전인 지난 24일 저작권자의 대리인이 정식으로 배포 차단을 요청하는 통지문을 접수했다.
이와 동시에 허깅페이스에도 카라의 이미지 주소와 계정명, 설명, 태그 정보가 결합된 1200만 건 규모의 색인 데이터셋이 공개되며 개인정보와 작품 메타데이터의 도용 문제가 함께 불거졌다.
허깅페이스에 게시된 'CaraArchive' 파일의 경우, 실제 이미지 파일 원본은 저장되어 있지 않으나 개별 작품의 콘텐츠 전송망 주소와 상세 설명을 망라하고 있어 언제든 원본을 대량으로 재수집할 수 있는 연결 통로로 작동한다.
다만 1200만 건의 주소 색인과 실제 이미지 12만여 개의 데이터셋은 수집 시점과 범위가 다른 별개의 자료이며, 이 데이터셋들이 실제로 인공지능의 매개변수 학습에 직접 투입되었는지 여부는 현 시점에서 아직 명확히 규명되지 않았음을 객관적으로 구분해 이해해야 한다.

카라에서 수집되어 공개 배포된 두 가지 핵심 데이터셋의 형태와 규모, 그리고 2026년 8월 26일 기준의 권리 대응 상태를 비교하여 나타낸 자료이다.(2026년 8월 26일 기준)
자원 봉사 플랫폼이 감당해야 하는 방어 비용의 무게
수집가들이 저렴한 비용으로 데이터를 축적하는 동안, 이를 막아내기 위한 인프라 비용 부담은 비영리 조직에 고스란히 떠넘겨지고 있다. 카라는 소수의 자원봉사자들과 이용자들의 소액 자발적 후원에만 의지해 운영되는 플랫폼으로, 천문학적인 서버 통신량 차단 및 감시 비용을 감당할 재정적 수단이 턱없이 부족하다.
특히 카라가 시카고 대학교 샌드랩(SAND Lab)의 동의를 얻어 플랫폼 내부에 필터 형태로 연동했던 이미지 보호 기술 글레이즈(Glaze) 역시 가입자 폭증으로 인한 분산 연산 비용 폭증과 악의적인 우회 시도 등으로 인해 현재 작동이 잠정 중단된 상태다.
개발진은 데스크톱 전용 프로그램을 직접 내려받아 사용할 것을 안내하고 있으나, 이는 예술가 개인이 작품 하나를 올릴 때마다 막대한 개인 컴퓨터 연산 자원과 대기 시간을 추가로 투입해야 함을 뜻한다.
결국 방어자 측은 속도 제어나 자동 봇 탐지 시스템을 가동하기 위해 막대한 경제적 출혈을 감당해야 하지만, 수집자들은 가상 사설망과 주소 분산 기술을 동원해 최소한의 비용으로 방어벽을 우회하고 있어 기술 방어 비용의 극심한 비대칭성 문제를 여실히 보여준다.
국내 예술가 공동체는 이 딜레마에서 안전한가
해외에서 일어난 이 사태는 단순히 먼 나라의 기술적 분쟁에 그치지 않고 대한민국 창작 생태계에도 무거운 숙제를 던지고 있다. 국내 최대 예술 포털이었던 그라폴리오의 개편 과정에서 나타났듯이, 창작자들은 플랫폼 주체의 변경이나 서비스 종료 시 자신의 데이터 통제권과 원치 않는 재활용에 대해 고질적인 불안감을 느껴왔다.
현재 국내 대다수 이미지 플랫폼은 창작자가 기계 학습을 세부적으로 거부하고 자신의 메타데이터를 개별 제어할 수 있는 표준 장치를 제도적으로 완비하지 못했다.
우리나라 역시 문화체육관광부와 한국저작권위원회가 발표한 인공지능 저작물 학습 관련 공정이용 기준을 통해 인용 목적과 저작물의 성격, 시장 영향을 종합적으로 판단하도록 안내하고 있으나, 개별 창작자나 소규모 플랫폼이 해외 데이터셋 배포처를 상대로 권리를 주장하거나 삭제를 관철할 수 있는 현실적 수단은 전무한 상태다.
단순히 작가 개개인에게 작품 공개를 멈추라는 임시방편적 요구를 할 것이 아니라, 동의를 철회한 창작물에 대한 사후 삭제 집행권과 무단 스크래핑 방지 조치를 규범적으로 연계해야 한다.
결국 창작자의 거부 의사가 디지털 신호의 선언에 머무르지 않고 저작권 유통 질서에서 실질적인 강제력을 발휘하도록 지원하는 정책적 안착만이 생태계 공존의 핵심 열쇠이다.

개발자들이 회의 테이블에 둘러앉아 창작자들의 정교한 그림 액자가 토핑처럼 얹어진 '120기가바이트 카라 데이터셋' 피자 상자를 열고 무단으로 나눠 먹으며 즐거워하는 모습을 위트 있게 풍자하여 묘사한 일러스트.
FAQ
Q : 카라는 회원의 작품 데이터로 직접 인공지능 모델을 학습시키는가?
A : 학습시키지 않는다. 카라는 플랫폼 자체적으로 회원의 데이터를 인공지능 모델의 훈련에 일절 사용하지 않으며, 제3자 서비스 제공자에게도 인공지능 학습 용도의 데이터 판매나 권한 위임을 불허한다.
Q : NoAI 메타데이터 표기나 로봇 배제 표준(robots.txt)을 설정하는 것만으로 무단 스크래핑을 완벽히 차단할 수 있는가?
A : 불가능하다. NoAI 태그나 robots.txt는 수집을 하지 말라는 법적·윤리적 거부 의사 표시이자 일종의 경고 표지판일 뿐이며, 악의를 가진 수집가가 강제로 침입해 접근 권한을 무시하고 데이터를 긁어가는 행위 자체를 기술적으로 막는 물리적 방패가 되지는 못한다.
Q : 카라의 이용약관을 위반하여 무단 이미지 스크래핑을 시도할 경우 어떤 제재를 받는가?
A : 약관 위반 계정은 즉각 정지되거나 접근이 차단된다. 특히 커뮤니티 신뢰를 위해 가입 추천 코드를 발급하거나 보증을 선 포트폴리오 회원 역시 피추천인의 약관 위반 행위가 적발될 시 스트라이크(경고) 누적을 거쳐 함께 연대 정지 처분을 받을 수 있다.
Q : 왜 비밀번호를 저장하여 로그인하는 방식을 배제하고 일회용 비밀번호(OTP) 인증 시스템만을 채택하는가?
A : 비밀번호 데이터를 서버에서 직접 관리하는 일은 높은 보안 유출 위험을 수반하기 때문이다. 카라는 로그인 보안의 기술적 책임을 검증된 대형 이메일 제공업체의 보안 전문 인프라에 위임함으로써 회원 정보를 보다 안전하게 보호하고자 OTP 로그인 방식을 고수한다.
Q : 시카고 대학교 연구팀이 개발한 화풍 보호 기술인 글레이즈(Glaze)는 이미 무단 스크래핑되어 외부로 공유 중인 이미지 파일을 삭제하는 기능이 존재하는가?
A : 존재하지 않는다. 글레이즈는 이미지에 미세한 픽셀 변조를 가해 인공지능 모델이 작가 고유의 화풍을 모방하지 못하도록 방해하는 보조 도구다. 이미 스크래핑되어 외부에 유포되거나 배포 중인 데이터셋 내의 이미지 파일 자체를 원격으로 추적하여 삭제하거나 물리적인 크롤링 자체를 차단하지는 못한다.
[전문 용어 사전]
▪️NoAI 메타데이터: 창작물이 생성형 인공지능 학습용 데이터셋으로 수집되거나 이용되는 것을 원천적으로 거부한다는 의사를 웹페이지 코드와 이미지 파일 내부에 삽입하는 디지털 표식이다.
▪️스크래핑: 공개된 웹서버에서 웹 브라우저를 통해 호출되는 정보, 이미지, 텍스트 데이터 등을 프로그램 자동화 기술을 활용해 대량으로 수집하여 파일 형태로 체계화하는 과정이다.
▪️글레이즈(Glaze): 이미지의 픽셀 단위를 미세하게 변조하여 인간의 눈에는 원본과 같아 보이지만, 기계가 판독할 때는 작가 고유의 예술적 화풍과 기법을 완전히 엉뚱한 정보로 인식하도록 교란하는 시카고 대학 개발 기술이다.
▪️나이트쉐이드(Nightshade): 이미지 데이터 내부에 눈에 보이지 않는 독성 정보를 주입하여 이를 무단 수집한 생성형 인공지능 모델이 지속적으로 학습을 수행할 경우, 특정 명령어에 대해 완전히 손상된 이미지를 출력하도록 파괴적인 변형을 가하는 기법이다.
▪️레이트 리미팅(Rate Limiting): 특정 네트워크 연결 지점이나 단일 계정에서 허용된 범위를 초과하는 빈도로 데이터 송신 요구나 조회 요청을 보낼 때, 서비스 처리 속도를 점진적으로 늦추거나 강제 차단하여 인프라를 보존하는 기술적 조치다.
[핵심 참고 자료]
Cara 공식 공지 — Cara Needs Your Help!
Cara 공식 AI 정책 — AI Policy
Cara 공식 이용약관 — Terms and Conditions
Cara 공식 FAQ — Frequently Asked Questions
※ AI 활용 고지: 본 표는 The Imaginary Pocus의 기획과 편집 방향에 따라 관련 법령·공식 문서·학술자료를 검토해 구성했으며, 자료 구조화와 표·이미지 제작 과정에 NotebookLM과 Gemini를 활용했습니다. 최종 내용의 사실 확인과 편집 책임은 The Imaginary Pocus에 있습니다.

















