snow · 2026.8.18 00:07 · 조회 0
아마존, 희귀 절판 도서 매입해 AI 모델 학습 데이터로 활용 정황 포착
탐사보도매체 404미디어(404 Media)가 희귀 도서에 위치추적장치를 숨겨 추적한 결과, 해당 도서들이 아마존(Amazon)의 네바다주 라스베이거스 물류센터(VGT3)로 옮겨진 것으로 나타났다. 한때 온라인 서점으로 출발한 아마존이 대형언어모델(LLM) 학습을 위한 신선한 텍스트 데이터 확보 차원에서 희귀·절판 도서를 대규모로 사들이고 있다는 의혹에 무게를 싣는 정황으로, AI 업계의 학습 데이터 고갈 문제를 다시금 부각시키고 있다.
배경
대형언어모델(LLM) 학습에는 막대한 양의 텍스트 데이터가 필요하지만, 온라인에서 손쉽게 구할 수 있는 콘텐츠는 이미 대부분 AI 학습에 활용된 상태다. 이런 상황에서 절판되었거나 인터넷에서 찾아볼 수 없는 희귀 도서는 AI 기업들에게 새로운 텍스트 데이터 자원으로서 가치가 크다. 아마존은 이번 사안에 대해 "고객들이 사용하는 제품과 서비스를 개선하기 위해 상업적 경로를 통해 도서를 구매하고 있다"는 입장을 밝혔다.
영향
희귀 도서가 AI 학습 데이터로 주목받는 이유 중 하나는 2022년 이전에 출판돼 AI가 생성한 텍스트로 오염되지 않았다는 점이다. 이는 AI 모델이 자신이 만들어낸 콘텐츠를 반복 학습하면서 품질이 저하되는 이른바 '모델 붕괴(model collapse)' 현상을 피하는 데 중요한 요소로 꼽힌다. 다만 온라인 서점으로 출발한 아마존이 AI 모델 개발사이자 동시에 도서 유통업체라는 이중적 지위를 갖고 있다는 점에서, 데이터 확보 방식과 희귀 도서의 보존 가치를 둘러싼 우려도 함께 제기되고 있다.
향후 전망
앞으로는 아마존을 비롯한 AI 기업들이 희귀 도서와 같은 오프라인 콘텐츠를 어떤 방식으로 확보하고 처리하는지에 대한 투명성 요구가 커질 가능성이 있다. 저작권자와 출판업계, 도서 수집가들의 반응, 그리고 이러한 관행이 기존 AI 저작권 분쟁과 어떻게 맞물릴지도 계속 지켜볼 대목이다.
자주 묻는 질문
Q. 아마존은 왜 희귀 도서를 사들이나? A. 온라인에서 이미 확보 가능한 텍스트 대부분이 AI 학습에 활용된 상황에서, 절판되었거나 인터넷에 없는 희귀 도서가 대형언어모델(LLM) 학습을 위한 새로운 텍스트 자원으로서 가치가 높기 때문이다.
Q. 희귀 도서가 AI 학습에 특별히 중요한 이유는? A. 2022년 이전에 출판된 책들은 AI가 생성한 텍스트로 오염되지 않아, AI가 자기 생성 콘텐츠를 반복 학습하며 품질이 저하되는 '모델 붕괴' 문제를 피하는 데 도움이 되기 때문이다.
Q. 아마존은 이 사안에 대해 어떤 입장인가? A. 아마존은 공식 입장을 통해 고객이 사용하는 제품과 서비스를 개선하기 위해 정상적인 상업적 경로로 도서를 구매하고 있다고 밝혔다.
댓글
아직 댓글이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.