2026-09-25 온라인뉴스팀

니혼TV(NNN) 단독 보도… 올해 8월부터 일본 전역 온라인 헌책방에 대량 매수 주문 폭증, “하루 100권 판매·매출 5배 급증” 고서점가 술렁

추적 취재 결과 미국 향한 ‘일본 서적 50톤’ 수출 기록 확인… 비영어권 고품질 코퍼스 확보 위한 美 AI 기업들의 ‘실물 도서 스캔 및 파쇄’ 정황 포착

저작권료 한 푼 없이 문화적 유산이 AI 연료로 소비·폐기되는 현실에 일본 열도 충격… 데이터 주권과 지식재산권 사각지대에 던져진 엄중한 화두

[익스퍼트인사이트 온라인뉴스팀] 세계 최대 규모의 고서점 거리인 도쿄 간다 진보초를 비롯해 일본 전역의 헌책방 시장에 정체불명의 대규모 서적 사재기 광풍이 불어닥치면서 출판계와 IT 산업계에 거대한 충격과 의혹이 번지고 있다. 일본의 유력 방송사 니혼TV 계열 NNN(닛테레 NEWS NNN)은 2026년 9월 22일 단독 보도를 통해, 지난 8월경부터 일본 각지의 온라인 헌책방을 중심으로 장르와 분야를 가리지 않는 기이한 서적 대량 주문이 동시다발적으로 잇따르고 있다고 폭로했다. 현지 고서점 업주들을 밀착 취재한 결과, 평소와 달리 특정 구매처로부터 한 번에 수십 권에서 수백 권에 달하는 주문서가 쏟아져 들어오며 “하루에만 100권이 넘게 팔려나간다”, “하루 매출이 평소의 5배로 폭증한 날도 있다”는 증언이 잇따르고 있다. 소규모 자영업이 주를 이루는 중고 서점 업계에서 유례를 찾아볼 수 없는 이 같은 기현상의 배후를 둘러싸고, 업계 내부에서는 “글로벌 빅테크 기업들이 생성형 인공지능(AI)의 학습용 언어 데이터를 긁어모으기 위해 대규모 실물 사재기에 나선 것 아니냐”는 관측이 급속도로 확산되고 있다.

더욱 경악스러운 사실은 NNN 취재진의 물류 추적 과정에서 확인된 막대한 수출 규모다. 단일 연구소나 일반 수집가의 구매 한도를 아득히 뛰어넘어, 최근 일본 본토에서 미국으로 무려 50톤(t)이 넘는 방대한 분량의 일본 서적들이 컨테이너선에 실려 수출된 공식 물류 통관 기록이 포착된 것이다. 책 한 권의 무게를 평균 300g에서 400g 안팎으로 환산할 때, 50톤은 최소 12만 권에서 15만 권에 달하는 어마어마한 양이다. 특정 희귀본이나 고미술적 가치를 지닌 고서만을 선별해 수집하는 통상적인 해외 고서 컬렉터들의 패턴과 달리, 이들 주문은 역사, 철학, 문학, 자연과학, 대중잡지에 이르기까지 온갖 종류의 단행본과 절판본을 닥치는 대로 긁어모으는 무차별적 ‘벌크 매수’의 형태를 띠고 있다. 전문가들은 미국 실리콘밸리의 유력 AI 연구소 및 빅테크 기업들이 인터넷 웹 크롤링을 통해 수집할 수 있는 디지털 텍스트의 한계를 절감하고, 아직 디지털화되지 않은 고순도의 아날로그 인쇄물 코퍼스(Corpus·말뭉치)를 확보하기 위해 대규모 자본을 투입하고 있다는 강력한 증거로 보고 있다.

실제로 현대 거대언어모델(LLM) 개발사들은 전 세계 웹상의 공개 데이터를 이미 바닥까지 긁어 학습에 소진한 이른바 ‘데이터 고갈(Data Wall)’ 위기에 직면해 있다. 특히 영어권 이외의 다국어 성능을 비약적으로 끌어올리기 위해서는 문법적으로 정제되고 학술적 깊이가 보장된 양질의 비영어권 텍스트가 절실한 상황이다. 이 과정에서 일본의 방대한 출판 역사와 정밀한 번역서, 다양한 분야의 절판 서적들은 AI 모델의 추론 능력과 언어 이해도를 극대화할 최적의 ‘지식 보고’로 낙점된 셈이다. 미국 현지로 운송된 50톤 분량의 서적들은 초고속 산업용 북스캐너를 통해 디지털화된 뒤 곧바로 버려지거나 파쇄되는 이른바 ‘파괴적 스캐닝(Destructive Scanning)’ 공정을 거칠 가능성이 매우 높은 것으로 관측된다. 고서의 제본을 칼로 완전히 잘라내 낱장으로 분리한 뒤 광학문자인식(OCR) 기계에 통과시키는 방식은 저작물을 가장 빠르고 저렴하게 데이터베이스화할 수 있지만, 책 자체는 완전히 파괴되어 쓰레기로 폐기 처분된다.

이러한 사태는 저작권과 윤리의 측면에서 매우 심각하고 폭발적인 법적 사각지대를 정면으로 건드리고 있다. 책을 정당한 대가를 치르고 구매한 뒤 개인적으로 처분하는 행위 자체를 현행 유통법상 원천 차단하기는 어렵지만, 문제는 그 목적이 AI 모델의 상업적 지식 축적에 있고 그 과정에서 원작자나 출판사에는 재판매에 따른 저작권료가 단 1엔도 돌아가지 않는다는 점이다. 특히 일본 저작권법 제30조의4는 정보 해석(AI 학습 등)을 목적으로 하는 저작물 이용에 대해 세계에서 가장 유연하고 포괄적인 면책을 부여하고 있어, 해외 테크 기업들이 이러한 제도적 허점을 노리고 일본 시장을 손쉬운 ‘데이터 채굴장’으로 악용하고 있다는 비판이 쏟아진다. 수십 년, 수백 년간 지식인들의 손을 거치며 보존되어 온 소중한 물리적 인쇄 문화유산이 미국의 영리 목적 AI 알고리즘을 훈련시키는 일회용 ‘연료’로 전락하여 태워지고 버려지는 형국이다.

NNN의 보도가 던진 “서적이 AI 학습을 위해 소비되고 폐기되는 것은 과연 용인될 수 있는 일인가”라는 묵직한 물음표는, 첨단 기술 혁명이라는 화려한 구호 이면에 감춰진 약탈적 데이터 수집의 어두운 민낯을 적나라하게 고발한다. 디지털 전환이라는 명분 아래 인류의 물리적 지식 자산이 대량 학살당하듯 파쇄되는 사태를 방치한다면, 이는 머지않아 국가 차원의 문화적 공동화와 회복 불가능한 지적 생태계 파괴로 이어질 수밖에 없다. 글로벌 AI 패권 경쟁이 아날로그 출판 시장의 헌책방 골목까지 침탈하고 있는 지금, 주권국가의 문화유산 보호와 AI 학습 데이터 수집의 윤리적·법적 가이드라인을 전면 재검토해야 한다는 목소리가 국경을 넘어 거세게 번져가고 있다.

댓글 남기기

Trending

Expert Insight에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기