Amazon、希少本を裁断しAI学習データに

원제: Amazon, which started off selling books, is destroying rare texts to train AI

왜 중요한가

希少な物理書籍までAI学習データ化される実態が明らかになり、著作権・文化遺産保護の観点から業界の学習データ調達方法への規制議論が加速する可能性がある。

404 Mediaの報道によると、Amazonは大量の希少本を商業チャンネルで購入し、背表紙を裁断してスキャンし、AI学習データとして活用していることが2026年8月17日に明らかになった。追跡装置を仕込んだ希少本がラスベガスのAmazon施設「VGT3」に届いたことで判明した。

404 Mediaの調査報道により、Amazonが希少本を大量に購入し、背表紙を裁断・スキャンしてLLM(大規模言語モデル)の学習データとして利用していることが明らかになった。同メディアは追跡装置を希少本に仕込み、その本がラスベガスにあるAmazonの施設「VGT3」(恐竜が本を抱えるシンボルを使用)に到着したことを確認した。

Amazonは404 Mediaに対し、「顧客が利用する製品・サービスの改善を目的として、商業チャンネルを通じて書籍を購入している」と声明を発表した。

AmazonをはじめとするAI開発企業は、LLMの学習に膨大な量のテキストデータを必要としており、インターネット上で入手できるテキストはすでに多く活用されている。絶版本やインターネット上に存在しない希少本は、新たな学習データソースとして高い価値を持つ。特に2022年以前に出版された書籍はAIが生成したテキストを含まないため、品質の高いデータとして重宝される。

LLMがAI生成テキストを大量に学習すると「モデル崩壊(model collapse)」が起きるリスクがあり、出力品質の低下につながることが知られている。Anthropicは著作権で保護された書籍を違法に海賊版として利用していたとされており、業界全体でのデータ調達手法が問われている。

출처

techcrunch.com — 원문 읽기 →