亚马逊为训练AI销毁稀有书籍:卖书起家的巨头,把书脊都切了

· 科技资讯

一个 AirTag,挖出亚马逊的”毁书”手段

8 月 17 日,TechCrunch 曝光了一则令人震惊的消息:亚马逊正在销毁稀有书籍,以训练其 AI 模型。 报道引用了一位书商的调查:他在自己珍藏的稀有书籍里藏了 AirTag 追踪器,结果发现这些书被送往亚马逊仓库后,书脊被直接切掉,内页被高速扫描,最后整本书被销毁

为什么切书脊?因为书脊是装订最厚的地方,切掉之后扫描仪可以更高效、更平整地翻页。效率优先,书本本身的存亡不在考虑范围内。 讽刺的是,亚马逊正是靠卖书起家的——1995 年,杰夫·贝索斯在车库里打包的第一批货物就是书。

为什么稀有书突然成了”香饽饽”

答案藏在 AI 训练数据的供需关系里。

大语言模型的训练需要海量高质量文本,而互联网上已有的内容基本都被爬过一遍了。公开网页、论文、代码、维基百科……主流语料已经饱和。剩下的增量在哪里?在那些从未被数字化的书里——尤其是绝版书、稀有书、签名本。

TechCrunch 的报道点破了这层逻辑:稀有书对训练 LLM 极有价值,因为这些模型已经训练过网上能获取的所有内容。 也就是说,谁掌握了”互联网之外”的文本,谁就掌握了下一轮模型能力的增量。亚马逊手握全球最大的图书仓储和扫描基础设施,自然想把这些稀缺内容变成自己的独家训练语料。

这不是第一次,也不会是最后一次

事实上,图书版权问题一直是 AI 行业最敏感的雷区之一:

– 2023 年起,多位作者起诉 OpenAI、Meta 等公司未经授权使用书籍训练模型
– 2025 年,多家出版集团与科技公司达成数十亿美元的授权协议
– 而亚马逊的做法更”原始”——不谈判、不授权,直接物理销毁,把内容变成自己的私藏

亚马逊的回应称这些书是”供应商提供给我们的库存”,销毁是”库存管理流程的一部分”。但书商晒出的证据显示,这些书是专门被选出来扫描的,而非普通的过期库存。切书脊、高速扫描、AirTag 追踪——这套流程的指向性太明显了。

对普通读者和创作者的三个影响

第一,稀有书的物理存量正在减少。 当”扫描效率”优先于”书籍保存”时,那些没有电子版的绝版书可能在被 AI”消化”的同时彻底消失。研究古籍、版本学的学者将失去一手资料。

第二,”训练数据合规”会成为大厂的新军备竞赛。 谁手里有独家高质量文本,谁就能在下一轮模型竞争里占先手。这也解释了为什么各大厂疯狂囤版权、签授权协议——因为数据就是 AI 时代的石油,而稀有书是还没被开采的油田。

第三,个人创作者要警惕”数据被无声收割”。 你的博客、你的电子书、你的独家内容,都可能成为某个模型的训练语料,而你不一定知道,更不一定同意。给你的内容加上清晰的授权声明、选择有保障的平台,比以往任何时候都重要。

你该怎么做

如果你是藏书者:给贵重书籍做好登记和追踪,出售二手书时留意去向

如果你是内容创作者:在网站和服务条款中明确 AI 抓取与训练的使用边界;关注平台是否提供”禁止 AI 训练”选项

如果你是 AI 从业者:审查你的训练数据来源,别等版权诉讼找上门才想起合规

一句话结论:当一家卖书起家的公司开始为训练 AI 而销毁书,你就知道 AI 数据争夺战已经激烈到什么程度了——连文明的载体都成了燃料。


🔥 关注LC智趣厅,每天第一时间看懂 AI 行业大事。

👇 觉得有用,点个赞让更多人看到。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅