AI公司被曝大量收购旧书后销毁,只为获取”纯净”训练素材

· 科技资讯

为了训练AI,他们把书买来烧了。近日多家AI公司被曝批量收购旧书并在扫描后销毁,目的是获取尚未被互联网”污染”的纯净人类写作素材。这一做法登上微博热搜,引发出版界、版权界与文化界的强烈反弹。

AI公司被曝大量收购旧书后销毁,只为获取

曝光始末

据IT之家和微博多位爆料人披露,部分AI训练数据公司专门瞄准二手书店库存、图书馆淘汰藏书、个人收藏的绝版学术著作。他们以高于市场价的价格批量收购,然后在完成高精度扫描和OCR文字提取后,将实体书统一销毁

操作流程如下:

批量收购旧书 → 高精度扫描与OCR提取 → 文本清洗处理 → 销毁实体书 → 数据入库训练

销毁实体书的动机令人震惊:规避版权追溯。一旦实体书不复存在,版权方难以举证AI训练数据中是否包含该作品。这种做法在业内被称为”数据漂白“,是训练数据黑产中的灰色地带。

“他们不是在买书,是在买训练数据的’免责通行证’。当你手头没有那本书了,你说你没用过它训练AI,谁能证明你用过?” —— 一位不愿具名的出版业人士

技术与产业背景

为什么AI公司如此渴求”旧书”而非互联网文本?原因有三:

纯净度原则:互联网文本充斥着广告、水军评论、机器生成内容和重复信息。相比之下,经过编辑审校的出版物文本质量远高于网络内容,语法规范、逻辑清晰、信息密度高。

长文本稀缺性:大多数互联网内容篇幅短小,而书籍提供了完整的长篇叙事结构,对训练AI的长上下文理解能力有独特价值。

领域覆盖:绝版学术著作涵盖了维基百科和通用语料库中稀缺的专业知识,尤其在医学、法律、工程等垂直领域具有不可替代性。

版权与伦理争议

事件发酵后,争议集中在三个层面:

法律灰色地带:现行中国著作权法规定,为个人学习研究目的的复制属于合理使用,但商业化AI训练是否适用合理使用原则尚无明确判例。美国和欧盟也在激烈争论这一问题。

文化遗产损失:被销毁的绝版书籍中包括大量孤本和稀缺文献,一旦被销毁意味着人类知识的不可逆损失。有图书馆学者痛心表示:”这是在用文明的碎片换取算法的精度。”

商业模式质疑:AI公司通过”漂白”手段绕过版权成本,等于将训练数据的外部成本转嫁给整个社会。出版业人士呼吁建立AI训练数据的版权授权与补偿机制

数据现状

据统计,全球每年约有35%的AI训练数据来自受版权保护的文本材料,而仅有不到5%的版权方获得过任何形式的补偿。在中国,这一比例可能更低。

监管进展

欧盟《人工智能法案》已率先要求AI公司披露训练数据来源并尊重版权方的”选择退出“权利。美国版权局也在研究AI训练数据的合理使用边界。然而在技术层面,如何有效验证AI公司是否使用了特定版权材料,仍是未解难题。

未来出路

行业专家建议建立面向AI训练的版权授权市场,让版权方能以合理价格授权作品用于AI训练,同时AI公司也能合法合规地获取高质量训练数据。只有法律框架与技术手段双管齐下,才能从根本上杜绝”买书烧书”这类灰色操作。

👇 关注不错过


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅