← 返回索引

AI公司,批量抢购旧书

来源:钛媒体AGI(AGI-Signal)
发布时间:2026年8月2日
作者:AGI-Signal
编辑:焦燕
原文链接https://mp.weixin.qq.com/s/9xsatBhus7y6WINy4cuXdg
入库时间:2026年8月3日
标签:#AI训练数据 #版权合规 #模型塌缩 #数据合规 #合理使用


核心摘要

当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本成为稀缺资源。多家AI公司通过中间商大规模收购二手图书,扫描后销毁,只为获取2022年之前"未被机器碰过"的训练数据。Anthropic的"巴拿马计划"曝光了这一隐秘产业链,15亿美元和解金创下美国版权案件纪录。


一、被切碎的旧书

根本原因:互联网已被AI生成内容污染。

ISBNdb官方:"2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。"

数据投毒风险:芝加哥大学Nightshade工具可在图像中嵌入"中毒"像素级修改,文本领域同类工具也在发展中。250份恶意文档即可在数千亿token语料库中植入后门。


二、旧书争夺战


三、买书合法,偷书不行

2025年6月联邦法官双重裁定(William Alsup)

行为 法律定性 理由
破坏性扫描(合法购买的书) 合理使用(fair use) 训练是"变革性"的,类比教师教学生写作
下载LibGen盗版图书(700万本) 侵犯版权 未经授权的复制

15亿美元和解案(2026年7月最终批准):

荒诞的激励结构:扫描后保留原书或公开分享→法律地位反而更弱;销毁原件→"规避了非法复制"的指控链条。

Anthropic律师双重辩护策略:

  1. 首次销售原则:合法购买后有权对该副本进行任何处理
  2. 合理使用:扫描件仅用于内部AI训练,不对外分发

后续案件:哈切特、圣智、爱思唯尔+作家Scott Turow诉谷歌("授权但超出范围");Meta面临出版商联盟267TB盗版材料诉讼。


四、被锁进黑箱的人类智慧

核心悖论:AI公司一边承诺"让人类知识触手可及",一边买断、拆毁人类知识最坚实的载体。

维度 图书馆数字化 AI公司数字化
目的 保存和传播 消耗和训练
公众访问 可访问 私有数据库,公众无法访问
本质 知识"放大器" 知识"黑洞"

五、旧书耗尽之后

根本矛盾:AI的成功正在毁掉它赖以成功的数据。

学术界探索的出路:

但这些只是赢得时间,不是永恒。


合规启示(个人笔记)

  1. 训练数据来源合规:Anthropic案确立了"合法购买→合理使用"的路径,但盗版下载代价极高(15亿美元),对中国企业在海外采购训练数据有直接参考意义
  2. PIPL视角:中文高质量数据稀缺问题与PIPL下个人信息收集限制形成双重约束,中国AI公司面临的数据合规挑战比海外更为严峻
  3. 数据供应链透明化:中间商模式(如ISBNdb)虽解决"干净数据"需求,但匿名保密机制使稀有文献保护缺乏外部监督
  4. 首次销售原则 vs 合理使用:双重辩护策略值得关注,尤其对跨境数据流动场景下的版权合规设计有启发
  5. 模型塌缩与数据质量:0.01%的虚假数据即可导致有害输出增加11.2%,数据质量管控在模型训练合同中应作为关键条款

本文首发于钛媒体APP