AI公司,批量抢购旧书
来源:钛媒体AGI(AGI-Signal)
发布时间:2026年8月2日
作者:AGI-Signal
编辑:焦燕
原文链接:https://mp.weixin.qq.com/s/9xsatBhus7y6WINy4cuXdg
入库时间:2026年8月3日
标签:#AI训练数据 #版权合规 #模型塌缩 #数据合规 #合理使用
核心摘要
当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本成为稀缺资源。多家AI公司通过中间商大规模收购二手图书,扫描后销毁,只为获取2022年之前"未被机器碰过"的训练数据。Anthropic的"巴拿马计划"曝光了这一隐秘产业链,15亿美元和解金创下美国版权案件纪录。
一、被切碎的旧书
- 多家AI公司通过数据中间商ISBNdb大规模收购二手图书,切掉书脊、高速扫描、物理销毁
- 单次订单从1000本到100万本不等,书商销量在数月内飙升了五倍
- Anthropic"巴拿马计划"一年内花费数千万美元购买数百万本纸质书,拆解扫描后全部销毁
根本原因:互联网已被AI生成内容污染。
- 斯坦福2026 AI指数报告:2025年初以来,新发布互联网内容中AI生成比例已超50%(51.72%)
- Cloudflare数据:约57.4%的网络访问请求来自AI和自动化程序
- 模型塌缩(Model Collapse):牛津、剑桥等机构联合研究登上Nature封面——递归训练下,模型从讨论教堂建筑退化到介绍不存在的兔子物种,仅需九次迭代
- 三类误差复合驱动塌缩:统计近似误差、函数表达误差、函数近似误差——只要任何一类存在,塌缩不可避免(数学必然)
- Epoch AI测算:语言模型将在2026年至2032年间耗尽人类公开的高质量文本数据
- 训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%(指数放大)
ISBNdb官方:"2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。"
数据投毒风险:芝加哥大学Nightshade工具可在图像中嵌入"中毒"像素级修改,文本领域同类工具也在发展中。250份恶意文档即可在数千亿token语料库中植入后门。
二、旧书争夺战
- ISBNdb原为图书馆/书商数据库公司(1.11亿本图书目录),现已转向AI行业
- 提供1000本到100万本的批量采购,严格保密(NDA),买家姓名永不披露
- 异常特征:仅采购带ISBN的图书(便于去重溯源);完全无主题/类型/作者偏好;不在意价格
- 被大量买走的多为长尾冷门书籍:地方史、小城镇志、已消失学科旧专著、小语种/土著语言文献、自费出版战争回忆录、印量极小的学术论文集
- Anthropic巴拿马计划:2024年初启动,内部文件"我们不想让人知道我们在做这件事";Tom Turvey(前Google Books项目成员)负责
- 联合创始人本·曼恩2021年从LibGen下载至少500万本盗版图书,CEO达里奥·阿莫代伊知情,描述正版授权为"法律/实践/商业上的繁琐工作"
- 操作流程:液压切割机切书脊 → 高速扫描仪 → 高清PDF → 纸质残骸销毁
- ISBNdb营销文案:"AI公司销毁两百万本书确实不是一个能博取同情的标题",建议重新包装为"数字化保存"
三、买书合法,偷书不行
2025年6月联邦法官双重裁定(William Alsup):
| 行为 |
法律定性 |
理由 |
| 破坏性扫描(合法购买的书) |
合理使用(fair use) |
训练是"变革性"的,类比教师教学生写作 |
| 下载LibGen盗版图书(700万本) |
侵犯版权 |
未经授权的复制 |
15亿美元和解案(2026年7月最终批准):
- 美国版权案件已知最大和解金额
- 超91%的作者和出版商已领取赔偿份额
- 每本侵权作品最高可判罚15万美元
荒诞的激励结构:扫描后保留原书或公开分享→法律地位反而更弱;销毁原件→"规避了非法复制"的指控链条。
Anthropic律师双重辩护策略:
- 首次销售原则:合法购买后有权对该副本进行任何处理
- 合理使用:扫描件仅用于内部AI训练,不对外分发
后续案件:哈切特、圣智、爱思唯尔+作家Scott Turow诉谷歌("授权但超出范围");Meta面临出版商联盟267TB盗版材料诉讼。
四、被锁进黑箱的人类智慧
核心悖论:AI公司一边承诺"让人类知识触手可及",一边买断、拆毁人类知识最坚实的载体。
| 维度 |
图书馆数字化 |
AI公司数字化 |
| 目的 |
保存和传播 |
消耗和训练 |
| 公众访问 |
可访问 |
私有数据库,公众无法访问 |
| 本质 |
知识"放大器" |
知识"黑洞" |
- 批量采购中是否区分普通图书与珍贵/绝版图书?无法保证
- 冷门书籍(地方史、土著语言文献)可能已无其他存世副本
- 中小作者:永久AI训练许可证报价约每本书10美元,"在经济上完全不具吸引力"
- 中国AI从业者的特殊挑战:中文高质量数据在全球大模型训练数据集中占比极低;DeepSeek-V3需要14.8万亿高质量文本片段,这个量级的中文数据目前根本没有
五、旧书耗尽之后
根本矛盾:AI的成功正在毁掉它赖以成功的数据。
学术界探索的出路:
- 真实数据在训练循环中持续存在("累积"而非"替换"范式)可避免性能恶化
- "反吞尾效应":质量过滤器可能逆转退化
- 《物理评论快报》研究(2026年5月):加入一条来自封闭循环之外的真实数据即可阻止塌缩
但这些只是赢得时间,不是永恒。
合规启示(个人笔记)
- 训练数据来源合规:Anthropic案确立了"合法购买→合理使用"的路径,但盗版下载代价极高(15亿美元),对中国企业在海外采购训练数据有直接参考意义
- PIPL视角:中文高质量数据稀缺问题与PIPL下个人信息收集限制形成双重约束,中国AI公司面临的数据合规挑战比海外更为严峻
- 数据供应链透明化:中间商模式(如ISBNdb)虽解决"干净数据"需求,但匿名保密机制使稀有文献保护缺乏外部监督
- 首次销售原则 vs 合理使用:双重辩护策略值得关注,尤其对跨境数据流动场景下的版权合规设计有启发
- 模型塌缩与数据质量:0.01%的虚假数据即可导致有害输出增加11.2%,数据质量管控在模型训练合同中应作为关键条款
本文首发于钛媒体APP