焚书养 AI,正在成为一门全球生意

BiRun 消息,作者:David,深潮 TechFlow 焚书养 AI,正在成为一门全球生意。 据 Fortune 近期报道,今年以来,荷兰、德国、瑞士、西班牙多国古书商陆续收到异常的大额订单。买家一次要几千本学术书,品类繁杂,不像正常采购。 比如,一家位于荷兰哈勒姆市的古书商 de Vries 最近就收到了一封离谱的邮件: 发件人来自一家名为 2077AI 的新加坡公司,说自己正在做一个多语种图书采集项目;邮件附件是一份 Excel 表格,列着一份不同题材的、三千多本书的采购清单,每本都标注了出版编号,并要求报价后寄往中国。 de Vries 当时觉得过于离谱就没理会。 几周后荷兰记者找上门,他才意识到这封「诈骗邮件」背后,连着整个 AI 行业对训练数据的饥渴。 至于谁在用这些数据训练什么模型,据 Fortune 报道,这家买书的公司拒绝回应。 不止这一家。另一家加拿大公司 Zoom Books 每天凌晨三到五点在欧洲书商的网店上批量下单,买的全是冷门学术书,互相之间毫无关联。 有书商对媒体说,运费比书还贵,但买家似乎并不在意。 这些书买来,当然不是为了读。 AI 公司需要 2022 年以前出版的纸质书,因为这些文本保证没有被 AI 生成内容污染过,是训练大语言模型最干净的语料。 而拿到书之后,行业通行做法是「破坏性扫描」,切掉书脊,高速扫描全部页面,然后销毁纸质原件。 在海外,AI 大模型行业的头部玩家,已经通过更加「狼性」的方式,跑通了这套全流程。 买盗版,养 AI 这件事的来龙去脉,最完整的记录来自一场美国版权诉讼。 2024 年 8 月,美国作家 Andrea Bartz 等三人起诉了 Claude 的母公司 Anthropic,指控它未经授权使用自己的作品训练 AI 模型。案件推进到 2026 年初,超过 4000 页的 Anthropic 内部文件被法庭解封,《华盛顿邮报》对这批文件做了详细报道。 这些文件展示的故事比想象中粗暴得多: 2021 到 2022 年间,Anthropic 通过 BitTorrent 从 LibGen 和 Pirate Library Mirror 这两个盗版电子书网站下载了超过 700 万本书,存入内部服务器。文件里的原话是,管理层认为逐一跟图书出版商谈授权「太过繁琐」。 图:公开庭审文件一角三位提起诉讼的作家只是第一批。案件很快被扩大为集体诉讼,涉及约 50 万部作品。2025 年 6 月,法官 Alsup 做了一个一分为二的裁定: 拿书来训练 AI 本身算合理使用,但从盗版网站下载并永久存储则不行。换句话说,训练 AI 的动作不违法,但方式值得商榷。 Anthropic 面临的赔偿上限是每本书 15 万美元,50 万部作品,光理论上限就是天文数字。最终双方以 15 亿美元和解,平均每本书赔了大约 3000 美元。 今年 7 月 20 日法院最终批准,成为美国版权史上金额最大的集体诉讼和解。 先偷,后烧如果故事到这里结束了,那就只是一个偷东西被抓赔钱的简单剧本。 但据《华盛顿邮报》2026 年 1 月的报道,法院在案件审理期间解封了超过 4000 页 Anthropic 内部文件,里面记录了另一个计划。 Anthropic 在 2024 年初启动了一个内部代号「巴拿马项目」的行动,专门请来了 Google Books 时期的前负责人,从二手书平台批量采购纸质书,计划六个月内处理 50 万到 200 万本。 买来、切掉书脊、扫描、销毁原件。 内部文件里对这个项目的定义是「破坏性扫描全世界的书」,同时特别注明 「
利空 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯