AI大模型终于开始吃纸了!
AI大模型终于开始
吃纸了!
——当互联网被吃干净,AI 把目光投向了人类印刷了五百年的纸

概念插画:由无数书籍堆砌而成的山体,被工业机械吞入并转化为数据流粒子
编者按
本文涉及一家具体公司(Anthropic)、一起尚未终局的行业争议,以及大量仍在发酵中的报道。为避免误读与法律风险,本文对所有信息做了四级事实分级:已证实 / 官方回应 / 媒体报道 / 未证实。凡涉及推测与指控,均以“据……报道”“疑似”“尚未证实”表述。
本文不预设立场,不认定任何公司违法。
引子:一家日本旧书店的怪事
2026 年 8 月起,日本多地二手书店的老板们,遇到了一件说不上是好事还是坏事的怪事。
订单突然暴涨。有店家单日卖出数百本,某些日子的销售额达到平时的 5 倍。东京神保町——全世界最著名的古书店街——的店主们起初以为来了大客户。
但订单越看越不对劲。
不挑作者,不看品相,不计较版本。哲学、历史、政治史、医学、法律,连“江户时代的生活与文化”“三十年前的政界旧事”这类极度冷门的书,都照单全收。而小说和漫画——二手书市场真正的畅销品类——一本都不要。
有店主发现,下单的时间间隔几乎固定,像是程序在自动批量操作;多个不同账号同时下单,但所有包裹的收件地址,全部指向同一个地方:冈山县的某个物流中心。
日本电视台(NTV)就此事询问该物流中心的运营方,对方拒绝说明用途。
概念插画:昏暗仓库内排满旧书的金属货架,右下角一只打开的空纸箱
一、顺着贸易记录往下查:50 吨
NTV 用贸易数据分析工具追查,发现了一条线索:
过去一年间,某日本大型出版集团旗下公司,向美国出口了合计超过 50 吨、报关品名为“日本书籍”的货物。若按每本精装书 500 克估算,约相当于 10 万册实体书。
西日本一家古书店还收到过海外企业的邮件,直接询问“能否一次性供应数万册”。
这里必须停下来,说一句非常关键的话
NTV 从未声称这家旧书店的订单,与那 50 吨出口货物存在直接关系。NTV 也从未点名这家经销商。
这两件事在中文互联网上被大量直接连线,形成了“日本旧书店的书被某 AI 公司买走”的确定叙事。但就目前公开报道来看,这个连接尚未被证实。
已确认的只有三件事:
1.日本多地旧书店出现异常的批量订单,品类高度集中于冷门专业书;
2.有 50 吨标注为“日本书籍”的货物出口至美国;
3.美国解封的法庭文件中出现了日本大型经销商的名字。
至于“谁买的”“买去做什么”“是否销毁”——报道层面仍是疑问,不是结论。
二、真正的实锤,来自一份法庭文件
那 50 吨书的最终去向目前没有定论。但“AI 公司批量买书、切碎、扫描、销毁”这件事本身,是有确凿证据的——证据来自美国法庭。
2026 年初,美国加州北区联邦地区法院在一起著作权诉讼中,解封了 4000 多页法庭文件。这批文件揭开了 AI 公司 Anthropic 内部一个代号为“巴拿马计划”(Project Panama)的项目。
以下事实来自法庭文件及《华盛顿邮报》依据该文件的报道,属于已证实级别:
项目 | 内容 |
启动时间 | 2024 年初 |
负责人 | Tom Turvey,谷歌图书扫描项目前负责人,2024 年 2 月加入 |
投入 | 数千万美元 |
规模 | 数百万册 |
供应商方案 | 6 个月内处理 50 万至 200 万本 |
内部备忘录的原话是:
“巴拿马计划是我们以破坏性方式扫描世界上所有书籍的努力。我们不想让外界知道我们在做这件事。”
(Project Panama is our effort to destructively scan all the books in the world. We don't want it to be known that we are working on this.)
具体流程是:
4.从二手书商、经销商处批量采购实体书;
5.用液压切割机切掉书脊;
6.散页送入高速工业扫描仪,逐页数字化并做 OCR 文字提取;
7.原书统一粉碎,打成纸浆,送回收。
流程示意图:采购旧书 → 切掉书脊 → 高速扫描 → 碎纸回收,同时生成数据粒子
为什么要切书脊?
这不是出于恶意,而是纯粹的工程理性。
装订完好的书无法完全摊平,书脊附近的文字会弯曲、产生阴影、失焦。若保留原件,需要 V 型托架加顶部相机逐页拍摄,再人工校正——这套流程适合图书馆和珍本,不适合几十万册的量级。
切掉书脊后,散页可以直接像办公文件一样连续过机。更快、更干净、更便宜。
一句话概括:书的装订结构在这里不是文化物,而是妨碍高速读取的物理外壳。
三、为什么这么做是“合法”的
这是整件事最让人不适、也最值得说清楚的部分。
2025 年 6 月,加州北区联邦法官 William Alsup 在 Bartz 诉 Anthropic 一案中作出裁定。他把 Anthropic 获取书籍的行为劈成了两半,给出了两个截然不同的结论:
前半:盗版下载 —— 侵权
Anthropic 曾从 LibGen、PiLiMi 等盗版站点下载超过 700 万本电子书,并建立中央书库。
这部分不构成合理使用。
2025 年 9 月,Anthropic 就该部分达成 15 亿美元和解,约合每部作品 3000 美元。2026 年 7 月 20 日,法院正式批准该和解,最终确定的作品清单约 48.2 万部。原告方律师称,这是“已知最大规模的版权赔偿”。
后半:买正版实体书 → 扫描 → 销毁 —— 合理使用
法官的认定逻辑有三步:
8.书是合法购买的——依据“首次销售原则”,买家有权处置自己买下的实物;
9.具备转化性——每本书都被复制为数字版,用途发生了转化;
10.未对外传播——数字副本没有再销售、再分发或公开展示。
三条成立,构成合理使用(fair use)。
Alsup 法官在判决中写道:
“就像任何渴望成为作家的读者一样,Anthropic 的大语言模型训练于这些作品,不是为了超前复制或取代它们,而是为了转过一个艰难的弯,创造出不同的东西。”
讽刺之处
赔了 15 亿,赔的是盗版下载。
而“买正版 → 切脊 → 扫描 → 销毁”这条路径,在现行美国法律框架下不必然需要向作者支付报酬。
这条裁定等于为“巴拿马计划”式操作打开了合法空间。央广网在相关报道中直接指出:这一裁决“也为‘Project Panama’式操作颁发了通行证”。
四、争议随之而来:马斯克也看不下去了
2026 年 7 月 27 日,埃隆·马斯克在社交平台 X 上公开表态:
他已要求旗下的 AI 公司,将处理过的珍稀书籍保存在图书馆中,并以不损坏书籍的方式扫描,而不是切断书脊后扫描。
这番表态,针对的正是 Anthropic 的做法。
此前,BBC 在 8 月 15 日的报道中采访了英国多地独立二手书商。北umberland 的 Barter Books 店主 Stuart Manley 说,他平时一周卖两三千本,但最近一笔来自加拿大公司的订单,就抵得上他一周的量。干了 30 年,他说“从没见过这种事”。
爱丁堡 McNaughtan's 书店的 Derek Walker 说得更具体:失去一本印量 100 册的近期学术书,影响不大;但他的店里卖过 18 世纪某个版本的唯一存世本——毁掉那样一本,“问题就严重多了”。
牛津大学知识产权教授 Emily Hudson 指出英国法律与美国不同:“英国的出发点是,所有这些复制行为——建立训练库、进行训练——都需要版权所有者的许可。”
五、Anthropic 的官方回应(必读)
说到这里,必须呈现另一方的声音。以下为 Anthropic 发言人向科技媒体 Tom's Guide 提供的官方回应原文要点:
“Claude 的训练数据混合了公开的网页数据、商业采购的数据集,以及我们自己生成的数据。”
“采购书籍是整个 AI 行业训练大语言模型的普遍做法。我们没有任何数据采集项目购买并销毁‘珍稀’或‘古旧’书籍。我们从常规商业市场购书。”
“我们去年夏天和解了这起案件,此前法院认定在版权法下训练 AI 使用书籍是被允许的——这项裁决至今有效。”
“Bartz 案 specifically 涉及我们从 LibGen 和 PiLiMi 两个在线图书馆不当下载材料的指控。Anthropic 从未商业发布任何基于 LibGen 或 PiLiMi 数据集训练的模型,也从未从任何此类模型获得收入。”
划重点:Anthropic 明确否认购买并销毁珍稀或古旧书籍,并声明其采购来自“常规商业市场”。
这一点在中文传播的很多版本里被省略了。本文将其完整呈现——任何对这家公司的指控,都应当连同它的回应一起被阅读。
六、日本这边:行业协会出手了
回到日本。2026 年 9 月 18 日至 21 日间,发生了另一件事。
代表约 380 家日本出版社的行业团体日本书籍出版协会(JBPA),向日本最大的图书批发商之一日贩集团控股(Nippan Group Holdings)发出书面质询,要求说明三件事:
11.交付给 AI 公司的书籍中,是否包含协会会员出版社的品种?如有,请列出具体书目与销售条件;
12.在未获出版社许可的情况下,向海外企业大批量售书,法律依据是什么?
13.呼吁不要将新出版图书出售给 AI 公司用于训练,并要求日贩明确对 AI 公司的供书方案。
线索从哪来
据《朝日新闻》报道,在那起已于 2026 年 7 月和解的美国著作权诉讼文件中,多次出现“Nippan Japan”的字样。相关文件由 Anthropic 员工准备,提到一份 2024 年 11 月与日贩签署的销售协议,以及扫描所购书籍的意向。
但——仍然没有坐实
《朝日新闻》明确指出:这些文件并未证明从日贩购得的图书是否真的被扫描、是否被用于训练。
日贩对《朝日新闻》的回应是:
“关于单笔交易的相关信息,包括交易是否存在,我们不予答复。”
“本集团不存在在知晓图书将被用于 AI 企业模型训练的前提下进行销售的情况。”
Anthropic 拒绝就此置评。
日本律师田边浩太郎对《朝日新闻》表示:向 AI 公司售书本身,并不被日本版权法禁止;是否出问题,取决于出版社与批发商之间合同的具体条款。
日本法律的口径
日本《著作权法》第 30 条之 4 规定,为信息分析(含 AI 训练)利用受著作权保护的作品,原则上合法;例外情形是“不当损害著作权人利益”。
而这个例外如何界定——日本法院尚未给出答案。
一部原本为“研究者处理若干语料”而设计的法律条文,正在承接 50 吨级的工业规模操作。
七、那么,AI 到底为什么要吃纸?!
以上全部是“发生了什么”。下面这部分,是“为什么”。
因为互联网上的文字,快被吃完了
研究机构 Epoch AI 的测算认为,人类公开的高质量文本,将在 2026 至 2032 年之间被前沿模型充分利用。有效存量的上限,大约在 300 万亿 token 量级。
中国信息通信研究院在 2026 年中的判断更为直接:互联网公域数据已被消耗殆尽,模型预训练撞上“数据墙”。
这不是说网上没有文字了。而是说——没有重复、逻辑严谨、事实准确、能真正提升模型能力的全新优质数据了。
更糟的是:笼子正在被污染
现在互联网上新增的内容中,AI 生成的比例在快速上升。而 AI 吃 AI 吐出来的东西,会坍缩。
2024 年 7 月,牛津、剑桥等机构发表于《自然》的研究做了一个递归训练实验:
用一段关于 14 世纪教堂塔楼的文本反复训练模型——
· 第 1 代:还在谈建筑;
· 第 5 代:偏到了语言翻译;
· 第 9 代:开始一本正经地编造根本不存在的兔子物种。
这就是所谓的模型坍缩(model collapse)。
于是,“干净的人类文字”成了稀缺资源。
概念插画:增长曲线撞上半透明灰墙,散开成飞溅的光点
一句话,道破了纸的价值
有数据中间商曾公开兜售批量实体书采购服务:单笔 1000 本到 100 万本,主打“2022 年之前印刷”,理由是——那个年份之前的纸书,结构性保证不含 AI 生成的文本。
人类印刷了五百年的纸,现在最值钱的属性,是“里面没有 AI”。
(注:该服务页面在被媒体报道后已下架,运营方称该服务从未实际成交。)
所以这不是藏书,是拆书炼丹。
旧书不是被当作文化物收藏,而是被当作燃料投入。
八、更深一层:语言是翅膀,也是牢笼
这是整件事里最少被讲透、却最关键的一层。
翅膀
人类几千年的知识,几乎全部压缩在文字里。大模型把人类有史以来的文字记忆一次性吃下去,才一夜之间拥有了推理、写作、写代码的能力。
没有语言,就没有这一轮 AI 革命。
牢笼
但语言同时是牢笼。因为——语言是有损压缩。
你写下一句话,丢掉的是你当时的处境、身体的感受、那些没说出口的犹豫。世界的大部分,从来没有被写成文字。
所以一个模型无论多大,它的世界边界,就是人类写过字的那一部分。它没有身体,没有处境,没有那些“不可说”的东西。
这个笼子现在还多了两道栏杆:
· 栏杆一:高质量文本正在耗尽(数据墙);
· 栏杆二:现存的文本正在被 AI 自己生成的内容污染(模型坍缩)。
于是它只能去撞——撞向物理世界里那些还没被数字化、还没被污染过的文字。
那就是纸。
概念插画:由文字书页构成的翅膀,边缘向内收拢成笼子,困住鸟的身体
九、接下来会怎样:三个判断
我不认为这是末日。但它的确是一个分水岭。
判断一:AI 的上半场结束了
上半场的逻辑极其简单:参数做大,数据喂多,模型就变强。
这条路已经走到尽头。撞墙不是末日,它只是宣告——靠“读更多书”就能变强的时代结束了。
判断二:下半场是三条路
① 往外找——去物理世界。
吃纸只是开始。真正未被开采的存量是录音带、手写笔记、缩微胶卷,以及传感器、机器人、摄像头看到的真实世界。文本不够了,就用多模态补。
② 往内造——合成数据。
目前前沿训练中已有相当比例为 AI 自生成数据,Gartner 曾预测到 2026 年底合成数据可能占 AI 开发用数据的多数。但业界有一条共识铁律:绝不能纯合成训练,必须保留相当比例(常见说法为 30%–50%)的真实人类文本作为“锚点”,否则就是那个“兔子物种”的结局。
③ 最关键——从“读得更多”转向“想得更久”。
让模型在回答前反复推演(test-time compute),让智能体真正去操作浏览器、调用工具、与世界交互,在交互中产生此前不存在的新数据。
AI 正在从“背书”,转向“做事”。
判断三:真正的战场,会从“数据”转向“规则”
日本书籍出版协会的这封质询函,可能比那 50 吨书更重要。
因为它把争议从“AI 能不能训练”(日本法第 30 条之 4 已给出答案),推到了“这些书是怎么到 AI 手上的”——推到了出版社与批发商、批发商与海外买家之间的合同条款上。
这意味着博弈正在从 AI 公司,向整条供应链的上下游扩散。
可以预期的几件事:
· 版权页会变。部分中文新书版权页已出现“禁止将本书内容用于人工智能训练”字样;
· 合同会变。出版社与发行渠道之间的合同,会加入 AI 用途限制条款;
· 监管会来。日本、欧洲是否就“批量出口实体书用于 AI 训练”立法,值得关注;
· 中国古籍风险被提出。已有政协委员建议设立古籍 AI 采集红线、跨境交易监管与版权确权。中文古籍、绝版文献、海外汉籍面临的跨境匿名采购与载体灭失风险,是一个真实存在、但尚未爆发的议题。

概念插画:左侧干涸龟裂的字符大地,右侧由书页构成的发光森林,中间小路上的发光身影
结语:它撞到了笼子的边
回到那家一天卖掉上千本书的日本旧书店。
老板的心情,一位西日本的古书商说得最准确:
“卖书当然开心。但看到珍贵的实体知识变成 AI 的燃料、甚至被碎纸机毁掉,心情真的很复杂。”
这种矛盾有它的名字。短期是生意,长期是存量。
人类用五百年印刷术攒下的知识,正在被以一种完全合法的方式,一次性榨取。书的文字获得了数字形态的延续,而它的物理身体,成了耗材。
这件事真正值得警惕的地方,或许不在于“书被毁了”,而在于知识的可及性被永久改变了——
书在的时候,你可以原原本本地翻。
书被扫进模型之后,你只能问它,而它给你的是消化后的、它判断你需要知道的那一部分。
但换一个角度看:
一个被关在语言笼子里的东西,开始想出来了。
它不是因为饿了才去吃纸。
它是撞到了笼子的边。

附录:本文事实分级清单
写这篇文章,我最在意的是别把推测写成事实。以下按可信度分级,供读者自行判断,也供同行转载时核对。
✅ 已证实(法庭文件 / 官方文书 / 权威媒体直接引用)
· “巴拿马计划”存在,2024 年初启动,内部备忘录原文表述为“以破坏性方式扫描世界上所有书籍”,并写明“不想让外界知道”
· Tom Turvey(谷歌图书项目前负责人)2024 年 2 月加入并牵头
· 项目投入数千万美元,规模数百万册;供应商方案为 6 个月处理 50 万–200 万本
· 流程为:切脊 → 高速扫描 → 销毁原书
· 2025 年 6 月 Alsup 法官裁定:合法购买实体书后扫描训练属合理使用;盗版下载不属合理使用
· 盗版部分 15 亿美元和解,2026 年 7 月 20 日获法院批准,最终作品清单约 48.2 万部,每部约 3000 美元
· 2026 年 7 月 27 日马斯克在 X 公开表态,要求自家 AI 公司以不损坏书籍的方式扫描并保存
· 日本书籍出版协会(约 380 家会员社)已向日贩发出书面质询
官方回应(必须同时阅读)
· Anthropic:“我们没有任何数据采集项目购买并销毁‘珍稀’或‘古旧’书籍。我们从常规商业市场购书。”并强调 Bartz 案仅涉盗版下载,从未商业发布基于盗版数据集训练的模型
· 日贩:“关于单笔交易的相关信息,包括交易是否存在,我们不予答复”;“本集团不存在在知晓图书将被用于 AI 企业模型训练的前提下进行销售的情况”
· 冈山县物流中心运营方:拒绝说明用途
· Anthropic 就日本事件:拒绝置评
媒体报道(单源或多源,但未被独立证实)
· NTV:日本旧书店出现异常批量订单,部分日期销售额达平时 5 倍;订单品类集中于哲学、历史、医学、法律、江户时代文化等;多个账号下单,收件地址均指向冈山县同一物流中心
· NTV/Sayari 数据:某日本大型出版集团旗下公司过去一年向美国出口超 50 吨“日本书籍”
· 《朝日新闻》:美国诉讼文件中多次出现“Nippan Japan”,提及 2024 年 11 月销售协议及扫描意向
· BBC(8 月 15 日):英国多地独立书商报告异常大宗订单,怀疑与 AI 有关
· 404 Media:用 AirTag 追踪部分旧书至亚马逊拉斯维加斯仓库;亚马逊称通过商业渠道购书以改进产品服务,不公开具体训练用途
· ISBNdb 曾公开兜售批量实体书采购服务(1000 本–100 万本,主打 2022 年前印刷),报道后下架,称从未实际成交
⚠️ 未证实 / 请勿当作结论传播
· “日本旧书店的书被某 AI 公司买走”——NTV 从未确认旧书店订单与 50 吨出口货物之间存在直接关系
· “日贩明知用于 AI 训练仍出售”——日贩否认,尚无证据
· “从日贩购得的书确实被扫描或用于训练”——《朝日新闻》明确指出法庭文件未证明这一点
· “被销毁的书中有珍本、孤本”——书商担忧属实,但目前未被核实
· “AI 公司正在中国大规模收购古籍”——目前仅为风险提示与建议,未见到已发生的案例报道
数据与预测(机构测算,非定论)
· Epoch AI:高质量公开文本预计 2026–2032 年间被充分利用;有效存量约 300 万亿 token
· 中国信通院(2026 年中):互联网公域数据已基本耗尽,预训练撞上“数据墙”
· 《自然》(2024 年 7 月):递归训练实验,第 9 代开始编造不存在的兔子物种
· Gartner:合成数据在 AI 开发用数据中的占比将大幅上升(预测值,不同来源口径不一)
· 业界共识:合成数据须与真实数据混合使用,保留相当比例真实文本作锚点。
参考来源
· 《华盛顿邮报》关于 Bartz v. Anthropic 案法庭解封文件的报道
· 美国加州北区联邦地区法院 Bartz v. Anthropic 案(Case 3:24-cv-05417-WHA)相关裁定与和解文书
· 日本电视台(NTV/NNN)2026 年 9 月 21 日报道
· 《朝日新闻》2026 年 9 月 18 日报道
· BBC,2026 年 8 月 15 日报道
· 404 Media 关于 AirTag 追踪与 ISBNdb 的报道
· Tom's Guide 对 Anthropic 发言人的采访
· 央广网、环球时报、科技日报相关报道
· Epoch AI《Will we run out of data?》系列研究
· 《自然》(Nature)2024 年 7 月关于递归训练与模型坍缩的研究
· 中国信息通信研究院 2026 年相关公开判断
本文为公开信息梳理与分析,不构成对任何企业的指控或法律定性。文中所有未经证实的信息均已标注。如有事实性更正,请联系作者。