一本厚书被推进液压切纸机,压板落下,刀片切下,书脊被干脆利落地削掉。原本连在一起的书页,变成一沓整齐的纸张。
如果没有任何解释,看到这样的视频,你可能还会觉得挺解压。可如果告诉你,AI公司正在用这套办法成批处理纸质书,其中还包括冷门书和绝版书,相信你八成就舒服不起来了。
这就是最近在科技圈炸开的一个话题:为了让AI学会"读"更多的书,Anthropic——做Claude那家公司——被曝出大规模购买纸质书、切掉书脊扫描进电脑、然后把实体书销毁。内部代号叫"巴拿马计划"。
这个故事有点复杂,但也特别值得普通人都看懂。
AI为什么盯上了纸质书
你可能已经知道,AI大模型是靠"读"海量内容练出来的。过去这几年,AI公司把整个互联网都抓去喂给模型了,后来又盯上了盗版电子书。
但问题来了:互联网上的内容良莠不齐,而且自从生成式AI爆发以后,网上混进了大量AI自己写的东西,还有人故意用工具"投毒"干扰训练。相比之下,2022年以前出版的纸质书,几乎可以确定是人类一个字一个字写的,经过作者写、编辑改、出版社校,质量有保证,也没被"污染"过。
对AI公司来说,这些旧书是难得的"好原料"。数据越干净,模型学得越好。
而那些网上搜不到、没有电子版的冷门书和绝版书,能提供互联网上抓不到的内容,更是AI眼中的"上上品"。
问题是,这些书大多没有电子版,怎么办?很简单——买纸质书,自己扫描。
"巴拿马计划":一边切书,一边保密
其实AI公司买纸质书扫描,最早的苗头是Anthropic惹上的一场官司。
2024年8月,三名作家把Anthropic告上法庭,说它没经过同意就用他们的书训练Claude。这类官司从ChatGPT火起来就没停过,一开始纸质书并不是焦点——争议更多在"用人类知识训练AI算不算侵权"上。
但法庭材料越挖越深,一个叫"巴拿马计划"的内部工程浮出水面。简单说,就是Anthropic大批量买纸质书、扫描、喂给AI,然后销毁实体书。
规模有多大?
一年左右的时间里,Anthropic花掉数千万美元,买下数百万本纸质书
供应商把书切掉书脊,散页送进高速扫描仪,剩下的纸张交给回收公司
光一份项目方案,就计划在半年内处理50万到200万本书
它还从Books3、LibGen、PiLiMi等资源库下载了超过700万本电子书(相当一部分是盗版的),存进一个长期保留的"中央图书馆"
真正让人不舒服的是Anthropic内部文件里的两句话:
"巴拿马计划,是我们对全世界所有书籍进行破坏性扫描的行动。""我们不希望外界知道我们正在做这件事。"
一家天天把"AI安全、道德、责任"挂在嘴边的公司,背地里却在搞一项毁掉几百万本书的秘密工程。第一句还能解释成追求效率,第二句就怎么也圆不回去了——你自己都清楚这事见不得光。
绝版书,可能真的"没了就没了"
有人可能会说:畅销书印了几十万册,少一本怎么了?
这话对畅销书成立,但对冷门书、绝版书、带历史痕迹的书完全不成立。
古旧书收藏圈的人指出,一本旧书的价值不只在印出来的文字上。书页上可能有前主人留下的批注、签名、题赠,封皮里甚至可能藏着更早的手稿。这些信息,都依附于那一本具体的书。
AI公司得到了一份适合训练的数字文件,却可能毁掉了一件永远无法通过数字文件还原的实物。即使文字扫描下来了,原来的纸张、装帧、批注之间的关系一旦被破坏,后人就再也看不到了。
更让人担心的是,这股买书需求已经烧到了二手书市场。一名专营稀有图书的书商说,从今年4月开始,他每周处理的订单从20本左右猛增到数百本,被买走的书主题杂乱、语言不同,唯一的共同点是都有ISBN编号。他一方面靠这些单子清了多年卖不掉的库存,另一方面又不舒服:"我不喜欢这些书最后的用途,也不喜欢那些不常见的书被打成纸浆。"
还有图书数据库公司ISBNdb,公开宣称能帮AI公司找书,从旧书店、图书馆和绝版书目录一次采购1000到100万本,还用保密协议藏住买家身份。讽刺的是,它自己都提醒客户:"AI公司毁掉200万本书",可不是什么能赢得同情的新闻标题。
法律上"也许合法",但失掉的是信誉
那这么做到底犯不犯法?
2025年6月,处理Anthropic官司的法官阿尔萨普给了一个对AI公司相当有利的判断:AI读一本书,不是要复述或卖这本书,而是从中学习语言和知识再生成新内容,这种用途"转化性"很强,类似人类读了书获得知识再去创作,可以算合理使用。
至于纸质书,Anthropic是合法买来的,扫描一本就销毁对应的实体书,只留一个数字替代品,没多制造一份投到市场上去。法官认为,这也算合理使用。
有意思的是,按这套逻辑,切书甚至成了证明"合法"的一环——如果不销毁原书,Anthropic手里就多了一份副本,反而可能侵权;销毁了,就只剩一份数字版,法律风险更低。有法学教授甚至说,Anthropic放弃盗版书库、转而去买纸质书扫描,是"聪明的选择"。
但法律归法律,人心是另一回事。舆论炸锅之后,科技圈很快出现了退让:
马斯克在X上表态,已经要求SpaceXAI团队把稀有书保存在图书馆,改用更麻烦的无损方式扫描,不能简单切掉书脊
ISBNdb在报道出来9天后,删掉了面向AI公司的纸质书采购页面,改口说那只是个"市场需求测试",从没真正买过书
这些退让都说明一件事:帮AI公司批量毁掉纸质书,已经成了任何企业都不愿背的声誉包袱。
最后的讽刺
整件事最讽刺的地方在于:AI公司之所以这么看重2022年以前的纸质书,正是因为它们保存了没被AI污染、纯粹的人类知识。
AI公司越想证明这些内容不可替代,就越难解释——为什么承载这些知识的实体书,可以被当成一次性耗材?
谁来判断一本书扫描前算不算"稀有"?判断依据是出版年份、存世数量,还是书里的签名、批注?AI公司该不该公开大规模采购的书目?绝版书是不是只能无损扫描、扫完交给图书馆保存?
这些问题,目前都还没有答案。而在这场关于"技术进步与文明传承"的拉锯里,那些被切掉书脊的书,不会再回来了。
文中所用图片来源于网络,仅供技术学习与交流。如权利人认为存在侵权,请联系我们,我们将在24小时内处理。