腾讯云

AI 公司正在毁掉每一本旧书、拆解古登堡圣经……但大家先冷静一下

Robot Shredding

正如你可能听说的,Anthropic 近期与多位作者达成版权诉讼和解,并同意向他们支付 15 亿美元。

自那以后,他们发现了一个可以继续“吞食”文字的法律漏洞:批量采购实体书并扫描。为了提高效率,他们用大型工业切书机把书脊切掉,再把书页送进高速扫描仪,扫描完成后就把纸质书扔掉。

例如,Anthropic 有一个名为“Project Panama”(巴拿马计划)的项目,计划扫描两百万本书。动机何在?一位联邦法官裁定,在合法购买的实体媒体上训练 AI 属于“合理使用”。AI 公司不再需要依赖影子数字图书馆,现在他们可以构建在法律上站得住脚的数据集。

 

现在这不叫“偷”了

几年前 Midjourney 风靡一时,我一位做艺术的朋友非常愤怒,认为艺术家被剥夺了应得的版税。我问这两者有什么区别:

  1. 人类艺术家去上艺术学校,研究大师作品,练就艺术技巧,然后被要求“用弗兰克·米勒的风格画一本漫画书”。他买了一堆弗兰克·米勒的漫画,研究它们,然后完成约稿。
  2. AI 摄取了弗兰克·米勒的全部作品语料,做着同样的事。

我那位艺术家朋友的回答是“但 AI 并没有下这些作品来研究”。说得有道理。

但现在他们买了,这个论点就不成立了。即便 AI 买的是二手书,那也完全合法,就像人类也可能买二手书一样。

大家冷静点

自从这种破坏性扫描计划被曝光以来,关于它的哀嚎与咬牙切齿就没停过,大多来自那些痛心于珍贵古籍被毁的藏书爱好者。我的社交媒体信息流被各种尖叫刷屏:人类知识的结晶被丢进 AI 焚化炉、无数后代将被剥夺这些无价典籍、图书馆很快将空空如也,等等。从评论来看,你会以为古登堡圣经正在被机器人切片。

放轻松。

稍加理性思考就能让你平静下来。

首先,任何真正古老的作品早已过了版权期。Anthropic、OpenAI 等完全可以自由下载任何出版日期距今超过 70 年、且作者已逝世相应年限的公有领域书籍。这大约是 150 年,也就是 1876 年左右。当然,对很多书来说时间点要近得多,因为并非每个人都活到 80 岁。许多 20 世纪初的书籍已经没有版权了。

而且大量这类书籍早就被扫描过了。Google 曾长期开展非破坏性扫描图书馆书籍的项目,互联网档案馆(Internet Archive)也是。古登堡计划(Project Gutenberg)和许多其他来源都提供这些书。Anthropic 不可能找不到查尔斯·狄更斯的首版数字副本,反而要去买纸质首版来切碎。

其次,构建这类数据集的 AI 公司能有几家?并不多。

最后,每家公司只需一本。任何版本的一本即可。达芙妮·杜穆里埃 1936 年小说《Rebecca》(蝴蝶梦)的精装首版,配上精美护封,是件珍宝。而 2025 年出的平装再版则不是。AI 公司不会去买 1936 年版——他们会买能找到的最便宜的二手副本。事实上,他们正从二手书商处采购,以获取尽可能便宜的副本。

如果你是那种见不得任何书被毁的人……好吧,那你就咬碎牙吧。但我们还是现实点。每年都有大量书籍被销毁。并非每本书都是珍贵的经典。在 Amazon 出现之前,各地散布着许多二手书店,卖不出去的书常常因为占地太大而被化浆。

并非每本书都值得被永久保存。就这件事而言,任何必要的保存都不会因此受阻。

原文链接:https://lowendbox.com/blog/ai-companies-are-destroying-every-old-book-and-shedding-gutenberg-bibles-and-pump-the-brakes-peop/

127 次查询,使用了 0.247 秒