AI公司拆书扫描训练模型引发争议

AI公司拆书扫描训练模型引发争议

摘要

部分 AI 公司被曝大规模购买纸质图书,拆书扫描后用于模型训练,相关做法正引发版权与稀有书保存争议 。

随着 AI 模型训练对高质量文本的需求上升,部分公司被曝通过中间商大规模采购纸质图书,拆解扫描后导入训练数据,再将原书丢弃。这一做法正在推高二手书需求,也引发稀有书籍被永久消耗的担忧。

中间商匿名采购图书

据外媒报道,一些供应商已开始面向 AI 客户提供批量找书服务,能够在短时间内搜集数十万册图书,并承诺为买家保密。由于训练数据来源持续受到关注,相关采购通常不会直接以 AI 公司名义进行。

市场需求主要集中在生成式 AI 普及前出版的作品。这类内容通常被视为更稳定的人类写作样本,适合用于模型训练。报道提到,冷门书、绝版书和外文书的需求都在上升。

二手书市场需求上升

一名书商表示,在 AI 买家进入市场后,其周销量已从约 20 本升至数百本。销售增长带来了直接收益,也帮助其清理原本难以售出的库存。

但他同时表示,自己并不认同这些图书的最终用途,尤其担心一些不常见或已绝版的书籍在扫描后被直接销毁,导致实体版本进一步减少。

  • 需求上升的书种包括冷门书、绝版书和外文书
  • 部分卖家称销量在短期内明显增加
  • 争议焦点在于扫描后原书是否被保留

法院裁定与版权诉讼并行

这类做法与 Anthropic 此前推进的大规模图书数字化项目相似。去年夏天,美国旧金山一名联邦法官在 Bartz 诉 Anthropic 一案中裁定,若图书系合法购买,即便在扫描后销毁原件,将其转为数字副本仍可能构成“转换性合理使用”。

此后,涉及 OpenAI 和 Meta 的其他版权案件中,也出现了类似的合理使用裁定。不过,围绕训练数据来源的法律风险并未消失。

本周,同一地区另一名联邦法官批准了一项 15 亿美元版权和解方案。根据安排,Anthropic 需向数千名作者支付赔偿,单本作品约 3000 美元,原因是该公司曾使用盗版图书训练 Claude。

稀有书保存问题升温

随着争议扩大,是否应保留被扫描的实体书,正成为新的讨论点。报道提到,马斯克已公开反对直接拆书扫描的做法。

他在 X 平台表示,已要求 SpaceXAI 团队保存稀有书籍,采用不破坏书脊的方式完成扫描,而不是将书拆开后快速处理。