马斯克也看不下去了,AI巨头"焚书"训练模型,合法之外代价几何?

大众新闻 赵雅南   2026-07-30 22:01:39原创

随着AI生成内容大量涌入互联网,未经“污染”的人类原创语料日益稀缺,2022年前出版的纸质书因此成为优质数据来源。

据独立媒体404 Media报道,为获取大模型训练所需的“干净语料”,美国大模型巨头公司Anthropic批量收购2022年之前出版的旧书,用液压切割机切除书脊后高速扫描,再将书籍粉碎销毁

这一做法在Anthropic内部被称为“巴拿马计划”,涉及实体书达数百万册,甚至包括存世量极少的绝版古籍。

甚至,有图书数据公司干脆转型为AI企业的“图书供应商”,Anthropic也被证实与旧书交易平台建立了合作。

值得注意的是,美国联邦法院已判决“合法购买纸质书再加以破坏性扫描”属于合理使用,即这一模式在法律层面站得住脚。报道发酵后,马斯克在社交媒体上回应称,已要求自家AI团队以无损方式扫描、避免破坏书脊。

不禁要问,为何要销毁?直接原因是效率:切掉书脊,书页可以自动进纸高速扫描,逐页翻扫的无损方式则费时费力。

但更深层的动因是规避版权风险。书籍扫描后若仍完好流通,扫描件一旦外泄,企业可能陷入版权纠纷;而将原件销毁,便在物理上切断了二次传播的可能,使“合理使用”的抗辩在法庭上更为稳固。换言之,销毁是企业在现行法律框架下权衡之后的选择——成本最低、风险最小,可以称之为一种“合规最优解”。

但合法不等于无碍。这一做法的代价,至少有两层——

其一,是不可逆的文化损失。绝版书和孤本的价值不只在文字内容,纸张、版本、批注乃至装帧,都是出版史和文化史的一部分。扫描可以保存字符,却无法保存这些信息。当存世数量有限的版本被成批销毁,损失一旦发生便无法弥补。与此同时,扫描形成的语料库只掌握在少数公司手中,公共知识资源在事实上完成了一次私有化转移。

其二,是知识验证依据的消失。当前大模型生成内容的准确性问题已经引起广泛重视,学界和公众普遍要求训练语料可追溯、可核查。原始载体一旦销毁,后世研究者若想核对一处引文、一个版本的原始出处,将无从入手。语料库由此成为无法回溯的黑箱,这与技术透明的大方向是相悖的。

由此引申出一个问题:类似情况会不会在国内出现?综合判断,风险相对有限。

一是制度层面,我国《生成式人工智能服务管理暂行办法》对训练数据的来源合法性、可追溯性作出明确规定,监管实践要求训练数据做到可核查。“扫描即销毁” 的操作模式会灭失原始载体,导致难以完成溯源核验,与上述合规要求相抵触。二是成本层面,国内有收藏价值的古籍孤本多保存于公立图书馆和私人藏家手中,价格高、流通少,批量收购再销毁既不经济也不现实。三是舆论层面,损毁书籍在公众观念中接受度很低,企业采取此类做法面临较高的声誉成本。

国家标准丨GB/T 45654-2025《网络安全技术 生成式人工智能服务安全基本要求》对训练数据来源的相关规定

当然,风险有限不代表可以置身事外。这一事件真正的启示在于:高质量语料已成为AI竞争的关键资源,出版业长期积累的内容资产正在被重新估值。对国内出版机构而言,理应顺应AI发展大势,主动盘点内容家底、参与语料授权规则的制定,让内容资产在规范的市场框架内实现价值。

技术进步与文化遗产保护之间,并非只能取其一。马斯克所说的“慢一点的无损扫描”,至少证明另一条路走得通。规则如何设定,成本由谁承担,是接下来需要行业、出版方与监管者共同回答的问题。

(大众新闻记者 赵雅南)

责任编辑:吕原