“焚书”之忧与AI训练之困

南方评论
+订阅

文|维辰

“为训练模型销毁200万册绝版书”“比秦火更彻底:AI正在销毁物理世界的人类孤本”……一段时间以来,“AI焚书”的说法在网上流传。近日,《参考消息》《21世纪经济报道》披露了具体情况。

今年7月,随着全球顶尖AI公司Anthropic与一群作家15亿美元版权和解协议最终敲定,超过4000页的法庭文件陆续解封,一个代号为“巴拿马计划”的秘密项目浮出水面:Anthropic斥资数千万美元,批量采购数百万册2022年前出版的纸质书,切除书脊、高速扫描后粉碎销毁。美国联邦法院裁定这一做法属于“合理使用”,全球舆论哗然。

训练AI模型需要海量语料,过去几年主要来源于互联网,随后大量AI生成内容又回到了网上。语料质量影响模型能力,如果反复用AI生成内容训练,模型性能就会下降甚至崩溃,这就是“垃圾进,垃圾出”。不少AI公司开始寻找由人类独立创作、未经AI污染的高质量训练语料,2022年前出版的纸质书籍,在物理层面上就不可能包含AI生成内容,自然成为“香饽饽”。

“巴拿马计划”的核心动作,其实有两个,即切毁书籍、将书籍内容用于模型训练,二者需分开评价。

一个人花钱买了书,能不能自由处置,甚至将其损毁?在这个问题上,几乎没有争议。与之不同的是,Anthropic销毁的是数百万册书,规模之大引起了人们对文化损失的警觉。于Anthropic而言,这么做是为了提高效率:扫描纸质书较为麻烦,每一页都必须翻动,才能被AI有效读取,如果切断书脊,就能将数千页纸张投入高速扫描仪,高效完成大规模扫描。但许多人对纸质书是有感情的,不仅因其承载知识,也因载体本身就可能具有不可替代的价值。

也正因此,虽说数百万册书籍目录并未公开,但已经出现了“绝版书/孤本被销毁”的传言。目前,没有证据显示Anthropic销毁了珍稀书籍,但外界无法确定Anthropic是否会特意区分普通书籍与珍稀书籍,毕竟精准区分与效率逻辑存在矛盾,粉碎销毁也难留下什么证据。所以,也不能说这种猜测毫无道理。只能说,对书籍缺乏敬畏心的人,很难避免反噬。

再说把内容“喂”给AI,法官认为属于“合理使用”,理由是Anthropic合法购买,且扫描后销毁了,数字文件仅保存在公司内部而非对外分发,符合法律上的“首次销售原则”,即合法购买的实体书所有者有权自行处置书籍。这种“以数字文件替换纸质书”逻辑的吊诡之处在于,可能形成“销毁即合规”的不良激励。另外,模型“吃”下作者智慧成果后,“吐”出的内容与原创相似度多高、算不算得上新作品,也需仔细对比。

最近,《新译黄庭经 阴符经》等书籍的版权信息页,就标注了“禁止将本书内容用于人工智能训练,违者必究”,态度相当明确。不少业内人士清醒认识到,实际操作中,很难直接获取书籍被用于AI训练的证据,著作权人并非单纯限制AI产业发展,而是期待配套搭建兼顾双方、可落地的许可与补偿平衡机制。诉求并不过分,著作权人与AI公司也并非对立面。

“焚书”,与特定历史事件紧密相关,可视为一种集体文化创伤。用“AI焚书”描述“破坏性获取语料投喂AI”,显然不够准确,但相较于“巴拿马计划”,“AI焚书”的感情色彩、本土化关切,都更为浓烈。换句话说,未经公开报道的信息,之所以能跨洋引发网友关注,很大程度上是因为,挖掘未经污染的“干净”训练语料不是某一个AI公司的渴求,AI训练数据的法律困境不是某一个国家面临的问题,该从此事吸取教训、获得启发的也不止Anthropic一家。

编辑 辜继漫
校对 蒙骏鸿
+1
您已点过

订阅后可查看全文(剩余80%)

更多精彩内容请进入频道查看

还没看够?打开南方+看看吧
立即打开