返回首页 >

AI公司在抢购“未经污染”的二手书?全球书商收异常巨额订单,18世纪古籍也被交易

2026-08-16 19:59   红星新闻

  而Anthropic则回应称,在书籍中寻找训练模型的材料是人工智能行业广泛采用的方法,该公司的数据采集项目不会“购买和销毁珍稀古籍”。

  在另一起诉讼中,Anthropic还被发现在盗版网站下载了大量电子版书籍用来训练模型。在这一诉讼中,Anthropic公司没有承认存在不当行为,而是同意向出版商和作者支付15亿美元的和解金,以避免审判。书籍被下载的作者可以申请获得和解金,预计每本书的赔偿金额约为3000美元。

  2022年之前的书籍成为抢手货

  专家表示,人工智能公司如今正面临着自身造成的数据难题:开放网络充斥着人工智能生成的文本,而用这些“垃圾”训练新模型会导致“模型崩溃”(即机器因吞噬自身输出而性能下降)。而不寻常和罕见的文本可以为改进大型语言模型的训练提供新的素材,这对生成式人工智能工具的发展至关重要。

  Anthropic的一位联合创始人曾提出,用书籍训练人工智能模型可以教会它们“如何写出好文章”,而不是模仿“低劣的网络用语”。Meta公司2024年的一封内部邮件中,则将获取数字书籍资源描述为与人工智能竞争对手抗衡的“关键”。

  还曾有图书数据库ISBNdb曾直接告诉AI公司,世界上最好的AI训练数据就摆在书架上,2022年之前出版的书籍是AI公司的理想素材,因为它们的文本没有被聊天机器人生成的素材污染。

猜你喜欢

热点新闻

{$loop_num=0}