🤖
🤖
核心导读
404 Media通过追踪器揭露,亚马逊大量购入珍本书籍并销毁其装订以扫描内容,供AI模型训练。这类绝版或网上难寻的文本能避免“模型崩溃”,成为科技公司争夺的新资源,但也引发对珍本文化遗产遭破坏的争议。
据404 Media报道,亚马逊正在购买大量珍本书籍,切断书脊并进行扫描以用于AI训练。404 Media在一本珍本书中放置了追踪设备,最终该设备抵达亚马逊位于拉斯维加斯的一处设施。
该设施名为VGT3,以一只恐龙用爪子抓着书的标志标识自己。亚马逊在给404 Media的一份声明中表示,它“通过商业渠道购买书籍,以改善客户使用的产品和服务。”
像亚马逊这样的公司需要极其海量的文本来训练其大语言模型(LLM),这些模型已经摄取了能从互联网上获取的内容(在Anthropic的案例中,还非法盗版了书籍)。珍本书籍,尤其是那些绝版或在互联网上无法找到的书籍,为它们提供了令人垂涎的新训练数据源。
这些文本尤其宝贵,因为2022年之前出版的任何内容都不可能是由LLM撰写的。当LLM用AI生成的文本进行训练时,它们面临“模型崩溃”的风险——当LLM摄入了太多AI生成的文本后,其输出质量可能会下降。
分享这篇文章: