🌐 English 即时比分

亚马逊,曾经的在线书商,正在销毁珍本书籍以训练AI模型

人工智能 来源: TechCrunch 发布时间: 热度: 👍
亚马逊,曾经的在线书商,正在销毁珍本书籍以训练AI模型
🤖
🤖

核心导读

404 Media通过追踪器揭露,亚马逊大量购入珍本书籍并销毁其装订以扫描内容,供AI模型训练。这类绝版或网上难寻的文本能避免“模型崩溃”,成为科技公司争夺的新资源,但也引发对珍本文化遗产遭破坏的争议。

据404 Media报道,亚马逊正在购买大量珍本书籍,切断书脊并进行扫描以用于AI训练。404 Media在一本珍本书中放置了追踪设备,最终该设备抵达亚马逊位于拉斯维加斯的一处设施。 该设施名为VGT3,以一只恐龙用爪子抓着书的标志标识自己。亚马逊在给404 Media的一份声明中表示,它“通过商业渠道购买书籍,以改善客户使用的产品和服务。” 像亚马逊这样的公司需要极其海量的文本来训练其大语言模型(LLM),这些模型已经摄取了能从互联网上获取的内容(在Anthropic的案例中,还非法盗版了书籍)。珍本书籍,尤其是那些绝版或在互联网上无法找到的书籍,为它们提供了令人垂涎的新训练数据源。 这些文本尤其宝贵,因为2022年之前出版的任何内容都不可能是由LLM撰写的。当LLM用AI生成的文本进行训练时,它们面临“模型崩溃”的风险——当LLM摄入了太多AI生成的文本后,其输出质量可能会下降。
分享这篇文章: