亚马逊被曝拆解珍本图书用于AI训练
摘要
币行吧报道: TechCrunch援引 404 Media 报道称,亚马逊正在购买大量稀有图书,拆除书脊后扫描内...
TechCrunch援引 404 Media 报道称,亚马逊正在购买大量稀有图书,拆除书脊后扫描内容,以获取可用于训练 AI 模型的文本数据。一册被放入追踪器的珍本图书,最终被送至亚马逊在拉斯维加斯的设施。
图书被追踪至 VGT3
404 Media称,这本图书最后到达名为 VGT3 的亚马逊设施。该地点使用“恐龙爪持书本”标识。亚马逊向 404 Media 表示,公司会通过商业渠道购买图书,用于改进客户使用的产品和服务。
绝版文本成新语料来源
报道指出,训练大语言模型需要极大规模的文本数据,而互联网上可直接获取的公开内容已被大量使用。对亚马逊这类公司而言,绝版、稀有或在线难以找到的图书,正成为新的训练语料来源。
模型训练转向线下资料
这类文本的价值还在于,出版时间早于 2022 年的内容通常不含 AI 生成文本。报道提到,模型如果持续摄入过多 AI 生成内容,可能出现“模型坍塌”,即输出质量逐步下降。这也让 AI 公司如何获取高质量原始文本,再次成为焦点。
评论 (5)
为了训练AI拆珍本图书,这也太浪费文化遗产了,珍本哪能这么用。
拿珍本图书训练AI,要是有更好的办法就不用这么干了,现在有点本末倒置。
亚马逊这么干不合适,珍本有历史价值,不能只当训练数据的来源啊。
训练AI就拆珍本,那以后珍本都得遭殃,这做法不行。
亚马逊为获取语料拆书,珍本可拆一本少一本,这不是长久之计。