近日,有关大量珍贵图书被集中粉碎以训练大语言模型(LLM)的消息引发广泛关注。消息称,一些图书供应商近期收到了数量异常庞大的图书订单,业内人士猜测AI公司希望获得更高质量的训练数据,同时规避版权风险。争议焦点指向了图书数据库网站ISBNdb,外界认为该网站不仅鼓励这种做法,甚至还为AI公司与图书供应商之间牵线搭桥。
随着舆论发酵,ISBNdb开始试图与争议划清界限,并删除了自己此前发布的相关内容。ISBNdb在最新声明中表示,他们并不训练AI模型,也从未从事过相关业务。那个页面只是一次市场需求测试,相关服务从未真正上线,目前页面已删除。此前,多家图书供应商突然接到大量图书采购订单,外界普遍怀疑幕后买家是AI公司,而ISBNdb则成为舆论焦点,因为它曾推出一项服务,似乎专门帮助AI企业与图书仓储机构建立联系。
据报道,随着AI公司越来越难获得“干净”的训练数据,它们正在寻找新的数据来源。互联网上大量低质量内容,以及越来越多由AI自己生成的内容,都可能导致模型训练出现“负反馈循环”问题。因此,各家公司希望获取质量更高的数据,同时又尽量避免引发外界关注。
