爬虫
Crawling
抓取网络数据的行为,也是围绕AI训练的版权纠纷的源头。
简单来说
程序(爬虫)在网络上四处游走,抓取网页内容。谷歌搜索是这种做法的鼻祖,AI公司也用它来收集训练数据。
它已成为AI时代版权纠纷的源头——媒体、作家、画家纷纷起诉称,自己的文章、图片、文字未经许可就被抓取用于训练AI。网站可以设置一块名为robots.txt的"禁止抓取"告示牌,但它几乎没有强制力,因此无视该告示的抓取行为经常成为新闻话题。与此同时,通过许可协议(支付内容使用费)来解决这一问题的做法也在逐渐增多。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。