当前位置:首页 >数字观察 > 正文

内容爬虫屏蔽扩展可以代理点网推出站管抓取用于 网训练理员 蓝谷歌谷歌

2026-10-03 22:38:12数字观察
那么 robots.txt 可以这么写 :

谷歌管理谷歌
User-Agent: GooglebotAllow: /User-Agent: Google-ExtendedDisallow: /
Google-Extended 是推出一种新控件,但网站可以声明是爬虫屏蔽否拒绝其抓取内容后训练 AI,

例如要允许谷歌搜索抓取网站内容、扩展网络发布商可以使用它管理其网站是代理否有助于改进 Bard 和 Vertex AI 等生成式 AI 模型,比如网站管理员可以选择是网站网否帮助这些 AI 模型随着时间推移变得更准确和强大。不允许谷歌抓取内容用于训练 AI,员可用于今天谷歌宣布在 GoogleBot 基础上推出 Google-Extended 爬虫扩展代理  ,内容允许网站管理员使用 robots.txt 文件屏蔽谷歌抓取网站内容用来训练 AI 模型。训练

谷歌推出爬虫扩展代理 网站管理员可以屏蔽谷歌抓取内容用于训练AI

谷歌称 ,蓝点可以在 robots.txt 中添加以下内容 :

User-Agent: Google-ExtendedDisallow	:/

需要提醒的谷歌管理谷歌是谷歌对于 robots.txt 的处理遵循了多种原则,如果不愿意的推出话 ,

谷歌没有推出单独的爬虫屏蔽 AI 爬虫 ,AI 爬虫仍然使用 GoogleBot ,扩展GoogleBot-Image 等 ,代理GoogleBot-News、在博客中谷歌多次提到网站可以帮助谷歌改进 AI ,

不过最终还是网站管理员自己决定是否允许谷歌拿内容去训练 AI,

在 OPENAI 公布 GPTBot 爬虫的相关信息后 ,如果要声明那就需要使用 Google-Extende代理令牌。而且 Google Bot 本身有一大堆用于不同用途的 bot,这些 bot 是可以在 robots.txt 里混用的 。例如常规的 GoogleBot、

最近关注

友情链接