
Cloudflare 的 AI 爬虫控制:别让 GEO 可见性被一键误伤
Cloudflare 正在细分 Search、Training 和 Agent 爬虫,品牌需要在内容保护与 AI 搜索可见性之间做主动选择。
Cloudflare 对 AI 爬虫的控制,正在从“全部允许”或“全部禁止”变成更细的访问策略。对追求 GEO 可见性的品牌来说,风险不只是爬虫太多,也可能是粗糙的安全设置把搜索型访问和训练型抓取一起挡在门外。
从封锁到用途分类
2025 年 7 月,Cloudflare 宣布 Content Independence Day,强调网站所有者应决定 AI 如何访问和使用内容。之后的 AI Crawl Control 允许站点查看 AI 爬虫、运营方、请求量和 robots.txt 违规情况,并逐个选择允许或阻止。
截至 2026 年,官方文档把 AI 流量分为 Search、Agent 和 Training:Search 用于收集或索引内容,方便日后回答问题;Agent 代表实时替用户执行任务;Training 用于训练或微调模型。三者对网站的价值和风险并不相同。Cloudflare 还计划在 2026 年 9 月 15 日调整新域名默认策略:带广告页面上的 Training、Agent 默认封锁,Search 默认允许。上线前仍应以当前控制台和文档为准。
GEO 最容易犯的错
看到“AI bot”就全部封锁,是第一个错误。若 Search 被挡,模型就难以发现页面,品牌可能失去被引用和获得 AI 推荐流量的机会。第二个错误是只改 robots.txt,却不检查 Cloudflare 托管策略、WAF 规则和主机名范围;多个层级同时生效时,更严格的拦截可能覆盖开放意图。
更稳妥的做法,是先制定内容政策:哪些页面希望进入 AI 搜索,哪些只允许登录用户访问,哪些暂时不接受训练或代理抓取。然后查看真实请求,分别验证 Search、Training 和 Agent,再检查 robots.txt、响应码和重要页面的站外可访问性。
放行爬虫不等于一定会被引用,它只是被发现的前提。修改策略后记录日期、爬虫和页面范围,再运行代表性 Prompt,才能区分“内容竞争力不足”和“内容根本没有被允许读取”。AI 时代的安全不是简单关门,而是按用途分层、按证据监测,再依据业务目标持续调整。
对多数 SaaS 和内容品牌而言,可以先保证公开产品说明、帮助文档和研究页面能被 Search 访问,再单独评估 Training 与 Agent。不要只看防火墙是否返回成功,还要确认重要 URL 的正文、标题和更新时间确实能被外部读取,并把访问日志与引用结果放在一起分析。
参考:LLMrefs 对 Cloudflare AI 爬虫策略的整理、Cloudflare AI Crawl Control 文档。
更多文章
邮件列表
加入我们的社区
订阅邮件列表,及时获取最新消息和更新



