
Common Crawl 是 AI 训练数据的主要来源,其 CCBot 爬虫能否访问你的网站决定了你的内容是否会被 AI 模型学习。通过自动化检查工具,你可以快速诊断网站在 Common Crawl 中的可见性,并根据诊断结果修复 robots.txt 或服务器配置,确保内容不被 AI 训练管道遗漏。
AI 的训练数据中? 每个月,一个名为 Common Crawl 的非营利组织都会抓取超过 20 亿个网页,并将这些内容免费提供给任何需要的人。这个免费的存档正是大多数 AI 模型训练数据的起点。根据 Mozilla 的审计报告,在 2019 年至 2023 年间发布的 LLM 中,有 64% 的模型以某种形式使用了 Common Crawl 的数据,而 GPT-3 大约有 60% 的训练权重来自经过过滤的 Common Crawl 数据。 如果某个 AI 模型在未实时搜索网页的情况下就已经知道你的品牌,那么它很可能就是从这些数据中学习到的。这个爬虫被称为 CCBot,它能否读取你的网站,直接决定了你的网站是否存在于这个庞大的档案库中。 在服务器日志中,它的访问记录看起来像这样:CCBot/2.0 (https://commoncrawl.org/faq/)。 2026 年 7 月的爬取包含了 21.4 亿个页面,其中只有三条记录来自 bbc.com。CCBot 请求了权限,读取了拒绝指令,然后离开了。对于训练数据管道而言,这个地球上最大的新闻网站之一仿佛不存在。BBC 的 robots.txt 屏蔽了检测工具追踪的 14 个 AI 爬虫中的 13 个,而其他顶级新闻网站自 2023 年起就故意屏蔽训练爬虫。根据 BuzzStream 的测量,美国和英国排名靠前的出版商中有 75% 都在这样做。 我更关心的问题是:有多少网站从未主动决定屏蔽,却依然从爬取中“失踪”了? Chris Green 最近在 LinkedIn 上分享了 HTTP Archive 的数据。大约有 492,000 个网站在 robots.txt 中提到了 CCBot,其中约 95% 是为了屏蔽它。他提出的开放性问题一直萦绕在我心头:这五十万个网站中,有多少是真正有意屏蔽的? 自 2025 年 7 月 1 日起,Cloudflare 默认在其服务的新域名上屏蔽 AI 爬虫。其管理的 robots.txt 已覆盖了另外 380 万个从未自己编写过该文件的域名。广告插件也在添加屏蔽列表。到 2026 年,屏蔽 CCBot 很可能只是平台默认设置,而非网站所有者的主动决定。 Common Crawl 自己编写了一份手册,正是为了审计这种情况。但所有步骤都是手动的。因此,我将其自动化了。 Common Crawl 可见性检查器 是免费的,无需注册,每次只需输入一个域名,即可直接从 Common Crawl 自己的档案中获取答案。
在 AI 管道中的位置 Common Crawl 自 2008 年以来每月运行一次,其快照是 C4、RefinedWeb、RedPajama、Dolma、FineWeb 等大多数大型训练集的原材料。实验室很少直接使用原始爬取数据,而是采用过滤后的衍生数据。因此,你的页面进入模型的路径是:CCBot → Common Crawl → 这些数据集之一,每一步都只保留通过上一步筛选的内容。 这条管道仍在运转。FineWeb 在去年 7 月添加了六个新的 2025 年爬取数据,NVIDIA 也将其 Nemotron 训练集托管在 Common Crawl 自己的存储桶中。 简而言之,CCBot 是唯一一个访问会产生“复利”效应的爬虫。GPTBot 抓取你的页面仅为 OpenAI 服务,而 CCBot 的一次访问,最终会被所有在开放网络上训练模型的机构使用。
期望你手动执行的审计 今年六月,Common Crawl 发布了一份有趣的指南——AI 可见性审计。这份 18 页的指南告诉网站所有者如何检查自己在数据集中的状态。这是一份不错的指南,但有一个问题:每一步检查都是手动的。 你需要用 CCBot 的用户代理 curl 你的主页,并与浏览器的响应进行比较;接着是索引 API,你需要手动查看捕获计数;然后是他们的网络图,查找你的排名。最后,你需要为每个域名手动编制一份记分卡。 我阅读了这份清单,然后将其自动化了。巧合的是,Common Crawl 在五月向浏览器工具开放了数据访问,这使得这个工具成为数据提供商真正希望构建的罕见工具。我认为他们很清楚自己在做什么,为他们点赞。
显示过去十二个月中,每月爬取捕获了多少页面,以及趋势。我的网站从去年 8 月爬取的 2 个页面增加到今年 7 月的 55 个,这是有史以来最令人满意的图表。大型域名则会显示估算值。例如,输入 wikipedia.org,你会看到约 370 万的估算数字,因为该工具会读取大型网站的索引结构,而不是逐条计数。
历史 Common Crawl 会存储每次爬取前读取的 robots.txt。检查器会逐月回溯检查这些存储的副本,并对比 AI 爬虫规则的变化,因此可以确定屏蔽指令的开始日期。运行 bbc.com,每个月的记录都相同:CCBot 被屏蔽,14 个令牌中屏蔽了 13 个,Disallow 根目录。
当屏蔽规则与已知模板匹配时,工具会明确指出。Cloudflare 管理的 robots.txt 具有独特的许可证注释,Squarespace 的默认设置也有其独特的签名。当一次屏蔽涉及八个或更多 AI 令牌时,这通常是插件或复制的列表。
历史记录说明了过去的情况,而这一项则检查当前的真实状态。它会以 CCBot/2.0 的身份,与普通浏览器和对照爬虫一起抓取你的主页,从而捕捉到 robots.txt 无法显示的屏蔽——例如防火墙在边缘对用户代理的质询。 这四个面板构成了诊断结果。检查器的其余部分则告诉你如何处理。每项检查都会以一个修复卡片面板结束,卡片内容与发现的问题相匹配。 - 如果是 Cloudflare 模板屏蔽,则显示仪表板路径和警告。
Sitemap 面板是我为自己想要的功能。检查器会抓取你的 sitemap,并与已捕获的 URL 进行对比,将关键数字转化为一个工作队列。我的网站显示,7 月爬取中有 97 个页面中的 42 个被收录,其余页面则是我需要检查的待办事项。
访问 Common Crawl 可见性检查器网站。
Common Crawl 收录有什么好处? 被 Common Crawl 收录意味着你的网站内容有可能被用于训练未来的 AI 模型,从而增加你的品牌在 AI 回答中被提及的概率。这是一种提升品牌在 AI 时代可见性的重要方式。
屏蔽 CCBot 会影响我的 SEO 吗? 对于传统搜索引擎(如 Google)的排名,屏蔽 CCBot 没有直接影响,因为 Google 使用自己的爬虫。但如果你希望被 AI 模型认知,屏蔽 CCBot 会使你的内容从 AI 训练数据中“消失”,从而影响你在 AI 搜索中的可见性。
robots.txt 是否屏蔽了 CCBot? 你可以查看网站根目录下的 robots.txt 文件。如果其中包含 User-agent: CCBot 和 Disallow: / 这样的规则,则说明你屏蔽了 CCBot。使用我们的检查器可以更直观地看到这一状态。
的默认屏蔽是永久性的吗? 并非永久性。Cloudflare 的托管 robots.txt 是一个默认设置,你可以通过 Cloudflare 控制面板修改或删除该规则,从而允许 CCBot 访问你的网站。
修复 robots.txt 后,效果会在下一次 Common Crawl 爬取时(通常在一个月内)体现出来。检查器会显示下个月的爬取日期,方便你复查。
在 AI 时代,了解并管理你的网站在训练数据中的存在感变得至关重要。Common Crawl 的 AI 可见性审计手册提供了宝贵的指导,而自动化工具的诞生,则让这一过程变得前所未有的简单。不要让默认设置或第三方插件无意中让你在 AI 的世界里“消失”。立即检查你的网站状态,确保你在 AI 的训练数据中占有一席之地。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI搜索衡量体系正经历从提及量、引用量等表面指标到真实流量数据的范式转移。本文基于数百个网站AI机器人数据分析,提出四类关键决策信号,帮助营销团队建立从机器行为到人类转化的完整衡量闭环。

Google 生成式 UI 正从 AI Overviews 向全球扩展,它能直接生成抵押贷款计算器等交互工具,对依赖工具页流量的网站构成直接威胁。本文剖析其能力边界、测试数据与应对策略,并给出国内同类产品视角。

AI公司重金收购旧书以获取高质量训练数据,同时水印技术军备竞赛正在升级。本文深入分析AI内容溯源的现状、局限与未来趋势,探讨检测与规避的猫鼠游戏。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。