
TollBit报告显示ChatGPT-User是访问被robots.txt禁止页面最多的AI爬虫。OpenAI解释称,由于该抓取由用户请求触发,robots.txt规则可能不适用。网站管理员应区分ChatGPT-User与OAI-SearchBot的功能差异,并采用网络层工具进行管控。
在搜索引擎优化与内容分发的博弈中,robots.txt 协议长期以来被视为网站管理员控制爬虫访问的基石。然而,随着 AI 驱动的搜索助手崛起,这一传统规则正面临前所未有的挑战。近期,TollBit 发布的《State of the Bots》报告揭示了 2026 年上半年 AI 爬虫行为的关键数据,其中 OpenAI 旗下的 ChatGPT-User 抓取机器人尤为引人注目——它不仅被最多网站禁止,还成功访问了最多被禁止的页面。
报告显示,在欧洲被调查的网站中,约有 15% 的 AI 页面抓取请求最终抵达了被标记为“不允许”的 URL。这一现象并非均匀分布,而是高度集中于少数几个特定的爬虫代理。例如,ChatGPT-User、Bytespider 和 Youbot 在近半数明确列出它们的欧洲网站上,都访问了被禁止的页面。其中,ChatGPT-User 触达的网站数量最多,显示出其抓取行为的广泛性。
值得注意的是,许多新出现的页面抓取代理几乎未被有效阻止。在欧洲,仅有 9% 的网站禁止 Claude-User,而在北美这一比例为 26%;Perplexity-User 的禁止率分别为 13% 和 26%。大多数最新代理在欧洲的禁止率都维持在个位数,但 ChatGPT-User 却是一个明显的例外,其被禁止率显著高于同类。
面对这一数据,OpenAI 在其爬虫文档中给出了一个关键解释:ChatGPT-User 是在 ChatGPT 用户提出问题时才会访问页面,由于这些行为由用户主动发起,因此 robots.txt 规则可能并不适用。Perplexity 也持有类似观点,认为其 Perplexity-User 代理通常会忽略该文件。然而,Anthropic 则持不同态度,明确表示其所有三个机器人都会遵守 robots.txt 规则。
TollBit 在报告中则采取了更为严格的立场:无论操作方如何声明,任何对禁止 URL 的请求都被视为一次绕过行为。
这场争论的核心或许在于一个常被混淆的细节。根据 OpenAI 的文档,决定一个网站是否出现在 ChatGPT 搜索结果中的代理是 OAI-SearchBot,而非 ChatGPT-User。这意味着,网站管理员若同时屏蔽这两个代理以防止 AI 流量,实际上是在放弃通过 OAI-SearchBot 获得搜索可见性的机会,而只保留了针对 ChatGPT-User 的、带有豁免条款的抓取控制权。
从服务器日志或 CDN 记录中,网站管理员可以看到实际到达的请求,而 robots.txt 文件本身只能反映网站的“意图”。这种信息不对称,使得单纯依赖 robots.txt 来管理 AI 爬虫变得愈发困难。
面对 AI 爬虫的“越界”行为,基础设施提供商正在寻求新的解决方案。Cloudflare 正在更新其爬虫管理机制,将决策权从爬虫本身转移到网络层。自 9 月 15 日起,新添加到 Cloudflare 的域名将默认阻止训练和代理爬虫访问带有广告的页面,而搜索爬虫则保持允许状态。
这一举措标志着行业正在从“信任爬虫遵守规则”转向“在网络层强制执行规则”。然而,用户发起的抓取请求是否会被视为“漏洞”而继续存在,仍是悬而未决的问题。这取决于一个核心论点:用户主动请求页面与爬虫自动抓取页面在本质上是否相同。目前,所有主流 AI 助手都以这种方式获取页面,这使得该问题的答案将对整个内容生态产生深远影响。
这一围绕 robots.txt 的争议并非海外独有。在国内,随着百度文心一言、阿里通义千问、字节跳动豆包、月之暗面 Kimi 等大模型产品的普及,它们内置的搜索与抓取功能同样对网站内容提出了新的访问需求。国内网站管理员在应对这些 AI 爬虫时,也面临着相似的困境:如何在保护内容与控制爬虫访问之间取得平衡。
与 OpenAI 的立场类似,国内主流 AI 产品的爬虫通常也会在用户触发特定功能时访问页面。目前,国内尚未形成统一的行业标准来规范此类行为,但可以预见的是,随着 AI 搜索的深入应用,围绕内容授权、访问控制与流量分配的讨论将愈发激烈。网站运营者需要密切关注这一趋势,并考虑采用更精细化的管理工具,例如通过 CDN 日志分析或专门的 AI 爬虫管理服务,来应对这一新挑战。
TollBit 的报告与 OpenAI 的回应,共同揭示了一个正在发生的转变:在 AI 时代,内容访问的规则正在被重新定义。对于网站管理员而言,理解不同 AI 爬虫(如 ChatGPT-User 与 OAI-SearchBot)的功能差异,是制定有效内容策略的前提。仅仅依赖 robots.txt 可能已不足以应对所有情况,结合服务器日志分析与网络层管控工具,才能更全面地掌握内容的实际触达情况。
对于整个行业而言,如何在保护内容创作者权益与促进 AI 技术创新之间找到新的平衡点,将是一个需要持续探索的课题。正如 Search Engine Journal 的报道所强调的,这一议题远未尘埃落定,其后续发展值得每一位内容生态参与者密切关注。
ChatGPT-User 是 OpenAI 用于在 ChatGPT 用户提出特定问题时抓取网页内容的机器人。它与用于决定网站是否出现在搜索索引中的 OAI-SearchBot 是功能不同的两个代理。
根据 OpenAI 的官方文档,由于 ChatGPT-User 的访问行为是由用户主动发起的,robots.txt 规则可能不适用于该机器人。但这并不意味着网站无法通过其他方式(如网络层控制)来管理其访问。
建议网站管理员首先明确区分不同 AI 爬虫的功能(如搜索索引与用户请求抓取),然后结合 robots.txt、服务器日志分析以及 CDN 或云服务商提供的网络层管控工具,制定综合的访问管理策略。
OAI-SearchBot 是 OpenAI 用于抓取网页以建立搜索索引的机器人,它决定了网站是否能在 ChatGPT 搜索中显示。而 ChatGPT-User 是用户提问时触发的实时抓取代理,两者在功能和控制方式上存在明显差异。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI搜索衡量体系正经历从提及量、引用量等表面指标到真实流量数据的范式转移。本文基于数百个网站AI机器人数据分析,提出四类关键决策信号,帮助营销团队建立从机器行为到人类转化的完整衡量闭环。

查询扇出(Query Fan-Out)是 AI 搜索的核心技术,它将一个复杂问题拆解为多个子查询并综合答案。本文深度解析其工作原理、六大类型,并提供一套系统化的优化方法论,帮助品牌在 AI 搜索时代提升可见度与权威性。

微软Clarity新增AI爬取与引荐比指标,揭示AI爬虫抓取与流量回馈的失衡现状。本文深入解析该指标的意义、局限性,并提供利用Semrush等工具优化AI可见性的实操策略,帮助企业理性评估AI搜索生态中的内容价值。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。