
Cloudflare 预测五年内机器流量将达人类流量的 1000 倍。但更关键的是,机器流量的性质正在改变,恶意扫描器开始伪装成 AI 爬虫,针对网站敏感配置和 AI Agent 凭证发起攻击,这给网站安全带来了全新的挑战。
近期,Cloudflare 的首席财务官 Thomas Seifert 在财报电话会议中抛出了一个令人震惊的预测:按照当前趋势,未来五年内,互联网上的非人类流量(机器流量)将达到人类流量的 1000 倍。他甚至直言,“人类将成为互联网上的一个四舍五入误差”。这一言论迅速引发了行业热议。然而,当我们深入探究支撑这一预测的数据时,会发现一个远比“量级增长”更值得警惕的现象:机器流量的构成正在发生质变,从“爬虫”演变为“扫描器”,甚至可能是“攻击者”。
Seifert 的预测并非空穴来风。Cloudflare 官方在同一时期发布的研究报告也证实,目前互联网上仅有不到一半的 HTML 页面请求来自真实人类。机器流量超越人类流量已成为既成事实,且增长速度惊人。值得注意的是,Seifert 本人也承认,他过去的预测总是偏向保守——Cloudflare 曾预计机器流量将在 2027 年超过人类流量,但实际上这一拐点在 2026 年 5 月就已到来。这种“屡屡低估”的历史,反而让这次“千倍”的预测显得更具分量。
一个更令人不安的趋势隐藏在流量增长的数字背后。以知名技术博客作者 Slobodan Manic 的网站 nohacks.co 为例,他在分析一天的 AI 爬虫日志时发现,最大的“访客”并非来自 OpenAI 或 Google,而是名为 CCBot(Common Crawl 的爬虫)的流量。但这部分流量的行为却完全偏离了“抓取网页内容”的初衷。
在近 3000 次请求中,高居榜首的路径竟然是 /.ssh/known_hosts、/phpinfo.php、/.env.production 等敏感文件路径。这些请求并非为了阅读文章,而是在系统地扫描网站配置错误和潜在的密钥泄露。这本质上是一个凭证扫描器,而非内容爬虫。更值得关注的是,其中出现了 /.mcp.json 和 /.continue/config.json 的请求,这两个文件是 AI Agent(智能体)工具链的配置文件,通常包含 API 密钥和访问令牌。这意味着,攻击者已经开始将 AI Agent 的凭证纳入自动化扫描的“字典”中,针对新兴技术栈的攻击向量已经出现。
Cloudflare 的“AI 爬虫”仪表盘将这些请求标记为 Common Crawl 的“AI 爬虫”流量。但 Slobodan 的测试表明,真正的 CCBot 流量来自可验证的 IP 段,并且会反向解析到 crawl.commoncrawl.org 域名。这引发了严重的信任问题:要么是有人伪造了 CCBot 的身份(IP 欺骗),要么是 Common Crawl 的爬虫行为出现了异常。
更令人担忧的是,这类恶意扫描流量在安全日志中完全不显示。因为安全日志只记录触发规则的请求,而这些扫描请求并未被拦截,直接通过了防火墙,因此不会留下任何安全事件记录。这意味着,它们作为“AI 爬虫”在仪表盘上清晰可见,但在安全监控层面却完全隐身。这种“身份”与“意图”的错位,使得现有的安全防护体系出现了巨大的盲区。
这一现象对国内蓬勃发展的 AI 产业同样具有警示意义。随着百度文心一言、阿里通义千问、DeepSeek、智谱 GLM 等大模型及各类 AI Agent 应用的普及,国内互联网同样面临着机器流量激增与恶意扫描的双重压力。国内的安全厂商如奇安信、深信服等,也面临着如何在海量 AI 流量中精准识别“恶意意图”的挑战。与 Cloudflare 类似,国内云服务商也需要在提供 AI 数据服务的同时,加强对 Agent 凭证、API 密钥等新型敏感数据的防护。从产业发展的角度看,建立针对 AI 流量的统一身份认证与行为审计标准,将是构建可信 AI 基础设施的关键一步。
面对这一趋势,网站运营者需要转变思路,从“被动防御”转向“主动识别”:
.env、/.ssh、/.git/config、/.mcp.json 等敏感路径的异常请求。mcp.json 等配置文件,避免将 API 密钥硬编码在可公开访问的路径中。Cloudflare 的“千倍”预测,与其说是一个关于流量规模的预言,不如说是一个关于互联网信任体系的警示。当机器流量成为绝对主流,我们不仅需要应对带宽和算力的挑战,更需要重新审视“身份”与“意图”的定义。AI 时代的网络攻防,正在从“漏洞扫描”演变为“凭证收割”和“Agent 劫持”。对于每一位网站运营者和技术决策者而言,理解并适应这一变化,将是未来五年最重要的安全课题之一。
机器流量是指由自动化程序(如搜索引擎爬虫、AI 抓取机器人、监控脚本等)而非真实用户产生的网络流量。随着 AI 模型的训练和推理需求爆炸式增长,以及自动化工具在数据采集、内容聚合、性能监控等领域的广泛应用,机器流量的增长速度已远超人类用户的增长速度,因此 Cloudflare 预测其数量将在未来几年内达到人类流量的千倍级别。
正常的 AI 爬虫(如 Googlebot、Common Crawl)通常会遵循 robots.txt 协议,其访问路径多为公开的网页内容,且来源 IP 可验证。恶意扫描器则往往针对敏感路径(如 /.env、/.ssh、/wp-login.php)发起大量请求,行为模式与爬虫完全不同,且其来源 IP 可能经过伪装或来自数据中心。通过分析访问日志的路径和频率,可以有效区分两者。
首先,应启用详细的访问日志记录,并定期审计异常路径的请求。其次,利用 WAF(Web 应用防火墙)或机器人管理工具,对识别为恶意的扫描 IP 进行拦截。最后,务必不要在网站根目录或公开可访问的位置存放任何包含密钥的配置文件(如 .env、mcp.json),并定期轮换 API 密钥。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI搜索衡量体系正经历从提及量、引用量等表面指标到真实流量数据的范式转移。本文基于数百个网站AI机器人数据分析,提出四类关键决策信号,帮助营销团队建立从机器行为到人类转化的完整衡量闭环。

信息增益是SEO中衡量内容独特性的关键概念,源自Google专利,强调提供超越现有结果的新信息。本文解析其机制、重要性,并提供实用策略,帮助你在AI时代脱颖而出。

当出版商忙于与谷歌谈判AI抓取授权时,Meta的爬虫已成为网络最大读者。文章分析这一认知差距的根源,探讨出版商在平台留人模式下的困境与出路,并提供普通网站的应对建议。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。