智能工具库

AI 机器人抓取与 AI 概览:双源验证的真相

AI 机器人抓取与 AI 概览:双源验证的真相

作者用 88 天数据和两个独立来源,验证了 AI 机器人抓取趋势的真实性,发现趋势并非单一上升,而是波动中下降,并揭示了 AI 概览与抓取之间的关系。

2026-08-31 0来源:Hacker Noon

从单源数据到双源验证:为什么一个仪表盘不够

今年七月,我在 HackerNoon 上发表了一篇文章,提到我的小型双语技术网站 TechNovice 的日志中,AI 系统代表用户抓取页面的请求数,竟然超过了真实人类的浏览会话。那篇文章反响不错,但读者提出了一个关键质疑:89 天的观察窗口可能只是偶然,未必代表长期趋势。为了回答这个问题,我决定用更长的周期、更严谨的方法重新验证:这次我跟踪了 88 天(2026 年 5 月 18 日至 8 月 13 日),同时使用两个完全独立的测量系统——网站自身的机器人流量日志(专门筛选用户触发的抓取器,如 OpenAI 和 Perplexity 的实时抓取),以及 Google Search Console 中关于 AI 概览(AI Overviews)的展示报告。这两个来源来自不同公司、测量不同指标,如果它们指向同一个结论,那比任何单一数据都更有说服力。

机器人日志:上升、下降,再下降

先看机器人流量日志的结果。在 88 天的干净窗口内,网站总共记录了 68,495 次 AI 用户机器人抓取,几乎全部来自 OpenAI 的用户触发抓取器,Perplexity 的贡献很小。平均每天约 778 次,其中 98.9% 的请求成功返回。但平均值掩盖了形状:如果按周看,趋势并非直线上升。前几周抓取量确实攀升,但随后出现明显回落,并在后半段持续走低。换句话说,如果只看头几周,你可能会得出“AI 抓取正在暴涨”的结论;但拉长到三个月,你会发现它更像是一次波动,而非持续上升。这提醒我们,短窗口数据很容易误导判断。

Google AI 概览:另一套数据,另一种视角

再看 Google Search Console 的 AI 概览报告。这里测量的不是抓取,而是我的页面在 Google 生成式答案功能中的展示次数。结果同样复杂:AI 概览的展示量在窗口前半段稳步增长,但在后半段出现下滑,尤其在最后几周,下降幅度明显。有趣的是,AI 概览的峰值出现在 6 月中旬,而机器人抓取的峰值则稍晚,两者并非完全同步。这说明 AI 概览的展示和实际的服务器抓取之间,存在时间差和逻辑差异——概览可能基于缓存或预测,而抓取则发生在用户实际点击时。

两个来源的交叉验证:趋势并非单一

将两个数据源放在一起看,一个清晰的图景浮现出来:AI 驱动的流量并非持续上升,而是经历了一个“上升—峰值—回落”的过程。这与我的第一篇文章中“AI 流量超过人类”的结论并不矛盾,但更精确地揭示了它的动态性。对于网站运营者来说,这意味着什么?

  • 不要依赖短期数据做决策:一两周的 AI 抓取峰值可能只是波动,至少需要 60 天以上的数据才能看到趋势。
  • 区分抓取类型:用户触发的抓取(如用户问 ChatGPT 时抓取你的页面)和模型训练爬虫(如 GPTBot 定期抓取)是两回事,前者可能带来实际用户,后者只是数据收集。
  • AI 概览展示与抓取不完全相关:Google 的 AI 概览可能基于索引内容,而不是实时抓取,所以即使概览展示下降,你的服务器抓取可能仍在波动。

对开发者和 AI 使用者的实用建议

如果你是网站运营者,建议同时监控多个数据源:服务器日志(区分用户代理)、Google Search Console 的 AI 概览报告、以及第三方工具(如 Cloudflare 的机器人分析)。不要只看一个仪表盘,因为每个系统都有偏差。如果你在开发 AI 应用,理解这些抓取模式有助于优化你的抓取策略——比如,避免在高峰期频繁抓取同一站点,尊重 robots.txt 和缓存头,以减少对源站的压力。

这次双源验证虽然没有得出一个“干净”的结论,但它展示了如何用数据严谨地检验直觉。AI 流量的世界比我们想象的更复杂,但正因如此,多角度的观察才更有价值。

本文基于 Hacker Noon 的公开内容,由 AI 辅助整理改写后发布。

原标题:A Two-Source Analysis of AI Bot Fetches and AI Overview Impressions

阅读原文