一个爬虫占了机器人流量的四分之三
这里的计数器把机器人放在单独的一列里。它们会被记录,但只要你不打开开关,它们就不会动徽章上的数字。这个分隔让一个原本尴尬的问题变得容易问出口:到底是谁在爬一个小到需要访问计数器的页面?
覆盖本服务全部计数器的十三天数据,2026 年 8 月 27 日读取:机器人访问共 47 841 次。
| 机器人 | 访问 | 计数器 | 每个计数器 |
| Meta AI | 36 670 | 151 | 243 |
| Googlebot | 3 272 | 148 | 22 |
| Baiduspider | 3 258 | 345 | 9 |
| Bytespider | 419 | 94 | 4 |
| ClaudeBot | 225 | 29 | 8 |
| GPTBot | 97 | 86 | 1 |
单单一个爬虫就占了本服务全部机器人流量的 76,6 %。而且它并不是覆盖面最广的那个——Baiduspider 触及的计数器多出一倍不止。Meta AI 是在少数几个上往深里钻。
一天一天看是什么样
它不是慢慢来的。8 月 14 日 148 次,第二天 613 次,然后 16 日 8 311 次,此后每天几千次,分布在五十到八十个计数器上。
单个计数器单日的峰值,是这一个爬虫带来的 2 488 次访问。
为什么这个数字对小站要紧
把自己放到接收的一端。你的页面平常一天来几个人。某天早上它显示两千五百。如果机器人和其他所有人一起计数,你会很合理地断定发生了什么事——某处有个链接、有人提到、来了读者。什么也没发生。是一个爬虫在你的站上走了 2 488 遍。
这就是把机器人单列一栏、而不是滤掉或并入的全部理由。并进去,它们制造虚假的欣喜。彻底滤掉,「那是真的吗」这个问题就再也没法回答。单独放着,这个问题有答案,而且看一眼就够。
我们说不了的那部分
这个爬虫为什么这么集中,从这里看不出来。它可能在跟着某个平台的链接结构,或者跟着某一份站点地图,又或者这些计数器恰好就长在它眼下感兴趣的那类页面上。我们看得见它做了什么,看不见它想要什么。
同样要说清楚:这是十三天,因为机器人表要到 8 月 14 日才开始。它很年轻,不知道上个月。把这里的占比读成描述一整年的数字,正是本服务反复在写的那个错误。
广告