联系支持

我们通过电子邮件回复,通常两天内。

为防止滥用,Google reCAPTCHA 会检查这次提交,其间会向 Google 传输数据。脚本只在此表单打开时才加载。

← 全部文章

当计数器显示与预期不同的数字时

预期中的流量数字与计数器上实际的读数之间的落差,是网站管理中经常引起困惑的一个来源。要分析这些出入,就得去检查究竟是哪些具体的技术机制,在网页服务器上触发了一次图片请求。

比预期低图片来自本地存储这次访问根本没发出去比预期高自己的访问和机器人一起算了进来而同一个页面有两个地址,会把数字劈成两半

下面这四个原因并不会互相抵消。其中两个把数字往下压,两个把数字往上推;在某一个具体的站点上,它们是同时起作用的,而且比例无从得知。所以,诚实的目标不是拿到一个正确的数字,而是拿到一个随时间变化可以信赖的数字。

为什么数字偏低

一个主要的因素,是经营者自己浏览自己网站的行为。每当管理员或者内容作者打开网站去检查排版、或者去发布新的材料时,浏览器都会请求那张计数图片,总数也就跟着加一。除非事先配置了排除规则,否则每一次内部的检查会话,都会直接计入公开的统计,把报出来的量顶到高于外部访客的真实水平之上。

另一个常见的原因,与现代互联网服务提供商、公司的代理服务器或者本地浏览器缓存所构成的中间缓存层有关。如果计数图片的一份缓存副本是直接从本地内存里送出来的,而不是重新向源服务器请求,那么底下那次访问事件就根本没有被登记。于是,来自同一批网络的、重复而密集的流量时段,可能反而呈现出一条出奇平坦的数字曲线。

这两个原因,与其去补偿,不如直接除掉。给站长自己的地址加一条排除,就从源头去掉了第一个;一条严格的、不许缓存计数图片的指令,去掉了第二个的大部分。事后去猜一个修正系数,只会再添上第三个误差来源。

为什么偏高,或者被拆成两份

自动化的软件代理和搜索引擎的爬虫也会显著地影响记录下来的总数。除非被明确地限制住,搜索索引的机器人会不停地遍历网络的结构,像人类访客一样发出图片请求。虽然复杂的过滤机制试图把已知的自动流量隔离出去,但新型的或者分散式的爬虫偶尔还是会畅通无阻地通过,造成与人的参与毫不相关的数字骤升。

最后,把一个网站维持在多个彼此不同的地址之下——比如带前缀和不带前缀的变体,或者别的域名后缀——会把记录下来的数据流打成碎片。如果不同的页面链接到彼此独立的计数器编号,总的流量就被分割进各自独立的记录里去,让人产生「计数少了」的印象。把这些技术上的参数系统地过一遍,也就说清楚了为什么观察到的指标常常与主观的预期对不上。

把这四个都弄明白之后,这个数字就不再是谜,而成了一条基准线。它不会跟任何别的工具对上,本来也不该对上;有用的问题是:在同一个计数器上,这个星期看起来像不像上个星期。

广告