一次访问并不等于一个人
网页统计里有一个根本性的误解:把每一次被记录下来的图片请求,都当成一个各自独立的人。要弄明白计数系统究竟记下了什么,就得把技术上发生的事件和人真的在场这两件事分开来看。
一个人,好几次请求
浏览器每次载入一个网页,都会各自独立地去请求所有嵌进来的资源。如果同一位访客打开了五个不同的子页面,服务器记下的就是五次分开的文件请求。反过来,几个人共用一台公司里的工作站或者同一条家庭线路,他们触发的请求又可能被归拢在同一个网络标识底下。
反过来的情形一样常见,而且更不容易看出来。一个四口之家共用一条线路,一所两百名学生的学校共用一条,一间公司的办公室——他们全都以同一个网络地址出现。一个想把这件事纠正过来的计数器只能靠猜,而猜比数更糟。
没有读者时,是什么发出了请求
除此之外,自动化的后台检查、浏览器的预取机制,以及 RSS 阅读器,都可能在没有任何人真正看到页面版式的情况下触发图片请求。这些技术性的自动行为混进了整体的日志流里,也就是说,那些数字反映的是机器之间的往来,而不是对人的一次直接普查。
预先加载值得单独说一句,因为它从两头看都是看不见的。浏览器如果预料下一页会被打开,可能会提前把它连同图片一起取回来。要是读的人始终没有点进去,这一页就是被计了数、却从未被看见。什么也没有坏;浏览器做的正是它被造出来要做的事。
那这个数字究竟是什么
认清这个区别,会彻底改变一个人读统计的方式。计数器给出的是一份关于系统被使用、内容被送出频率的客观索引;它是一件运行状况的量具,而不是一次对人头的普查。
有用的那个视角转换,是别再把这个数字当成人头数来读,而把它当成「送出的次数」来读。它说的是这一页被送出去了多少回。这是一个真实的量,是量出来的而不是估出来的,而且不会因为它不是一次人口普查就变得不那么真。
它还有一条随时间推移最要紧的性质:它跟自己是一致的。无论请求数和人数之间的比例究竟是多少,这个比例从一个月到下一个月大体不变——所以数字翻了一倍,仍然意味着被阅读的量大约翻了一倍。
也正因为如此,真正值得去做的那种比较,永远是内部的比较。这个月比上个月,这篇文章比那一篇,这个赛季比上一个——而绝不是拿这个计数器去比另一件工具给出的数字,因为那件工具在同一个词底下数的是另一样东西。