永远不应比较的两个数字
网站管理员经常在复杂的分析平台旁边安装视觉访问者计数器,在逻辑上期望报告的流量数字完全一致。
当这些数字不可避免地出现分歧时——有时候差距还相当惊人——人的第一反应是假定其中某一件测量工具出了根本性的故障。然而,这种差异反映的是数字统计的一个基本事实,而不是一处技术上的错误。
差异之所以存在,是因为不同的测量系统盯着的是技术基础设施中根本不同的那些方面,它们对「一次访问」的定义彼此完全不兼容。
图片漏掉的,脚本漏掉的
基于图像的计数器严格在从托管服务器请求特定图形文件时记录访问。
如果访问者用的是纯文本的浏览界面,或者是在一条会丢弃图片资源的、极其受限的连接上上网,又或者装着一个配置成过滤跟踪域名的强力广告拦截扩展,那么这次访问就完全不会被视觉计数记录下来。反过来,基于 JavaScript 的分析平台则完全依赖于在访问者的浏览器环境里执行复杂的代码。
如果脚本的执行被全局禁用了,或者某个特定的隐私扩展挡住了分析用的域名,那么面板上就什么也不会显示——尽管在完全同一次会话里,那张简单的计数图片可能加载得毫无问题。
日志把机器也算进去
原始的服务器日志带来的是范围更广的一类测量差异。托管商记录下来的访问日志,会把打到网络接口上的每一个文件请求统统算进去。
这包括来自搜索引擎索引机器人、激进的漏洞扫描程序和自动化正常运行时间监控服务的持续自动化流量。
这些机器系统常常只把原始的 HTML 源代码下载走,而从不执行嵌在里面的 JavaScript,也从不去请求那些视觉上的图片资源。于是,服务器日志上的数字总是远远高过可视计数器和 JavaScript 分析平台各自报出来的数字——它代表的是原始的技术请求,而不是人的参与。
会话不是固定的单位
最后,「一次会话」这个最基本的定义,在不同的跟踪方法之间差别巨大。可视计数器随着每一次图片加载客观地往上加一,也就是说,一个反复刷新页面的访问者会当场被算上好几次。
复杂的分析工具尝试将多个页面浏览智能地分组为统一的逻辑会话,通常仅在设置的三十分钟不活动期后才过期。
要建立一条可靠的基准线,需要的是彻底的内部一致。任何一件测量工具真正的价值,都稳稳地落在它自己随时间推移的方向性趋势上,而不在于它与另一套建立在完全不同技术原理之上的跟踪系统在绝对数字上是否吻合。