联系支持

我们通过电子邮件回复,通常两天内。

为防止滥用,Google reCAPTCHA 会检查这次提交,其间会向 Google 传输数据。脚本只在此表单打开时才加载。

← 全部文章

国家列表是一个估算

地理方面的统计,常常把访问者按国家分门别类地摆出来给人看。可是,仅仅依据网络层面上的那点凭据,就去判定一位访问者究竟身处何地,本质上是一次带着系统性偏差的推算,而不是一次直接的观察。

家庭线路地区通常对得上一个还算靠谱的推断移动、公司、VPN在别处冒出来推断落空大范围的地区趋势站得住,单独一行站不住

这个推断是怎么做出来的

当浏览器来请求一个图片文件的时候,服务器读到的是发起这次连接的那个网络地址。这串数字会拿去和地理映射数据库比对,从而把某一个号码段和某一个国家对应起来。对于固定在某一处的普通住宅宽带来说,这套机制相当可靠;但只要换成另外几种情形,就有一堆技术上的变量把不确定性带了进来。

那些用来做对应的数据库,本身也是靠人工和推断维护起来的。号码段分配给各家运营商,运营商再申报自己把它们用在什么地方,而这份申报有时候已经过时好几个月了。一个从某国运营商手里卖到另一国运营商手里的号码段,在有人注意到之前,会一直保留着它旧的那条记录。

这个推断在哪里出错

移动通信网络常常把流量绕经集中的区域枢纽,而那个枢纽可能离用户本人有好几百公里远。同样地,公司里的代理配置、学校的网络,以及虚拟专用网服务,都会有意遮住真实的出发地,把出口安排在完全不同的司法管辖区里。

误差的大小并不是处处一样,而这恰恰是值得知道的那一部分。对于一个小国家里的固定线路来说,这个推断通常是对的。对于一条移动线路来说,它可能把国家猜对了,地区却偏出两百公里之远。而对于一条私有网络来说,它是被故意弄错的,而且对此谁也无能为力。

这份清单究竟还能派上什么用场

尽管有这些天生的误差,汇总起来的地理清单在辨认大范围的地区趋势和主要的受众构成上,依旧非常有用。只要认清这份数据是一次有根据的近似,而不是地图学意义上的绝对确定,就能以现实的眼光去读那份国际分布。

有一个问题,这份清单回答得很好:受众大体上是不是在人们预先设想的那个地方。一个几乎全部来自同一个国家的教区网页,表现得正如预期。而同一个网页如果突然有一半的流量来自三个跟它毫无关系的国家,那它通常看到的是索引机器人,而不是真正的读者。

它撑不起来的,是一个悬在单独一行数据上的决定。因为从邻镇来了十一次访问,就断定那个镇子值得单开一页,这等于是把一个从来不打算承受这种重量的推断,当成了地基来用。

把它当成量级来读,这份清单既有启发,又不花什么代价。把它当成一本通讯录来读,它就是虚构。

广告