用 CSV 或 JSON 把数据带走
统计页面上有一个标着 CSV 的链接,旁边还有一个标着 JSON 的链接。它们会把数据以文件形式交出来。不需要账户,不需要填写表单,也不用等一封带下载链接的邮件。
这篇文章主要想说的是,这个链接为什么会存在。
文件里有什么
CSV 每天提供一行数据,共四列——日期、访问次数、独立访客数,以及机器人数量。它可以在任何电子表格软件中直接打开,无需任何配置,这正是选择这种格式的全部意义所在。
JSON 提供相同的每日数据,外加更细致的分类:国家、城市、浏览器、屏幕尺寸,以及访问量最高的页面,同时还会注明文件的生成时间和所覆盖的时间段。
两种格式都支持指定时间段。加上 &days=90 就能得到三个月的数据,最多可以到 400——这也是统计数据本身保留的时间跨度。不指定的话,默认得到最近 30 天的数据。
它就是一个普通的地址
这个导出功能就是一个普通的 URL,这意味着任何能获取 URL 的东西都能获取到它。不管是每周把数据自动拉入一份电子表格,还是用一个小脚本维护一份比 400 天更长的自有存档,这里都没有任何阻碍,也不需要密钥。
这是刻意如此设计的。一个只有人在浏览器里手动点击才能用的下载按钮,是一个只打算被用一次的下载按钮。
它不包含什么
有必要坦白说清楚:这就是统计页面上已经显示过的那些数据,并不存在被解锁的更丰富的隐藏层。设立导出功能是为了让数据便于携带,而不是为了让它更完整。
其中尤其不包含任何针对单个访客的信息,因为本站根本不保留这类信息。用来分辨重复访问的每日哈希值会在2天后删除,并不会出现在文件里。能导出的,就是实际存在的东西:经过分组的计数。
为什么要费这个事
因为随时都应该能够离开。
一个把历史数据当作人质的服务,留住人靠的不是质量,而是重新开始的成本。这对任何人来说都是留下来的糟糕理由,而蓄意打造这样的东西,则是更糟糕的做法。
访客历史数据属于计数器的所有者。带着它转投别处,完全是合情合理的事,而实现这件事的工具,不应该是本站维护得最差的部分。