我会先告诉你我们做什么
我们实施的措施抓住了很多蜘蛛,但我们不知道有多less我们失踪。 目前,我们采用一系列明显部分重叠的措施:
监控我们robots.txt文件的请求 :然后过滤来自同一IP地址+用户代理的所有其他请求
比较用户代理和IP地址与发布的列表 :iab.net和user-agents.org发布这两个似乎是最广泛用于此目的的列表
模式分析 :我们当然没有这些指标的预先设定的阈值,但仍然发现它们是有用的。 我们将(i)页面浏览视为时间的函数(即点击每页200毫秒的链接是很有效的)。 (ii)“用户”遍历站点的path,是系统性的,完整的或几乎如此(如下面的回溯algorithm); 和(iii)精确定时的访问(例如,每天上午3点)。
再次,我相当肯定我们正在取得低下的成果,但我有兴趣从社区获得意见。
这些简报post被标记为Web日志分析
从Nihuo网站页面的商业Web日志分析器可能是有用的阅读。