复制还是?

最近,我们被谷歌机器人和其他各种机器人所攻击(我们平均所经历的网站stream量的60%来自机器人),我们正在试图将谷歌机器人stream量分成不同的服务器(低成本的服务器)但是,数据库或者需要被复制或者镜像,如果我们想要接近实时的话,是否有一种解决scheme比另一种解决scheme更好?我们目前在SAN上有我们的生产服务器的数据,我们可以复制这个数据。更像快照复制。

不要“分割”蜘蛛。

试图“分割”WWW蜘蛛正在与WWW蜘蛛所有者作斗争,蜘蛛所有者尽可能希望他们的蜘蛛看到其他人看到的东西。 沿着这条路走下去,你会发现自己和蜘蛛的主人一直在进行持续的军备竞赛。

检查您的网站devise。

高蜘蛛交通有时是不好的现场devise的症状。 例如:其URL包含会话ID的超链接将导致蜘蛛多次查看和爬行单个页面。 检查您的内容HTTP服务器logging蜘蛛stream量实际上什么。 如果事情一遍又一遍地被抓取,只能通过会话ID之类的东西来改变,那么调整你的网站就不会有这个问题。 请参阅Google的技术指南 ,了解更多错误以便进行检查和修复。

使用提供给您的工具作为最后的手段。

Google在其网站pipe理员工具中为其抓取速度提供了一个调整旋钮。 如果您确定自己的网站符合技术指南,而您的网站devise不是高抓取stream量的根本原因,请使用网站pipe理员工具。 但是请注意,如果您每90天都必须这样做,为了保持静态内容的抓取速度,那么您的网站devise最有可能出现了一些问题,而这些问题还没有find并解决。

你的数据真的改变了多less? 你可以提供一个较低的成本服务器上你的网站不太经常更新的版本机器人吗? 您可能可以在一夜之间刷新这些数据,或者其他东西。

SQL Server的数据库镜像实际上不允许您使用辅助查询 – 除非您使用数据库快照进行只读访问,这是企业版function。 随着下一个版本的SQL Server的发展,情况也会改变,但是还有一段时间。

数据库镜像也是每个数据库,所以如果你有几个数据库组成的解决scheme – 你需要把它们全部镜像。

复制更多的是移动数据的一个子集 – 许多人可能不同意这一点。 使用任何技术转移的数据越多,需要的带宽就越多,否则就会开始落后。

也许一个解决scheme是提供更多的僵尸网站的静态内容,通过一个过程定期更新。

感谢您的回应。 我猜测,我会给复制一个镜头,看看它是如何去的。 只有复制在晚上运行。

@JdeBP我已经尝试过,甚至尝试设置爬网率分钟。 没有帮助我的情况。 此外,这是近4000个网站。