Articles of robots.txt

Google-Bot爱上了我的404页

每天我的访问日志看起来都是这样的: 66.249.78.140 – – [21/Oct/2013:14:37:00 +0200] "GET /robots.txt HTTP/1.1" 200 112 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" 66.249.78.140 – – [21/Oct/2013:14:37:01 +0200] "GET /robots.txt HTTP/1.1" 200 112 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" 66.249.78.140 – – [21/Oct/2013:14:37:01 +0200] "GET /vuqffxiyupdh.html HTTP/1.1" 404 1189 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" 或这个 66.249.78.140 – – [20/Oct/2013:09:25:29 +0200] "GET /robots.txt HTTP/1.1" […]

从url中删除?= collcc

Google网站pipe理员工具已通知我有太多重复的url。 有些参数已添加,我不知道,我需要删除它,例如: http://example.com/5454/my-utr.html http://example.com/5454/my_url.html?collcc=3067605522& 这在Google上被标记为重复的url。 我怎样才能阻止?=collcc或使用.htaccess删除它。 或者最好删除只是?collcc=和redirect到正常的URL与.htaccess ? 我知道我可以阻止在robots.txt文件,但我需要干净的url,仍然在谷歌索引,所以我需要删除只是查询collcc 。 我努力了: RewriteCond %{QUERY_STRING} collcc= RewriteRule (.*) http://my-site.com/$1? [R=301,L]

在尊重robot.txt的同时,我需要多less硬盘空间来caching网页?

我想尝试创build一个networking爬虫。 我将开始索引一些中等大小的网站,比如Stack Overflow或者Smashing Magazine。 如果有效,我想开始抓取整个networking。 我会尊重robot.txts。 我将所有的html,pdf,word,excel,powerpoint,keynote等文件保存在MySQL数据库中(不是exes,dmgs等等,只是文件)。 接下来,我将有第二张包含所有重复和描述的表格,以及一个包含单词的表格以及在哪个页面上查找这些单词(又名索引)。 你认为我需要保存所有页面多less硬盘空间? 低至1TB还是10TB左右? 也许30? 1000? 谢谢

理想的gitweb安装robots.txt?

我使用gitweb(和gitolite)在git.nomeata.de上托pipe了一些git仓库。 有时,一个search引擎蜘蛛出现,并开始敲击界面。 虽然我通常希望我的git存储库在search引擎中显示,但我不想完全阻止它们。 但他们不应该调用昂贵的操作,例如快照存档,search或生成差异。 什么是这样的安装“最好的” robots.txt文件?

使用robots.txt来防止抓取工具获取Trac页面的旧版本

看我的Apache access.log我看到,抓取工具往往会得到旧版本的页面和文档,如: 119.63.196.86 – – [10/Jun/2011:10:36:31 +0200] "GET /wiki/News?version=14 HTTP/1.1" 200 6073 "-" "Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)" 我希望他们不要将?version=x后缀追加到URL中,这样他们只能得到最新的内容。 有没有办法通过robots.txt文件(或我不知道的其他机制?

阻止离线浏览器

有没有办法阻止在日志中显示为“Mozilla”的离线浏览器(如Teleport Pro,Webzip等)? 例如:Webzip在我的站点日志中显示为“Mozilla / 4.0(compatible; MSIE 8.0; Win32)” Teleport Pro在我的站点日志中显示为“Mozilla / 4.0(compatible; MSIE 7.0; Windows NT)” 我做了一些使用.htaccess文件的testing,但是都以浏览器阻塞(Mozilla和Chrome)而告终,当然我不想阻挡正常的访问者,但是只是带有leechers(同时也吃了很多CPU / RAM他们的请求),加上看起来这个离线浏览器甚至忽略robots.txt文件。 任何人都知道一种方法来识别和阻止他们? 如果有可能给我举例。

什么是随机字符查询来自googlebot,例如,vvytnoxvontwusz.html?

我的一个网站已经从googlebot获取查询,顺序为: example-log:66.249.79.216 – – [06/Apr/2016:15:36:56 -0700] "GET /vvytnoxvontwusz.html HTTP/1.1" 404 15136 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" TLSv1.2 AES128-GCM-SHA256 过去几天我收到了一些这样的信息。 这个地址似乎在Google的IP空间中是真实的,但是我不知道发生了什么,除了它正确的404':我并不惊讶地发现,被引用的页面在我的网站上,也没有在互联网上的其他地方(正如你所期望的,如果有人正在产生一个随机的15个字符的string)。 我想我并不是过分担心事情的macros伟计划,但是有没有人知道发生了什么? 谢谢!

如果网站没有robots.txt文件,会发生什么情况?

如果网站的根目录中缺lessrobots.txt文件,那么事情如何处理为: 该网站根本没有索引 该网站的索引没有任何限制 根据我的理论,这在逻辑上应该是第二个。 我提到这个问题 。

为什么googlebot从我的SSH服务器请求robots.txt?

我在我的服务器上运行ossec,并定期收到如下警告: Received From: myserver->/var/log/auth.log Rule: 5701 fired (level 8) -> "Possible attack on the ssh server (or version gathering)." Portion of the log(s): Nov 19 14:26:33 myserver sshd[2105]: Bad protocol version identification 'GET /robots.txt HTTP/1.1' from 66.249.73.226 IP地址总是对应于一个谷歌爬虫。 但为什么在这个世界上googlebot会试图索引我的SSH服务器? 我们在标准的知名端口(22)上运行SSH,所以看起来谷歌似乎比在这里寻找一个Web服务器更好。 而且我们绝对没有发布任何会导致它相信的链接。

百度蜘蛛每天造成3Gb的stream量 – 但我在中国做生意

我遇到了一个困难的情况,百度蜘蛛打我的网站每天带来3Gb的带宽。 同时我在中国做生意,所以不想阻止它。 有没有其他人在类似的情况下(任何蜘蛛)? 你遇到了一个神奇的解决scheme? 或者你只是接受它,并阻止或阻止机器人?