Articles of robots.txt

带有SSL的apache robots.txt

我有一个带有重写规则的.htaccess文件来获取每个HTTP请求redirect到HTTPS。 但现在我有一个问题,我的robots.txt不被一些在线检查器识别。 如果我从.htaccess文件中删除redirect,robots.txt被正确识别。 也许我应该排除robots.txtredirect到HTTPS连接? 这是redirect到HTTPS的.htaccess的一部分 RewriteCond %{SERVER_PORT} !^443$ RewriteRule (.*) https://%{HTTP_HOST}/$1 [L]

如何阻止假的谷歌蜘蛛和假的网页浏览器访问?

最近我发现一些人正试图镜像我的网站。 他们通过两种方式来做到这一点: 假装是谷歌蜘蛛。 访问日志如下: 89.85.93.235 – – [05/May/2015:20:23:16 +0800] "GET /robots.txt HTTP/1.0" 444 0 "http://www.example.com" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" "66.249.79.138" 79.85.93.235 – – [05/May/2015:20:23:34 +0800] "GET /robots.txt HTTP/1.0" 444 0 "http://www.example.com" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" "66.249.79.154" http_x_forwarded_for地址是google地址。 假装是一个正常的网页浏览器。 我试图使用下面的configuration来阻止他们的访问: 对于问题1,我将检查X_forward_for地址。 如果用户代理是蜘蛛,并且X_forward_for不为空。 然后阻止。 我在用着 map $http_x_forwarded_for $xf { default 1; "" 0; } map $http_user_agent $fakebots […]

自定义robots.txt在Azure IIS 8中被覆盖

我们的IIS云服务Azure网站的根目录中有一个自定义的robots.txt文件,导航到www.oursite.com/robots.txt时无法正确显示。 显示一个“不同的”robots.txt文件,其中包含: User-agent: LinkChecker Allow: / User-agent: * Disallow: / 我们已经尝试过: 1.删​​除root中的robots.txt文件 – 不正确的robots.txt文件仍然显示。 2.将url-rewrite规则添加到web.config中以显示自定义robots.txt – 正确的robots.txt将显示一段时间,然后恢复到不同的 任何想法是什么踩在我们的自定义robots.txt?

GoogleBot尊重用户代理:*

我在User-agent:*下的robots.txt中封锁了一个页面,并尝试从网站pipe理员工具中的Googlecaching中手动删除该url。 Google说我的robots.txt文件没有被封锁,所以我在User-agent:GoogleBot下面专门封锁了它,试着再次删除它,这一次运行。 这是否意味着Google不尊重用户代理:*或什么?

robots.txt文件对某些用户代理具有更严格的规则

我对robots.txt的精确语法有点模糊,但我试图达到的是: 告诉所有用户代理不要抓取某些页面 告诉某些用户代理不要抓取任何东西 (基本上,一些拥有大量数据的页面不应该被抓取;而一些贪婪而无用的search引擎,例如Cuil,不应该抓取任何东西) 如果我做这样的事情: User-agent: * Disallow: /path/page1.aspx Disallow: /path/page2.aspx Disallow: /path/page3.aspx User-agent: twiceler Disallow: / 所有的用户代理都会匹配第一条规则并跳过page1,page2和page3; 再次匹配第二条规则并跳过所有内容?

如果拒绝抓取工具通过robots.txt访问目录,如果我直接链接,是否还会索引该目录中的文件?

我拒绝通过robots.txt索引到一个名为pdf的文件夹。 但是,我直接链接到该目录中存在的几个文件。 search引擎,如谷歌索引这些文件,或忽略他们,因为他们驻留在pdf文件夹?

如何禁用robots.txt中的特定path

我想禁止/path但也想在robots.txt允许/path/another-path 。 我已经尝试过了: Disallow: /path 要么: Disallow: /path$ 但不起作用,我的意思是它阻止/path/another-path 。 有没有可能做到这一点? 任何帮助,将不胜感激。

Apache 2.2上的access.log中奇怪的条目

我正在运行的Apache 2.2,我的服务器运行良好。 注意到这个奇怪的exception在我的access.log文件中,我应该如何防止它? robots.txt似乎没有工作。 127.0.0.1 – – [17/Apr/2011:12:17:00 +0100] "GET / HTTP/1.1" 200 3022 "-" "msnbot/1.1 (+http://search.msn.com/msnbot.htm)" 127.0.0.1 – – [17/Apr/2011:12:17:00 +0100] "GET /icons/blank.gif HTTP/1.1" 200 487 "http://localhost/" "msnbot/1.1 (+http://search.msn.com/msnbot.htm)" 127.0.0.1 – – [17/Apr/2011:12:17:00 +0100] "GET /icons/layout.gif HTTP/1.1" 200 616 "http://localhost/" "msnbot/1.1 (+http://search.msn.com/msnbot.htm)" 127.0.0.1 – – [17/Apr/2011:12:17:00 +0100] "GET /icons/folder.gif HTTP/1.1" 200 564 "http://localhost/" "msnbot/1.1 […]

有没有办法阻止漫游器通过整个站点的IISpipe理控制台爬行

我可以通过IIS设置与robots.txt一样吗? 天音 User-agent: * Disallow: / 在主机头或通过web.config?

Googlebot无法访问我的网站网站站长工具回复无法访问的robots.txt

当我尝试获取我的网站作为网站pipe理员工具中的googlebot时,它返回无法访问的robots.txt,调查后我明白谷歌机器人可以看到我的服务器: tcpdump | grep google 它返回谷歌可以访问我的服务器IP aa.bb.cc.xx或aa.bb.cc.yy. 但access_log或error_log或其他apache日志中没有任何内容。 cat access_log | grep google or cat error_log | grep aa.bb.cc.xx 其他机器人(冰,…)可以访问Apache,但谷歌不能。 在我的robots.txt或其权限没有问题,因为你知道robots.txt是没有必要的,所以我删除它,但网站pipe理员工具返回“无法访问robots.txt”,不是404没有find! 有关服务器的信息 服务器操作系统:CentOS 6 Web服务器:Apache 2.x 防火墙:IPTables已停用 SELinux被禁用 在我的服务器上没有任何其他安全措施。 我该如何调查这个问题,还有什么其他的命令可以帮助我find问题吗?