请有人向我解释设置允许和不允许在robots.txt文件之间的区别,并创build没有跟随,没有索引元标记! 是否有可能在robots.txt文件中设置没有跟踪和索引? 我看在http://www.robotstxt.org/robotstxt.html并没有真正得到什么即时通讯寻找! 谢谢
网站由亚马逊ec2上托pipe的匿名机器人抓取。 这个机器人不尊重robots.txt并且在web服务器上创build高负载,所以我添加了检查请求的反向IP是否以“amazonaws.com”结束,然后服务器立即返回403页。 这解决了问题,但可能会导致其他问题? ec2可能会被用于某些“好”的机器人,这将导致他们的访问问题。 你能举出这样的问题吗?
如果我有一个用于获取消息的URL,我创build它就像这样: http : //www.mydomain.com/somelonghash123456etcetc这个URL允许其他服务POST消息。 search引擎机器人有可能find它吗? 我不想把它放在我的robots.txt文件中,因为这会将它暴露给看到机器人文件的任何人。 当然,我会在应用程序中进行其他身份validation,但没有任何人发现该URL是第一步。 任何常见的方法?
我似乎无法正确configurationnginx来返回robots.txt内容。 理想情况下,我不需要该文件,只想提供直接在nginx中configuration的文本内容。 这是我的configuration: server { listen 80 default_server; listen [::]:80 default_server ipv6only=on; root /usr/share/nginx/html; index index.html index.htm; server_name localhost; location = /robots.txt { #return 200 "User-agent: *\nDisallow: /"; #alias /media/ws/crx-apps/eap/welcome-content/robots.txt; alias /usr/share/nginx/html/dir/robots.txt ; } location / { try_files $uri $uri/ =404; } } = /robots.txt位置中的任何内容都不起作用,我不明白为什么。 访问http://localhost/robots.txt给出了404。但是, http://localhost/index.html是正确的。 请注意,除了添加新的位置(用于testing)之外,我没有更改从apt-get install nginx获得的nginx的任何默认设置。
我正在尝试为nginx http服务器下的所有虚拟主机设置robots.txt 。 我可以通过在主要的httpd.confjoin以下内容来实现: <Location "/robots.txt"> SetHandler None </Location> Alias /robots.txt /var/www/html/robots.txt 我尝试在nginx.conf和(b)中添加下面的(a)行来做类似于nginx的工作,包括conf.d / robots.conf location ^~ /robots.txt { alias /var/www/html/robots.txt; } 我已经尝试了'=',甚至把它放在虚拟主机之一来testing它。 似乎没有任何工作。 我在这里错过了什么? 有没有另一种方法来实现这一目标?
我想阻止yandex.rusearch机器人的所有请求。 这是非常stream量密集(2GB /天)。 我第一次阻止了一个C类IP范围,但似乎这个僵尸程序出现在不同的IP范围。 例如: spider31.yandex.ru – > 77.88.26.27 spider79.yandex.ru – > 95.108.155.251等。 我可以在robots.txt中join一些否认,但不确定是否尊重这一点。 我想阻止IP范围的列表。 有人可以提出一些通用的解决scheme。
我想创build一个robots.txt文件,并为我的IIS上的所有站点(本例中为7)提供服务。 我不想在任何个人网站上configuration任何东西。 我怎样才能做到这一点?
如果我想要我的主要网站在search引擎上,但没有子域是,我应该只是把“禁止所有”robots.txt子目录的目录? 如果我这样做,我的主域名仍然可以抓取?
我们有一个带有虚拟主机的XAMPP Apache开发Web服务器设置,并希望阻止serps爬取我们所有的站点。 这很容易通过robots.txt文件完成。 但是,我们宁愿不在每个虚拟主机中包含一个disallow robots.txt,然后当我们与另一台服务器上的网站一起使用时,必须将其删除。 有没有一种方法与Apacheconfiguration文件重写所有的vhosts robots.txt的所有请求到一个robots.txt文件? 如果是这样,你能举个例子吗? 我认为这将是这样的: RewriteEngine On RewriteRule .*robots\.txt$ C:\xampp\vhosts\override-robots.txt [L] 谢谢!
为了: 增加我的网站的安全性 降低带宽要求 防止收集邮件地址