我有这个robots.txt文件: User-agent: * Sitemap: Path_to_sitemap.xml 我的问题是,我还应该有其他的东西吗? 像允许所有或东西? 谢谢
我的networking服务器运行( apache 2.4.10 )不同的虚拟主机为以下域名: foo.example.com bar.example.com www.example.com example.com 这是我的虚拟主机的configuration文件: <VirtualHost *:80> DocumentRoot /var/www/ Redirect 404 / ErrorLog ${APACHE_LOG_DIR}/error.log CustomLog ${APACHE_LOG_DIR}/access.log combined </VirtualHost> <VirtualHost *:80> ServerName foo.example.com DocumentRoot /var/www/foo/ ErrorLog ${APACHE_LOG_DIR}/foo-error.log CustomLog ${APACHE_LOG_DIR}/foo-access.log combined </VirtualHost> <VirtualHost *:80> ServerName bar.example.com DocumentRoot /var/www/bar/ ErrorLog ${APACHE_LOG_DIR}/bar-error.log CustomLog ${APACHE_LOG_DIR}/bar-access.log combined </VirtualHost> <VirtualHost *:80> ServerName example.com ServerAlias www.example.com DocumentRoot /var/www/www/ ErrorLog […]
我们开发网站,并将QA环境托pipe在与生产环境相同的服务器上。 我想为所有质量检查站点提供特定的robots.txt,但不是针对生产站点。 我们有很多站点,所以我不想更新数百个虚拟主机configuration块。 QA站点很容易从域名和目录中识别.QA和生产站点分为两个不同的目录。 所有质量检查站点都托pipe在* .qa.mycompany.com下。 生产示例:host:example.org docroot:/var/www/production/example.org 示例QA:host:example.qa.mycompany.com docroot:/var/www/qa/example.org 有没有办法将Apacheconfiguration为为所有QA站点提供robots.txt,而不需要更新所有QA vhostconfiguration?
以下robots.txt语法是否能正确阻止以“_.php”结尾的网站上的所有页面? 我不想意外阻止其他页面。 User-Agent: * Disallow: /*_.php 另外,我允许在同一robots.txt文件中同时具有“允许:/”和“禁止:”命令吗? 谢谢!
我想使用Varnish 2.1生成一个robots.txt文件。 这意味着domain.com/robots.txt是使用Varnish服务的,而且subdomain.domain.com/robots.txt也是使用Varnish服务的。 robots.txt必须硬编码到default.vcl文件中。 那可能吗? 我知道清漆会产生错误的维护页面。 我试图让它生成一个robots.txt文件。 谁能帮忙? sub vcl_error { set obj.http.Content-Type = "text/html; charset=utf-8"; synthetic {" <?xml version="1.0" encoding="utf-8"?> <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Strict//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-strict.dtd"> <html> <head> <title>Maintenance in progress</title> </head> <body> <h1>Maintenance in progress</h1> </body> </html> "}; return (deliver); }
我们知道,我们可以阻止某些蜘蛛使用robots.txt或.htaccess或者通过Apacheconfiguration文件httpd.conf来抓取网页。 但是这需要编辑可能是一些专用服务器上的大量网站,机器人仍然会“访问”和消耗资源。 是否有任何其他“安全”的方式来阻止这些IMG蜘蛛从根服务器像Windows服务器?
我已经看到了很多robot.txt的东西,还有一些mod改写的解决scheme,看起来很有前途……但是一直没能find一个简单的解决scheme来阻止Spiders / Scrapers /无论我想阻挡谁…我宁愿做这个主机名/域,因为它似乎比依靠用户代理等更简单… 例如,说我在Apache日志中看到这个 msnbot-207-46-192-48.search.msn.com – – [07/Dec/2011:23:01:41 -0500] "GET /%3f/$/bluebox/blog/2011/iphoto/ HTTP/1.1" 404 366 好的…我想阻止*.search.msn.com来到这里,或任何我的网站 – 在我的任何文件夹 – VHOST或其他… 通常情况下,我有很多<VirtualHost *.80>的设置,并不想重复每个主机的configuration。在同样的情况下,我有很多DocumentRoot的…并在其中每个文件,又名.htaccess真的不是一个选项.. 我一直在使用httpd.conf中的东西,类似于… RewriteEngine on RewriteCond %{HTTP_USER_AGENT} ^BadBot [OR] RewriteRule ^(.*)$ http://go.away/` 我如何使用UseCanonicalName On提供的主机名来覆盖 – Deny all我想要的域名?
我们有一个专门的开发服务器,只在公共networking上运行testingPHP应用程序。 我们已经为该站点设置了基于会话的身份validation。 我们遇到的问题是robots.txt的访问日志中logging了很多404。 所以,我们想要阻止/忽略lighttpd上的这些请求来节省一些带宽。 我们如何在lighttpd / 1.4.31中做到这一点?
我有这个robots.txt: User-Agent: * Disallow: /files/ User-Agent: ia_archiver Allow: / User-agent: Googlebot Disallow: User-agent: googlebot-image Disallow: User-agent: googlebot-mobile Disallow: 我发现/ files /目录中的PDF文件正在被Google索引。 我应该把第一个入口移到底部吗? 与Google的网站pipe理员工具一起工作。 我将/ files / disallow移动到底部,并在文件目录中的一个PDF文件上运行testing,并返回Success。 我该如何解决这个问题? 我们不希望这个目录中的任何东西被索引。 EDITED 即使我除了第一个条款之外, User-Agent: * Disallow: /files/ Google仍然可以在/ files /目录中看到PDF,我在这里做错了什么? 在Bing的网站pipe理员工具中,它显示为阻止,但Google仍显示成功。
我有两个域名指向同一个虚拟服务器。 其中之一, http://ilarikaila.com ,是我为朋友制作的工作手册网站。 我使用另一个http://teemuleisti.com在公开之前对网站进行testing – 回想起来,这可能是个坏主意。 很长一段时间,Google-bot在两个方面对于search“ilari kaila”感到困惑,但是当我写这个的时候,第二个问题似乎已经消失了( 编辑时加上:不,它没有)。 混淆第一 “ilari kaila”的Googlesearch结果中包含ilarikaila.com,但仅包含结果的第三页,而不是来自网站的摘录,结果中包含文字“此结果的描述不可用,因为这个网站的robots.txt – 了解更多。“ robots.txt文件的内容很简单 User-agent: * Allow: / 这当然不应该阻止任何机器人列出网站的内容。 事实上,当serge的术语“ilari kaila”被送入bing.com时 ,该网站就成为第一个search结果(和stlil),并且显示了一个正确的片段。 几天前,我完全删除了robots.txt (或更名为not_robots.txt ),但Google仍然显示相同的结果,指的是robots.txt。 (这可能是网站只出现在search结果的第三页上的原因。) 混淆第二 最初,对teemuleisti.com的请求显示与ilarikaila.com相同的页面,因为我没有为我的nginx.conf文件中的前者编写单独的server块。 几个星期前,我做了这个,为前一个网站写了一个非常简单的HTML页面。 尽pipe如此,谷歌search“ilari kaila”的search结果甚至在我进行前两个星期之前,甚至一个小时之前,也显示了与teemuleisti.com网站的链接。 然而,这个问题似乎已经解决( 编辑时添加:不,它没有),当我写这个问题,也许是因为我只是添加了以下redirect到服务器的nginx.conf文件: server { listen 80; server_name teemuleisti.com www.teemuleisti.com; … location = /index.html { break; } location ~* ^/(.+)$ { rewrite ^ […]