一、robots基本概念
robots.txt文件是网站的一个文件,它是给搜索引擎蜘蛛看的。搜索引擎蜘蛛爬行道我们的网站首先就是抓取这个文件,根据里面的内容来决定对网站文件访问的范围。它能够保护我们的一些文件不暴露在搜索引擎之下,从而有效的控制蜘蛛的爬取路径,为我们站长做好seo创造必要的条件。尤其是我们的网 站刚刚创建,有些内容还不完善,暂时还不想被搜索引擎收录时。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
几点注意:文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
网站必须要有一个robot.txt文件。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
robots.txt文件应该放置在网站根目录下文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
文件名是小写字母。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
当需要完全屏蔽文件时,需要配合meta的robots属性。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
二、robots.txt的基本语法
内容项的基本格式:键: 值对。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
1) User-Agent键文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
后面的内容对应的是各个具体的搜索引擎爬行器的名称。如百度是Baiduspider,谷歌是Googlebot。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
一般我们这样写:文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-Agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
表示允许所有搜索引擎蜘蛛来爬行抓取。如果只想让某一个搜索引擎蜘蛛来爬行,在后面列出名字即可。如果是多个,则重复写。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
注意:User-Agent:后面要有一个空格。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
在robots.txt中,键后面加:号,后面必有一个空格,和值相区分开。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
2)Disallow键文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
该键用来说明不允许搜索引擎蜘蛛抓取的URL路径。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例如:Disallow: /index.php 禁止网站index.php文件文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Allow键文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
该键说明允许搜索引擎蜘蛛爬行的URL路径文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例如:Allow: /index.php 允许网站的index.php文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
通配符*文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
代表任意多个字符文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例如:Disallow: /*.jpg 网站所有的jpg文件被禁止了。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
结束符$文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
表示以前面字符结束的url。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例如:Disallow: /?$ 网站所有以?结尾的文件被禁止。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
三、robots.txt实例分析
例1. 禁止所有搜索引擎访问网站的任何部分文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例2. 允许所有的搜索引擎访问网站的任何部分文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow:文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例3. 仅禁止Baiduspider访问您的网站文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: Baiduspider文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例4. 仅允许Baiduspider访问您的网站文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: Baiduspider文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow:文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例5. 禁止spider访问特定目录文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /cgi-bin/文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /tmp/文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /data/文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
注意事项:1)三个目录要分别写。2)请注意最后要带斜杠。3)带斜杠与不带斜杠的区别。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例6. 允许访问特定目录中的部分url文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
我希望a目录下只有b.htm允许访问,怎么写?文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Allow: /a/b.htm文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /a/文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
注:允许收录优先级要高于禁止收录。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
从例7开始说明通配符的使用。通配符包括(“$” 结束符;文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
“*”任意符)文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例7. 禁止访问网站中所有的动态页面文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /*?*文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
例8. 禁止搜索引擎抓取网站上所有图片文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
User-agent: *文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /*.jpg$文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /*.jpeg$文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /*.gif$文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /*.png$文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
Disallow: /*.bmp$文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
其他很多情况呢,需要具体情况具体分析。只要你了解了这些语法规则以及通配符的使用,相信很多情况是可以解决的。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
四、meta robots标签
meta是网页html文件的head标签里面的标签内容。它规定了此html文件对与搜索引擎的抓取规则。与robot.txt 不同,它只针对写在此html的文件。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
写法:文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
<meta name=”robots” content=”…” />。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
…里面的内容列出如下文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
noindex – 阻止页面被列入索引。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
nofollow – 阻止对于页面中任何超级链接进行索引。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
noarchive – 不保存该页面的网页快照。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
nosnippet – 不在搜索结果中显示该页面的摘要信息,同时不保存该页面的网页快照。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html
noodp – 在搜索结果中不使用Open Directory Project中的描述信息作为其摘要信息。文章源自菜鸟学院-https://www.cainiaoxueyuan.com/youhua/2869.html