Robots文件的作用和規(guī)范寫法
控制頁(yè)面的抓取、索引是SEO優(yōu)化網(wǎng)站結(jié)構(gòu)時(shí)經(jīng)常需要用到的技術(shù)。常見(jiàn)的工具包括:
robots文件
頁(yè)面的noindex標(biāo)簽
鏈接的nofollow屬性
頁(yè)面的301轉(zhuǎn)向
頁(yè)面的canonical標(biāo)簽等
這幾個(gè)工具各有各的特定應(yīng)用場(chǎng)景,但都是用于控制網(wǎng)站內(nèi)部結(jié)構(gòu),之間容易混淆,還經(jīng)常需要配合使用,SEO們必須準(zhǔn)確理解這幾個(gè)工具的機(jī)制和原理,不然很容易出錯(cuò)。
這篇貼子討論robots文件。
Robots文件的作用
robots文件是一個(gè)放置在域名(或子域名)根目錄下的、文件名固定為robots.txt的(全部小寫)、UTF8編碼的、純ASCII文本文件,用來(lái)通知搜索引擎,網(wǎng)站的哪些部分可以抓取,哪些禁止抓取。robots.txt只對(duì)所在的域名(或子域名)、協(xié)議和端口號(hào)起作用。
搜索引擎蜘蛛在抓取網(wǎng)站頁(yè)面前,會(huì)先看一下robots.txt的內(nèi)容,哪些頁(yè)面可以抓取,哪些頁(yè)面被站長(zhǎng)禁止抓取。當(dāng)然,是否遵守robots文件的規(guī)則就靠自覺(jué)了,某些壞蜘蛛就不遵守,站長(zhǎng)是沒(méi)辦法的,比如采集內(nèi)容的、克隆網(wǎng)站的。
所以,robots.txt文件是站長(zhǎng)禁止搜索引擎抓取某些頁(yè)面的指令。但是要注意,頁(yè)面沒(méi)有被抓取,不意味著頁(yè)面就不會(huì)被索引和收錄,這是兩個(gè)概念。詳情參考爬行、抓取、索引的概念介紹貼子。
怎樣寫Robots文件
Robots文件的每行記錄均由一個(gè)字段、一個(gè)冒號(hào)和一個(gè)值組成,標(biāo)準(zhǔn)格式是:
<field>:<optional space><value><optional space><#optional-comment>
其中<optional space>指的是可以加一個(gè)空格,但不是必須,通常建議加這個(gè)空格,比較容易讀。
<#optional-comment>是另一個(gè)可選項(xiàng),用于寫些注釋。
通常robots文件中的記錄通常以User-agent開(kāi)始,后面加上若干Disallow和Allow行。User-agent指定本記錄用于哪個(gè)搜索引擎蜘蛛,Disallow是指定禁止抓取的文件或目錄,Allow是指定允許抓取的文件或記錄。
所有搜索引擎都支持的robots文件記錄包括:
Disallow – 告訴蜘蛛不要抓取某些文件或目錄。如下面代碼將阻止所有蜘蛛抓取所有的網(wǎng)站文件:
User-agent: *
Disallow: /
Allow – 告訴蜘蛛應(yīng)該抓取某些文件。Allow和Disallow配合使用,可以告訴蜘蛛某個(gè)目錄下,大部分都不抓取,只抓取一部分。如下面代碼將使蜘蛛不抓取ab目錄下其他文件,而只抓取其中cd下的文件:
User-agent: *
Disallow: /ab/
Allow: /ab/cd
$通配符 – 匹配URL結(jié)尾的字符。如下面代碼將允許蜘蛛訪問(wèn)以.htm為后綴的URL:
User-agent: *
Allow: .htm$
*通配符 – 告訴蜘蛛匹配任意一段字符。如下面一段代碼將禁止所有蜘蛛抓取所有htm文件:
User-agent: *
Disallow: /*.htm
Sitemaps位置 – 告訴蜘蛛你的網(wǎng)站地圖在哪里,格式為:
Sitemap: <sitemap_location>
Robots文件的注意事項(xiàng)
另外提醒大家注意的是,robots.txt文件可以不存在,返回404錯(cuò)誤,意味著允許蜘蛛抓取所有內(nèi)容。但抓取robots.txt文件時(shí)卻發(fā)生超時(shí)之類的錯(cuò)誤,可能導(dǎo)致搜索引擎不收錄網(wǎng)站,因?yàn)橹┲氩恢纑obots.txt文件是否存在或者里面有什么內(nèi)容,這與確認(rèn)文件不存在是不一樣的。
另外,如果robots.txt文件不存在,而404頁(yè)面上包含一些URL,可能會(huì)造成搜索引擎誤將404頁(yè)面的內(nèi)容當(dāng)作robots文件的內(nèi)容,導(dǎo)致無(wú)法預(yù)測(cè)的后果。所以,即使想開(kāi)放所有搜索引擎蜘蛛抓取所有內(nèi)容,也最好放一個(gè)robots文件,哪怕是空的文件。
Robots文件的檢測(cè)
寫好robots文件后如果不確定是否寫得正確,可以用搜索引擎官方工具檢測(cè)驗(yàn)證。如百度資源平臺(tái)的robots文件驗(yàn)證工具 https://ziyuan.baidu.com/robots/index
robots文件檢測(cè)驗(yàn)證工具
輸入網(wǎng)址后,驗(yàn)證工具會(huì)告訴你這個(gè)URL是否允許被抓取。
掌握robots文件用法和寫法是SEO的基本功。遇到頁(yè)面不被收錄或收錄驟降,robots文件也是第一個(gè)要檢查的。
來(lái)源:seo每天一貼 Zac 昝輝