国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


Robots文件的作用和規(guī)范寫法

控制頁(yè)面的抓取、索引是SEO優(yōu)化網(wǎng)站結(jié)構(gòu)時(shí)經(jīng)常需要用到的技術(shù)。常見(jiàn)的工具包括:

robots文件

頁(yè)面的noindex標(biāo)簽

鏈接的nofollow屬性

頁(yè)面的301轉(zhuǎn)向

頁(yè)面的canonical標(biāo)簽等

這幾個(gè)工具各有各的特定應(yīng)用場(chǎng)景,但都是用于控制網(wǎng)站內(nèi)部結(jié)構(gòu),之間容易混淆,還經(jīng)常需要配合使用,SEO們必須準(zhǔn)確理解這幾個(gè)工具的機(jī)制和原理,不然很容易出錯(cuò)。

這篇貼子討論robots文件。

Robots文件的作用

robots文件是一個(gè)放置在域名(或子域名)根目錄下的、文件名固定為robots.txt的(全部小寫)、UTF8編碼的、純ASCII文本文件,用來(lái)通知搜索引擎,網(wǎng)站的哪些部分可以抓取,哪些禁止抓取。robots.txt只對(duì)所在的域名(或子域名)、協(xié)議和端口號(hào)起作用。

搜索引擎蜘蛛在抓取網(wǎng)站頁(yè)面前,會(huì)先看一下robots.txt的內(nèi)容,哪些頁(yè)面可以抓取,哪些頁(yè)面被站長(zhǎng)禁止抓取。當(dāng)然,是否遵守robots文件的規(guī)則就靠自覺(jué)了,某些壞蜘蛛就不遵守,站長(zhǎng)是沒(méi)辦法的,比如采集內(nèi)容的、克隆網(wǎng)站的。

所以,robots.txt文件是站長(zhǎng)禁止搜索引擎抓取某些頁(yè)面的指令。但是要注意,頁(yè)面沒(méi)有被抓取,不意味著頁(yè)面就不會(huì)被索引和收錄,這是兩個(gè)概念。詳情參考爬行、抓取、索引的概念介紹貼子。

怎樣寫Robots文件

Robots文件的每行記錄均由一個(gè)字段、一個(gè)冒號(hào)和一個(gè)值組成,標(biāo)準(zhǔn)格式是:

<field>:<optional space><value><optional space><#optional-comment>

其中<optional space>指的是可以加一個(gè)空格,但不是必須,通常建議加這個(gè)空格,比較容易讀。

<#optional-comment>是另一個(gè)可選項(xiàng),用于寫些注釋。

通常robots文件中的記錄通常以User-agent開(kāi)始,后面加上若干Disallow和Allow行。User-agent指定本記錄用于哪個(gè)搜索引擎蜘蛛,Disallow是指定禁止抓取的文件或目錄,Allow是指定允許抓取的文件或記錄。

所有搜索引擎都支持的robots文件記錄包括:

Disallow – 告訴蜘蛛不要抓取某些文件或目錄。如下面代碼將阻止所有蜘蛛抓取所有的網(wǎng)站文件:

User-agent: *

Disallow: /

Allow – 告訴蜘蛛應(yīng)該抓取某些文件。Allow和Disallow配合使用,可以告訴蜘蛛某個(gè)目錄下,大部分都不抓取,只抓取一部分。如下面代碼將使蜘蛛不抓取ab目錄下其他文件,而只抓取其中cd下的文件:

User-agent: *

Disallow: /ab/

Allow: /ab/cd

$通配符 – 匹配URL結(jié)尾的字符。如下面代碼將允許蜘蛛訪問(wèn)以.htm為后綴的URL:

User-agent: *

Allow: .htm$

*通配符 – 告訴蜘蛛匹配任意一段字符。如下面一段代碼將禁止所有蜘蛛抓取所有htm文件:

User-agent: *

Disallow: /*.htm

Sitemaps位置 – 告訴蜘蛛你的網(wǎng)站地圖在哪里,格式為:

Sitemap: <sitemap_location>

Robots文件的注意事項(xiàng)

另外提醒大家注意的是,robots.txt文件可以不存在,返回404錯(cuò)誤,意味著允許蜘蛛抓取所有內(nèi)容。但抓取robots.txt文件時(shí)卻發(fā)生超時(shí)之類的錯(cuò)誤,可能導(dǎo)致搜索引擎不收錄網(wǎng)站,因?yàn)橹┲氩恢纑obots.txt文件是否存在或者里面有什么內(nèi)容,這與確認(rèn)文件不存在是不一樣的。

另外,如果robots.txt文件不存在,而404頁(yè)面上包含一些URL,可能會(huì)造成搜索引擎誤將404頁(yè)面的內(nèi)容當(dāng)作robots文件的內(nèi)容,導(dǎo)致無(wú)法預(yù)測(cè)的后果。所以,即使想開(kāi)放所有搜索引擎蜘蛛抓取所有內(nèi)容,也最好放一個(gè)robots文件,哪怕是空的文件。

Robots文件的檢測(cè)

寫好robots文件后如果不確定是否寫得正確,可以用搜索引擎官方工具檢測(cè)驗(yàn)證。如百度資源平臺(tái)的robots文件驗(yàn)證工具 https://ziyuan.baidu.com/robots/index

robots文件檢測(cè)驗(yàn)證工具

輸入網(wǎng)址后,驗(yàn)證工具會(huì)告訴你這個(gè)URL是否允許被抓取。

掌握robots文件用法和寫法是SEO的基本功。遇到頁(yè)面不被收錄或收錄驟降,robots文件也是第一個(gè)要檢查的。

來(lái)源:seo每天一貼 Zac 昝輝


Public @ 2012-12-30 16:09:20

百度robots中的user-agent

百度各個(gè)產(chǎn)品使用不同的user-agent:無(wú)線搜索Baiduspider-mobile圖片搜索Baiduspider-image視頻搜索Baiduspider-video新聞搜索Baiduspider-news百度搜藏Baiduspider-favo百度聯(lián)盟Baiduspider-cpro商務(wù)搜索Baiduspider-ads網(wǎng)頁(yè)以及其他搜索Baiduspider來(lái)源:360站長(zhǎng)平臺(tái)

Public @ 2022-11-11 16:09:02

RobotsMETA標(biāo)簽的寫法

Robots META標(biāo)簽中沒(méi)有大小寫之分,name="Robots"表示所有的搜索引擎,可以針對(duì)某個(gè)具體搜索引擎寫為name="BaiduSpider"。 content部分有四個(gè)指令選項(xiàng):index、noindex、follow、nofollow,指令間以","分隔。INDEX 指令告訴搜索機(jī)器人抓取該頁(yè)面;FOLLOW 指令表示搜索

Public @ 2019-11-07 16:09:03

什么是meta robots 標(biāo)簽?meta robots 標(biāo)簽的寫法

Meta robots標(biāo)簽是一種HTML頭部元數(shù)據(jù)標(biāo)簽,用于指示搜索引擎如何處理指定頁(yè)面的內(nèi)容。它告訴網(wǎng)絡(luò)爬蟲(chóng)如何爬取索引優(yōu)化。這些標(biāo)簽是在和之間添加的,旨在為“robots(搜索引擎蜘蛛)”提供有關(guān)如何索引和緩存頁(yè)面內(nèi)容的指令。 以下是meta robots標(biāo)簽的寫法: - - - - 其中,“content”屬性指定一組用逗號(hào)分隔的值,可以是以下之一: - index:告訴爬

Public @ 2023-04-05 21:50:30

更多您感興趣的搜索

0.465295s