国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


robots.txt文件的格式

robots文件往往放置于根目錄下,包含一條或更多的記錄,這些記錄通過空行分開(以CR,CR/NL, or NL作為結(jié)束符),每一條記錄的格式如下所示:

"<field>:<optional space><value><optionalspace>"

在該文件中可以使用#進(jìn)行注解,具體使用方法和UNIX中的慣例一樣。該文件中的記錄通常以一行或多行User-agent開始,后面加上若干Disallow和Allow行,詳細(xì)情況如下:

User-agent:該項(xiàng)的值用于描述搜索引擎robot的名字。在"robots.txt"文件中,如果有多條User-agent記錄說明有多個(gè)robot會(huì)受到"robots.txt"的限制,對(duì)該文件來說,至少要有一條User-agent記錄。如果該項(xiàng)的值設(shè)為*,則對(duì)任何robot均有效,在"robots.txt"文件中,"User-agent:*"這樣的記錄只能有一條。如果在"robots.txt"文件中,加入"User-agent:SomeBot"和若干Disallow、Allow行,那么名為"SomeBot"只受到"User-agent:SomeBot"后面的 Disallow和Allow行的限制。

Disallow:該項(xiàng)的值用于描述不希望被訪問的一組URL,這個(gè)值可以是一條完整的路徑,也可以是路徑的非空前綴,以Disallow項(xiàng)的值開頭的URL不會(huì)被 robot訪問。例如"Disallow:/help"禁止robot訪問/help.html、/helpabc.html、/help/index.html,而"Disallow:/help/"則允許robot訪問/help.html、/helpabc.html,不能訪問/help/index.html。"Disallow:"說明允許robot訪問該網(wǎng)站的所有url,在"/robots.txt"文件中,至少要有一條Disallow記錄。如果"/robots.txt"不存在或者為空文件,則對(duì)于所有的搜索引擎robot,該網(wǎng)站都是開放的。

Allow:該項(xiàng)的值用于描述希望被訪問的一組URL,與Disallow項(xiàng)相似,這個(gè)值可以是一條完整的路徑,也可以是路徑的前綴,以Allow項(xiàng)的值開頭的URL 是允許robot訪問的。例如"Allow:/hibaidu"允許robot訪問/hibaidu.htm、/hibaiducom.html、/hibaidu/com.html。一個(gè)網(wǎng)站的所有URL默認(rèn)是Allow的,所以Allow通常與Disallow搭配使用,實(shí)現(xiàn)允許訪問一部分網(wǎng)頁同時(shí)禁止訪問其它所有URL的功能。

使用"*"and"$":Baiduspider支持使用通配符"*"和"$"來模糊匹配url。

"*" 匹配0或多個(gè)任意字符

"$" 匹配行結(jié)束符。

最后需要說明的是:百度會(huì)嚴(yán)格遵守robots的相關(guān)協(xié)議,請(qǐng)注意區(qū)分您不想被抓取或收錄的目錄的大小寫,百度會(huì)對(duì)robots中所寫的文件和您不想被抓取和收錄的目錄做精確匹配,否則robots協(xié)議無法生效。

robots.txt文件用法舉例

來源:百度搜索資源平臺(tái) 百度搜索學(xué)堂


Public @ 2012-09-17 16:08:56

巧用Robots避免蜘蛛黑洞

對(duì)于百度搜索引擎來說,蜘蛛黑洞特指網(wǎng)站通過極低的成本制造出大量參數(shù)過多,及內(nèi)容雷同但具體參數(shù)不同的動(dòng)態(tài)URL ,就像一個(gè)無限循環(huán)的“黑洞”將spider困住,Baiduspider浪費(fèi)了大量資源抓取的卻是無效網(wǎng)頁。比如很多網(wǎng)站都有篩選功能,通過篩選功能產(chǎn)生的網(wǎng)頁經(jīng)常會(huì)被搜索引擎大量抓取,而這其中很大一部分檢索價(jià)值不高,如“500-1000之間價(jià)格的租房”,首先網(wǎng)站(包括現(xiàn)實(shí)中)上基本沒有相關(guān)資源,

Public @ 2020-05-11 16:08:55

301轉(zhuǎn)向的作用和設(shè)置方法

301轉(zhuǎn)向是指在網(wǎng)站代碼中設(shè)置一個(gè)永久重定向,將一個(gè)網(wǎng)頁的URL地址重定向到另一個(gè)URL地址。301轉(zhuǎn)向的作用包括: 1. 改變URL結(jié)構(gòu)時(shí),將舊URL地址重定向到新URL地址,以保持搜索引擎的收錄和排名。 2. 合并或重構(gòu)網(wǎng)站時(shí),將原來的網(wǎng)頁重定向到新的網(wǎng)頁,以避免404錯(cuò)誤頁面的出現(xiàn),同時(shí)保留原來網(wǎng)頁的SEO價(jià)值。 3. 修復(fù)破損的鏈接,將錯(cuò)誤的URL重定向到正確的URL地址。 設(shè)置3

Public @ 2023-04-09 09:50:45

RobotsMETA標(biāo)簽的寫法

Robots META標(biāo)簽中沒有大小寫之分,name="Robots"表示所有的搜索引擎,可以針對(duì)某個(gè)具體搜索引擎寫為name="BaiduSpider"。 content部分有四個(gè)指令選項(xiàng):index、noindex、follow、nofollow,指令間以","分隔。INDEX 指令告訴搜索機(jī)器人抓取該頁面;FOLLOW 指令表示搜索

Public @ 2019-11-07 16:09:03

robots里這樣寫,就能避免蜘蛛爬這個(gè)“index.htm”這個(gè)首頁?

我robots這樣寫是不是就能避免蜘蛛爬這個(gè)“index.htm”這個(gè)首頁?User-agent: *Disallow: /index.htm11-30.我的index.htm是現(xiàn)在默認(rèn)的首頁,想屏蔽蜘蛛抓取。讓蜘蛛爬另一個(gè)文檔,主要是規(guī)避備案巡查我的網(wǎng)站和我備案的不一樣,服務(wù)器那邊要求改,我就整了個(gè)htm文檔來規(guī)避下。寫法沒有問題。但正常的不建議屏蔽首頁地址,,“index.htm”這個(gè)后綴地址

Public @ 2019-12-16 16:09:25

更多您感興趣的搜索

0.434939s