国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


robots.txt文件的格式

robots文件往往放置于根目錄下,包含一條或更多的記錄,這些記錄通過(guò)空行分開(kāi)(以CR,CR/NL,or NL作為結(jié)束符),每一條記錄的格式如下所示:

"<field>:<optional space><value><optionalspace>"

在該文件中可以使用#進(jìn)行注解,具體使用方法和UNIX中的慣例一樣。該文件中的記錄通常以一行或多行User-agent開(kāi)始,后面加上若干Disallow和Allow行,詳細(xì)情況如下:

User-agent:該項(xiàng)的值用于描述搜索引擎robot的名字。在"robots.txt"文件中,如果有多條User-agent記錄說(shuō)明有多個(gè)robot會(huì)受到"robots.txt"的限制,對(duì)該文件來(lái)說(shuō),至少要有一條User-agent記錄。如果該項(xiàng)的值設(shè)為*,則對(duì)任何robot均有效,在"robots.txt"文件中,"User-agent:*"這樣的記錄只能有一條。如果在"robots.txt"文件中,加入"User-agent:SomeBot"和若干Disallow、Allow行,那么名為"SomeBot"只受到"User-agent:SomeBot"后面的 Disallow和Allow行的限制。

Disallow:該項(xiàng)的值用于描述不希望被訪問(wèn)的一組URL,這個(gè)值可以是一條完整的路徑,也可以是路徑的非空前綴,以Disallow項(xiàng)的值開(kāi)頭的URL不會(huì)被 robot訪問(wèn)。例如"Disallow:/help"禁止robot訪問(wèn)/help.html、/helpabc.html、/help/index.html,而"Disallow:/help/"則允許robot訪問(wèn)/help.html、/helpabc.html,不能訪問(wèn)/help/index.html。"Disallow:"說(shuō)明允許robot訪問(wèn)該網(wǎng)站的所有url,在"/robots.txt"文件中,至少要有一條Disallow記錄。如果"/robots.txt"不存在或者為空文件,則對(duì)于所有的搜索引擎robot,該網(wǎng)站都是開(kāi)放的。

Allow:該項(xiàng)的值用于描述希望被訪問(wèn)的一組URL,與Disallow項(xiàng)相似,這個(gè)值可以是一條完整的路徑,也可以是路徑的前綴,以Allow項(xiàng)的值開(kāi)頭的URL是允許robot訪問(wèn)的。例如"Allow:/hibaidu"允許robot訪問(wèn)/hibaidu.htm、/hibaiducom.html、/hibaidu/com.html。一個(gè)網(wǎng)站的所有URL默認(rèn)是Allow的,所以Allow通常與Disallow搭配使用,實(shí)現(xiàn)允許訪問(wèn)一部分網(wǎng)頁(yè)同時(shí)禁止訪問(wèn)其它所有URL的功能。

使用"*"and"$":Baiduspider支持使用通配符"*"和"$"來(lái)模糊匹配url。

"*"匹配0或多個(gè)任意字符

"$"匹配行結(jié)束符。

最后需要說(shuō)明的是:百度會(huì)嚴(yán)格遵守robots的相關(guān)協(xié)議,請(qǐng)注意區(qū)分您不想被抓取或收錄的目錄的大小寫(xiě),百度會(huì)對(duì)robots中所寫(xiě)的文件和您不想被抓取和收錄的目錄做精確匹配,否則robots協(xié)議無(wú)法生效。

robots.txt文件用法舉例

來(lái)源:百度搜索資源平臺(tái)


Public @ 2015-08-19 16:08:59

sitemap提交后,多久能被百度抓?。?/a>

通常情況下,sitemap提交后,百度會(huì)在1-2天內(nèi)進(jìn)行抓取。但具體時(shí)間也受到網(wǎng)站規(guī)模、更新頻率、抓取限制等因素的影響。如果長(zhǎng)期未被抓取,可以檢查一下sitemap是否存在問(wèn)題,并通過(guò)百度站長(zhǎng)平臺(tái)的工具進(jìn)行排查。

Public @ 2023-06-16 10:50:16

URL是什么?URL里包含關(guān)鍵詞對(duì)收錄有幫助嗎?

URL是統(tǒng)一資源定位器,是一個(gè)指向網(wǎng)頁(yè)的地址。URL里包含關(guān)鍵詞是對(duì)收錄有幫助的,因?yàn)樗阉饕婵梢酝ㄟ^(guò)URL中的關(guān)鍵詞來(lái)判斷網(wǎng)頁(yè)的主題和內(nèi)容。同時(shí),URL中的關(guān)鍵詞也有助于用戶在搜索結(jié)果中快速找到相關(guān)頁(yè)面。但是,過(guò)多地添加關(guān)鍵詞在URL中會(huì)被搜索引擎認(rèn)為是作弊行為,影響網(wǎng)站的排名。

Public @ 2023-06-10 16:00:11

哪些網(wǎng)站的目錄需求運(yùn)用robots.txt文件制止抓取

1)、圖像目錄圖像是構(gòu)成網(wǎng)站的首要組成元素。跟著現(xiàn)在建站越來(lái)越便利,許多cms的呈現(xiàn),真實(shí)做到了會(huì)打字就會(huì)建網(wǎng)站,而正是由于如此便利,網(wǎng)上呈現(xiàn)了許多的同質(zhì)化模板網(wǎng)站,被重復(fù)運(yùn)用,這樣的網(wǎng)站查找引擎是必定不喜愛(ài)的,就算是你的網(wǎng)站被錄入了,那你的作用也是很差的。若是你非要用這種網(wǎng)站的話,主張你大概在robots.txt文件中進(jìn)行屏蔽,一般的網(wǎng)站圖像目錄是:imags 或許 img;2)、網(wǎng)站模板目錄如

Public @ 2015-08-28 16:09:28

robots使用技巧

以下是一些使用robots.txt文件的技巧和最好的做法: 1. 不要放棄robots.txt - 一些網(wǎng)站管理員沒(méi)有robots.txt文件,因?yàn)樗麄冋J(rèn)為這是保護(hù)網(wǎng)站的安全措施,但事實(shí)上它可能會(huì)影響搜索引擎爬取。 2. 維護(hù)一個(gè)更新的robots.txt文件 - 確保您的robots.txt文件不是過(guò)時(shí)的。如果您從網(wǎng)站上刪除了某些頁(yè)面或文件夾,請(qǐng)務(wù)必更新文件以反映更改。 3. 不要使用ro

Public @ 2023-05-28 16:00:31

更多您感興趣的搜索

0.629346s