国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


關(guān)于robots.txt的二三事

【Robots簡介】

robots.txt是一個協(xié)議,是搜索引擎訪問網(wǎng)站時第一個要查看的文件,它存在的目的是告訴搜索引擎哪些頁面能被抓取,哪些頁面不能被抓取。

當spider訪問一個站點時,會首先檢查該站點根目錄下是否存在robots.txt,如果存在,spider會按照文件中的內(nèi)容來確定訪問的范圍;如果該文件不存在,所有的spider將能夠訪問網(wǎng)站上所有沒有被口令保護的頁面。

【具體介紹】

1、User-agent用于描述搜索引擎robot的名字。在\robots.txt\文件中,如果有多條User-agent記錄說明有多個robot會受到\robots.txt\的限制,對該文件來說,至少要有一條User-agent記錄。如果該項的值設(shè)為*,則對任何robot均有效,在\robots.txt\文件中,\User-agent:*\這樣的記錄只能有一條。

360搜索支持user-agent命令,包括使用通配符的user-agent命令。

2、Disallow命令指定不建議收錄的文件、目錄。

Disallow值可以是一條完整的路徑,也可以是路徑的非空前綴,以Disallow項的值開頭的URL不會被 robot訪問。

3、Allow命令指定建議收錄的文件、目錄。

Allow值用于描述希望被訪問的一組URL,它的值也可以是一條完整的路徑,也可以是路徑的前綴,以Allow項的值開頭的URL 是允許robot訪問的。

User-agent: * 這里的*代表所有的搜索引擎種類,*是一個通配符,*也可以替換成其他的蜘蛛名稱,例如:Googlebot、yisouspider,表示屏蔽特定搜索引擎的蜘蛛

Disallow: /admin/ 這里定義是禁止爬尋admin目錄下面的目錄

Disallow: /require/ 這里定義是禁止爬尋require目錄下面的目錄

Disallow: /ABC/ 這里定義是禁止爬尋ABC目錄下面的目錄

Disallow: /cgi-bin/*.htm 禁止訪問/cgi-bin/目錄下的所有以\.htm\為后綴的URL(包含子目錄)。

Disallow: /*?* 禁止訪問網(wǎng)站中所有包含問號(?) 的網(wǎng)址

Disallow: /.jpg$ 禁止抓取網(wǎng)頁所有的.jpg格式的圖片

Disallow:/ab/adc.html 禁止爬取ab文件夾下面的adc.html文件。

Allow: /cgi-bin/ 這里定義是允許爬尋cgi-bin目錄下面的目錄

Allow: /tmp 這里定義是允許爬尋tmp的整個目錄

Allow: .htm$ 僅允許訪問以\.htm\為后綴的URL。

Allow: .gif$ 允許抓取網(wǎng)頁和gif格式圖片

Sitemap: 網(wǎng)站地圖,告訴爬蟲這個頁面是網(wǎng)站地圖

【注意事項】

1、robots文件往往放置于根目錄下;

2、當您的網(wǎng)站包含有不希望被搜索引擎收錄的內(nèi)容時,才需要使用robots.txt文件;

3、360搜索會對#這樣形式的robots進行全匹配url處理,所以在寫robots的時候一定要小心,最好寫盡量精確的url通配,不建議做泛匹配

User-agent: *

Disallow: *#*

或者

User-agent: *

Disallow: #

360搜索會把#認為是全部匹配,從而不抓取全部的url,并且會將線上收錄的鏈接做下線處理?。∫虼宋覀儾唤ㄗh站長寫入這樣的規(guī)則!

類似的,如寫成:Disallow: #.html,則會不抓取所有以html為后綴的url

【常見問題】

Robots相關(guān)的常見問題主要是因錯誤書寫robots導致的網(wǎng)站不被360搜索引擎收錄。所以建議站長,當網(wǎng)站出現(xiàn)不收錄時,首先檢查一下robtos文件是否正確。

Robots協(xié)議是一個搜索引擎和網(wǎng)站之間的善意協(xié)議,我們鼓勵站長們也能善意使用這一協(xié)議,除非有充足合理的理由,否則我們一般都不建議使用Robots協(xié)議屏蔽360搜索及其他搜索引擎的蜘蛛。

其他任何不清楚的,還可以訪問咱們的robots百科詞條:

https://baike.so.com/doc/5339174-7435147.html

或參考360搜索針對robots的FAQ:

http://www.so.com/help/help_3_2.html

來源:360站長平臺


Public @ 2017-02-13 16:09:19

robot.txt在SEO中的作用

鑒于網(wǎng)絡(luò)安全與隱私的考慮,搜索引擎遵循robots.txt協(xié)議。通過根目錄中創(chuàng)建的純文本文件robots.txt,網(wǎng)站可以聲明不想被robots訪問的部分。每個網(wǎng)站都可以自主控制網(wǎng)站是否愿意被搜索引擎收錄,或者指定搜索引擎只收錄指定的內(nèi)容。當一個搜索引擎的爬蟲訪問一個站點時,它會首先檢查該站點根目錄下是否存在robots.txt,如果該文件不存在,那么爬蟲就沿著鏈接抓取,如果存在,爬蟲就會按照該文

Public @ 2023-01-27 16:09:31

我的網(wǎng)站擁有幾千萬個網(wǎng)址;我可以只提交最近更改過的網(wǎng)址嗎?

您可以在少數(shù)頻繁更改的 Sitemap 中列出已更新的網(wǎng)址,然后使用 Sitemap 索引文件中的 lastmod 標記識別這些 Sitemap 文件。隨后,百度即可逐步抓取這些已更改的 Sitemap。

Public @ 2011-06-22 16:11:55

robots是什么?

robots是網(wǎng)站跟爬蟲間的協(xié)議,用簡單直接的txt格式文本方式告訴對應的爬蟲被允許的權(quán)限,也就是說robots.txt是搜索引擎中訪問網(wǎng)站的時候要查看的第一個文件。當一個搜索蜘蛛訪問一個站點時,它會首先檢查該站點根目錄下是否存在robots.txt,如果存在,搜索機器人就會按照該文件中的內(nèi)容來確定訪問的范圍;如果該文件不存在,所有的搜索蜘蛛將能夠訪問網(wǎng)站上所有沒有被口令保護的頁面。搜索引擎通過一

Public @ 2017-11-12 16:09:33

robots使用技巧

1. 每當用戶試圖訪問某個不存在的URL時,服務(wù)器都會在日志中記錄404錯誤(無法找到文件)。每當搜索蜘蛛來尋找并不存在的robots.txt文件時,服務(wù)器也將在日志中記錄一條404錯誤,所以你應該在網(wǎng)站中添加一個robots.txt。2. 網(wǎng)站管理員必須使蜘蛛程序遠離某些服務(wù)器上的目錄--保證服務(wù)器性能。比如:大多數(shù)網(wǎng)站服務(wù)器都有程序儲存在"cgi-bin"目錄下,因此在ro

Public @ 2009-05-16 16:09:17

更多您感興趣的搜索

0.455967s