国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


巧用robots文件管理引導(dǎo)搜索引擎蜘蛛對網(wǎng)站的抓取

許多年前,讓網(wǎng)站被搜索引擎選中包括填寫表格,注冊該網(wǎng)站,并手動編輯希望該網(wǎng)站被搜索的關(guān)鍵詞,這個過程隨著搜索引擎網(wǎng)絡(luò)爬蟲或網(wǎng)絡(luò)蜘蛛的出現(xiàn)而改變。本文就robots相關(guān)內(nèi)容,做詳細的介紹。

什么是搜索引擎蜘蛛?

搜索引擎蜘蛛是一種自動程序,它沿著從一個網(wǎng)頁到另一個網(wǎng)頁的鏈接在互聯(lián)網(wǎng)上爬行,為內(nèi)容編制索引并將其添加到數(shù)據(jù)庫中。這意味著,只要網(wǎng)站有一個來自其他網(wǎng)站且搜索引擎已經(jīng)知道的鏈接,然后它會找到隨著時間的推移。鏈接到站點越多,發(fā)生這種情況的速度就越快。

不幸的是,這些蜘蛛可以非常密集地訪問網(wǎng)站。這是因為他們加載每個頁面和文件,以便為數(shù)據(jù)庫編目。蜘蛛會導(dǎo)致虛擬專用數(shù)據(jù)庫負載過高,可能會給訪問者帶來問題。為了幫助解決這些負載問題,有一種標(biāo)準(zhǔn)化的方法來控制這些爬蟲的行為,方法是將名為robots.txt的文件放在網(wǎng)站的根目錄中。但是,沒有任何強制遵守此文件的內(nèi)容。所以,雖然大多數(shù)網(wǎng)絡(luò)搜索引擎爬蟲會服從它,但有些爬蟲可能不會。

robots.txt文件有特定的形式,請看以下示例:

User-agent: googlebot

Disallow: /images

Allow: /images/metadata

crawl-delay: 2

sitemap: /sitemap.xml

按順序查看每個指令行:

首先從“User-agent”(用戶代理)行開始:機器人或網(wǎng)絡(luò)瀏覽器將使用用戶代理來標(biāo)識自身,而各種搜索引擎爬蟲將擁有自己的用戶代理。遵循“User-agent”指令的任何其他指令將僅對給定的用戶代理有效。帶星號(*)的用戶代理將被視為引用所有用戶代理。在示例文件中,該指令與googlebot搜索引擎蜘蛛程序相關(guān)。

“Disallow”(禁止)指令用于告訴搜索引擎蜘蛛程序有關(guān)不加載的目錄或文件。需要注意的是,盡管搜索引擎蜘蛛不會加載文件,如果它跟蹤到它們的鏈接,它仍然會在搜索結(jié)果中列出這些文件。因此,它不能用來阻止頁面出現(xiàn)在搜索結(jié)果中?!癉isallow”可能是所有搜索引擎蜘蛛都支持的唯一指令。因此在示例中,不允許爬行/images目錄。

“Allow”(允許)指令可用于指定搜索引擎蜘蛛可以加載的禁止目錄中的文件或目錄。雖然并不是所有的搜索引擎蜘蛛都支持這個指令,但大多數(shù)蜘蛛都支持。在示例中,允許蜘蛛加載 /images/metadata目錄中的文件。

下一個指令是“crawl-delay”(爬行延遲),惠州網(wǎng)站建設(shè)它以秒為單位給出蜘蛛在加載下一頁之前將等待的數(shù)字。這是降低蜘蛛速度的最好方法,盡管可能不想讓數(shù)字太高,除非站點上只有很少的頁面,因為這將極大地限制蜘蛛每天可以加載的頁面數(shù)量。

最后,是“sitemap”(網(wǎng)站地圖)指令,可以將蜘蛛引導(dǎo)到網(wǎng)站的XML網(wǎng)站地圖文件,它也可以用來幫助網(wǎng)站進行索引。

控制搜索引擎蜘蛛

在robots.txt中可以填充盡可能多或很少的用戶代理,以控制訪問站點的方式。對于所有蜘蛛來說,從一個用戶代理區(qū)開始,然后為特定的蜘蛛添加單獨的部分是有意義的,因為它們可能會給站點帶來問題。創(chuàng)建了robots.txt之后,就需要對它進行測試,以確保它是有效的。如果語法中出現(xiàn)輸入錯誤或拼寫錯誤,則可能會導(dǎo)致蜘蛛忽略正在設(shè)置的規(guī)則。幸運的是,有很多測試它的工具,還有一些主要的搜索引擎,比如谷歌提供的測試工具。(來源:夫唯seo特訓(xùn)營)


Public @ 2017-11-23 16:09:28

網(wǎng)站導(dǎo)航怎么設(shè)計?網(wǎng)站導(dǎo)航設(shè)計注意事項

清晰的導(dǎo)航系統(tǒng)是網(wǎng)站設(shè)計的重要部分之一。網(wǎng)站導(dǎo)航的作用就是引導(dǎo)用戶快速找到主要信息,指引用戶到達目標(biāo)頁面,合理的導(dǎo)航設(shè)計大大提升用戶的體驗感,提高搜索引擎對網(wǎng)站的友好性。站在SEO角度上,網(wǎng)站導(dǎo)航怎么設(shè)計?1、文字導(dǎo)航使用HTML文字導(dǎo)航,文字鏈接對搜索引擎阻力最小的抓取通道,因此不要在導(dǎo)航上給搜索引擎設(shè)置任何的障礙。2、錨文本包含關(guān)鍵詞為了提升關(guān)鍵詞的排名,可以針對某些關(guān)鍵詞做錨文本,記住避免過

Public @ 2020-07-11 16:11:45

網(wǎng)站結(jié)構(gòu)優(yōu)化:所謂F型結(jié)構(gòu)是指什么

F型結(jié)構(gòu)是一種網(wǎng)頁布局方式,顧名思義,它的布局和字母“F”類似。網(wǎng)頁中的主要內(nèi)容通常位于頁面的頂部和左側(cè),而次要內(nèi)容則位于頁面的中部和右側(cè)。這種布局方式可以使用戶更容易地掃描和閱讀網(wǎng)頁,并快速了解主要內(nèi)容。F型結(jié)構(gòu)也可以幫助網(wǎng)站優(yōu)化,將重要信息放在用戶最容易看到的位置,提升網(wǎng)站的用戶體驗和轉(zhuǎn)化率。

Public @ 2023-06-27 21:00:32

禁止搜索引擎收錄的方法

禁止搜索引擎收錄的方法什么是robots.txt文件?搜索引擎使用spider程序自動訪問互聯(lián)網(wǎng)上的網(wǎng)頁并獲取網(wǎng)頁信息。spider在訪問一個網(wǎng)站時,會首先會檢查該網(wǎng)站的根域下是否有一個叫做 robots.txt的純文本文件,這個文件用于指定spider在您網(wǎng)站上的抓取范圍。您可以在您的網(wǎng)站中創(chuàng)建一個robots.txt,在文件中聲明該網(wǎng)站中不想被搜索引擎收錄的部分或者指定搜索引擎只收錄特定的部分

Public @ 2016-10-21 16:09:20

robots.txt文件的格式

"robots.txt"文件包含一條或更多的記錄,這些記錄通過空行分開(以CR,CR/NL, or NL作為結(jié)束符),每一條記錄的格式如下所示:"<field>:<optionalspace><value><optionalspace>"。在該文件中可以使用#進行注解,具體使用方法和UNIX中的慣例一樣。該文件

Public @ 2014-06-28 16:09:17

更多您感興趣的搜索

0.519750s