国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


搜索引擎蜘蛛對于網(wǎng)站抓取是否很智能?如何引導蜘蛛?

盡管搜索引擎在不斷的升級算法,但是終究其還是程序,因此我們在布局網(wǎng)站結構的時候要盡可能的讓搜索引擎蜘蛛能看的懂。每個搜索引擎蜘蛛都有自己的名字,在抓取網(wǎng)頁的時候,都會向網(wǎng)站標明自己的身份。搜索引擎蜘蛛在抓取網(wǎng)頁的時候會發(fā)送一個請求,這個請求中就有一個字段為User-agent,用于標識此搜索引擎蜘蛛的身份。

例如Google搜索引擎蜘蛛的標識為GoogleBot,百度搜索引擎蜘蛛的標識為Baidu spider,Yahoo搜索引擎蜘蛛的標識為Inktomi Slurp。如果在網(wǎng)站上有訪問日志記錄,網(wǎng)站管理員就能知道,哪些搜索引擎的搜索引擎蜘蛛過來過,什么時候過來的,以及讀了多少數(shù)據(jù)等等。如果網(wǎng)站管理員發(fā)現(xiàn)某個蜘蛛有問題,就通過其標識來和其所有者聯(lián)系。

搜索引擎蜘蛛進入一個網(wǎng)站,一般會訪問一個特殊的文本文件Robots.txt,這個文件一般放在網(wǎng)站服務器的根目錄下,網(wǎng)站管理員可以通過robots.txt來定義哪些目錄搜索引擎蜘蛛不能訪問,或者哪些目錄對于某些特定的搜索引擎蜘蛛不能訪問。例如有些網(wǎng)站的可執(zhí)行文件目錄和臨時文件目錄不希望被搜索引擎搜索到,那么網(wǎng)站管理員就可以把這些目錄定義為拒絕訪問目錄。Robots.txt語法很簡單,例如如果對目錄沒有任何限制,可以用以下兩行來描述。

User-agent: *

Disallow:

當然,Robots.txt只是一個協(xié)議,如果搜索引擎蜘蛛的設計者不遵循這個協(xié)議,網(wǎng)站管理員也無法阻止搜索引擎蜘蛛對于某些頁面的訪問,但一般的搜索引擎蜘蛛都會遵循這些協(xié)議,而且網(wǎng)站管理員還可以通過其它方式來拒絕搜索引擎蜘蛛對某些網(wǎng)頁的抓? ?

搜索引擎蜘蛛在下載網(wǎng)頁的時候,會去識別網(wǎng)頁的HTML代碼,在其代碼的部分,會有META標識。通過這些標識,可以告訴搜索引擎蜘蛛本網(wǎng)頁是否需要被抓取,還可以告訴搜索引擎蜘蛛本網(wǎng)頁中的鏈接是否需要被繼續(xù)跟蹤。例如:表示本網(wǎng)頁不需要被抓取,但是網(wǎng)頁內(nèi)的鏈接需要被跟蹤。

現(xiàn)在一般的網(wǎng)站都希望搜索引擎能更全面的抓取自己網(wǎng)站的網(wǎng)頁,因為這樣可以讓更多的訪問者能通過搜索引擎找到此網(wǎng)站。為了讓本網(wǎng)站的網(wǎng)頁更全面被抓取到,網(wǎng)站管理員可以建立一個網(wǎng)站地圖,即Site Map。許多搜索引擎蜘蛛會把sitemap.htm文件作為一個網(wǎng)站網(wǎng)頁爬取的入口,網(wǎng)站管理員可以把網(wǎng)站內(nèi)部所有網(wǎng)頁的鏈接放在這個文件里面,那么搜索引擎蜘蛛可以很方便的把整個網(wǎng)站抓取下來,避免遺漏某些網(wǎng)頁,也會減小對網(wǎng)站服務器的負擔。(Google專門為網(wǎng)站管理員提供了XML的Sitemap)

搜索引擎建立網(wǎng)頁索引,處理的對象是文本文件。對于搜索引擎蜘蛛來說,抓取下來網(wǎng)頁包括各種格式,包括html、圖片、doc、pdf、多媒體、動態(tài)網(wǎng)頁及其它格式等。這些文件抓取下來后,需要把這些文件中的文本信息提取出來。準確提取這些文檔的信息,一方面對搜索引擎的搜索準確性有重要作用,另一方面對于搜索引擎蜘蛛正確跟蹤其它鏈接有一定影響。

對于doc、pdf等文檔,這種由專業(yè)廠商提供的軟件生成的文檔,廠商都會提供相應的文本提取接口。搜索引擎蜘蛛只需要調(diào)用這些插件的接口,就可以輕松的提取文檔中的文本信息和文件其它相關的信息。

HTML等文檔不一樣,HTML有一套自己的語法,通過不同的命令標識符來表示不同的字體、顏色、位置等版式,如:、、等,提取文本信息時需要把這些標識符都過濾掉。過濾標識符并非難事,因為這些標識符都有一定的規(guī)則,只要按照不同的標識符取得相應的信息即可。但在識別這些信息的時候,需要同步記錄許多版式信息。

除了標題和正文以外,會有許多廣告鏈接以及公共的頻道鏈接,這些鏈接和文本正文一點關系也沒有,在提取網(wǎng)頁內(nèi)容的時候,也需要過濾這些無用的鏈接。例如某個網(wǎng)站有“產(chǎn)品介紹”頻道,因為導航條在網(wǎng)站內(nèi)每個網(wǎng)頁都有,若不過濾導航條鏈接,在搜索“產(chǎn)品介紹”的時候,則網(wǎng)站內(nèi)每個網(wǎng)頁都會搜索到,無疑會帶來大量垃圾信息。過濾這些無效鏈接需要統(tǒng)計大量的網(wǎng)頁結構規(guī)律,抽取一些共性,統(tǒng)一過濾;對于一些重要而結果特殊的網(wǎng)站,還需要個別處理。這就需要搜索引擎蜘蛛的設計有一定的擴展性。


Public @ 2020-07-03 16:22:36

蜘蛛抓取有好多動態(tài)鏈接是否有影響?要怎么處理?

蜘蛛抓取動態(tài)鏈接不會有太大影響,但是可能會增加抓取時間和資源消耗。為了減少浪費,可以采取以下措施: 1.使用靜態(tài)鏈接:將動態(tài)鏈接轉換為靜態(tài)鏈接,使用URL Rewrite等工具來實現(xiàn)。 2.限制抓?。和ㄟ^robots.txt文件限制蜘蛛抓取動態(tài)鏈接,只允許抓取靜態(tài)鏈接。 3.使用nofollow屬性:在動態(tài)鏈接中添加nofollow屬性,告訴蜘蛛不要抓取該鏈接。 4.使用canonical

Public @ 2023-04-12 02:00:27

蜘蛛程序(spider)

蜘蛛也稱為機器人,指的是查找引擎運行的核算機程序,沿著頁面上的超鏈接發(fā)現(xiàn)和匍匐更多頁面,抓取頁面內(nèi)容,關入查找引擎數(shù)據(jù)庫?! ≈┲氤绦蚓褪琴橘氤绦?,是查找引擎的一部分,擔任在互聯(lián)網(wǎng)上定位和收這樣可以呼應查找者的懇求,成功的查找引擎營銷取決于爬的網(wǎng)頁。

Public @ 2019-05-11 16:22:38

網(wǎng)站抓取了一些不存在的目錄跟頁面?

網(wǎng)站抓取了一些不存在的目錄跟頁面,本站倒是一個都不抓取是怎么回事?微信 懸賞網(wǎng)站抓取了一些不存在的目錄跟頁面,本站倒是一個都不抓取是怎么回事?要如何做才能讓百度來抓取本站頁面,一個多頁了啥都沒抓取,謎一樣。。。以下抓取頁面都不存在,另外網(wǎng)站例如新聞頁面生成的文章在根目錄是沒有的,應該是動態(tài)的,這是否導致都不抓取了呢?回答:你確定蜘蛛是真的百度蜘蛛嗎?99.99%的概率是假蜘蛛,不是真的!來源:A5

Public @ 2010-05-17 16:05:02

蜘蛛抓取過程中涉及的網(wǎng)絡協(xié)議有哪些

搜索引擎通過站長們提供資源,來滿足用戶的搜索需求,而站長通過搜索引擎將網(wǎng)站的內(nèi)容傳播出去,獲得有效的流量和用戶。蜘蛛在抓取過程中雙方都要遵守一定的規(guī)范,便于搜索引擎抓取,不要使用過多對搜索引擎不友好的元素。蜘蛛抓取過程中涉及的網(wǎng)絡協(xié)議有以下四種:1、HTTP協(xié)議HTTP是超文本傳輸協(xié)議,在互聯(lián)網(wǎng)上被廣泛應用的一種網(wǎng)絡協(xié)議,客戶端和服務器端請求和應答的標準。用戶通過瀏覽器或蜘蛛等對指定端口發(fā)起一個請

Public @ 2012-07-29 16:22:31

更多您感興趣的搜索

0.582644s