国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


Google搜索引擎的工作原理

PPCblog.com呈現(xiàn)給我們一幅由Jess Bachman(在WallStats.com工作)精心描繪的示意圖,這張流程圖展示了每天擁有3億次點(diǎn)擊量的Google搜索按鈕背后搜索引擎在那不到1秒的響應(yīng)時(shí)間內(nèi)所進(jìn)行的處理。這張流程圖演示了在你點(diǎn)擊Google搜索按鈕后,在Google返回查詢結(jié)果前那一眨眼的功夫里,Google是如何處理你的搜索請(qǐng)求的?這可是搜索巨人Google年贏利額高達(dá)200億美元的殺手級(jí)應(yīng)用,也是Internet首屈一指的商業(yè)和技術(shù)神話,大家肯定都想知道Google這棵搖錢樹背后的秘密。

Google官方對(duì)其搜索技術(shù)的敘述

我們搜索技術(shù)的后端軟件會(huì)在服務(wù)器側(cè)觸發(fā)一系列執(zhí)行時(shí)間不到1秒的并行計(jì)算,Google問(wèn)世前的傳統(tǒng)搜索引擎的搜索結(jié)果嚴(yán)重依賴于關(guān)鍵詞在頁(yè)面上出現(xiàn)的頻度,我們使用了200多個(gè)指標(biāo)信號(hào)(其中包括我們擁有專利的PageRank頁(yè)面等級(jí)加權(quán)算法)用來(lái)檢查萬(wàn)維網(wǎng)的鏈接結(jié)構(gòu)(佩奇和布林最初的想法是把萬(wàn)維網(wǎng)的鏈接結(jié)構(gòu)用圖論的有向無(wú)環(huán)圖來(lái)建模)并決定網(wǎng)頁(yè)的重要程度,我們假定一個(gè)網(wǎng)頁(yè)的重要程度取決于別的頁(yè)面對(duì)它的引用,就像學(xué)術(shù)論文中的引用指數(shù)一樣,重要的論文總是會(huì)被很多其他論文引用。然后我們?cè)俑鶕?jù)搜索條件進(jìn)行超文本匹配分析(對(duì)bot抓取的頁(yè)面內(nèi)容進(jìn)行關(guān)鍵詞倒排索引檢索)確定跟搜索請(qǐng)求最相關(guān)的網(wǎng)頁(yè)。綜合最重要的網(wǎng)頁(yè)和跟搜索請(qǐng)求最相關(guān)的網(wǎng)頁(yè)兩個(gè)方面,我們就能按重要程度和用戶搜索請(qǐng)求相關(guān)程度把查詢結(jié)果排序后呈現(xiàn)給我們的用戶。

數(shù)據(jù)中心:Google用來(lái)索引世界的塔

Google的數(shù)據(jù)中心高度機(jī)密,我們能了解到的不多:

1. 在美國(guó)本土有19個(gè)以上的數(shù)據(jù)中心,其余17個(gè)數(shù)據(jù)中心分布在美國(guó)以外的世界各地。

2. 每個(gè)數(shù)據(jù)中心有50萬(wàn)平方英尺那么大,建造一個(gè)數(shù)據(jù)中心要花費(fèi)約6億美元。

3. Google數(shù)據(jù)中心是世界上最高效的設(shè)施之一,而且也非常環(huán)保,幾乎沒(méi)有碳排放。

4. 數(shù)據(jù)中心使用50到100兆瓦的電力,由于需要冷卻,通常建在便于用水的地方。

5. Google服務(wù)器安置在一個(gè)一組容得下1160臺(tái)服務(wù)器的有房子那么大的標(biāo)準(zhǔn)集裝箱容器中。

處理流程

1.你寫博客、或在Twitter上推微博、更新站點(diǎn)等諸如此類往Web上添加內(nèi)容的操作

2.Google bots程序(一種作為搜索引擎構(gòu)件的智能代理程序)抓取你網(wǎng)頁(yè)的title和description、keyword等內(nèi)容

(1)Google爬蟲沿著鏈接路徑周游萬(wàn)維網(wǎng),如果沒(méi)有超文本路徑到你的站點(diǎn),你的站點(diǎn)將不會(huì)被索引

(2)如果你在robots.txt中設(shè)置不許索引,Google爬蟲程序?qū)⒉粫?huì)抓取你的網(wǎng)頁(yè)

(3)如果鏈接到你站點(diǎn)的超文本鏈接上有nofollow標(biāo)簽,Google爬蟲將不會(huì)從這些鏈接路徑周游到你的站點(diǎn)。

(4)Google也能通過(guò)blog軟件或xml站點(diǎn)地圖找到你的網(wǎng)站

(5)從PageRank越高的網(wǎng)站鏈接到你的網(wǎng)站的鏈接越多,你的網(wǎng)站的PageRank就越高。

(6)Google爬蟲將周游所有未標(biāo)注為nofollow的鏈接

3.一旦被Google爬蟲訪問(wèn)到,網(wǎng)頁(yè)幾秒內(nèi)就被索引了

(1)網(wǎng)頁(yè)內(nèi)容被存儲(chǔ)在一個(gè)倒排索引中

① 網(wǎng)頁(yè)標(biāo)題和鏈接數(shù)據(jù)被保存在一個(gè)索引中,用于廣度優(yōu)先搜索

② 網(wǎng)頁(yè)內(nèi)容保存在另一個(gè)索引中,以用于檢索頻率不高的長(zhǎng)尾、個(gè)性化、深度優(yōu)先搜索

(2)當(dāng)你用Google搜索時(shí),你并沒(méi)有在檢索時(shí)時(shí)更新的萬(wàn)維網(wǎng),而是在檢索Google的緩存,Google定期更新其索引庫(kù),在Twitter實(shí)時(shí)搜索等的競(jìng)爭(zhēng)下,Google的索引庫(kù)更新周期趨短。

4.Google基于鏈接評(píng)估域名和網(wǎng)頁(yè)的總體PageRank值。

5.檢查網(wǎng)頁(yè)以防止作弊行為

(1) Google的搜索質(zhì)量和反垃圾信息審查和優(yōu)化算法

(2) 1萬(wàn)多遠(yuǎn)程測(cè)試用戶評(píng)價(jià)搜索結(jié)果的質(zhì)量

(3) Google征請(qǐng)用戶對(duì)有PageRank訛詐嫌疑的垃圾信息進(jìn)行舉報(bào)

(4) Google接到 (美國(guó))數(shù)字千年版權(quán)法案的通知,要求Google從搜索結(jié)果中剔除涉嫌盜版的內(nèi)容

6.在對(duì)頁(yè)面做了損害分析后,現(xiàn)在每個(gè)頁(yè)面都有很多用于輔助用戶搜索的數(shù)據(jù)片(比如檢索關(guān)鍵詞)反向引用著它

7.用戶發(fā)出搜索請(qǐng)求

(1)Google搜索質(zhì)量工程師Patrick Riley:在大多數(shù)Google搜索中,你的搜索處于許多并行的控制過(guò)程或Google實(shí)驗(yàn)室的創(chuàng)新項(xiàng)目組過(guò)程中,可以說(shuō)每一個(gè)查詢請(qǐng)求都會(huì)參與一些Google的創(chuàng)意實(shí)驗(yàn)。

8.Google會(huì)用同義詞匹配與你的搜索關(guān)鍵詞語(yǔ)義相近的查詢結(jié)果

9.生成初步的查詢結(jié)果

(1)Google當(dāng)然能返回成千上萬(wàn)數(shù)量無(wú)限的查詢結(jié)果,但一般只顯示不到1000條的查詢結(jié)果,出于“少則得,多則惑”的考慮。(2)對(duì)查詢結(jié)果做本地化處理,本土站點(diǎn)在查詢結(jié)果中優(yōu)先出現(xiàn)

10.對(duì)查詢結(jié)果集按權(quán)威性和PageRank進(jìn)行排序,重復(fù)的查詢結(jié)果被剔除。

(1) Google根據(jù)關(guān)鍵詞、廣告類型、用戶所處位置找出相關(guān)的被競(jìng)價(jià)拍賣的關(guān)鍵詞廣告

(2) 關(guān)鍵詞廣告必須遵守當(dāng)?shù)胤蓷l文

① 廣告業(yè)主的非法廣告將被取締

② 如果關(guān)鍵詞的搜索流量過(guò)低或關(guān)鍵詞廣告點(diǎn)擊量偏低,則會(huì)被自動(dòng)禁用

③ 出于商業(yè)策略,像亞馬遜這樣的客戶會(huì)給予優(yōu)惠折扣。

(3) 關(guān)鍵詞相關(guān)廣告按收益潛力(對(duì)關(guān)鍵詞進(jìn)行競(jìng)價(jià)拍賣后的廣告質(zhì)量不斷進(jìn)行評(píng)估)排序

(4) 對(duì)廣告業(yè)主來(lái)說(shuō)廣告內(nèi)容一般都是固定的,但有時(shí)使用動(dòng)態(tài)關(guān)鍵詞使關(guān)鍵詞廣告與搜索關(guān)鍵詞相關(guān)度更高

① 一些廣告本身允許增加易變的附屬信息,比如網(wǎng)站鏈接、電話號(hào)碼、產(chǎn)品鏈接、地址等

(5) 當(dāng)廣告擁有了相當(dāng)高的點(diǎn)擊率,則會(huì)顯示在搜索結(jié)果列表的上方,以使其更顯眼。

(6) 其余的廣告依序顯示在相應(yīng)的位置

11.對(duì)查詢結(jié)果進(jìn)行過(guò)濾處理

(1) 對(duì)通常的查詢(比如在Google首頁(yè)上發(fā)出的搜索請(qǐng)求),Google會(huì)把相關(guān)的專題性垂直搜索結(jié)果(比如新聞、購(gòu)物、視頻、書籍、地圖等)也加到返回的查詢結(jié)果中

(2) 個(gè)性化方面:用戶訪問(wèn)過(guò)的網(wǎng)站在查詢結(jié)果列表中會(huì)更靠上

(3) 大量使用錨點(diǎn)的網(wǎng)站有可能被從查詢結(jié)果中刪除

(4) 搜索結(jié)果集的聚簇性:如果網(wǎng)頁(yè)被其他高PageRank的網(wǎng)站引用,則網(wǎng)頁(yè)的重要性會(huì)大大提高。

(5) 趨勢(shì)分析:對(duì)搜索流量爆增或有大量新聞的搜索關(guān)鍵詞,Google會(huì)在新的查詢結(jié)果中增加額外的PageRank權(quán)值。(Google有反映關(guān)鍵詞搜索流量的Google趨勢(shì)專題頁(yè)面)

(6) 同一個(gè)域名下的多個(gè)網(wǎng)頁(yè)如果具有相同的PageRank會(huì)被歸為一組。

12. 最終返回給瀏覽器端的用戶一個(gè)人性化的、布局良好的、查詢結(jié)果和廣告涇渭分明的有機(jī)查詢結(jié)果頁(yè)面。

所有這些步驟在總共不到1秒的響應(yīng)時(shí)間內(nèi)完成,每天3億次的點(diǎn)擊量給Google帶來(lái)了超過(guò)200億美元的年收入。

文章來(lái)源:honest Translate

來(lái)源:盧松松博客


Public @ 2013-07-27 16:21:54

搜索引擎收錄網(wǎng)頁(yè)的四個(gè)階段

作為SEO從業(yè)者,不僅要被搜索引擎抓取,還要被收錄,最重要的是在收錄后有良好的排名,本文將簡(jiǎn)單分析下搜索引擎收錄網(wǎng)頁(yè)的四個(gè)階段。每個(gè)網(wǎng)站、每個(gè)網(wǎng)頁(yè)的排名都是不一樣的,看看你的網(wǎng)站處于哪個(gè)階段呢?搜索引擎收錄網(wǎng)頁(yè)的四個(gè)階段 PageRank 搜索引擎 建站教程 第1張網(wǎng)頁(yè)收錄第一階段:大小通吃搜索引擎的網(wǎng)頁(yè)抓取都是采取「大小通吃」的策略,也就是把網(wǎng)頁(yè)中能發(fā)現(xiàn)的鏈接逐一加入到待抓取URL中,機(jī)械性的將

Public @ 2012-08-25 16:22:23

搜索引擎工作原理

搜索引擎的工作原理基本上包括以下幾個(gè)步驟: 1. 網(wǎng)絡(luò)爬蟲:搜索引擎首先會(huì)派出網(wǎng)絡(luò)爬蟲(也稱為蜘蛛或機(jī)器人),自動(dòng)訪問(wèn)互聯(lián)網(wǎng)上的頁(yè)面,并把這些頁(yè)面的內(nèi)容和相關(guān)信息收集下來(lái)。 2. 索引:搜索引擎將爬取到的頁(yè)面內(nèi)容和相關(guān)信息存儲(chǔ)到搜索引擎數(shù)據(jù)庫(kù)中,以方便后續(xù)搜索。 3. 檢索:當(dāng)用戶輸入關(guān)鍵詞進(jìn)行搜索時(shí),搜索引擎會(huì)根據(jù)關(guān)鍵詞從數(shù)據(jù)庫(kù)中檢索相關(guān)的頁(yè)面。 4. 排名:搜索引擎會(huì)根據(jù)一系列算法評(píng)估

Public @ 2023-04-19 05:00:10

搜索引擎工作的基礎(chǔ)流程與原理

搜索引擎工作的基本流程如下: 1. 網(wǎng)絡(luò)爬蟲:首先搜索引擎需要通過(guò)網(wǎng)絡(luò)爬蟲抓取網(wǎng)頁(yè),并對(duì)網(wǎng)頁(yè)進(jìn)行解析,將其中的文本、圖片、鏈接等信息提取出來(lái)。 2. 存儲(chǔ)索引:接著搜索引擎需要將這些信息存儲(chǔ)在索引庫(kù)中,為后續(xù)搜索做準(zhǔn)備。 3. 搜索關(guān)鍵詞:當(dāng)用戶輸入關(guān)鍵詞進(jìn)行搜索時(shí),搜索引擎需要對(duì)這些關(guān)鍵詞進(jìn)行分詞,并對(duì)分詞結(jié)果進(jìn)行查詢,找到相關(guān)的網(wǎng)頁(yè)并按照相關(guān)度排序。 4. 顯示結(jié)果:最后,搜索引擎會(huì)按

Public @ 2023-04-02 03:00:29

了解搜索引擎來(lái)進(jìn)行SEO

搜索引擎的工作的過(guò)程非常復(fù)雜,而簡(jiǎn)單的講搜索引擎的工過(guò)程大體可以分成三個(gè)階段。爬行和抓取:搜索引擎蜘蛛通過(guò)跟蹤鏈接訪問(wèn)頁(yè)面,獲取頁(yè)面HTML代碼存入數(shù)據(jù)庫(kù)。預(yù)處理:搜索贏球?qū)ψト?lái)的頁(yè)面數(shù)據(jù)文字進(jìn)行文字提取、中文分詞、索引等處理,以備排名程序調(diào)用。排名:用戶輸入關(guān)鍵字后,排名調(diào)用索引庫(kù)數(shù)據(jù),計(jì)算相關(guān)性,然后按一定格式生成搜索結(jié)果頁(yè)面。爬行和抓取爬行和抓取是搜索引擎工作的第一步,完成數(shù)據(jù)收集任務(wù)。蜘

Public @ 2018-03-18 16:21:53

更多您感興趣的搜索

0.479191s