国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


百度搜索引擎工作原理-3-檢索排序

搜索引擎索引系統(tǒng)概述

眾所周知,搜索引擎的主要工作過程包括:抓取、存儲(chǔ)、頁面分析、索引、檢索等幾個(gè)主要過程。上一章我們主要介紹了部分抓取存儲(chǔ)環(huán)節(jié)中的內(nèi)容,此章簡要介紹一下索引系統(tǒng)。

在以億為單位的網(wǎng)頁庫中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時(shí)間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗(yàn)角度我們必須在毫秒級(jí)別給予用戶滿意的結(jié)果,否則用戶只能流失。怎樣才能達(dá)到這種要求呢?

如果能知道用戶查找的關(guān)鍵詞(query切詞后)都出現(xiàn)在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內(nèi)以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:

1,頁面分析的過程實(shí)際上是將原始頁面的不同部分進(jìn)行識(shí)別并標(biāo)記,例如:title、keywords、content、link、anchor、評(píng)論、其他非重要區(qū)域等等;

2,分詞的過程實(shí)際上包括了切詞分詞同義詞轉(zhuǎn)換同義詞替換等等,以對(duì)某頁面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類、詞性等等;

3,之前的準(zhǔn)備工作完成后,接下來即是建立倒排索引,形成{termàdoc},下圖即是索引系統(tǒng)中的倒排索引過程。

倒排索引是搜索引擎實(shí)現(xiàn)毫秒級(jí)檢索非常重要的一個(gè)環(huán)節(jié),下面我們要重要介紹一下索引系統(tǒng)建立倒排索引的重要過程——入庫寫庫。

倒排索引的重要過程——入庫寫庫

索引系統(tǒng)在建立倒排索引的最后還需要有一個(gè)入庫寫庫的過程,而為了提高效率這個(gè)過程還需要將全部term以及偏移量保存在文件頭部,并且對(duì)數(shù)據(jù)進(jìn)行壓縮,這涉及到的過于技術(shù)化在此就不多提了。在此簡要給大家介紹一下索引之后的檢索系統(tǒng)。

檢索系統(tǒng)主要包含了五個(gè)部分,如下圖所示:

(1)Query串切詞分詞即將用戶的查詢?cè)~進(jìn)行分詞,對(duì)之后的查詢做準(zhǔn)備,以“10號(hào)線地鐵故障”為例,可能的分詞如下(同義詞問題暫時(shí)略過):

10  0x123abc

號(hào)   0x13445d

線   0x234d

地鐵 0x145cf

故障 0x354df

(2)查出含每個(gè)term的文檔集合,即找出待選集合,如下:

0x123abc   1  2 3  4  7  9…..

0x13445d   2  5 8  9  10  11……

……

……

(3)求交,上述求交,文檔2和文檔9可能是我們需要找的,整個(gè)求交過程實(shí)際上關(guān)系著整個(gè)系統(tǒng)的性能,這里面包含了使用緩存等等手段進(jìn)行性能優(yōu)化;

(4)各種過濾,舉例可能包含過濾掉死鏈、重復(fù)數(shù)據(jù)、色情、垃圾結(jié)果以及你懂的;

(5)最終排序,將最能滿足用戶需求的結(jié)果排序在最前,可能包括的有用信息如:網(wǎng)站的整體評(píng)價(jià)、網(wǎng)頁質(zhì)量、內(nèi)容質(zhì)量、資源質(zhì)量、匹配程度、分散度、時(shí)效性等等

影響搜索結(jié)果排序的因素

上面的內(nèi)容好象有些深?yuàn)W,因?yàn)樯婕按罅考夹g(shù)細(xì)節(jié),我們只能說到這兒了。那下面我們說說大家最感興趣的排序問題吧。用戶輸入關(guān)鍵詞進(jìn)行檢索,百度搜索引擎在排序環(huán)節(jié)要做兩方面的事情,第一是把相關(guān)的網(wǎng)頁從索引庫中提取出來,第二是把提取出來的網(wǎng)頁按照不同維度的得分進(jìn)行綜合排序。“不同維度”包括:

1,相關(guān)性:網(wǎng)頁內(nèi)容與用戶檢索需求的匹配程度,比如網(wǎng)頁包含的用戶檢查關(guān)鍵詞的個(gè)數(shù),以及這些關(guān)鍵詞出現(xiàn)的位置;外部網(wǎng)頁指向該頁面所用的錨文本等

2,權(quán)威性:用戶喜歡有一定權(quán)威性網(wǎng)站提供的內(nèi)容,相應(yīng)的,百度搜索引擎也更相信優(yōu)質(zhì)權(quán)威站點(diǎn)提供的內(nèi)容。

3,時(shí)效性:時(shí)效性結(jié)果指的是新出現(xiàn)的網(wǎng)頁,且網(wǎng)頁內(nèi)承載了新鮮的內(nèi)容。目前時(shí)效性結(jié)果在搜索引擎中日趨重要。

4,重要性:網(wǎng)頁內(nèi)容與用戶檢查需求匹配的重要程度或受歡迎程度

5,豐富度:豐富度看似簡單卻是一個(gè)覆蓋范圍非常廣的命題??梢岳斫鉃榫W(wǎng)頁內(nèi)容豐富,可以完全滿足用戶需求;不僅可以滿足用戶單一需求,還可以滿足用戶的延展需求。

6,受歡迎程度:指該網(wǎng)頁是不是受歡迎。

以上便是百度搜索引擎決定搜索結(jié)果排序時(shí)考慮的六大原則,那么六大原則的側(cè)重點(diǎn)是怎樣的呢?哪個(gè)原則在實(shí)際應(yīng)用時(shí)占比最大呢?其實(shí)在這里沒有一個(gè)確切的答案。在百度搜索引擎早期,這些閾值的確是相對(duì)固定的,比如“相關(guān)性”在整體排序中的重量可以占到七成。但隨著互聯(lián)網(wǎng)的不斷發(fā)展,檢索技術(shù)的進(jìn)步,網(wǎng)頁數(shù)量的爆發(fā)式增長,相關(guān)性已經(jīng)不是難題。于是百度搜索引擎引入了機(jī)器學(xué)習(xí)機(jī)制,讓程序自動(dòng)產(chǎn)出計(jì)算公式,推進(jìn)排序策略更加合理。

低質(zhì)網(wǎng)頁狙擊策略——石榴算法

我們理解網(wǎng)站生存發(fā)展需要資金支持,從來不反對(duì)網(wǎng)站添加各種合法廣告,不要再問我們“我們網(wǎng)站加了XX聯(lián)盟的廣告會(huì)不會(huì)被處罰”這類問題。有些站點(diǎn)好不容易在百度有了比較好的排位,卻在頁面上放置大量有損訪問用戶體驗(yàn)的廣告,已經(jīng)嚴(yán)重影響到百度搜索引擎用戶的使用感受。為此,百度質(zhì)量團(tuán)隊(duì)2013年5月17日發(fā)布公告:針對(duì)低質(zhì)量網(wǎng)頁推出了石榴算法,旨在打擊含有大量妨礙用戶正常瀏覽的惡劣廣告的頁面,尤其是彈出大量低質(zhì)廣告、存在混淆頁面主體內(nèi)容的垃圾廣告的頁面。

如以下網(wǎng)頁截圖,用戶要花很長時(shí)間去尋找真正的下載地址,是百度無法接受容忍的。

百度質(zhì)量團(tuán)隊(duì)希望站長能夠多從用戶角度出發(fā),朝著長遠(yuǎn)發(fā)展考慮,在不影響用戶體驗(yàn)的前提下合理地放置廣告,贏得用戶的長期青睞才是一個(gè)網(wǎng)站發(fā)展壯大的基礎(chǔ)。

來源:百度搜索資源平臺(tái) 百度搜索學(xué)堂


Public @ 2022-09-15 16:21:46

頭條搜索Bytespider基本流程

1. 抓取網(wǎng)頁每個(gè)獨(dú)立的搜索引擎都有自己的網(wǎng)頁抓取程序爬蟲(Spider)。爬蟲順著網(wǎng)頁中的超鏈接,從這個(gè)網(wǎng)站爬到另一個(gè)網(wǎng)站,通過超鏈接分析連續(xù)訪問抓取更多網(wǎng)頁。被抓取的網(wǎng)頁被稱之為網(wǎng)頁快照。由于互聯(lián)網(wǎng)中超鏈接的應(yīng)用很普遍,理論上,從一定范圍的網(wǎng)頁出發(fā),就能搜集到絕大多數(shù)的網(wǎng)頁。2. 處理網(wǎng)頁搜索引擎抓到網(wǎng)頁后,還要做大量的預(yù)處理工作,才能提供檢索服務(wù)。其中,最重要的就是提取關(guān)鍵詞,建立索引庫和索

Public @ 2022-03-13 15:38:59

百度搜索引擎工作原理-1-抓取建庫

百度搜索引擎的工作原理包括四個(gè)主要步驟:抓取建庫、索引和排序、查詢和展示。本文將詳細(xì)介紹第一步——抓取建庫。 抓取建庫是指百度搜索引擎自動(dòng)收集互聯(lián)網(wǎng)上的網(wǎng)頁,并將其存儲(chǔ)在一個(gè)龐大的數(shù)據(jù)庫中。這個(gè)過程是由自動(dòng)化程序(稱為爬蟲或蜘蛛)執(zhí)行的。 百度的爬蟲程序以網(wǎng)頁為基礎(chǔ),從每個(gè)網(wǎng)頁的鏈接開始自動(dòng)抓取所有相關(guān)的網(wǎng)頁,并將這些網(wǎng)頁保存在一個(gè)大型數(shù)據(jù)庫中。這個(gè)過程被稱為“爬行”,“爬取”或“抓取”。

Public @ 2023-04-06 19:50:54

百度搜索引擎工作原理-5-結(jié)果展現(xiàn)

結(jié)構(gòu)化數(shù)據(jù)——助力站點(diǎn)獲得更多點(diǎn)擊網(wǎng)頁經(jīng)歷了抓取建庫,參與了排序計(jì)算,最終展現(xiàn)在搜索引擎用戶面前。目前在百度搜索左側(cè)結(jié)果展現(xiàn)形式很多,如:鳳巢、品牌專區(qū)、自然結(jié)果等,一條自然結(jié)果怎樣才能獲得更多的點(diǎn)擊,是站長要考慮的重要一環(huán)。目前自然結(jié)果里又分為兩類,見下圖,第一個(gè),即結(jié)構(gòu)化展現(xiàn),形式比較多樣。目前覆蓋80%的搜索需求,即80%的關(guān)鍵詞下會(huì)出現(xiàn)這種復(fù)雜展現(xiàn)樣式;第二個(gè)即一段摘要式展現(xiàn),最原始的展現(xiàn)

Public @ 2021-09-11 16:21:45

百度搜索引擎工作原理-4-外部投票

外部投票是指其他網(wǎng)站通過鏈接引導(dǎo)用戶來到被投票網(wǎng)站的行為。在搜索引擎的工作原理中,外部投票是非常重要的因素之一,因?yàn)樗阉饕鎸⑵湟暈槠渌W(wǎng)站對(duì)被投票網(wǎng)站的認(rèn)可和推薦。 外部投票的數(shù)量和質(zhì)量對(duì)搜索引擎的排名影響非常大。如果一個(gè)網(wǎng)站擁有高質(zhì)量的外部投票,那么搜索引擎就會(huì)認(rèn)為這個(gè)網(wǎng)站是一個(gè)權(quán)威和受歡迎的網(wǎng)站,排名會(huì)相應(yīng)提高。相反,如果一個(gè)網(wǎng)站的外部投票數(shù)量和質(zhì)量很差,搜索引擎就會(huì)認(rèn)為這個(gè)網(wǎng)站不值得被推

Public @ 2023-04-21 22:50:31

更多您感興趣的搜索

0.495694s