国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


搜索引擎中各關鍵功能模塊功能簡介

(1)爬蟲:從互聯(lián)網(wǎng)爬取原始網(wǎng)頁數(shù)據(jù),存儲于文檔知識庫服務器。

(2)文檔知識庫服務器:存儲原始網(wǎng)頁數(shù)據(jù),通常是分布式Key-Value數(shù)據(jù)庫,能根據(jù)URL/UID快速獲取網(wǎng)頁內容。

(3)索引:讀取原始網(wǎng)頁數(shù)據(jù),解析網(wǎng)頁,抽取有效字段,生成索引數(shù)據(jù)。索引數(shù)據(jù)的生成方式通常是增量的,分塊/分片的,并會進行索引合并、優(yōu)化和刪除。生成的索引數(shù)據(jù)通常包括:字典數(shù)據(jù)、倒排表、正排表、文檔屬性等。生成的索引存儲于索引服務器。

(4)索引服務器:存儲索引數(shù)據(jù),主要是倒排表,通常是分塊、分片存儲,并支持增量更新和刪除。數(shù)據(jù)內容量非常大時,還根據(jù)類別、主題、時間、網(wǎng)頁質量劃分數(shù)據(jù)分區(qū)和分布,更好地服務在線查詢。

(5)檢索:讀取倒排表索引,響應前端查詢請求,返回相關文檔列表數(shù)據(jù)。

(6)排序:對檢索器返回的文檔列表進行排序,基于文檔和查詢的相關性、文檔的鏈接權重等屬性。

(7)鏈接分析:收集各網(wǎng)頁的鏈接數(shù)據(jù)和錨文本(Anchor Text),以此計算各網(wǎng)頁鏈接評分,最終會作為網(wǎng)頁屬性參與返回結果排序。

(8)網(wǎng)頁去重:提取各網(wǎng)頁的相關特征屬性,計算相似網(wǎng)頁組,提供離線索引和在線查詢的去重服務。

(9)網(wǎng)頁反垃圾:收集各網(wǎng)頁和網(wǎng)站歷史信息,提取垃圾網(wǎng)頁特征,從而對在線索引中的網(wǎng)頁進行判定,去除垃圾網(wǎng)頁。

(10)查詢分析:分析用戶查詢,生成結構化查詢請求,指派到相應的類別、主題數(shù)據(jù)服務器進行查詢。

(11)頁面描述/摘要:為檢索和排序完成的網(wǎng)頁列表提供相應的描述和摘要。

(12)前端:接受用戶請求,分發(fā)至相應服務器,返回查詢結果。


Public @ 2017-08-24 16:22:25

數(shù)據(jù)分析:如何追蹤訪客初始來源

了解網(wǎng)站的運營情況、了解用戶構成是保證網(wǎng)站健康持續(xù)發(fā)展的重要基礎,所以看數(shù)據(jù)做分析是網(wǎng)站優(yōu)化人員每日必做的工作。上周平臺發(fā)布了《網(wǎng)站分析白皮書(站長版)》,本周小編又發(fā)現(xiàn)了一篇非常好的實戰(zhàn)型文章《在Google Analytics中如何跟蹤訪客的初始來源》,作者馬駿是已獲得GOOGLE Analytics IQ認證的網(wǎng)站訪客行為分析師,得知平臺要轉載此文章后很貼心地將原文中的英文內容都做成了中文的

Public @ 2020-09-06 16:21:48

百度搜索引擎工作原理-2-抓取建庫

Spider抓取系統(tǒng)的基本框架互聯(lián)網(wǎng)信息爆發(fā)式增長,如何有效的獲取并利用這些信息是搜索引擎工作中的首要環(huán)節(jié)。數(shù)據(jù)抓取系統(tǒng)作為整個搜索系統(tǒng)中的上游,主要負責互聯(lián)網(wǎng)信息的搜集、保存、更新環(huán)節(jié),它像蜘蛛一樣在網(wǎng)絡間爬來爬去,因此通常會被叫做“spider”。例如我們常用的幾家通用搜索引擎蜘蛛被稱為:Baiduspdier、Googlebot、Sogou Web Spider等。Spider抓取系統(tǒng)是搜索

Public @ 2022-09-10 16:21:47

搜索引擎對用戶搜索詞如何處理,怎么判斷用戶搜索詞的結果?

搜索引擎通常會對用戶的搜索詞進行以下處理: 1. 分詞:將用戶輸入的搜索詞拆分成一個個單詞,例如將“電影票”拆分為“電影”和“票”。 2. 去除停用詞:將搜索詞中的一些常見單詞(如“的”、“了”等)去掉,因為這些詞對搜索結果的影響較小。 3. 相關性計算:根據(jù)搜索引擎的算法,計算出每個搜索詞與搜索結果的相關性,從而排序展示合適的結果。 4. 相關性排名:將搜索結果按相關性從高到低排序,優(yōu)先

Public @ 2023-06-24 18:50:12

搜索引擎檢索系統(tǒng)概述

前面簡要介紹過了搜索引擎的索引系統(tǒng),實際上在建立倒排索引的最后還需要有一個入庫寫庫的過程,而為了提高效率這個過程還需要將全部term以及偏移量保存在文件頭部,并且對數(shù)據(jù)進行壓縮,這涉及到的過于技術化在此就不多提了。今天簡要給大家介紹一下索引之后的檢索系統(tǒng)。檢索系統(tǒng)主要包含了五個部分,如下圖所示:索引&檢索.jpg(1)Query串切詞分詞即將用戶的查詢詞進行分詞,對之后的查詢做準備,以“1

Public @ 2011-11-07 16:21:49

更多您感興趣的搜索

0.429833s