搜索引擎是怎么刪除重復網(wǎng)頁的
- 威海搜索引擎工作原理 威海搜索引擎工作原理
- 2661
搜索引擎是通過比較網(wǎng)頁URL,內(nèi)容和相關(guān)屬性來刪除重復網(wǎng)頁的,具體步驟如下: 1. 搜索引擎收集器(Crawler)會在網(wǎng)絡上發(fā)現(xiàn)新網(wǎng)頁并收集,此時會有一定概率發(fā)現(xiàn)相同的網(wǎng)頁,并添加到收集器的索引中去。 2. 收集器會識別新的網(wǎng)頁,把重復的網(wǎng)頁排除。 3. 然后,搜索引擎把新索引serves給布置在 Indexer(索引器)中,執(zhí)行深入索引,會把相同內(nèi)容的文章及URL排除,僅保留一條記錄。 4. 最后,Indexer根據(jù)收集器搜集來的URL和文章,再次把重復的網(wǎng)頁排除,僅保留一條記錄。