国产成人精品999视频&日本一区二区亚洲人妻精品&久久久精品国产99久久精&99热这里只有成人精品国产&精品国产剧情av一区二区&成人亚洲精品久久久久app&国产精品美女高潮抽搐A片

Categories


Tags


“百度蜘蛛”全面解析

鐺鐺鐺鐺!

好久不見(jiàn),平小雕帶著最新一期搜索問(wèn)答劇場(chǎng)又雙叒回來(lái)啦!

第五集【搜索問(wèn)答劇場(chǎng)】,為大家?guī)?lái)“百度蜘蛛”的全面解析,幫助大家清楚的了解“百度蜘蛛”在各種場(chǎng)景發(fā)揮的作用,為網(wǎng)站整體運(yùn)營(yíng)打下基礎(chǔ)。

【抓取篇】

1、什么是Baiduspider?

A:Baiduspider也叫百度蜘蛛,是百度搜索引擎的一個(gè)自動(dòng)程序,它的作用是訪(fǎng)問(wèn)互聯(lián)網(wǎng)上的網(wǎng)頁(yè),建立索引數(shù)據(jù)庫(kù),使用戶(hù)能在百度搜索引擎中搜索到網(wǎng)站相關(guān)內(nèi)容。

2、Q:如何才能識(shí)別當(dāng)前抓取是正確的百度蜘蛛?

A:有兩個(gè)方式可以判斷百度蜘蛛。

方式一:查看UA信息

如果UA信息不對(duì),可以直接判斷為非百度搜索的蜘蛛。目前UA分為移動(dòng)、PC、和小程序三個(gè)應(yīng)用場(chǎng)景,這三個(gè)渠道UA分別如下:

移動(dòng)UA:

Mozilla/5.0 (Linux;u;Android 4.2.2;zh-cn;) AppleWebKit/534.46 (KHTML,like Gecko)Version/5.1 Mobile Safari/10600.6.3 (compatible; Baiduspider/2.0;+http://www.baidu.com/search/spider.html)

Mozilla/5.0 (iPhone;CPU iPhone OS 9_1 like Mac OS X) AppleWebKit/601.1.46 (KHTML, like Gecko)Version/9.0 Mobile/13B143 Safari/601.1 (compatible; Baiduspider-render/2.0;+http://www.baidu.com/search/spider.html)

PC UA:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

小程序UA:

Mozilla/5.0 (iPhone;CPU iPhone OS 9_1 like Mac OS X) AppleWebKit/601.1.46 (KHTML, like Gecko)Version/9.0 Mobile/13B143 Safari/601.1 (compatible; Baiduspider-render/2.0;Smartapp; +http://www.baidu.com/search/spider.html)

方式二:雙向DNS解析認(rèn)證

第一步:DNS反查IP,開(kāi)發(fā)者通過(guò)對(duì)日志中訪(fǎng)問(wèn)服務(wù)器的IP地址運(yùn)行反向DNS查找,判斷某只spider是否來(lái)自百度搜索引擎,Baiduspider的hostname以*.baidu.com或*.baidu.jp 的格式命名,非*.baidu.com或*.baidu.jp即為冒充。

根據(jù)平臺(tái)不同驗(yàn)證方法不同,如linux/windows/os三種平臺(tái)下的驗(yàn)證方法分別如下:

①在linux平臺(tái)下,可以使用host ip命令反解ip來(lái)判斷是否來(lái)自Baiduspider的抓取。Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即為冒充。

②在windows平臺(tái)或者IBM OS/2平臺(tái)下,可以使用nslookup ip命令反解ip來(lái) 判斷是否來(lái)自Baiduspider的抓取 。

③在mac os平臺(tái)下,可以使用dig 命令反解ip來(lái) 判斷是否來(lái)自Baiduspider的抓取。

第二步:對(duì)域名運(yùn)行正向DNS查找。對(duì)第1步中通過(guò)命令檢索到的域名運(yùn)行正向DNS查找,驗(yàn)證該域名與您日志中訪(fǎng)問(wèn)服務(wù)器的原始IP地址是否一致,IP地址一致可確認(rèn)spider來(lái)自百度搜索引擎,IP地址不一致即為冒充。

3、Q:百度蜘蛛會(huì)一直抓我的網(wǎng)站嗎?

A:一般會(huì)的,若網(wǎng)站持續(xù)生產(chǎn)新資源、更新內(nèi)容等,蜘蛛會(huì)持續(xù)抓取的。需要提醒的是,若網(wǎng)站需要百度蜘蛛抓取一定不要做任何封禁哦。(封禁相關(guān)參考下文內(nèi)容)

此外,您也可以檢查網(wǎng)站訪(fǎng)問(wèn)日志,及時(shí)判斷正確的百度蜘蛛,以防止有人惡意冒充百度蜘蛛來(lái)頻繁抓取您的網(wǎng)站。

4、Q:百度蜘蛛頻繁光顧網(wǎng)站,導(dǎo)致網(wǎng)站服務(wù)器壓力大,怎么辦?

A:若發(fā)現(xiàn)百度蜘蛛頻繁抓取,可能是因?yàn)?/p>

① 網(wǎng)站存在新生產(chǎn)資源、更新內(nèi)容待抓取更新;

② 可能存在惡意冒充百度蜘蛛,可以通過(guò)上文Q2“如何識(shí)別正常百度蜘蛛”的方法排查問(wèn)題;

若百度蜘蛛抓取頻次過(guò)高,造成網(wǎng)站服務(wù)異常,可以通過(guò)搜索資源平臺(tái)-【抓取頻次】工具調(diào)整頻次。

【封禁篇】

1、Q:網(wǎng)站的部分資源不希望被百度蜘蛛訪(fǎng)問(wèn),該怎么做?

A:百度蜘蛛遵守互聯(lián)網(wǎng)robots協(xié)議。站長(zhǎng)可以更新robots.txt文件,文件中明確不希望百度蜘蛛訪(fǎng)問(wèn)資源或目錄等,并及時(shí)通過(guò)搜索資源平臺(tái)-【Robots】工具,提交robots文件。

需要注意,robots文件更新和提交后,搜索引擎需要逐漸完成更新,所以百度蜘蛛不是立即停止抓取網(wǎng)頁(yè),請(qǐng)耐心等待。

2、Q:網(wǎng)站封禁百度蜘蛛,可能會(huì)帶來(lái)哪些影響?

A:網(wǎng)站資源優(yōu)質(zhì),也沒(méi)有其他違規(guī)問(wèn)題,但是存在以下情況

①?zèng)]有查詢(xún)到百度蜘蛛任何抓取記錄,

②在百度搜索中沒(méi)有得到收錄和展現(xiàn),

③網(wǎng)站/目錄存在流量異常下降的情況,

④在搜索結(jié)果中的摘要展現(xiàn)為“存在robots封禁”字樣。

若發(fā)現(xiàn)以上情況,可以先自查是否存在封禁百度蜘蛛的問(wèn)題,及時(shí)解除封禁(解除封禁參考QA7),等待恢復(fù)。

3、Q:如何解除封禁百度蜘蛛?

A:常見(jiàn)的封禁行為包括robots封禁、封禁百度UA、封禁百度IP這三種,可以逐一排查解決:

(1) 查看robots.txt文件,是否存在封禁記錄。(一般robots.txt文件放置在網(wǎng)站根目錄下。)

(2)robots文件無(wú)異常,進(jìn)一步排查是否存在封禁百度UA情況;

方案一:執(zhí)行 curl --head --user-agent 'Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)' --request GET 'xxxxxxx'

注:正常返回碼是200,其他情況為異常。

方案二:變更瀏覽器UA驗(yàn)證;

(3)以上驗(yàn)證均無(wú)異常,最后進(jìn)一步排查是否存在IP級(jí)別的封禁;

常見(jiàn)的IP封禁,源自網(wǎng)站的防火墻系統(tǒng)配置,需要查看防火墻配置系統(tǒng)后臺(tái),檢查是否存在百度蜘蛛的IP級(jí)別封禁措施。

詳情可參考《開(kāi)發(fā)者如何解除封禁百度蜘蛛》

——什么是【搜索問(wèn)答劇場(chǎng)】?

【搜索問(wèn)答劇場(chǎng)】是資源平臺(tái)基于資源平臺(tái)工具相關(guān),對(duì)站長(zhǎng)反饋的高頻或常見(jiàn)問(wèn)題的整體梳理總結(jié),定期為開(kāi)發(fā)者運(yùn)營(yíng)過(guò)程中產(chǎn)生的疑惑問(wèn)題進(jìn)行梳理解答,致力于為開(kāi)發(fā)者提供更便捷的運(yùn)營(yíng)知識(shí)庫(kù)。

往期回顧:

【第一集】“站點(diǎn)關(guān)聯(lián)主體”常見(jiàn)問(wèn)題解析

【第二集】“站點(diǎn)Logo”常見(jiàn)問(wèn)題解析

【第三集】“流量異?!背R?jiàn)問(wèn)題解析

【第四集】“網(wǎng)站改版”常見(jiàn)問(wèn)題解析

來(lái)源:百度搜索資源平臺(tái)


Public @ 2013-05-26 15:38:35

輕松兩步,正確識(shí)別百度蜘蛛(User-Agent)

步驟1:查看日志 首先,我們需要查看網(wǎng)站的訪(fǎng)問(wèn)日志。在日志中,我們可以看到每個(gè)請(qǐng)求的詳細(xì)信息,包括訪(fǎng)問(wèn)者的IP地址、請(qǐng)求的頁(yè)面、時(shí)間戳和User-Agent(用戶(hù)代理)等信息。 User-Agent是用來(lái)識(shí)別客戶(hù)端的應(yīng)用程序類(lèi)型和版本號(hào)的字符串。在百度蜘蛛訪(fǎng)問(wèn)網(wǎng)站時(shí),其User-Agent通常會(huì)包含“Baiduspider”關(guān)鍵詞。因此,通過(guò)查看日志,我們可以很容易地識(shí)別是否有百度蜘蛛在訪(fǎng)問(wèn)我

Public @ 2023-04-06 11:00:21

sogou spider User-Agent字段是什么?

Sogou spider User-Agent字段是一種用于爬蟲(chóng)程序中的HTTP報(bào)頭,它是搜狗搜索的爬蟲(chóng)程序使用的字符串,其格式為:"Sogou web spider/版本號(hào)(語(yǔ)言:語(yǔ)言代碼;平臺(tái):操作系統(tǒng))",例如:"Sogou web spider/4.0(Windows NT 6.1;zh-CN)"。該字段包含了爬蟲(chóng)程序的名稱(chēng)、版本號(hào)、語(yǔ)言和操作系統(tǒng)等信息。

Public @ 2023-05-26 16:50:07

屏蔽百度爬蟲(chóng)的方法

在百度C2C產(chǎn)品“百度有啊”即將上線(xiàn)的時(shí)候,淘寶網(wǎng)站曾經(jīng)屏蔽百度搜索爬蟲(chóng),禁止百度搜索引擎抓取淘寶網(wǎng)站的網(wǎng)頁(yè)內(nèi)容,淘寶官方的解釋是“杜絕不良商家欺詐”。在技術(shù)層面,淘寶屏蔽百度的方法是,在網(wǎng)站的robots.txt文件中加上如下內(nèi)容:User-agent: BaiduspiderDisallow: /但實(shí)際上這種方法并不能完全屏蔽百度的爬蟲(chóng),至今在百度上輸入site:taobao.com還是可以看

Public @ 2012-08-15 15:56:41

【官方說(shuō)法】百度蜘蛛抓取流量暴增的原因

Spider對(duì)網(wǎng)站抓取數(shù)量突增往往給站點(diǎn)帶來(lái)很大煩惱,紛紛找平臺(tái)想要Baiduspider IP白名單,但實(shí)際上BaiduSpider IP會(huì)隨時(shí)變化,所以并不敢公布出來(lái),擔(dān)心站長(zhǎng)設(shè)置不及時(shí)影響抓取效果。百度是怎么計(jì)算分配抓取流量的呢?站點(diǎn)抓取流量暴增的原因有哪些呢?總體來(lái)說(shuō),Baiduspider會(huì)根據(jù)站點(diǎn)規(guī)模、歷史上網(wǎng)站每天新產(chǎn)出的鏈接數(shù)量、已抓取網(wǎng)頁(yè)的綜合質(zhì)量打分等等,來(lái)綜合計(jì)算抓取流量,同

Public @ 2011-07-18 15:38:37

更多您感興趣的搜索

0.422264s