97免费在线观看视频 I 午夜夫妻视频 I 久久久久久网站 I 天堂网男人 I 欧美大波大乳人奶 I 丝袜 中出 制服 人妻 美腿 I 窝窝午夜理论片影院 I 日韩在线伦理电影 I 韩国特级毛片 I 亚洲欧美另类激情 I 在线成人日韩 I 麻豆视频免费看 I 黄色生活毛片 I 极品一线天小嫩嫩真紧 I 色久天堂 I 久久久久久黄色片 I 林智妍三级露全乳电影视频 I 大肉大捧一进一出好爽视频 I 空乘伦理hd I 少妇口述与子做过爱 I 成人免费影片 I 国产精品国内免费一区二区三区 I 日韩制服一区 I 青青草福利在线 I 日本在线观看不卡视频 I 婷婷六月综合亚洲 I 国产又粗又黄又硬 I 美女扒开屁股让男子桶爽 I 欧美性午夜视频观看 I 欧美狠狠插 I 亚洲福利在线观看视频 I 无码抽搐高潮喷水流白浆 I 亚洲欧美国产日韩色伦 I 你懂的视频网站在线观看 I www.蜜桃视频在线观看 I 日本无码人妻精品一区二区蜜桃 I 久久中文字幕人妻丝袜 I 碰草在线视频 I 日韩精品成人av网站

搜索引擎抓取系統概述

2013/10/10 15:34:36   閱讀:2410    發布者:2410

之前與大家分享了關于搜索引擎抓取系統中有關抓取系統基本框架、抓取中涉及的網絡協議、抓取的基本過程的內容,今天將于大家分享搜索引擎抓取系統第二部分內容—spider抓取過程中的策略。
spider在抓取過程中面對著復雜的網絡環境,為了使系統可以抓取到盡可能多的有價值資源并保持系統及實際環境中頁面的一致性同時不給網站體驗造成壓力,會設計多種復雜的抓取策略。以下簡單介紹一下抓取過程中涉及到的主要策略類型:
1、抓取友好性:抓取壓力調配降低對網站的訪問壓力
2、常用抓取返回碼示意
3、多種url重定向的識別
4、抓取優先級調配
5、重復url的過濾
6、暗網數據的獲取
7、抓取反作弊
8、提高抓取效率,高效利用帶寬
1、抓取友好性
互聯網資源龐大的數量級,這就要求抓取系統盡可能的高效利用帶寬,在有限的硬件和帶寬資源下盡可能多的抓取到有價值資源。這就造成了另一個問題,耗費被抓網站的帶寬造成訪問壓力,如果程度過大將直接影響被抓網站的正常用戶訪問行為。因此,在抓取過程中就要進行一定的抓取壓力控制,達到既不影響網站的正常用戶訪問又能盡量多的抓取到有價值資源的目的。
通常情況下,最基本的是基于ip的壓力控制。這是因為如果基于域名,可能存在一個域名對多個ip(很多大網站)或多個域名對應同一個ip(小網站共享ip)的問題。實際中,往往根據ip及域名的多種條件進行壓力調配控制。同時,站長平臺也推出了壓力反饋工具,站長可以人工調配對自己網站的抓取壓力,這時百度spider將優先按照站長的要求進行抓取壓力控制。
對同一個站點的抓取速度控制一般分為兩類:其一,一段時間內的抓取頻率;其二,一段時間內的抓取流量。同一站點不同的時間抓取速度也會不同,例如夜深人靜月黑風高時候抓取的可能就會快一些,也視具體站點類型而定,主要思想是錯開正常用戶訪問高峰,不斷的調整。對于不同站點,也需要不同的抓取速度。
2、常用抓取返回碼示意
簡單介紹幾種百度支持的返回碼:
1)  最常見的404代表“NOT FOUND”,認為網頁已經失效,通常將在庫中刪除,同時短期內如果spider再次發現這條url也不會抓取;
2)  503代表“Service Unavailable”,認為網頁臨時不可訪問,通常網站臨時關閉,帶寬有限等會產生這種情況。對于網頁返回503狀態碼,百度spider不會把這條url直接刪除,同時短期內將會反復訪問幾次,如果網頁已恢復,則正常抓取;如果繼續返回503,那么這條url仍會被認為是失效鏈接,從庫中刪除。
3)  403代表“Forbidden”,認為網頁目前禁止訪問。如果是新url,spider暫時不抓取,短期內同樣會反復訪問幾次;如果是已收錄url,不會直接刪除,短期內同樣反復訪問幾次。如果網頁正常訪問,則正常抓取;如果仍然禁止訪問,那么這條url也會被認為是失效鏈接,從庫中刪除。
4)301  代表是“Moved Permanently”,認為網頁重定向至新url。當遇到站點遷移、域名更換、站點改版的情況時,我們推薦使用301返回碼,同時使用站長平臺網站改版工具,以減少改版對網站流量造成的損失。
3、多種url重定向的識別
互聯網中一部分網頁因為各種各樣的原因存在url重定向狀態,為了對這部分資源正常抓取,就要求spider對url重定向進行識別判斷,同時防止作弊行為。重定向可分為三類:http 30x重定向、meta refresh重定向和js重定向。另外,百度也支持Canonical標簽,在效果上可以認為也是一種間接的重定向。
4、抓取優先級調配
由于互聯網資源規模的巨大以及迅速的變化,對于搜索引擎來說全部抓取到并合理的更新保持一致性幾乎是不可能的事情,因此這就要求抓取系統設計一套合理的抓取優先級調配策略。主要包括:深度優先遍歷策略、寬度優先遍歷策略、pr優先策略、反鏈策略、社會化分享指導策略等等。每個策略各有優劣,在實際情況中往往是多種策略結合使用以達到最優的抓取效果。
5、重復url的過濾
spider在抓取過程中需要判斷一個頁面是否已經抓取過了,如果還沒有抓取再進行抓取網頁的行為并放在已抓取網址集合中。判斷是否已經抓取其中涉及到最核心的是快速查找并對比,同時涉及到url歸一化識別,例如一個url中包含大量無效參數而實際是同一個頁面,這將視為同一個url來對待。
6、暗網數據的獲取
互聯網中存在著大量的搜索引擎暫時無法抓取到的數據,被稱為暗網數據。一方面,很多網站的大量數據是存在于網絡數據庫中,spider難以采用抓取網頁的方式獲得完整內容;另一方面,由于網絡環境、網站本身不符合規范、孤島等等問題,也會造成搜索引擎無法抓取。目前來說,對于暗網數據的獲取主要思路仍然是通過開放平臺采用數據提交的方式來解決,例如“百度站長平臺”“百度開放平臺”等等。
7、抓取反作弊
spider在抓取過程中往往會遇到所謂抓取黑洞或者面臨大量低質量頁面的困擾,這就要求抓取系統中同樣需要設計一套完善的抓取反作弊系統。例如分析url特征、分析頁面大小及內容、分析站點規模對應抓取規模等等。

 

主站蜘蛛池模板: 欲色欲色天天天www 在线亚洲天堂 | 免费观看又色又爽又黄6699 | 亚洲中文字幕日产乱码高清app | 国产精品乱码久久久久久软件 | 日干夜干天天干 | 欧美最新精品videossexohd | 国产精选av | 日韩久久无码精品不卡一区二区电影 | 国产高清一区二区三区视频 | 久久精品国产999大香线蕉 | www.亚洲com| 久久婷婷综合缴情亚洲狠狠 | 97人人模人人爽人人喊38tv | 人妻夜夜爽天天爽一区二区 | 乡下人产国偷v产偷v自拍 | 欧美成人精品一区二区 | 韩日视频在线 | 国产成人欧美视频在线观看 | 国产精品五月天 | 日韩喷潮| 无码一区二区三区不卡av | 国农村精品国产自线拍 | 久久久久性色av毛片特级 | 国产精品久久久久电影网 | 免费看成人午夜福利专区 | 国产一区不卡视频 | 久久精品国产精品久久久 | 欧美人与禽性猛交狂配 | 午夜桃色 | 亚洲丁香婷婷久久一区二区 | 国产特级毛片aaaaaa视频 | 麻豆国产av尤物网站尤物 | 久久久久国产精品人妻aⅴ果冻 | 亚洲精品久久久久久久观看 | 婷婷午夜| 1000部拍拍拍18勿入免费视频下载 | 美国伦理3野性 | 无码中文人妻在线一区 | 九九看片 | 福利一区三区 | 妺妺窝人体色www聚色窝 | 亚洲一区二区精品在线 | 国产自偷自偷免费一区 | 亚洲欧美另类小说 | 日本少妇高潮叫床声一区二 | 777精品久无码人妻蜜桃 | 久久精品日日躁夜夜躁 | 色视频网站在线观看一=区 人体内射精一区二区三区 伊人伊人伊人伊人 | 成人区人妻精品一熟女 | 亚洲国产精品高潮呻吟久久 | 欧美一区二区三区在线免费观看 | 欧美色图网址 | 搡女人真爽免费午夜网站 | 欧美黑人性猛交xxxx | 宅男噜噜噜 | 吃奶摸下高潮60分钟免费视频 | 精品国产午夜福利在线观看 | 久久蜜桃资源一区二区老牛 | 国产成人啪精品视频网站 | 亚洲欧美a | 91精品国产一区二区三区蜜臀 | 波多野结衣视频网站 | 天堂中文а√在线官网 | 午夜激情在线观看视频 | 亚洲第一国产 | 久久婷五月 | 2018年亚洲欧美在线v | 国产精品毛片在线完整版sab | 亚洲欧美亚洲 | 日韩成人看片 | 亚洲精品一区二区久 | 操你啦青青草 | 国产一区二区视频在线播放 | 男女做性无遮挡免费视频 | 日本黄色xxxx | 免费女人高潮流视频在线 | 精品国产制服丝袜高跟 | 精品视频无码一区二区三区 | 狠狠五月深爱婷婷 | 99热在线精品免费全部my | 狠狠色噜噜狠狠狠狠69 | 亚洲精品国产字幕久久不卡 | 欧美三级在线播放 | 亚洲码无人客一区二区三区 | 黑巨人与欧美精品一区 | 国产又粗又猛又黄又爽性视频 | 2021在线不卡国产麻豆 | 亚洲日韩中文无码久久 | 极品美女扒开粉嫩小泬 | 青草久久久国产线免观 | 日韩av免费在线观看 | 男人午夜 | 国产免费久久精品99re丫丫一 | 欧美日韩精品在线一区二区 | 国产 欧美 日韩 | 激情网站五月天 | 中文字幕一级片 | 国产精品中文字幕av | 国语自产拍91在线a拍拍 |