97免费在线观看视频 I 午夜夫妻视频 I 久久久久久网站 I 天堂网男人 I 欧美大波大乳人奶 I 丝袜 中出 制服 人妻 美腿 I 窝窝午夜理论片影院 I 日韩在线伦理电影 I 韩国特级毛片 I 亚洲欧美另类激情 I 在线成人日韩 I 麻豆视频免费看 I 黄色生活毛片 I 极品一线天小嫩嫩真紧 I 色久天堂 I 久久久久久黄色片 I 林智妍三级露全乳电影视频 I 大肉大捧一进一出好爽视频 I 空乘伦理hd I 少妇口述与子做过爱 I 成人免费影片 I 国产精品国内免费一区二区三区 I 日韩制服一区 I 青青草福利在线 I 日本在线观看不卡视频 I 婷婷六月综合亚洲 I 国产又粗又黄又硬 I 美女扒开屁股让男子桶爽 I 欧美性午夜视频观看 I 欧美狠狠插 I 亚洲福利在线观看视频 I 无码抽搐高潮喷水流白浆 I 亚洲欧美国产日韩色伦 I 你懂的视频网站在线观看 I www.蜜桃视频在线观看 I 日本无码人妻精品一区二区蜜桃 I 久久中文字幕人妻丝袜 I 碰草在线视频 I 日韩精品成人av网站

搜索引擎抓取系統概述

2013/10/10 15:34:36   閱讀:2441    發布者:2441

之前與大家分享了關于搜索引擎抓取系統中有關抓取系統基本框架、抓取中涉及的網絡協議、抓取的基本過程的內容,今天將于大家分享搜索引擎抓取系統第二部分內容—spider抓取過程中的策略。
spider在抓取過程中面對著復雜的網絡環境,為了使系統可以抓取到盡可能多的有價值資源并保持系統及實際環境中頁面的一致性同時不給網站體驗造成壓力,會設計多種復雜的抓取策略。以下簡單介紹一下抓取過程中涉及到的主要策略類型:
1、抓取友好性:抓取壓力調配降低對網站的訪問壓力
2、常用抓取返回碼示意
3、多種url重定向的識別
4、抓取優先級調配
5、重復url的過濾
6、暗網數據的獲取
7、抓取反作弊
8、提高抓取效率,高效利用帶寬
1、抓取友好性
互聯網資源龐大的數量級,這就要求抓取系統盡可能的高效利用帶寬,在有限的硬件和帶寬資源下盡可能多的抓取到有價值資源。這就造成了另一個問題,耗費被抓網站的帶寬造成訪問壓力,如果程度過大將直接影響被抓網站的正常用戶訪問行為。因此,在抓取過程中就要進行一定的抓取壓力控制,達到既不影響網站的正常用戶訪問又能盡量多的抓取到有價值資源的目的。
通常情況下,最基本的是基于ip的壓力控制。這是因為如果基于域名,可能存在一個域名對多個ip(很多大網站)或多個域名對應同一個ip(小網站共享ip)的問題。實際中,往往根據ip及域名的多種條件進行壓力調配控制。同時,站長平臺也推出了壓力反饋工具,站長可以人工調配對自己網站的抓取壓力,這時百度spider將優先按照站長的要求進行抓取壓力控制。
對同一個站點的抓取速度控制一般分為兩類:其一,一段時間內的抓取頻率;其二,一段時間內的抓取流量。同一站點不同的時間抓取速度也會不同,例如夜深人靜月黑風高時候抓取的可能就會快一些,也視具體站點類型而定,主要思想是錯開正常用戶訪問高峰,不斷的調整。對于不同站點,也需要不同的抓取速度。
2、常用抓取返回碼示意
簡單介紹幾種百度支持的返回碼:
1)  最常見的404代表“NOT FOUND”,認為網頁已經失效,通常將在庫中刪除,同時短期內如果spider再次發現這條url也不會抓取;
2)  503代表“Service Unavailable”,認為網頁臨時不可訪問,通常網站臨時關閉,帶寬有限等會產生這種情況。對于網頁返回503狀態碼,百度spider不會把這條url直接刪除,同時短期內將會反復訪問幾次,如果網頁已恢復,則正常抓取;如果繼續返回503,那么這條url仍會被認為是失效鏈接,從庫中刪除。
3)  403代表“Forbidden”,認為網頁目前禁止訪問。如果是新url,spider暫時不抓取,短期內同樣會反復訪問幾次;如果是已收錄url,不會直接刪除,短期內同樣反復訪問幾次。如果網頁正常訪問,則正常抓取;如果仍然禁止訪問,那么這條url也會被認為是失效鏈接,從庫中刪除。
4)301  代表是“Moved Permanently”,認為網頁重定向至新url。當遇到站點遷移、域名更換、站點改版的情況時,我們推薦使用301返回碼,同時使用站長平臺網站改版工具,以減少改版對網站流量造成的損失。
3、多種url重定向的識別
互聯網中一部分網頁因為各種各樣的原因存在url重定向狀態,為了對這部分資源正常抓取,就要求spider對url重定向進行識別判斷,同時防止作弊行為。重定向可分為三類:http 30x重定向、meta refresh重定向和js重定向。另外,百度也支持Canonical標簽,在效果上可以認為也是一種間接的重定向。
4、抓取優先級調配
由于互聯網資源規模的巨大以及迅速的變化,對于搜索引擎來說全部抓取到并合理的更新保持一致性幾乎是不可能的事情,因此這就要求抓取系統設計一套合理的抓取優先級調配策略。主要包括:深度優先遍歷策略、寬度優先遍歷策略、pr優先策略、反鏈策略、社會化分享指導策略等等。每個策略各有優劣,在實際情況中往往是多種策略結合使用以達到最優的抓取效果。
5、重復url的過濾
spider在抓取過程中需要判斷一個頁面是否已經抓取過了,如果還沒有抓取再進行抓取網頁的行為并放在已抓取網址集合中。判斷是否已經抓取其中涉及到最核心的是快速查找并對比,同時涉及到url歸一化識別,例如一個url中包含大量無效參數而實際是同一個頁面,這將視為同一個url來對待。
6、暗網數據的獲取
互聯網中存在著大量的搜索引擎暫時無法抓取到的數據,被稱為暗網數據。一方面,很多網站的大量數據是存在于網絡數據庫中,spider難以采用抓取網頁的方式獲得完整內容;另一方面,由于網絡環境、網站本身不符合規范、孤島等等問題,也會造成搜索引擎無法抓取。目前來說,對于暗網數據的獲取主要思路仍然是通過開放平臺采用數據提交的方式來解決,例如“百度站長平臺”“百度開放平臺”等等。
7、抓取反作弊
spider在抓取過程中往往會遇到所謂抓取黑洞或者面臨大量低質量頁面的困擾,這就要求抓取系統中同樣需要設計一套完善的抓取反作弊系統。例如分析url特征、分析頁面大小及內容、分析站點規模對應抓取規模等等。

 

主站蜘蛛池模板: 久久精品国产69国产精品亚洲 | 久久综合九色综合网站 | 国产卡二卡三卡四卡免费网址 | 夜夜澡天天碰人人爱av | 四虎影院在线看 | 日韩h视频 | 99在线精品视频观看 | 一本久久a精品一区二区 | 久久青青草原精品国产app | 亚洲综合天堂婷婷五月 | 国产 | 欧洲野花视一 | 免费人妻精品一区二区三区 | 亚洲va欧美va人人爽午夜 | 无码人妻品一区二区三区精99 | 蜜桃狠狠色伊人亚洲综合网站 | 欧美v成 人在线观看 | 偷偷在线观看免费高清av | 中国老熟女重囗味hdxx | 人妻体内射精一区二区三四 | 亚洲欧美综合区自拍另类 | 一级猛片免费看 | 粉嫩av淫片一区二区三区 | 免费无码麻豆av片在线观看 | 国产久爱免费精品视频 | 大象一区一品精区搬运机器 | 精品无码国产日韩制服丝袜 | 久久天天躁狠狠躁夜夜2019 | 国产爽视频在线观看视频 | 久久99国产精一区二区三区 | 大又大又粗又硬又爽少妇毛片 | 女人18毛片水真多免费看 | 日韩av片无码一区二区三区 | 在线看毛片网站 | 成年午夜性影院免费观看 | 在线视频免费观看一区 | 美女扒开腿让男人桶爽久久软件 | 精品国产一区二区三区京东影业 | 亚洲 欧美 制服 综合 另类 | 日韩国产一级 | 农村少妇无套内谢粗又长 | 狠狠色狠狠色狠狠五月 | 又色又污又爽又黄的网站 | 福利免费观看午夜体检区 | 国产黑丝av | 成人无码av网站在线观看 | 色臀av| 玖玖玖视频 | 久久久久国色av免费看图片 | 国内精品一区二区三区不卡 | 嫩草影院在线观看视频 | 日本一级特黄高潮 | 任我爽精品视频在线观看 | 国产亚洲产品影市在线产品 | 国产成人av乱码免费观看 | 九九热最新视频 | 免费成人在线视频观看 | 美女张开腿黄网站免费下载 | 国产精品人人爽人人做我的可爱 | 无码人妻精品中文字幕不卡 | 国产成人精品av在线观 | 一边摸一边抽搐一进一出口述 | 成人欧美18| 无遮掩60分钟从头啪到尾 | 国产精品三级视频 | 黄色网在线 | 97香蕉碰碰人人澡人人爱 | 中文字幕 在线 欧美 日韩 制服 | 女人大荫蒂毛茸茸视频 | 综合精品欧美日韩国产在线 | 婷婷综合缴情亚洲狠狠小说 | 亚洲乱码尤物193yw | 国产偷国产偷精品高清尤物 | 色香视频首页 | 亚洲免费视频在线观看 | 蜜臀色欲av在线播放国产日韩 | 亚洲精品久久久久午夜aⅴ 色妞精品av一区二区三区 | 国产亚洲无线码一区二区 | 激情欧美一区二区免费视频 | 天天躁日日躁狼狼超碰97 | 欧美不卡区 | 国产日韩久久免费影院 | 亚洲视频精品一区二区 | 香港三级日本三级妇三级 | 久久亚洲道色综合久久 | 自拍偷拍精品视频 | 亚洲综合久久无码色噜噜 | 中文字幕亚洲综合久久菠萝蜜 | 国产三级a在线观看 | 99热思思 | 向日葵视频色 | 欧美激情专区 | 国产精品美女久久久久久久网站 | 国产黄色资源 | 成人高清无遮挡免费视频在线观看 | 四川丰满妇女毛片四川话 | 路边理发店露脸熟妇泻火 | 九九久久精品国产波多野结衣 | 精品国产一区二区三区av性色 | 国产成a人亚洲精v品久久网 |