防止網(wǎng)站被采集的理論分析以及十條方法對策第1/2頁
a. 兩者都需要直接抓取到網(wǎng)頁源碼才能有效工作,
b. 兩者單位時間內(nèi)會多次大量抓取被訪問的網(wǎng)站內(nèi)容;
c. 宏觀上來講兩者IP都會變動;
d. 兩者多沒耐心的去破解你對網(wǎng)頁的一些加密(驗(yàn)證),比如網(wǎng)頁內(nèi)容通過js文件加密,比如需要輸入驗(yàn)證碼才能瀏覽內(nèi)容,比如需要登錄才能訪問內(nèi)容等。
不同點(diǎn):
搜索引擎爬蟲先忽略整個網(wǎng)頁源碼腳本和樣式以及html標(biāo)簽代碼,然后對剩下的文字部分進(jìn)行切詞語法句法分析等一系列的復(fù)雜處理。而采集器一般是通過 html標(biāo)簽特點(diǎn)來抓取需要的數(shù)據(jù),在制作采集規(guī)則時需要填寫目標(biāo)內(nèi)容的開始標(biāo)志何結(jié)束標(biāo)志,這樣就定位了所需要的內(nèi)容;或者采用對特定網(wǎng)頁制作特定的正則表達(dá)式,來篩選出需要的內(nèi)容。無論是利用開始結(jié)束標(biāo)志還是正則表達(dá)式,都會涉及到html標(biāo)簽(網(wǎng)頁結(jié)構(gòu)分析)。
然后再來提出一些防采集方法
1、限制IP地址單位時間的訪問次數(shù)
分析:沒有哪個常人一秒鐘內(nèi)能訪問相同網(wǎng)站5次,除非是程序訪問,而有這種喜好的,就剩下搜索引擎爬蟲和討厭的采集器了。
弊端:一刀切,這同樣會阻止搜索引擎對網(wǎng)站的收錄
適用網(wǎng)站:不太依靠搜索引擎的網(wǎng)站
采集器會怎么做:減少單位時間的訪問次數(shù),減低采集效率
2、屏蔽ip
分析:通過后臺計(jì)數(shù)器,記錄來訪者ip和訪問頻率,人為分析來訪記錄,屏蔽可疑Ip。
弊端:似乎沒什么弊端,就是站長忙了點(diǎn)
適用網(wǎng)站:所有網(wǎng)站,且站長能夠知道哪些是google或者百度的機(jī)器人
采集器會怎么做:打游擊戰(zhàn)唄!利用ip代理采集一次換一次,不過會降低采集器的效率和網(wǎng)速(用代理嘛)。
3、利用js加密網(wǎng)頁內(nèi)容
Note:這個方法我沒接觸過,只是從別處看來
分析:不用分析了,搜索引擎爬蟲和采集器通殺
適用網(wǎng)站:極度討厭搜索引擎和采集器的網(wǎng)站
采集器會這么做:你那么牛,都豁出去了,他就不來采你了
4、網(wǎng)頁里隱藏網(wǎng)站版權(quán)或者一些隨機(jī)垃圾文字,這些文字風(fēng)格寫在css文件中
分析:雖然不能防止采集,但是會讓采集后的內(nèi)容充滿了你網(wǎng)站的版權(quán)說明或者一些垃圾文字,因?yàn)橐话悴杉鞑粫瑫r采集你的css文件,那些文字沒了風(fēng)格,就顯示出來了。
適用網(wǎng)站:所有網(wǎng)站
采集器會怎么做:對于版權(quán)文字,好辦,替換掉。對于隨機(jī)的垃圾文字,沒辦法,勤快點(diǎn)了。
5、用戶登錄才能訪問網(wǎng)站內(nèi)容
分析:搜索引擎爬蟲不會對每個這樣類型的網(wǎng)站設(shè)計(jì)登錄程序。聽說采集器可以針對某個網(wǎng)站設(shè)計(jì)模擬用戶登錄提交表單行為。
適用網(wǎng)站:極度討厭搜索引擎,且想阻止大部分采集器的網(wǎng)站
采集器會怎么做:制作擬用戶登錄提交表單行為的模塊
6、利用腳本語言做分頁(隱藏分頁)
分析:還是那句,搜索引擎爬蟲不會針對各種網(wǎng)站的隱藏分頁進(jìn)行分析,這影響搜索引擎對其收錄。但是,采集者在編寫采集規(guī)則時,要分析目標(biāo)網(wǎng)頁代碼,懂點(diǎn)腳本知識的人,就會知道分頁的真實(shí)鏈接地址。
適用網(wǎng)站:對搜索引擎依賴度不高的網(wǎng)站,還有,采集你的人不懂腳本知識
采集器會怎么做:應(yīng)該說采集者會怎么做,他反正都要分析你的網(wǎng)頁代碼,順便分析你的分頁腳本,花不了多少額外時間。
相關(guān)文章
ASP 支持中文的len(),left(),right()的函數(shù)代碼
在用ASP處理文字時。系統(tǒng)自帶的字符串長度檢測函數(shù)有時候也不是很好用。2010-05-05asp中獲取當(dāng)前月份距離以前某個時間的月份數(shù)
獲取當(dāng)前月份距離以前某個時間的月份數(shù),asp都是用DateDiff函數(shù)來實(shí)現(xiàn)2012-04-04巧用FileSystem組件實(shí)現(xiàn)WEB應(yīng)用中的本地特定打印的方法
巧用FileSystem組件實(shí)現(xiàn)WEB應(yīng)用中的本地特定打印的方法...2007-04-04ASP中怎么實(shí)現(xiàn)SQL數(shù)據(jù)庫備份、恢復(fù)!
ASP中怎么實(shí)現(xiàn)SQL數(shù)據(jù)庫備份、恢復(fù)!...2007-03-03ASP中if語句、select 、while循環(huán)的使用方法
這篇文章主要介紹了ASP中if語句、select 、while循環(huán)的使用方法,需要的朋友可以參考下2015-11-11asp 驗(yàn)證輸入網(wǎng)址是否有效并可以訪問 與正則驗(yàn)證輸入網(wǎng)址
這篇文章主要是驗(yàn)證用戶輸入的字符是否是網(wǎng)址的方法,需要的朋友可以參考一下2007-08-08asp中通過addnew添加內(nèi)容后取得當(dāng)前文章的自遞增ID的方法
asp中使用addnew方法添加一條記錄后,我們經(jīng)常使用取得自遞增的ID,而使用bookmark很容易實(shí)現(xiàn)這樣的功能。2011-01-01隨機(jī)調(diào)用n條數(shù)據(jù)的方法分析
隨機(jī)調(diào)用n條數(shù)據(jù)的方法分析...2007-07-07