使用Python編寫簡單網(wǎng)絡(luò)爬蟲抓取視頻下載資源
我第一次接觸爬蟲這東西是在今年的5月份,當(dāng)時(shí)寫了一個(gè)博客搜索引擎,所用到的爬蟲也挺智能的,起碼比電影來了這個(gè)站用到的爬蟲水平高多了!
回到用Python寫爬蟲的話題。
Python一直是我主要使用的腳本語言,沒有之一。Python的語言簡潔靈活,標(biāo)準(zhǔn)庫功能強(qiáng)大,平??梢杂米饔?jì)算器,文本編碼轉(zhuǎn)換,圖片處理,批量下載,批量處理文本等??傊液芟矚g,也越用越上手,這么好用的一個(gè)工具,一般人我不告訴他。。。
因?yàn)槠鋸?qiáng)大的字符串處理能力,以及urllib2,cookielib,re,threading這些模塊的存在,用Python來寫爬蟲就簡直易于反掌了。簡單到什么程度呢。我當(dāng)時(shí)跟某同學(xué)說,我寫電影來了用到的幾個(gè)爬蟲以及數(shù)據(jù)整理的一堆零零散散的腳本代碼行數(shù)總共不超過1000行,寫電影來了這個(gè)網(wǎng)站也只有150來行代碼。因?yàn)榕老x的代碼在另外一臺(tái)64位的黑蘋果上,所以就不列出來,只列一下VPS上網(wǎng)站的代碼,tornadoweb框架寫的
[xiaoxia@307232 movie_site]$ wc -l *.py template/*
156 msite.py
92 template/base.html
79 template/category.html
94 template/id.html
47 template/index.html
77 template/search.html
下面直接show一下爬蟲的編寫流程。以下內(nèi)容僅供交流學(xué)習(xí)使用,沒有別的意思。
以某灣的最新視頻下載資源為例,其網(wǎng)址是
http://某piratebay.se/browse/200
因?yàn)樵摼W(wǎng)頁里有大量廣告,只貼一下正文部分內(nèi)容:
對于一個(gè)python爬蟲,下載這個(gè)頁面的源代碼,一行代碼足以。這里用到urllib2庫。
>>> import urllib2
>>> html = urllib2.urlopen('http://某piratebay.se/browse/200').read()
>>> print 'size is', len(html)
size is 52977
當(dāng)然,也可以用os模塊里的system函數(shù)調(diào)用wget命令來下載網(wǎng)頁內(nèi)容,對于掌握了wget或者curl工具的同學(xué)是很方便的。
使用Firebug觀察網(wǎng)頁結(jié)構(gòu),可以知道正文部分html是一個(gè)table。每一個(gè)資源就是一個(gè)tr標(biāo)簽。
而對于每一個(gè)資源,需要提取的信息有:
1、視頻分類
2、資源名稱
3、資源鏈接
4、資源大小
5、上傳時(shí)間
就這么多就夠了,如果有需要,還可以增加。
首先提取一段tr標(biāo)簽里的代碼來觀察一下。
<tr>
<td class="vertTh">
<center>
<a href="/browse/200" title="此目錄中更多">視頻</a><br />
(<a href="/browse/205" title="此目錄中更多">電視</a>)
</center>
</td>
<td>
<div class="detName"> <a href="/torrent/7782194/The_Walking_Dead_Season_3_Episodes_1-3_HDTV-x264" class="detLink" title="細(xì)節(jié) The Walking Dead Season 3 Episodes 1-3 HDTV-x264">The Walking Dead Season 3 Episodes 1-3 HDTV-x264</a>
</div>
<a href="magnet:?xt=urn:btih:4f63d58e51c1a4a997c6f099b2b529bdbba72741&dn=The+Walking+Dead+Season+3+Episodes+1-3+HDTV-x264&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A80&tr=udp%3A%2F%2Ftracker.publicbt.com%3A80&tr=udp%3A%2F%2Ftracker.istole.it%3A6969&tr=udp%3A%2F%2Ftracker.ccc.de%3A80" title="Download this torrent using magnet"><img src="http://static.某piratebay.se/img/icon-magnet.gif" alt="Magnet link" /></a> <a href="http://torrents.某piratebay.se/7782194/The_Walking_Dead_Season_3_Episodes_1-3_HDTV-x264.7782194.TPB.torrent" title="下載種子"><img src="http://static.某piratebay.se/img/dl.gif" class="dl" alt="下載" /></a><img src="http://static.某piratebay.se/img/11x11p.png" /><img src="http://static.某piratebay.se/img/11x11p.png" />
<font class="detDesc">已上傳 <b>3 分鐘前</b>, 大小 2 GiB, 上傳者 <a class="detDesc" href="/user/paridha/" title="瀏覽 paridha">paridha</a></font>
</td>
<td align="right">0</td>
<td align="right">0</td>
</tr>
下面用正則表達(dá)式來提取html代碼中的內(nèi)容。對正則表達(dá)式不了解的同學(xué),可以去 http://docs.python.org/2/library/re.html 了解一下。
為何要用正則表達(dá)式而不用其他一些解析HTML或者DOM樹的工具是有原因的。我之前試過用BeautifulSoup3來提取內(nèi)容,后來發(fā)覺速度實(shí)在是慢死了啊,一秒鐘能夠處理100個(gè)內(nèi)容,已經(jīng)是我電腦的極限了。。。而換了正則表達(dá)式,編譯后處理內(nèi)容,速度上直接把它秒殺了!
提取這么多內(nèi)容,我的正則表達(dá)式要如何寫呢?
根據(jù)我以往的經(jīng)驗(yàn),“.*?”或者“.+?”這個(gè)東西是很好使的。不過也要注意一些小問題,實(shí)際用到的時(shí)候就會(huì)知道
對于上面的tr標(biāo)簽代碼,我首先需要讓我的表達(dá)式匹配到的符號(hào)是
<tr>
表示內(nèi)容的開始,當(dāng)然也可以是別的,只要不要錯(cuò)過需要的內(nèi)容即可。然后我要匹配的內(nèi)容是下面這個(gè),獲取視頻分類。
(<a href="/browse/205" title="此目錄中更多">電視</a>)
接著我要匹配資源鏈接了,
<a href="..." class="detLink" title="...">...</a>
再到其他資源信息,
font class="detDesc">已上傳 <b>3 分鐘前</b>, 大小 2 GiB, 上傳者
最后匹配
</tr>
大功告成!
當(dāng)然,最后的匹配可以不需要在正則表達(dá)式里表示出來,只要開始位置定位正確了,后面獲取信息的位置也就正確了。
對正則表達(dá)式比較了解的朋友,可能知道怎么寫了。我Show一下我寫的表達(dá)式處理過程,
就這么簡單,結(jié)果出來了,自我感覺挺歡喜的。
當(dāng)然,這樣設(shè)計(jì)的爬蟲是有針對性的,定向爬取某一個(gè)站點(diǎn)的內(nèi)容。也沒有任何一個(gè)爬蟲不會(huì)對收集到的鏈接進(jìn)行篩選。通??梢允褂肂FS(寬度優(yōu)先搜索算法)來爬取一個(gè)網(wǎng)站的所有頁面鏈接。
完整的Python爬蟲代碼,爬取某灣最新的10頁視頻資源:
# coding: utf8
import urllib2
import re
import pymongo
db = pymongo.Connection().test
url = 'http://某piratebay.se/browse/200/%d/3'
find_re = re.compile(r'<tr>.+?\(.+?">(.+?)</a>.+?class="detLink".+?">(.+?)</a>.+?<a href="(magnet:.+?)" .+?已上傳 <b>(.+?)</b>, 大小 (.+?),', re.DOTALL)
# 定向爬去10頁最新的視頻資源
for i in range(0, 10):
u = url % (i)
# 下載數(shù)據(jù)
html = urllib2.urlopen(u).read()
# 找到資源信息
for x in find_re.findall(html):
values = dict(
category = x[0],
name = x[1],
magnet = x[2],
time = x[3],
size = x[4]
)
# 保存到數(shù)據(jù)庫
db.priate.save(values)
print 'Done!'
以上代碼僅供思路展示,實(shí)際運(yùn)行使用到mongodb數(shù)據(jù)庫,同時(shí)可能因?yàn)闊o法訪問某灣網(wǎng)站而無法得到正常結(jié)果。
所以說,電影來了網(wǎng)站用到的爬蟲不難寫,難的是獲得數(shù)據(jù)后如何整理獲取有用信息。例如,如何匹配一個(gè)影片信息跟一個(gè)資源,如何在影片信息庫和視頻鏈接之間建立關(guān)聯(lián),這些都需要不斷嘗試各種方法,最后選出比較靠譜的。
曾有某同學(xué)發(fā)郵件想花錢也要得到我的爬蟲的源代碼。
要是我真的給了,我的爬蟲就幾百來行代碼,一張A4紙,他不會(huì)說,坑爹?。。。 ?/p>
都說現(xiàn)在是信息爆炸的時(shí)代,所以比的還是誰的數(shù)據(jù)挖掘能力強(qiáng)
好吧,那么問題來了學(xué)習(xí)挖掘機(jī)(數(shù)據(jù))技術(shù)到底哪家強(qiáng)?
相關(guān)文章
python實(shí)現(xiàn)MySQL?數(shù)據(jù)庫表格創(chuàng)建?數(shù)據(jù)插入及獲取插入ID操作教程
這篇文章主要為大家介紹了python實(shí)現(xiàn)MySQL?數(shù)據(jù)庫表格創(chuàng)建?數(shù)據(jù)插入及獲取插入ID操作教程,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-11-11Python 獲取命令行參數(shù)內(nèi)容及參數(shù)個(gè)數(shù)的實(shí)例
今天小編就為大家分享一篇Python 獲取命令行參數(shù)內(nèi)容及參數(shù)個(gè)數(shù)的實(shí)例,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧2019-12-12pytorch加載訓(xùn)練好的模型用來測試或者處理方式
這篇文章主要介紹了pytorch加載訓(xùn)練好的模型用來測試或者處理方式,具有很好的參考價(jià)值,希望對大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教2023-09-09django之用戶、用戶組及權(quán)限設(shè)置方式
這篇文章主要介紹了django之用戶、用戶組及權(quán)限設(shè)置方式,具有很好的參考價(jià)值,希望對大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教2023-05-05編寫python代碼實(shí)現(xiàn)簡單抽獎(jiǎng)器
這篇文章主要介紹了編寫python代碼實(shí)現(xiàn)簡單抽獎(jiǎng)器,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-10-10Django?ORM數(shù)據(jù)庫操作Python化藝術(shù)探索
這篇文章主要介紹了Django?ORM數(shù)據(jù)庫操作Python化藝術(shù)探索,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-11-11