PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集
什么叫采集?
就是使用PHP程序,把其他網(wǎng)站中的信息抓取到我們自己的數(shù)據(jù)庫中、網(wǎng)站中。
PHP制作采集的技術(shù)
從底層的socket到高層的文件操作函數(shù),一共有3種方法可以實(shí)現(xiàn)采集。
1. 使用socket技術(shù)采集:
socket采集是最底層的,它只是建立了一個長連接,然后我們要自己構(gòu)造http協(xié)議字符串去發(fā)送請求。
例如要想獲取這個頁面的內(nèi)容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫如下:
<?php //連接,$error錯誤編號,$errstr錯誤的字符串,30s是連接超時時間 $fp=fsockopen("www.youku.com",80,$errno,$errstr,30); if(!$fp) die("連接失敗".$errstr); //構(gòu)造http協(xié)議字符串,因?yàn)閟ocket編程是最底層的,它還沒有使用http協(xié)議 $http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n"; // \r\n表示前面的是一個命令 $http.="Host:www.youku.com\r\n"; //請求的主機(jī) $http.="Connection:close\r\n\r\n"; // 連接關(guān)閉,最后一行要兩個\r\n //發(fā)送這個字符串到服務(wù)器 fwrite($fp,$http,strlen($http)); //接收服務(wù)器返回的數(shù)據(jù) $data=''; while (!feof($fp)) { $data.=fread($fp,4096); //fread讀取返回的數(shù)據(jù),一次讀取4096字節(jié) } //關(guān)閉連接 fclose($fp); var_dump($data); ?>
打印出的結(jié)果如下,包含了返回的頭信息及頁面的源碼:
2. 使用curl_一套函數(shù)
curl把HTTP協(xié)議都封裝成了很多函數(shù),直接傳相應(yīng)參數(shù)即可,降低了編寫HTTP協(xié)議字符串的難度。
前提:在php.ini中要開啟curl擴(kuò)展。
//生成一個curl對象 $curl=curl_init(); //設(shè)置URL和相應(yīng)的選項(xiàng) curl_setopt($curl, CURLOPT_URL, "http://www.youku.com"); curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1); //將curl_exec()獲取的信息以字符串返回,而不是直接輸出。 //執(zhí)行curl操作 $data=curl_exec($curl); var_dump($data);
打印出的結(jié)果如下,只包含頁面的源碼:
3. 直接使用file_get_contents(最頂層的)
前提:在php.ini中設(shè)置允許打開一個網(wǎng)絡(luò)的url地址。
//使用file_get_contents() $data=file_get_contents("http://www.youku.com"); var_dump($data);
3種方式的選擇
網(wǎng)絡(luò)之間通信主要使用的是以上三種。其中后兩種用的較多:如果要批量采集大量的數(shù)據(jù)時使用第二種【CURL】,性能好、穩(wěn)定。
偶爾發(fā)幾個請求發(fā)的頻繁不密集時使用第三種。
擴(kuò)展:圖片的防盜鏈如何破?
比如7060網(wǎng)站上的圖片做了防盜鏈:在他的網(wǎng)站中可以看到圖片,把圖片拿到站外就無法訪問。
原理:在HTTP協(xié)議中有一個referer項(xiàng),代表發(fā)這個請求的來源地址,服務(wù)器會判斷如果這個請求不是這個網(wǎng)站發(fā)來的就會過濾掉這個請求:
解決辦法:發(fā)HTTP時自己模擬referer即可:
擴(kuò)展:有些要采集數(shù)據(jù)時時必須先登錄,可以使用模擬的試模擬在登錄狀態(tài)下的采集:
a. 先用瀏覽登錄一下,登錄完,瀏覽器的COOKIE中就會有SESSIONID
b. 發(fā)PHP發(fā)HTTP協(xié)議時,把瀏覽器中的SESSIONID放到PHP的HTTP協(xié)議請求里,這樣就在以登錄的狀態(tài)發(fā)請求。
總結(jié):所有客戶端發(fā)過來的數(shù)據(jù)都可以被模擬,所以服務(wù)器上的程序必須要必要的地方過濾客戶端的數(shù)據(jù)。
什么時候用以上東西?接口開發(fā)時、采集時。
數(shù)據(jù)采集
例如我要采集這個url里的所有美國電影的信息,
http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html
則先要知道電影所在的節(jié)點(diǎn)的結(jié)構(gòu),我們使用firebug查看。
然后開始寫代碼:完整代碼如下
/** * 發(fā)一個GET請求獲取數(shù)據(jù) */ function get($url) { global $curl; // 配置curl中的http協(xié)議->可配置的薦可以查PHP手冊中的curl_ curl_setopt($curl, CURLOPT_URL, $url); curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE); curl_setopt($curl, CURLOPT_HEADER, FALSE); // 執(zhí)行這個請求 return curl_exec($curl); } // 生成一個curl對象 $curl = curl_init(); $url='http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html'; $data=get($url); // 匹配電影所在位置 $list_preg = '/<li class="yk-col4 mr1">.+<\/li>/Us'; // 匹配img標(biāo)簽上的src和alt $img_preg = '/<img class="quic" _src="(.*)" src="(.*)" alt="(.*)" \/>/U'; //匹配電影的url $video_preg='/<a href="(.*)" rel="external nofollow" title="(.*)" target="(.*)"><\/a>/U'; //把所有的li存到$list里,$list是個二維數(shù)組 preg_match_all($list_preg,$data,$list); //var_dump($list); foreach ($list[0] as $k => $v) { //這里$v就是每一個li標(biāo)簽 /* 獲取圖片及電影名稱 preg_match($img_preg,$v,$img); //把匹配到的圖片的信息存到$img里 var_dump($img); */ /*獲取電影地址 preg_match($video_preg,$v,$video); //把匹配到的電影的信息存到$video里 var_dump($video); */ preg_match($img_preg,$v,$img); preg_match($video_preg,$v,$video); echo $img[0].'<a href="'.$video[1].'" rel="external nofollow" >'.$video[2].'</a>'; }
測試:
打印$list;
打印$img
打印$video
最終效果:
如果需要把圖片拷貝到硬盤上,則在foreach循環(huán)里加上以下代碼:
$imgData = get($img[1]); // 把圖片文件寫到硬盤上【下載】 // 因?yàn)椴僮飨到y(tǒng)是GBK的,所以要把UTF8轉(zhuǎn)成GBK is_dir('./youkuimg/') ? '': mkdir('./youkuimg/'); file_put_contents('./youkuimg/'.mb_convert_encoding($img[3], 'gbk', 'utf-8').'.jpg', $imgData);
效果如下:在當(dāng)前目錄下的youkuimg目錄下就會有下載好的圖片。
以上就是PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集的詳細(xì)內(nèi)容,更多關(guān)于PHP使數(shù)據(jù)采集的資料請關(guān)注腳本之家其它相關(guān)文章!
- 深入php數(shù)據(jù)采集的詳解
- php7中停止php-fpm服務(wù)的方法詳解
- PHP 對接美團(tuán)大眾點(diǎn)評團(tuán)購券(門票)的開發(fā)步驟
- PHP小程序后臺部署運(yùn)行 LNMP+WNMP的方法
- 為PHP模塊添加SQL SERVER2012數(shù)據(jù)庫的步驟詳解
- php微信小程序解包過程實(shí)例詳解
- 利用ajax+php實(shí)現(xiàn)商品價格計算
- PHP對接阿里云虛擬號的實(shí)現(xiàn)(號碼隱私保護(hù))
- thinkphp5redis緩存新增方法實(shí)例講解
- PHP引擎php.ini參數(shù)優(yōu)化深入講解
- php優(yōu)化查詢foreach代碼實(shí)例講解
- PHP使用Redis隊(duì)列執(zhí)行定時任務(wù)實(shí)例講解
- PHP如何限制定時任務(wù)的進(jìn)程數(shù)量
相關(guān)文章
PHP設(shè)計模式之簡單工廠和工廠模式實(shí)例分析
這篇文章主要介紹了PHP設(shè)計模式之簡單工廠和工廠模式,結(jié)合實(shí)例形式分析了php設(shè)計模式中工廠模式的實(shí)現(xiàn)方法及相關(guān)操作注意事項(xiàng),需要的朋友可以參考下2019-03-03yii框架源碼分析之創(chuàng)建controller代碼
我們可以看到有時會使用protected目錄下的controller,有時會使用module中controller,具體是如何處理的呢,請看如下的分析2011-06-06php foreach 參數(shù)強(qiáng)制類型轉(zhuǎn)換的問題
大家都知道foreach的參數(shù)如果不是數(shù)組類型,在運(yùn)行的時候 就會出現(xiàn)類似“Warning: Invalid argument supplied for foreach() in XXX”warning信息。2010-12-12PHP實(shí)現(xiàn)約瑟夫環(huán)問題的方法分析
這篇文章主要介紹了PHP實(shí)現(xiàn)約瑟夫環(huán)問題的方法,結(jié)合實(shí)例形式分析了php使用循環(huán)與遞歸實(shí)現(xiàn)約瑟夫環(huán)的相關(guān)操作技巧,需要的朋友可以參考下2017-12-12