快捷導(dǎo)航

Python爬蟲使用bs4方法實(shí)現(xiàn)數(shù)據(jù)解析

更新時(shí)間：2020年08月25日 10:29:44 作者：Keep__Studying

這篇文章主要介紹了Python爬蟲使用bs4方法實(shí)現(xiàn)數(shù)據(jù)解析,文中通過示例代碼介紹的非常詳細(xì)，對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下

聚焦爬蟲:

爬取頁(yè)面中指定的頁(yè)面內(nèi)容。

編碼流程：

1.指定url
2.發(fā)起請(qǐng)求
3.獲取響應(yīng)數(shù)據(jù)
4.數(shù)據(jù)解析
5.持久化存儲(chǔ)

數(shù)據(jù)解析分類：

1.bs4
2.正則
3.xpath (***)

數(shù)據(jù)解析原理概述：

解析的局部的文本內(nèi)容都會(huì)在標(biāo)簽之間或者標(biāo)簽對(duì)應(yīng)的屬性中進(jìn)行存儲(chǔ)

1.進(jìn)行指定標(biāo)簽的定位

2.標(biāo)簽或者標(biāo)簽對(duì)應(yīng)的屬性中存儲(chǔ)的數(shù)據(jù)值進(jìn)行提取（解析）

bs4進(jìn)行數(shù)據(jù)解析數(shù)據(jù)解析的原理：

1.標(biāo)簽定位

2.提取標(biāo)簽、標(biāo)簽屬性中存儲(chǔ)的數(shù)據(jù)值

bs4數(shù)據(jù)解析的原理：

1.實(shí)例化一個(gè)BeautifulSoup對(duì)象，并且將頁(yè)面源碼數(shù)據(jù)加載到該對(duì)象中

2.通過調(diào)用BeautifulSoup對(duì)象中相關(guān)的屬性或者方法進(jìn)行標(biāo)簽定位和數(shù)據(jù)提取

環(huán)境安裝：

pip install bs4 -i https://pypi.tuna.tsinghua.edu.cn/simple
pip install lxml -i https://pypi.tuna.tsinghua.edu.cn/simple

實(shí)例化BeautifulSoup對(duì)象步驟：

from bs4 import BeautifulSoup

對(duì)象的實(shí)例化：

1.將本地的html文檔中的數(shù)據(jù)加載到該對(duì)象中

fp = open('./test.html','r',encoding='utf-8')
soup = BeautifulSoup(fp,'lxml')

2.將互聯(lián)網(wǎng)上獲取的頁(yè)面源碼加載到該對(duì)象中（常用方法，推薦）

page_text = response.text
soup = BeatifulSoup(page_text,'lxml')

提供的用于數(shù)據(jù)解析的方法和屬性：

soup.tagName:返回的是文檔中第一次出現(xiàn)的tagName對(duì)應(yīng)的標(biāo)簽
soup.find():
find('tagName'):等同于soup.div

1.屬性定位：

soup.find('div',class_/id/attr='song')
soup.find_all('tagName'):返回符合要求的所有標(biāo)簽（列表）
select：
select('某種選擇器（id，class，標(biāo)簽...選擇器）'),返回的是一個(gè)列表。

2.層級(jí)選擇器：

soup.select('.tang > ul > li > a')：>表示的是一個(gè)層級(jí)
soup.select('.tang > ul a')：空格表示的多個(gè)層級(jí)

3.獲取標(biāo)簽之間的文本數(shù)據(jù)：

soup.a.text/string/get_text()
text/get_text():可以獲取某一個(gè)標(biāo)簽中所有的文本內(nèi)容
string：只可以獲取該標(biāo)簽下面直系的文本內(nèi)容

4.獲取標(biāo)簽中屬性值：

soup.a['href']

案例：爬取三國(guó)演義小說(shuō)所有的章節(jié)標(biāo)題和章節(jié)內(nèi)容代碼如下：

import requests
from bs4 import BeautifulSoup

if __name__ == "__main__":
  #對(duì)首頁(yè)的頁(yè)面數(shù)據(jù)進(jìn)行爬取
  headers = {
    'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.121 Safari/537.36'
  }
  url = 'http://www.shicimingju.com/book/sanguoyanyi.html'
  page_text = requests.get(url=url,headers=headers).text

  #在首頁(yè)中解析出章節(jié)的標(biāo)題和詳情頁(yè)的url
  #實(shí)例化BeautifulSoup對(duì)象，需要將頁(yè)面源碼數(shù)據(jù)加載到該對(duì)象中
  soup = BeautifulSoup(page_text,'lxml')
  #解析章節(jié)標(biāo)題和詳情頁(yè)的url
  li_list = soup.select('.book-mulu > ul > li')
  fp = open('./sanguo.txt','w',encoding='utf-8')
  for li in li_list:
    title = li.a.string
    detail_url = 'http://www.shicimingju.com'+li.a['href']
    #對(duì)詳情頁(yè)發(fā)起請(qǐng)求，解析出章節(jié)內(nèi)容
    detail_page_text = requests.get(url=detail_url,headers=headers).text
    #解析出詳情頁(yè)中相關(guān)的章節(jié)內(nèi)容
    detail_soup = BeautifulSoup(detail_page_text,'lxml')
    div_tag = detail_soup.find('div',class_='chapter_content')
    #解析到了章節(jié)的內(nèi)容
    content = div_tag.text
    fp.write(title+':'+content+'\n')
    print(title,'爬取成功！??！')

運(yùn)行結(jié)果：