亚洲乱码中文字幕综合,中国熟女仑乱hd,亚洲精品乱拍国产一区二区三区,一本大道卡一卡二卡三乱码全集资源,又粗又黄又硬又爽的免费视频

python中scrapy處理項(xiàng)目數(shù)據(jù)的實(shí)例分析

 更新時(shí)間:2020年11月22日 08:52:10   作者:小妮淺淺  
在本篇文章里小編給大家整理了關(guān)于python中scrapy處理項(xiàng)目數(shù)據(jù)的實(shí)例分析內(nèi)容,有興趣的朋友們可以學(xué)習(xí)下。

在我們處理完數(shù)據(jù)后,習(xí)慣把它放在原有的位置,但是這樣也會(huì)出現(xiàn)一定的隱患。如果因?yàn)樾聰?shù)據(jù)的加入或者其他種種原因,當(dāng)我們?cè)俅蜗胍獑⒂眠@個(gè)文件的時(shí)候,小伙伴們就會(huì)開(kāi)始著急卻怎么也翻不出來(lái),似乎也沒(méi)有其他更好的搜集辦法,而重新進(jìn)行數(shù)據(jù)整理顯然是不現(xiàn)實(shí)的。下面我們就一起看看python爬蟲(chóng)中scrapy處理項(xiàng)目數(shù)據(jù)的方法吧。

1、拉取項(xiàng)目

$ git clone https://github.com/jonbakerfish/TweetScraper.git

$ cd TweetScraper/

$ pip install -r requirements.txt #add '--user' if you are not root

$ scrapy list

$ #If the output is 'TweetScraper', then you are ready to go.

2、數(shù)據(jù)持久化

通過(guò)閱讀文檔,我們發(fā)現(xiàn)該項(xiàng)目有三種持久化數(shù)據(jù)的方式,第一種是保存在文件中,第二種是保存在Mongo中,第三種是保存在MySQL數(shù)據(jù)庫(kù)中。因?yàn)槲覀冏ト〉臄?shù)據(jù)需要做后期的分析,所以,需要將數(shù)據(jù)保存在MySQL中。

抓取到的數(shù)據(jù)默認(rèn)是以Json格式保存在磁盤 ./Data/tweet/ 中的,所以,需要修改配置文件 TweetScraper/settings.py 。

ITEM_PIPELINES = {  # 'TweetScraper.pipelines.SaveToFilePipeline':100,
#'TweetScraper.pipelines.SaveToMongoPipeline':100, # replace `SaveToFilePipeline` with this to use MongoDB
  'TweetScraper.pipelines.SavetoMySQLPipeline':100, # replace `SaveToFilePipeline` with this to use MySQL
}
#settings for mysql
MYSQL_SERVER = "18.126.219.16"
MYSQL_DB   = "scraper"
MYSQL_TABLE = "tweets" # the table will be created automatically
MYSQL_USER  = "root"    # MySQL user to use (should have INSERT access granted to the Database/Table
MYSQL_PWD  = "admin123456"    # MySQL user's password

內(nèi)容擴(kuò)展:

scrapy.cfg是項(xiàng)目的配置文件

from scrapy.spider import BaseSpider
class DmozSpider(BaseSpider):
name = "dmoz"
allowed_domains = ["dmoz.org"]
start_urls = [
  "http://www.dmoz.org/Computers/Programming/Languages/Python/Books/",
  "http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/"
]
def parse(self, response):
  filename = response.url.split("/")[-2]
  open(filename, 'wb').write(response.body)

到此這篇關(guān)于python中scrapy處理項(xiàng)目數(shù)據(jù)的實(shí)例分析的文章就介紹到這了,更多相關(guān)python爬蟲(chóng)中scrapy如何處理項(xiàng)目數(shù)據(jù)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python3 shelve模塊的詳解

    python3 shelve模塊的詳解

    這篇文章主要介紹了python3 shelve模塊的詳解的相關(guān)資料,需要的朋友可以參考下
    2017-07-07
  • Python判斷素?cái)?shù)的3種方法及for-else語(yǔ)句的用法介紹

    Python判斷素?cái)?shù)的3種方法及for-else語(yǔ)句的用法介紹

    素?cái)?shù)又叫質(zhì)數(shù),指的是>1的整數(shù)中,只能被1和這個(gè)數(shù)本身整除的數(shù),這篇文章主要給大家介紹了關(guān)于Python判斷素?cái)?shù)的3種方法及for-else語(yǔ)句的用法介紹的相關(guān)資料,文中通過(guò)代碼介紹的非常詳細(xì),需要的朋友可以參考下
    2024-05-05
  • Pycharm不同版本鏡像源添加方法

    Pycharm不同版本鏡像源添加方法

    本文主要介紹了Pycharm不同版本鏡像源添加方法,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2023-02-02
  • python3 深淺copy對(duì)比詳解

    python3 深淺copy對(duì)比詳解

    這篇文章主要介紹了python3 深淺copy對(duì)比詳解,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-08-08
  • Django日志模塊logging的配置詳解

    Django日志模塊logging的配置詳解

    日志在程序開(kāi)發(fā)中是少不了的,通過(guò)日志我們可以分析到錯(cuò)誤在什么地方,有什么異常。在生產(chǎn)環(huán)境下有很大的用處。在java 開(kāi)發(fā)中通常用 log4j,logback 等三方組件。下面這篇文章主要介紹了Django日志模塊logging的相關(guān)資料,需要的朋友可以參考下。
    2017-02-02
  • python3下實(shí)現(xiàn)搜狗AI API的代碼示例

    python3下實(shí)現(xiàn)搜狗AI API的代碼示例

    這篇文章主要介紹了python3下實(shí)現(xiàn)搜狗AI API的代碼示例,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2018-04-04
  • 用python簡(jiǎn)單實(shí)現(xiàn)mysql數(shù)據(jù)同步到ElasticSearch的教程

    用python簡(jiǎn)單實(shí)現(xiàn)mysql數(shù)據(jù)同步到ElasticSearch的教程

    今天小編就為大家分享一篇用python簡(jiǎn)單實(shí)現(xiàn)mysql數(shù)據(jù)同步到ElasticSearch的教程,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2018-05-05
  • Python爬取成語(yǔ)接龍類網(wǎng)站

    Python爬取成語(yǔ)接龍類網(wǎng)站

    在本篇文章里我們給大家分享了關(guān)于Python爬取成語(yǔ)接龍類網(wǎng)站的相關(guān)知識(shí)點(diǎn),有需要的朋友們學(xué)習(xí)下。
    2018-10-10
  • Python實(shí)現(xiàn)豆瓣圖片下載的方法

    Python實(shí)現(xiàn)豆瓣圖片下載的方法

    這篇文章主要介紹了Python實(shí)現(xiàn)豆瓣圖片下載的方法,涉及Python針對(duì)網(wǎng)頁(yè)操作的相關(guān)技巧,需要的朋友可以參考下
    2015-05-05
  • ubuntu安裝sublime3并配置python3環(huán)境的方法

    ubuntu安裝sublime3并配置python3環(huán)境的方法

    這篇文章主要介紹了ubuntu安裝sublime3并配置python3環(huán)境的方法,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2018-03-03

最新評(píng)論