Pandas DataFrame數(shù)據(jù)存儲格式比較分析
創(chuàng)建測試Dataframe
首先創(chuàng)建一個包含不同類型數(shù)據(jù)的測試Pandas Dataframe。
import pandas as pd import random import string import numpy as np # Config DF df_length= 10**6 start_date= '2023-01-01' all_string= list(string.ascii_letters + string.digits) string_length= 10**1 min_number= 0 max_number= 10**3 # Create Columns date_col= pd.date_range(start= start_date, periods= df_length, freq= 'H') str_col= [''.join(np.random.choice(all_string, string_length)) for i in range(df_length)] float_col= np.random.rand(df_length) int_col= np.random.randint(min_number,max_number, size = df_length) # Create DataFrame df= pd.DataFrame({'date_col' : date_col, 'str_col' : str_col, 'float_col' : float_col, 'int_col' : int_col}) df.info() df.head()
以不同的格式存儲
接下來創(chuàng)建測試函數(shù),以不同的格式進(jìn)行讀寫。
import time import os def check_read_write_size(df, file_name, compression= None) : format= file_name.split('.')[-1] # Write begin= time.time() if file_name.endswith('.csv') : df.to_csv(file_name, index= False, compression= compression) elif file_name.endswith('.parquet') : df.to_parquet(file_name, compression= compression) elif file_name.endswith('.pickle') : df.to_pickle(file_name, compression= compression) elif file_name.endswith('.orc') : df.to_orc(file_name) elif file_name.endswith('.feather') : df.to_feather(file_name) elif file_name.endswith('.h5') : df.to_hdf(file_name, key= 'df') write_time= time.time() - begin # Read begin= time.time() if file_name.endswith('.csv') : pd.read_csv(file_name, compression= compression) elif file_name.endswith('.parquet') : pd.read_parquet(file_name) elif file_name.endswith('.pickle') : pd.read_pickle(file_name, compression= compression) elif file_name.endswith('.orc') : pd.read_orc(file_name) elif file_name.endswith('.h5') : pd.read_hdf(file_name) read_time= time.time() - begin # File Size file_size_mb = os.path.getsize(file_name) / (1024 * 1024) return [format, compression, read_time, write_time, file_size_mb]
然后運(yùn)行該函數(shù)并將結(jié)果存儲在另一個Pandas Dataframe中。
test_case= [ ['df.csv','infer'], ['df.csv','gzip'], ['df.pickle','infer'], ['df.pickle','gzip'], ['df.parquet','snappy'], ['df.parquet','gzip'], ['df.orc','default'], ['df.feather','default'], ['df.h5','default'], ] result= [] for i in test_case : result.append(check_read_write_size(df, i[0], compression= i[1])) result_df= pd.DataFrame(result, columns= ['format','compression','read_time','write_time','file_size']) result_df
測試結(jié)果
下面的圖表和表格是測試的結(jié)果。
分析
我們對測試的結(jié)果做一個簡單的分析
CSV
- 未壓縮文件的大小最大
- 壓縮后的尺寸很小,但不是最小的
- CSV的讀取速度和寫入速度是最慢的
Pickle
- 表現(xiàn)得很平均
- 但壓縮寫入速度是最慢的
Feather
最快的讀寫速度,文件的大小也是中等,非常的平均
ORC
- 所有格式中最小的
- 讀寫速度非???,幾乎是最快的
Parquet
總的來說,快速并且非常小,但是并不是最快也不是最小的
總結(jié)
從結(jié)果來看,我們應(yīng)該使用ORC或Feather,而不再使用CSV ?是嗎?
“這取決于你的系統(tǒng)。”
如果你正在做一些單獨(dú)的項目,那么使用最快或最小的格式肯定是有意義的。
但大多數(shù)時候,我們必須與他人合作。所以,除了速度和大小,還有更多的因素。
未壓縮的CSV可能很慢,而且最大,但是當(dāng)需要將數(shù)據(jù)發(fā)送到另一個系統(tǒng)時,它非常容易。
ORC作為傳統(tǒng)的大數(shù)據(jù)處理格式(來自Hive)對于速度的和大小的優(yōu)化是做的最好的,Parquet比ORC更大、更慢,但是它卻是在速度和大小中取得了最佳的平衡,并且支持他的生態(tài)也多,所以在需要處理大文件的時候可以優(yōu)先選擇Parquet。
以上就是Pandas DataFrame數(shù)據(jù)存儲格式比較分析的詳細(xì)內(nèi)容,更多關(guān)于Pandas DataFrame數(shù)據(jù)存儲格式的資料請關(guān)注腳本之家其它相關(guān)文章!
- SQL操作Pandas?DataFrame的三種方式示例詳解
- Python數(shù)據(jù)處理利器Pandas?DataFrame常用操作
- Python pymysql連接數(shù)據(jù)庫并將查詢結(jié)果轉(zhuǎn)化為Pandas dataframe
- Pandas處理DataFrame稀疏數(shù)據(jù)及維度不匹配數(shù)據(jù)分析詳解
- Python Pandas創(chuàng)建Dataframe數(shù)據(jù)框的六種方法匯總
- Pandas.DataFrame重置Series的索引index(reset_index)
- Pandas.DataFrame刪除指定行和列(drop)的實現(xiàn)
相關(guān)文章
Python?Watchdog實現(xiàn)實時監(jiān)控文件系統(tǒng)
Python?Watchdog是一個優(yōu)秀的第三方庫,用于實現(xiàn)高效的文件系統(tǒng)監(jiān)控,本文將為大家詳細(xì)介紹一下Python如何使用Watchdog實現(xiàn)實時監(jiān)控文件,需要的可以參考下2023-11-11python3多重排序處理多數(shù)據(jù)的示例詳解
Python3的多重排序通常指的是對數(shù)據(jù)集合按照兩個或多個人數(shù)屬性進(jìn)行排序的過程,這可以通過將多個排序關(guān)鍵字作為元組傳遞給內(nèi)置的sorted()函數(shù)或者是使用列表推導(dǎo)式結(jié)合lambda函數(shù)完成,本文詳細(xì)分析了python3多重排序處理多數(shù)據(jù),需要的朋友可以參考下2024-07-07Python+OpenCV之形態(tài)學(xué)操作詳解
這篇文章主要為大家詳細(xì)介紹了Python?OpenCV中的形態(tài)學(xué)操作(開運(yùn)算、閉運(yùn)算)的實現(xiàn),文中的示例代碼講解詳細(xì),感興趣的小伙伴可以了解一下2022-09-09用python爬取中國大學(xué)排名網(wǎng)站排名信息
大家好,本篇文章主要講的是用python爬取中國大學(xué)排名網(wǎng)站排名信息,感興趣的同學(xué)趕快來看一看吧,對你有幫助的話記得收藏一下2022-01-01安裝不同版本的tensorflow與models方法實現(xiàn)
這篇文章主要介紹了安裝不同版本的tensorflow與models方法實現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2021-02-02Python-OpenCV:cv2.imread(),cv2.imshow(),cv2.imwrite()的區(qū)別
本文主要介紹了OpenCV cv2.imread(),cv2.imshow(),cv2.imwrite()的區(qū)別,具有一定的參考價值,感興趣的小伙伴們可以參考一下2021-06-06