python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中
pdfplumber操作pdf文件
python開源庫(kù)pdfplumber,可以較為方便地獲取pdf的各種信息,包含pdf的基本信息(作者、創(chuàng)建時(shí)間、修改時(shí)間…)及表格、文本、圖片等信息,基本可以滿足較為簡(jiǎn)單的格式轉(zhuǎn)換功能。
一、pdfplumber安裝及導(dǎo)入
跟其他包一樣,支持使用pip安裝,安裝命令:
pip install pdfplumber

安裝成功后,可直接用import導(dǎo)入,導(dǎo)入命令:
import pdfplumber
二、pdfplumber基礎(chǔ)使用
1、基礎(chǔ)知識(shí)
(1)pdfplumber有2個(gè)基礎(chǔ)類
PDF和Page,PDF用來(lái)處理整個(gè)文檔,Page用來(lái)處理整個(gè)頁(yè)面。
| 類 | 用法簡(jiǎn)介 |
|---|---|
| pdfplumber.PDF | .metadata,獲取pdf基礎(chǔ)信息,返回字典格式,包含作者、創(chuàng)建時(shí)間等。 .pages,返回pdfplumber.Page實(shí)例的列表,每一個(gè)實(shí)例包含pdf每一頁(yè)的信息 |
| pdfplumber.Page | pdfplumber核心功能,對(duì)PDF的大部分操作都是基于這個(gè)類,包括提取文本、表格等 |
(2)pdfplumber讀取pdf文件方式
pdfplumber.open(‘文件路徑’),返回pdfplumber.PDF類的實(shí)例。
如果pdf有密碼,加入password參數(shù):
pdfplumber.open(‘文件路徑’,password=‘密碼’)
2、獲取pdf基礎(chǔ)信息
讀取pdf文件,并輸出pdf文件的基礎(chǔ)信息
import pdfplumber
# 打開pdf文件,有密碼加入password參數(shù)
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata # pdf的基礎(chǔ)信息
page_con = len(pdf_info.pages) # 獲取pdf的總頁(yè)數(shù)
print('pdf文件的基礎(chǔ)信息:\n', meta_data)
print('pdf共%s頁(yè)' % page_con)

3、pdfplumber提取表格數(shù)據(jù)
提取表格數(shù)據(jù)主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。
用以下pdf文檔,作為演示文檔。

(1)extract_tables()方法
輸出文檔所有表格,返回一個(gè)嵌套列表,其結(jié)構(gòu)層次為table-row-cell。如:
#extract_tables()用法
with pdfplumber.open(r'test.pdf') as pdf_info: # 打開pdf文件
page_one = pdf_info.pages[0] # 選擇第一頁(yè)
page_one_table =page_one.extract_tables() # 獲取pdf文檔第一頁(yè)的所有表格數(shù)據(jù)
for row in page_one_table:
print('第一頁(yè)的表格數(shù)據(jù):', row)

(2)、extact_table()方法
不會(huì)返回文檔的所有表格,僅返回行數(shù)最多的表格數(shù)據(jù),如存在多個(gè)行數(shù)相等的表格,則默認(rèn)輸出頂部表格數(shù)據(jù)。返回的數(shù)據(jù)結(jié)構(gòu)層次為row-cell,表格的每一行都為一個(gè)單獨(dú)的列表,列表中的元素即為原表格的各個(gè)單元格的數(shù)據(jù)。如:
# extract_table()用法
with pdfplumber.open(r'test.pdf') as pdf_info: # 打開pdf文件
page_one = pdf_info.pages[0] # 選擇第一頁(yè)
page_one_table = page_one.extract_table()
for row in page_one_table:
print(row)

三、提取pdf表格數(shù)據(jù)并保存到excel中
完整版,提取pdf表格數(shù)據(jù)并保存到excel中
import pdfplumber
from openpyxl import Workbook
class PDF(object):
def __init__(self, file_path):
self.pdf_path = file_path
# 讀取pdf文件
try:
self.pdf_info = pdfplumber.open(self.pdf_path)
print('讀取文件完成!')
except Exception as e:
print('讀取文件失敗:', e)
# 打印pdf的基本信息、返回字典,作者、創(chuàng)建時(shí)間、修改時(shí)間/總頁(yè)數(shù)
def get_pdf(self):
pdf_info = self.pdf_info.metadata
pdf_page = len(self.pdf_info.pages)
print('pdf共%s頁(yè)' % pdf_page)
print("pdf文件基本信息:\n", pdf_info)
self.close_pdf()
# 提取表格數(shù)據(jù),并保存到excel中
def get_table(self):
wb = Workbook() # 實(shí)例化一個(gè)工作簿對(duì)象
ws = wb.active # 獲取第一個(gè)sheet
con = 0
try:
# 獲取每一頁(yè)的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]]
for page in self.pdf_info.pages:
for table in page.extract_tables():
for row in table:
# 對(duì)每個(gè)單元格的字符進(jìn)行簡(jiǎn)單清洗處理
row_list = [cell.replace('\n', ' ') if cell else '' for cell in row]
ws.append(row_list) # 寫入數(shù)據(jù)
con += 1
print('---------------分割線,第%s頁(yè)---------------' % con)
except Exception as e:
print('報(bào)錯(cuò):', e)
finally:
wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx')
print('寫入完成!')
self.close_pdf()
# 關(guān)閉文件
def close_pdf(self):
self.pdf_info.close()
if __name__ == "__main__":
file_path = input('請(qǐng)輸入pdf文件路徑:')
pdf_info = PDF(file_path)
# pdf_info.get_pdf() # 打印pdf基礎(chǔ)信息
# 提取pdf表格數(shù)據(jù)并保存到excel中,文件保存到跟pdf同一文件路徑下
pdf_info.get_table()總結(jié)
到此這篇關(guān)于python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中的文章就介紹到這了,更多相關(guān)python提取pdf數(shù)據(jù)保存excel內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- Python使用PyPDF2庫(kù)實(shí)現(xiàn)向PDF文件中插入內(nèi)容
- Python利用PyPDF2庫(kù)實(shí)現(xiàn)輕松提取PDF文本
- Python使用PyPDF2?Pillow庫(kù)來(lái)將PDF文件轉(zhuǎn)圖片
- PyPDF2讀取PDF文件內(nèi)容保存到本地TXT實(shí)例
- 解決pyPdf和pyPdf2在合并pdf時(shí)出現(xiàn)異常的問(wèn)題
- Python實(shí)現(xiàn)PyPDF2處理PDF文件的方法示例
- Python中使用pypdf2合并、分割、加密pdf文件的代碼詳解
- Python使用pdfplumber庫(kù)高效解析PDF文件
- Python利用pdfplumber庫(kù)提取pdf中表格數(shù)據(jù)
- Python利用pdfplumber實(shí)現(xiàn)讀取PDF寫入Excel
- python使用PyPDF2 和 pdfplumber操作PDF文件
相關(guān)文章
Python3標(biāo)準(zhǔn)庫(kù)之threading進(jìn)程中管理并發(fā)操作方法
這篇文章主要介紹了Python3標(biāo)準(zhǔn)庫(kù)之threading進(jìn)程中管理并發(fā)操作方法,本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2020-03-03
Python實(shí)現(xiàn)根據(jù)日期獲取當(dāng)天凌晨時(shí)間戳的方法示例
這篇文章主要介紹了Python實(shí)現(xiàn)根據(jù)日期獲取當(dāng)天凌晨時(shí)間戳的方法,涉及Python針對(duì)日期與時(shí)間戳的相關(guān)轉(zhuǎn)換、運(yùn)算等操作技巧,需要的朋友可以參考下2019-04-04
Python中urllib與urllib2模塊的變化與使用詳解
urllib是python提供的一個(gè)用于操作URL的模塊,在python2.x中有URllib庫(kù),也有Urllib2庫(kù),在python3.x中Urllib2合并到了Urllib中,我們爬取網(wǎng)頁(yè)的時(shí)候需要經(jīng)常使用到這個(gè)庫(kù),需要的朋友可以參考下2023-05-05
Python虛擬環(huán)境創(chuàng)建和使用方法(使用自帶的venv模塊)
這篇文章主要如何在Python中使用虛擬環(huán)境,包括創(chuàng)建、激活、使用、生成requirements.txt文件、卸載包和刪除虛擬環(huán)境,虛擬環(huán)境有助于隔離項(xiàng)目依賴,避免版本沖突,并便于部署,需要的朋友可以參考下2024-12-12

