亚洲乱码中文字幕综合,中国熟女仑乱hd,亚洲精品乱拍国产一区二区三区,一本大道卡一卡二卡三乱码全集资源,又粗又黄又硬又爽的免费视频

Python中re模塊結(jié)合正則表達(dá)式的實(shí)際應(yīng)用案例

 更新時(shí)間:2025年06月28日 14:18:19   作者:topfine  
Python中的re模塊是用于處理正則表達(dá)式的強(qiáng)大工具,正則表達(dá)式是一種用來(lái)匹配字符串的模式,它可以在文本中搜索和匹配特定的字符串模式,這篇文章主要介紹了Python中re模塊結(jié)合正則表達(dá)式的實(shí)際應(yīng)用案例,需要的朋友可以參考下

前言

在 Python 中,re 模塊是用于處理正則表達(dá)式的標(biāo)準(zhǔn)庫(kù)。它非常適合用于文本清洗、提取和整理任務(wù)。下面是一些常見(jiàn)的使用 re 包結(jié)合正則表達(dá)式進(jìn)行文本清洗的方法示例。

re模塊常用函數(shù)

函數(shù)功能
re.match()從字符串開(kāi)頭開(kāi)始匹配
re.search()在整個(gè)字符串中查找第一個(gè)匹配項(xiàng)
re.findall()找出所有匹配的內(nèi)容,返回列表
re.sub()替換匹配內(nèi)容
re.split()根據(jù)正則表達(dá)式分割字符串

一、查看文本中是否包含 A 或 B 字符串

import re

text = "這是一個(gè)測(cè)試字符串,包含apple和banana。"

# 查看是否包含 'apple' 或 'banana'
if re.search(r'apple|banana', text):
    print("包含 apple 或 banana")
else:
    print("不包含")
說(shuō)明:
r'apple|banana' 是一個(gè)正則表達(dá)式,表示匹配 “apple” 或者 “banana”
re.search():只要在字符串中有匹配項(xiàng)就返回 True(或匹配對(duì)象)

二、替換多個(gè)關(guān)鍵詞為統(tǒng)一格式

text = "訪(fǎng)問(wèn)網(wǎng)址 www.google.com 或 http://www.baidu.com 獲取信息"
cleaned_text = re.sub(r'www\.|http://', '', text)
print(cleaned_text)
# 輸出: 訪(fǎng)問(wèn)網(wǎng)址 google.com 或 baidu.com 獲取信息

三、提取所有數(shù)字

text = "電話(huà)號(hào)碼是1234567890,郵編是100000"
numbers = re.findall(r'\d+', text)
print(numbers)
# 輸出: ['1234567890', '100000']

四、去除標(biāo)點(diǎn)符號(hào)

import string

text = "你好!這是一段,含有很多標(biāo)點(diǎn)?"
pattern = f"[{re.escape(string.punctuation)}]"
cleaned_text = re.sub(pattern, "", text)
print(cleaned_text)
# 輸出: 你好這是一段含有很多標(biāo)點(diǎn)

五、提取中文字符

text = "Hello 你好,世界123"
chinese_chars = re.findall(r'[\u4e00-\u9fa5]+', text)
print(''.join(chinese_chars))
# 輸出: 你好世界

六、刪除空白字符(空格、換行、制表符等)

text = "  這是一個(gè)\t帶有很多\n空白的文本  "
cleaned_text = re.sub(r'\s+', ' ', text).strip()
print(cleaned_text)
# 輸出: 這是一個(gè) 帶有很多 空白的文本

七、提取郵箱地址

深色版本
text = "聯(lián)系我 at example@example.com 或 support@domain.co.cn"
emails = re.findall(r'[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+\.[a-zA-Z0-9-.]+', text)
print(emails)
# 輸出: ['example@example.com', 'support@domain.co.cn']

八、提取 URL 地址

text = "訪(fǎng)問(wèn) https://example.com 或 http://www.google.com"
urls = re.findall(r'https?://(?:www\.)?\S+', text)
print(urls)
# 輸出: ['https://example.com', 'http://www.google.com']

九、保留字母、數(shù)字、中文,刪除其他字符

text = "這!is a 123_測(cè)試-text..."
cleaned_text = re.sub(r'[^\u4e00-\u9fa5a-zA-Z0-9]', '', text)
print(cleaned_text)
# 輸出: 這is a 123測(cè)試text

十、分詞前預(yù)處理(小寫(xiě) + 去除特殊字符)

text = "Hello World! 你好,World!"
cleaned_text = re.sub(r'[^\w\s]|_', '', text).lower()
print(cleaned_text)
# 輸出: hello world 你好world

十一、提取手機(jī)號(hào)碼方法(11位數(shù)字)

1.提前手機(jī)號(hào)碼

示例目標(biāo): 將如 13812345678 格式手機(jī)號(hào)提取出來(lái),并格式化為 138-1234-5678。

實(shí)現(xiàn)代碼:

import re

text = "我的電話(huà)是13812345678,請(qǐng)?jiān)诠ぷ鲿r(shí)間撥打。另一個(gè)號(hào)碼是13987654321"

# 提取所有11位手機(jī)號(hào)
phone_numbers = re.findall(r'1\d{10}', text)

# 格式化為 138-1234-5678 樣式
formatted_numbers = [re.sub(r'(\d{3})(\d{4})(\d{4})', r'\1-\2-\3', num) for num in phone_numbers]

print(formatted_numbers)
# 輸出: ['138-1234-5678', '139-8765-4321']

2.從包含干擾字符的字符串中提取手機(jī)號(hào)并清理

有時(shí)候手機(jī)號(hào)中可能夾雜著空格、短橫線(xiàn)等字符,比如 "138 1234 5678" 或 "139-1234-5678"。 示例代碼:

text = "聯(lián)系方式:138 1234 5678 或 139-1234-5678"

# 去除非數(shù)字字符后提取11位手機(jī)號(hào)
cleaned_numbers = re.findall(r'1\d{10}', re.sub(r'\D', '', text))

# 再格式化輸出
formatted_numbers = [re.sub(r'(\d{3})(\d{4})(\d{4})', r'\1-\2-\3', num) for num in cleaned_numbers]

print(formatted_numbers)
# 輸出: ['138-1234-5678', '139-1234-5678']

4.添加國(guó)家區(qū)號(hào)并統(tǒng)一格式

如果你需要加上國(guó)家區(qū)號(hào) +86:

formatted_with_code = ['+86 ' + num for num in formatted_numbers]
print(formatted_with_code)
# 輸出: ['+86 138-1234-5678', '+86 139-1234-5678']

5.封裝成函數(shù)

def format_chinese_phone(text):
    # 清理非數(shù)字內(nèi)容
    cleaned = re.sub(r'\D', '', text)
    # 提取手機(jī)號(hào)
    phones = re.findall(r'1\d{10}', cleaned)
    # 格式化
    return [re.sub(r'(\d{3})(\d{4})(\d{4})', r'\1-\2-\3', p) for p in phones]

# 使用示例
text = "我的聯(lián)系電話(huà)是:138 1234 5678 和 139-8765-4321"
print(format_chinese_phone(text))
# 輸出: ['138-1234-5678', '139-8765-4321']

6.正則說(shuō)明

正則表達(dá)式含義
\d匹配任意數(shù)字
\D匹配非數(shù)字
{n}精確匹配 n 次
r'(\d{3})(\d{4})(\d{4})'分組提取前3位、中間4位、后4位
\1-\2-\3替換為帶連字符的格式

總結(jié) 

到此這篇關(guān)于Python中re模塊結(jié)合正則表達(dá)式實(shí)際應(yīng)用案例的文章就介紹到這了,更多相關(guān)Python re模塊正則表達(dá)式內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • 詳解Selenium如何使用input標(biāo)簽上傳文件完整流程

    詳解Selenium如何使用input標(biāo)簽上傳文件完整流程

    這篇文章主要介紹了詳解Selenium如何使用input標(biāo)簽上傳文件完整流程,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-05-05
  • Tensorflow獲取張量Tensor的具體維數(shù)實(shí)例

    Tensorflow獲取張量Tensor的具體維數(shù)實(shí)例

    今天小編就為大家分享一篇Tensorflow獲取張量Tensor的具體維數(shù)實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-01-01
  • 關(guān)于python函數(shù)的建立、調(diào)用、傳參、返回值詳解

    關(guān)于python函數(shù)的建立、調(diào)用、傳參、返回值詳解

    這篇文章主要介紹了關(guān)于python函數(shù)的建立、調(diào)用、傳參、返回值詳解,Python?還支持自定義函數(shù),即將一段有規(guī)律的、可重復(fù)使用的代碼定義成函數(shù),從而達(dá)到一次編寫(xiě)多次調(diào)用的目的,需要的朋友可以參考下
    2023-07-07
  • 決策樹(shù)剪枝算法的python實(shí)現(xiàn)方法詳解

    決策樹(shù)剪枝算法的python實(shí)現(xiàn)方法詳解

    這篇文章主要介紹了決策樹(shù)剪枝算法的python實(shí)現(xiàn)方法,結(jié)合實(shí)例形式較為詳細(xì)的分析了決策樹(shù)剪枝算法的概念、原理并結(jié)合實(shí)例形式分析了Python相關(guān)實(shí)現(xiàn)技巧,需要的朋友可以參考下
    2019-09-09
  • Python+selenium破解拼圖驗(yàn)證碼的腳本

    Python+selenium破解拼圖驗(yàn)證碼的腳本

    很多網(wǎng)站在登錄或者注冊(cè)時(shí)都會(huì)遇到拼圖驗(yàn)證碼,這種拼圖驗(yàn)證碼實(shí)際上是多個(gè)小碎片經(jīng)過(guò)重新組合成的一張整體。本文將和大家分享一個(gè)基于Python selenium的破解拼圖驗(yàn)證碼的腳本,需要的可以參考一下
    2022-02-02
  • Python實(shí)現(xiàn)的tcp端口檢測(cè)操作示例

    Python實(shí)現(xiàn)的tcp端口檢測(cè)操作示例

    這篇文章主要介紹了Python實(shí)現(xiàn)的tcp端口檢測(cè)操作,結(jié)合實(shí)例形式分析了Python使用socket模塊實(shí)現(xiàn)tcp端口檢測(cè)功能的相關(guān)操作技巧,需要的朋友可以參考下
    2018-07-07
  • python中關(guān)于property的最詳細(xì)使用方法

    python中關(guān)于property的最詳細(xì)使用方法

    這篇文章主要介紹了python中關(guān)于property的最詳細(xì)使用方法,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-04-04
  • Python re 模塊findall() 函數(shù)返回值展現(xiàn)方式解析

    Python re 模塊findall() 函數(shù)返回值展現(xiàn)方式解析

    這篇文章主要介紹了Python re 模塊findall() 函數(shù)返回值展現(xiàn)方式解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-08-08
  • selenium+python自動(dòng)化測(cè)試之鼠標(biāo)和鍵盤(pán)事件

    selenium+python自動(dòng)化測(cè)試之鼠標(biāo)和鍵盤(pán)事件

    這篇文章主要介紹了selenium+python自動(dòng)化測(cè)試之鼠標(biāo)和鍵盤(pán)事件,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2019-01-01
  • Python HTTP下載文件并顯示下載進(jìn)度條功能的實(shí)現(xiàn)

    Python HTTP下載文件并顯示下載進(jìn)度條功能的實(shí)現(xiàn)

    這篇文章主要介紹了Python HTTP下載文件并顯示下載進(jìn)度條功能,本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-04-04

最新評(píng)論