亚洲乱码中文字幕综合,中国熟女仑乱hd,亚洲精品乱拍国产一区二区三区,一本大道卡一卡二卡三乱码全集资源,又粗又黄又硬又爽的免费视频

基于Python正則表達式提取搜索結(jié)果中的站點地址

 更新時間:2015年10月15日 09:59:29   投稿:mrr  
正則表達式對于Python來說并不是獨有的,最近在鼓搗一個東西把google搜索的結(jié)果中所有的站點地址導出,于是想到用python正則表達式提取搜索結(jié)果中的站點地址,小編把具體實現(xiàn)思路整理分享給大家

正則表達式對于Python來說并不是獨有的,最近在把google搜索的結(jié)果中所有的站點地址導出,于是想到用python正則表達式提取搜索結(jié)果中的站點地址。

這其中涉及幾個需要解決的問題:

1、獲取搜索的結(jié)果文本

為了獲得更多的地址,我使用了Google的高級搜索功能,每個頁面顯示100條結(jié)果。

獲得顯示的結(jié)果后,可以查看源碼,并保持成文本文件就有了搜索的結(jié)果文本

2、分析如何提取站點信息

首先需要分析獲取的頁面,查看以怎樣的方式可以提取出站點信息。

我使用IE8自帶的開發(fā)工具(按F12就會彈出來)中的探查器功能查看自己要關心的內(nèi)容有什么特殊的格式

從上圖可以看出我需要的站點在標簽<cite></cite>中,所以我使用正則表達式提取這其中的文本是否就可以呢?

3、編寫正則表達式來獲取站點地址

接下來的就是寫表達式了,我使用Python3.2編寫的,方便好用(~_~)

代碼如下,先把搜索結(jié)果頁面保持到e:/t3.txt中,在執(zhí)行如下代碼

import re
p = re.compile(r'<cite>([^<>\/].+?)</cite>')
f = open("e:/t3.txt", encoding='utf-8')
content = f.read()
print ("\n".join(p.findall(content)))

運行如下:


大家可以對照一下運行效果圖,看看所有的站點地址是不是都給獲取到了。

相關文章

最新評論