帝國cms采集圖文教程(上,中,下)全集
發(fā)布時間:2012-05-21 10:50:22 作者:佚名
我要評論

帝國cms采集圖文教程,現(xiàn)在把上,中,下全部都發(fā)來.給大家方便的看.
帝國cms是我們用得比較多得PHP的建站系統(tǒng),在建站過程中,如果自己沒有信息源,只能靠手工不斷的重復copy和粘貼,這樣費時費力,于是我們就要使用帝國cms自帶的采集功能來完成信息的錄入。為了深入了解帝國cms采集功能,下面我們以“新浪各地新聞”欄目為例來進行實戰(zhàn)采集。
一、增加采集節(jié)點
1、添加節(jié)點:

2、選擇要增加采集的欄目:

3、進入增加節(jié)點表單:

4、在節(jié)點名稱框里起個名字,然后把要采集的新浪各地新聞列表地址copy過來:


5、下來發(fā)現(xiàn)好多選項,如“采集頁面地址方式二,內(nèi)容頁地址前綴...”先不要理他,后面再一一詳解,直接拉到 “信息鏈接區(qū)域正則”這里:

6、這里是設置采集的列表信息鏈接區(qū)域正則,我們點擊查看新浪各地新聞列表“源文件”:

7、把源文件代碼copy到Dreamweaver里,在Dreamweaver里選定要采集的信息鏈接區(qū)域:

8、切換到Dreamweaver代碼方式,
一、全部列出式
全部列表式只需看第一頁的頁面HTML代碼,這一頁的所有分頁鏈接都列出來了。
1、我們以“中華網(wǎng)內(nèi)容分頁(http://auto.china.com/dongtai/yejie/11012724/20120309/17081442.html)”為例:

可以看到這條新聞總共有3條分頁。
2、查看源代碼:

這一頁里除了已經(jīng)采集到的第1條分頁外,還包括了第2條和第3條分頁,所有的分頁都列出來了。
3、取得 分頁區(qū)域正則([!--smallpageallzz--]):

4、取得 分頁鏈接正則([!--pageallzz--]):

二、上下頁導航式
上下頁導航式是分頁采集的難點,他需要所有頁面都符合分頁正則才行,在不熟悉的情況下,我們可以用第1頁和第2頁的代碼來進行對比分析然后確定分頁正則。
1、我們以“愛麗網(wǎng)內(nèi)容分頁(http://fashion.aili.com/76/445845.html)”為例:

可以看到這條新聞總共有20條分頁。
2、查看源代碼:

這一頁里除了已經(jīng)采集到的第1條分頁外,還包括了第2,第3,第4,第5,第6,第7,第8,第20條分頁,但是第9到第19條分頁并沒有列出來,這時候我們拿用第1頁和第2頁的代碼來進行對比分析,來確定分頁正則:
(1)第1頁代碼:

(2)第2頁代碼:

從這兩幅圖片可以看到他們有著相同的“分頁區(qū)域開始代碼”,“分頁鏈接”格式,“分頁區(qū)域結(jié)束代碼”,那么就可以確定“分頁區(qū)域正則”,“分頁鏈接正則”。
3、取得 分頁區(qū)域正則([!--smallpageallzz--]):

4、取得 分頁鏈接正則([!--pageallzz--]):

5、為了方便教程顯示,newstext我采集了標題而不是采集內(nèi)容,預覽結(jié)果:

注意事項:
第一、在第一頁的頁面HTML代碼里,內(nèi)容分頁鏈接全部列出來的情況下我們使用“全部列出式”。在第一頁的頁面HTML代碼里,內(nèi)容分頁鏈接沒有全部列出來的情況下我們使用“上下頁導航式”。
第二、用全部列出式時,采集規(guī)則正確但是莫名其妙的出現(xiàn)重復的分頁,這時可以利用替換法把它過濾掉(下一講我們再說)。
第三、用上下頁導航式時,老是采到第1頁,其他頁連個影子都沒有見過,這是因為分頁區(qū)域正則([!--smallpagezz--])截取錯誤。
第四、用上下頁導航式時,可以采集到前幾頁了,但是接下來這前幾頁全部重復循環(huán)到底,這也是因為分頁區(qū)域正則([!--smallpagezz--])截取錯誤,截取范圍過大,導致重復截取前幾個分頁鏈接。
好的,這一講就到這里,下一頁我們主要介紹帝國cms采集過濾和替換。
前兩講我們分別介紹了帝國cms采集基本流程和帝國cms如何采集內(nèi)容分頁,最后這一講主要介紹帝國cms采集過濾與替換,還有些技巧。
一、過濾
1、帝國cms采集過濾分為兩種:
(1)“整體頁面過濾正則”:

(2)“過濾廣告正則”:

我們有些疑惑,這兩種過濾到底有什么區(qū)別?“整體頁面過濾正則”是過濾整個網(wǎng)頁的html代碼。“過濾廣告正則”是過濾文章內(nèi)容,僅對文章內(nèi)容([!--newstext--])起作用。
2、過濾實例:
過濾實例(1):

我們采集后發(fā)現(xiàn)信息內(nèi)容底部多了行代碼:“<div style="clear:both;height:0;visibility:hiddden;overflow:hidden;"> </div>”,根據(jù)格式“廣告開始[!--ad--]廣告結(jié)束”得到“過濾廣告正則
”:

過濾實例(2):

要過濾鏈接代碼怎么辦,注意“過濾廣告正則”右邊有堆代碼:

鼠標先點擊A,系統(tǒng)自動生成過濾鏈接代碼“,,,”,這樣就可以把采集后的內(nèi)容鏈接過濾掉了。同理,如果想過濾其他html代碼就點擊相應的標簽代碼。
注意事項:當內(nèi)容分頁包含在內(nèi)容([!--newstext--])里時,要過濾掉內(nèi)容分頁,否則會重復出現(xiàn)內(nèi)容分頁。
二、替換
1、帝國cms采集替換也分為兩種:
(1)“整體頁面替換”:

(2)“替換”:

他們兩種區(qū)別:“整體頁面替換”是替換整個網(wǎng)頁的html代碼。“替換”是替換文章標題和內(nèi)容,僅對標題([!--title--])和([!--newstext--])起作用。
2、替換實例:

我們要把內(nèi)容里的“新華網(wǎng)”替換成“中華網(wǎng)”:

預覽下:

沒有問題,替換過來了。
三、圖片采集
(1)我們采集時會碰到信息內(nèi)容可以正常采集,但是里面的圖片卻不顯示,例子:

信息內(nèi)容可以正常采集,就是圖片不顯示出來,這是由于內(nèi)容圖片的路徑不對,圖片的路徑為相對地址。
(2)查看源代碼:

圖片是相對地址,要換成絕對地址才能采集成功。
(3)替換成絕對地址:
先在目標站的圖片右鍵查看屬性:

目標站的圖片地址為“http://www.gdyd.com/news/PNews/a/e77366_634655073936250000.jpg”,我們采集所到的圖片地址為“/news/PNews/a/e77366_634655073936250000.jpg”,分析得到前綴“http://www.gdyd.com”,我們把前綴放到“圖片/FLASH地址前綴(內(nèi)容)”,如下圖:

(4)前臺預覽圖片:
圖片顯示出來了:

查看源代碼:

圖片地址沒錯,是本地地址。
注意事項:我們在采集預覽和在本地臨時入庫信息時,發(fā)現(xiàn)已經(jīng)添加了圖片地址前綴了,但是圖片還是不顯示,出現(xiàn)這個你不用理他,直接入庫,入庫了系統(tǒng)才會自動添加圖片地址前綴。
至此采集實例講解完畢,這三講對帝國cms采集的基本流程,重點,難點基本都概括了,還有些基礎的功能沒能一一介紹清楚,大家可以到帝國官方網(wǎng)站看下基礎教程。
本文由 國外網(wǎng)站大全http://www.kguowai.com 原創(chuàng),轉(zhuǎn)載請注明出處,謝謝!
一、增加采集節(jié)點
1、添加節(jié)點:

2、選擇要增加采集的欄目:

3、進入增加節(jié)點表單:

4、在節(jié)點名稱框里起個名字,然后把要采集的新浪各地新聞列表地址copy過來:


5、下來發(fā)現(xiàn)好多選項,如“采集頁面地址方式二,內(nèi)容頁地址前綴...”先不要理他,后面再一一詳解,直接拉到 “信息鏈接區(qū)域正則”這里:

6、這里是設置采集的列表信息鏈接區(qū)域正則,我們點擊查看新浪各地新聞列表“源文件”:

7、把源文件代碼copy到Dreamweaver里,在Dreamweaver里選定要采集的信息鏈接區(qū)域:

8、切換到Dreamweaver代碼方式,
- 就是信息鏈接區(qū)域:

9、得到信息鏈接區(qū)域正則:

10、得到信息頁鏈接正則:

11、注意:如果信息頁鏈接是相對地址,例如< a href="/c/2012-03-05/205924063527.shtml" target="_blank" >,那么“內(nèi)容頁地址前綴”要加域名:

12、現(xiàn)在要采集內(nèi)容頁的標題和內(nèi)容:

13、查看新聞頁“源文件”,找title標簽:

14、取得標題正則:

15、這里是要采集的內(nèi)容區(qū)域:

16、取得新聞內(nèi)容正則:

(注意:新聞內(nèi)容正則里的 d_id='*' 用了通配符,因為每一篇新聞的d_id值是不同的,所以可以用*來代替它,“*”可以代替任意字符。)
17、點擊提交按鈕就完成了整個采集節(jié)點:

二、預覽采集節(jié)點是否正確
1、提交按鈕后返回管理節(jié)點:

2、點擊“預覽”采集,進入節(jié)點預覽結(jié)果:

3、采集內(nèi)容頁列表

4、采集內(nèi)容頁頁面:

三、采集
1、預覽采集節(jié)點無誤后,然后返回“管理節(jié)點”,點擊“開始采集”鏈接就開始進行采集:

2、系統(tǒng)正在采集中:

3、采集完后顯示本地臨時入庫的信息,這時可以對臨時入庫的信息進行修改或者刪除:

4、修改信息頁面如圖:

5、對采集的信息進行審核并入庫,點擊“入庫全部信息按鈕”:

6、確定操作:

7、信息入庫完畢提示:

信息入庫完畢后下來點擊”管理信息“:

我們可以看到剛剛采集入庫的新聞信息:

最后到“數(shù)據(jù)更新”刷新首頁、欄目、和內(nèi)容頁就可以完成網(wǎng)站的信息采集了。由于帝國cms采集功能非常強大,一時半刻也說不完,下一頁將繼續(xù)講解其他功能的使用和技巧。
一、全部列出式
全部列表式只需看第一頁的頁面HTML代碼,這一頁的所有分頁鏈接都列出來了。
1、我們以“中華網(wǎng)內(nèi)容分頁(http://auto.china.com/dongtai/yejie/11012724/20120309/17081442.html)”為例:

可以看到這條新聞總共有3條分頁。
2、查看源代碼:

這一頁里除了已經(jīng)采集到的第1條分頁外,還包括了第2條和第3條分頁,所有的分頁都列出來了。
3、取得 分頁區(qū)域正則([!--smallpageallzz--]):

4、取得 分頁鏈接正則([!--pageallzz--]):

二、上下頁導航式
上下頁導航式是分頁采集的難點,他需要所有頁面都符合分頁正則才行,在不熟悉的情況下,我們可以用第1頁和第2頁的代碼來進行對比分析然后確定分頁正則。
1、我們以“愛麗網(wǎng)內(nèi)容分頁(http://fashion.aili.com/76/445845.html)”為例:

可以看到這條新聞總共有20條分頁。
2、查看源代碼:

這一頁里除了已經(jīng)采集到的第1條分頁外,還包括了第2,第3,第4,第5,第6,第7,第8,第20條分頁,但是第9到第19條分頁并沒有列出來,這時候我們拿用第1頁和第2頁的代碼來進行對比分析,來確定分頁正則:
(1)第1頁代碼:

(2)第2頁代碼:

從這兩幅圖片可以看到他們有著相同的“分頁區(qū)域開始代碼”,“分頁鏈接”格式,“分頁區(qū)域結(jié)束代碼”,那么就可以確定“分頁區(qū)域正則”,“分頁鏈接正則”。
3、取得 分頁區(qū)域正則([!--smallpageallzz--]):

4、取得 分頁鏈接正則([!--pageallzz--]):

5、為了方便教程顯示,newstext我采集了標題而不是采集內(nèi)容,預覽結(jié)果:

注意事項:
第一、在第一頁的頁面HTML代碼里,內(nèi)容分頁鏈接全部列出來的情況下我們使用“全部列出式”。在第一頁的頁面HTML代碼里,內(nèi)容分頁鏈接沒有全部列出來的情況下我們使用“上下頁導航式”。
第二、用全部列出式時,采集規(guī)則正確但是莫名其妙的出現(xiàn)重復的分頁,這時可以利用替換法把它過濾掉(下一講我們再說)。
第三、用上下頁導航式時,老是采到第1頁,其他頁連個影子都沒有見過,這是因為分頁區(qū)域正則([!--smallpagezz--])截取錯誤。
第四、用上下頁導航式時,可以采集到前幾頁了,但是接下來這前幾頁全部重復循環(huán)到底,這也是因為分頁區(qū)域正則([!--smallpagezz--])截取錯誤,截取范圍過大,導致重復截取前幾個分頁鏈接。
好的,這一講就到這里,下一頁我們主要介紹帝國cms采集過濾和替換。
前兩講我們分別介紹了帝國cms采集基本流程和帝國cms如何采集內(nèi)容分頁,最后這一講主要介紹帝國cms采集過濾與替換,還有些技巧。
一、過濾
1、帝國cms采集過濾分為兩種:
(1)“整體頁面過濾正則”:

(2)“過濾廣告正則”:

我們有些疑惑,這兩種過濾到底有什么區(qū)別?“整體頁面過濾正則”是過濾整個網(wǎng)頁的html代碼。“過濾廣告正則”是過濾文章內(nèi)容,僅對文章內(nèi)容([!--newstext--])起作用。
2、過濾實例:
過濾實例(1):

我們采集后發(fā)現(xiàn)信息內(nèi)容底部多了行代碼:“<div style="clear:both;height:0;visibility:hiddden;overflow:hidden;"> </div>”,根據(jù)格式“廣告開始[!--ad--]廣告結(jié)束”得到“過濾廣告正則
”:

過濾實例(2):

要過濾鏈接代碼怎么辦,注意“過濾廣告正則”右邊有堆代碼:

鼠標先點擊A,系統(tǒng)自動生成過濾鏈接代碼“,,,”,這樣就可以把采集后的內(nèi)容鏈接過濾掉了。同理,如果想過濾其他html代碼就點擊相應的標簽代碼。
注意事項:當內(nèi)容分頁包含在內(nèi)容([!--newstext--])里時,要過濾掉內(nèi)容分頁,否則會重復出現(xiàn)內(nèi)容分頁。
二、替換
1、帝國cms采集替換也分為兩種:
(1)“整體頁面替換”:

(2)“替換”:

他們兩種區(qū)別:“整體頁面替換”是替換整個網(wǎng)頁的html代碼。“替換”是替換文章標題和內(nèi)容,僅對標題([!--title--])和([!--newstext--])起作用。
2、替換實例:

我們要把內(nèi)容里的“新華網(wǎng)”替換成“中華網(wǎng)”:

預覽下:

沒有問題,替換過來了。
三、圖片采集
(1)我們采集時會碰到信息內(nèi)容可以正常采集,但是里面的圖片卻不顯示,例子:

信息內(nèi)容可以正常采集,就是圖片不顯示出來,這是由于內(nèi)容圖片的路徑不對,圖片的路徑為相對地址。
(2)查看源代碼:

圖片是相對地址,要換成絕對地址才能采集成功。
(3)替換成絕對地址:
先在目標站的圖片右鍵查看屬性:

目標站的圖片地址為“http://www.gdyd.com/news/PNews/a/e77366_634655073936250000.jpg”,我們采集所到的圖片地址為“/news/PNews/a/e77366_634655073936250000.jpg”,分析得到前綴“http://www.gdyd.com”,我們把前綴放到“圖片/FLASH地址前綴(內(nèi)容)”,如下圖:

(4)前臺預覽圖片:
圖片顯示出來了:

查看源代碼:

圖片地址沒錯,是本地地址。
注意事項:我們在采集預覽和在本地臨時入庫信息時,發(fā)現(xiàn)已經(jīng)添加了圖片地址前綴了,但是圖片還是不顯示,出現(xiàn)這個你不用理他,直接入庫,入庫了系統(tǒng)才會自動添加圖片地址前綴。
至此采集實例講解完畢,這三講對帝國cms采集的基本流程,重點,難點基本都概括了,還有些基礎的功能沒能一一介紹清楚,大家可以到帝國官方網(wǎng)站看下基礎教程。
本文由 國外網(wǎng)站大全http://www.kguowai.com 原創(chuàng),轉(zhuǎn)載請注明出處,謝謝!
相關(guān)文章
帝國CMS根據(jù)內(nèi)容正文字段[newstext]批量獲取描述簡介字段[smalltext]的
這篇文章主要介紹了帝國CMS根據(jù)內(nèi)容正文字段[newstext]批量重新生成簡介字段[smalltext]的方法,需要的朋友可以參考下2023-06-26帝國CMS 7.2和7.5適用的火車頭采集免登陸發(fā)布模塊配置方法詳解(親測可
帝國cms7.2版本開始增加了金剛模式,登錄發(fā)布有難度。親測可用的帝國CMS 7.2/7.5適用免登陸新聞發(fā)布模塊插件配合火車采集器,可以解決這類問題??胺Q完美2022-04-21帝國cms高危SQL注入漏洞(盲注)系統(tǒng)自帶RepPIntvar過濾函數(shù)使用方法
帝國cms開發(fā)的時候要注意一些危險的注入漏洞,防止被黑,RepPIntvar為系統(tǒng)自帶函數(shù)可以起到過濾字符的作用,下面就為大家介紹一下使用方法2021-07-26- 帝國cms后臺啟用SESSION驗證所有的登錄信息都是保存在服務器端的,尤其是公共場所登錄用默認的cookies是不安全的2021-07-26
- 最近需要將老版本的帝國cms將7.2升級到7.5版本,參考這篇文章完美升級,特分享一下給需要的朋友2020-08-02
帝國cms常用標簽調(diào)用方法(靈動標簽和萬能標簽的調(diào)用方法)
整理了一些常用的帝國CMS調(diào)用,靈動標簽和萬能標簽的調(diào)用方法舉例,包括幻燈片、標題、一級欄目、二級欄目、帶模版的友情鏈接(下拉菜單)、判斷內(nèi)容頁字段為空時是如何調(diào)用2020-02-04帝國cms網(wǎng)站地圖sitemap.xml的制作方法
這篇文章主要介紹了帝國cms網(wǎng)站地圖sitemap.xml的制作方法,需要的朋友可以參考下2020-02-04帝國CMS數(shù)據(jù)更新中心設置教程(更新網(wǎng)站細節(jié))
在使用帝國cms的時候有時候需要把前臺數(shù)據(jù)都更新一下,那么就可以參考下面的文章了,要不漏掉了部分就達不到更新的目地了2020-02-04- 今天接到網(wǎng)友詢問怎么修改后臺登錄界面及后臺界面,特把方法分享出來需要的朋友可以參考下2020-02-04
- 最近仿站團隊接到很多仿站客戶訂單,這里面有一個這樣的功能,表單提交,今天花時間寫個教程給大家,需要的朋友可以參考下2020-02-02