python實現的正則表達式功能入門教程【經典】

2020-01-04 17:16:50

字體：大中小

來源：轉載

供稿：網友

本文講述了python實現的正則表達式功能。分享給大家供大家參考，具體如下：

前文：

首先，什么叫正則表達式（Regular Expression）？

例如我們要判斷字符串"adi_e32fv,Ls"里面是否含有子串"e32f"，又例如我們在一個含百萬個姓名的txt文件中找姓“王”，名字以“五”結尾的名字，然后打印出來。結果為：“王五”、“王小五”、“王大五”、“王小小五”……

以前我們是使用字符串函數來查找的，但是代碼實現起來會很復雜。如今用正則表達式只需要一句 re.findall('王.*？五',txt1) 就可以了！正則表達式是寫網絡爬蟲的最基本的知識，可以用正則表達式在html中搜集滿足某些字串要求的網址。下面是個人對正則表達式基礎知識的一些總結。

（操作環境：32位Win8系統，運行工具：python2.7.9+Eclipse.）

正文：

1、首先要導入python的re模塊。

2、元字符 . ^ $ * + ? {} [] / | ()

re模塊中的findall（str1，str2）方法返回字串str2中匹配str1格式的字串。例如在字符串'dit dot det,dct dit dot'中匹配'dit'結果為：

str1 = 'dit dot det,dct dit dot'print re.findall('dit',str1)

結果：

['dit', 'dit']

|作用：'dit|dct'表示dit或者dct。

str1 = 'dit dot det,dct dit dot'print re.findall('dit|dct',str1)

結果：

['dit', 'dct', 'dit']

[]作用：[ic]表示i或c，例如'd[ic]t'表示dit和dct兩者，和'dit|dct'等價：

str1 = 'dit dot det,dct dit dot'print re.findall('d[ic]t',str1)

結果：

['dit', 'dct', 'dit']

^作用一：[^ic]中^表示否定，即除了i和c：

str1 = 'dit dot det,dct dit dot'print re.findall('d[^ic]t',str1)

結果：

['dot', 'det', 'dot']

^作用二：^dit表示子串dit在開頭位置，而dct不是在開頭：

str1 = 'dit dot det,dct dit dot'print re.findall('^dit',str1)print re.findall('^dct',str1)

結果：

['dit'][]

$作用：dot$表示子串dot要在末尾位置，而dct不是在末尾：

str1 = 'dit dot det,dct dit dot'print re.findall('dot$',str1)print re.findall('dct$',str1)

結果：

['dot'][]

.作用：d.t表示d與t之間省略了一個任意字符：

str1 = 'dit dot det,dct dit dot'print re.findall('d.t',str1)

結果：

['dit', 'dot', 'det', 'dct', 'dit', 'dot']

+作用：di+t表示d與t之間省略了一個或多個'i'：

str1 = 'd dt dit diit det'print re.findall('d.+t',str1)

結果：

['dit', 'diit']

*作用：di*t表示d與t之間省略了零個至多個'i'：

str1 = 'd dt dit diit det'print re.findall('d.*t',str1)

結果：

['dt', 'dit', 'diit']

經常，'.'和'+'或者'*'搭配使用。'.+'表示省略了一個至多個任意元素，'.*'表示省略了零個至多個任意元素：

str1 = 'd dt dit diit det'print re.findall('d.+t',str1)print re.findall('d.*t',str1)

結果：

['d dt dit diit det']['d dt dit diit det']

？作用一：看.+的匹配結果，'dit'、'dot'也滿足'd.+t'的匹配條件，而輸出的卻是滿足匹配條件的最長子串'dit dot det,dct dit dot'，這個叫貪婪匹配。如果要輸出最短的匹配字串，只需在'+'后面加上'？'：（注：對于'*'也是一樣，只需在'*'后面加上'？'）

str1 = 'd dt dit diit det'print re.findall('d.+?t',str1)

結果：

['dit', 'dot', 'det', 'dct', 'dit', 'dot']

？作用二：di?t表示i可有可無，即dt、dit都滿足匹配條件：

str1 = 'd dt dit diit det'print re.findall('di?t',str1)

結果：

['dt', 'dit']

{}作用一：di{n}t表示d和t之間有n個'i'：

str1 = 'dt dit diit diiit diiiit'print re.findall('di{2}t',str1)

結果：

['diit']

{}作用二：di{n,m}t表示d和t之間有n到m個'i'：

str1 = 'dt dit diit diiit diiiit'print re.findall('di{1,3}t',str1)

結果：

['dit', 'diit', 'diiit']

其中，n和m都是可以省略的。{n,}表示n個到任意個；{,m}表示0個到m個；{,}表示任意個，和'*'功能一樣：

str1 = 'dt dit diit diiit diiiit'print re.findall('di{1,}t',str1)print re.findall('di{,3}t',str1)print re.findall('di{,}t',str1)

結果：

['dit', 'diit', 'diiit', 'diiiit']   ['dt', 'dit', 'diit', 'diiit']   ['dt', 'dit', 'diit', 'diiit', 'diiiit']

/作用一：取消元字符，變成轉義字符：

str1 = '^abc ^abc'print re.findall('^abc',str1)print re.findall('/^abc',str1)

結果：

[]['^abc', '^abc']

/作用二：預定義字符

str1 = '12 abc 345 efgh'print re.findall('/d+',str1)print re.findall('/w+',str1)

結果：

['12', '345']   ['12', 'abc', '345', 'efgh']

()作用：在匹配字符串后，只輸出匹配字串'()'里面的內容：

str1 = '12abcd34'print re.findall('12abcd34',str1)print re.findall('1(2a)bcd34',str1)print re.findall('1(2a)bc(d3)4',str1)

結果：

['12abcd34']   ['2a']   [('2a', 'd3')]

3、re模塊里的主要方法：findall()、finditer()、match()、search()、compile()、split()、sub()、subn()。

re.findall(pattern,string,flags = 0)

作用：在string中從左往右搜索與pattern匹配的字串，結果以list形式返回。

str1 = 'ab cd'print re.findall('/w+',str1)

結果：['ab', 'cd']

re.finditer(pattern,string,flags = 0)

作用：其功能與re.findall相同，但結果以迭代器的形式返回。

str1 = 'ab cd'iter1 = re.finditer('/w+',str1)for a in iter1:  print a.group(),a.span()

結果：

ab (0, 2)
cd (3, 5)

（注：a.group()返回滿足匹配調節的字串，a.span()返回字串的起始位置和末尾位置）

re.search(pattern,string,flags = 0)

作用：在string中從左往右搜索與pattern匹配的字串，無匹配結果則返回None，否則返回一個search實例。

str1 = 'ab cd'result = re.search('cd',str1)if result == None:  print 'None'else:  print result.group(),result.start(),result.end()

結果：cd 3 5

re.match(pattern,string,flags = 0)

作用：判斷string的頭部是否與pattern匹配，是則返回match實例，否則返回None。

str1 = 'ab cd'result = re.match('cd',str1)if result == None:  print 'None'else:  print result.group(),result.start(),result.end()

結果：None

re.compile(pattern,flags = 0)

作用：對匹配格式pattern進行編譯，返回一個實例對象。對正則表達式先編譯，可以大幅提高匹配速度。

str1 = 'ab cd'pre = re.compile('ab')print pre.findall(str1)

結果：['ab']

re.split(pattern,string,maxsplit = 0,flags = 0)

作用：在string匹配pattern的時候做分割：

str1 = 'ab.c.de'str2 = '12+34-56*78/90'print re.split('/.',str1)print re.split('[/+/-/*/]',str2)

結果：

['ab', 'c', 'de']
['12', '34', '56', '78', '90']

re.sub(pattern,repl,string,count = 0,flags = 0)

作用：在string當中把滿足pattern正則的字串替換成repl：

str1 = 'abcde'print re.sub('bc','123',str1)

結果：a123de

re.subn(pattern,repl,string,count = 0,flags = 0)

作用：其功能與re.sub()相同，但返回的結果多了一個數字，代表替換了多少次

str1 = 'abcdebce'print re.subn('bc','123',str1)

結果：('a123de123e', 2)

希望本文所述對大家Python程序設計有所幫助。

上一篇：Python中easy_install 和 pip 的安裝及使用

下一篇：Python實現Smtplib發送帶有各種附件的郵件實例

學習交流

解決內存不足妙方

解決內存不足妙方...

熱門圖片

猜你喜歡的新聞

猜你喜歡的關注

新聞熱點

雷軍2020新年全員信：“5G+AIoT”五年投500億

2020-01-03 21:43:53

春運售票超3億張！售票總量再創歷史新高

2020-01-03 20:41:46

Windows10市場份額全球第一微軟是否再無敵手？

2020-01-03 20:31:47

比爾蓋茨一次錯誤，付出2.8萬億的代價

2020-01-02 08:44:34

長江迎來最長禁漁期：十年禁漁，方才有魚

2020-01-02 08:28:02

快手封殺淘寶？回應：系統升級，淘寶商品暫無法審核

2020-01-01 22:50:39

疑難解答

圖片精選

網友關注

国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

python實現的正則表達式功能入門教程【經典】