zoukankan html css js c++ java

python正则表达式模块re

正则表达式的特殊元素

匹配符号	描述
" . "	字符点"."匹配除换行符之外的任何字符。
" ^ "	匹配以字符串开头,找到后返回匹配的字段 import re print(re.findall("^abc","abcsaf")) # 打印结果：['abc']
" $ "	匹配以字符串结尾,找到后返回匹配的字符串 import re print(re.findall("abc$","safabc")) # 打印结果：['abc']
" * "	匹配星号前面字符，星号前面的字符可以没有，也可以有多个，如ab，将修饰字符b，字符b可以没有只匹配字符a，也可以有多个b。所以ab可以匹配“a”、“ab”或“abbbbb”后面跟着任意数量的“b”。如下: import re print(re.findall("ab*","ampabnabbbbq")) # 打印结果：['a', 'ab', 'abbbb']
" + "	匹配+号前字符出现的次数，如ab+，会匹配ab，和ab加上任意数量的b，如abbbb import re print(re.findall("ab+","apabnabbbbq")) # 打印结果：['ab', 'abbbb']
" ? "	匹配?前字符出现的次数，字符可以是0次，最多是一次，如ab?，只能匹配a或者ab。 import re print(re.findall("ab?","amabnabbbbq")) # 打印结果：['a', 'ab', 'ab']
" *? "	匹配?前字符出现的次数，被匹配的字符可以出现0次，最多是1次。但是?具有惰性，当匹配到第一个字符后，就不会继续在匹配。如ab?可以匹配a或者ab，但是当出现字符a后就不会在去匹配字符b了。如下： import re print(re.findall("ab?","apabcabbbbq")) # 打印结果：['a', 'a', 'a']
" +? "	匹配+?前字符，+?具有惰性，被匹配的字符最少出现1次，仅匹配+?前面的字符串，匹配到后就结束，不会在匹配后边的结果，如ab+?只能匹配ab，如下: import re print(re.findall("ab+?","apabcabbbbq")) # 打印结果：['ab', 'ab']
" ?? "	匹配??前的字符，??具有惰性，匹配到第一个字符后便不会继续向后匹配，如：ab?? 只匹配到a便结束了。 import re print(re.findall("ab??","apabcabbbqq")) # 打印结果：['a', 'a', 'a']
{m}	匹配m个被修饰的字符，如ab{2}将匹配abb。如下： import re print(re.findall("ab{2}","apaabbcabbbbqq")) # 打印结果：['abb', 'abb']
{m,n}	匹配m到n范围内的被修饰符的个数，如ab{1,3}将匹配ab，abb，abbb 如下： import re print(re.findall("ab{1,3}","abmpabbcabbbbbqq")) # 打印结果：['ab', 'abb', 'abbb']
{m,n}?	有?号将具有惰性机制，将只能匹配到m个，如ab{1,3}?，将只能匹配ab 如下: import re print(re.findall("ab{1,3}?","abmpabbcabbbbbqq")) # 打印结果：['ab', 'ab', 'ab']
" \| "	或的意思，匹配两边的字符，如a\|b将匹配a或者匹配b 如下： import re print(re.findall("a\|b","abmpabbcaqq")) # 打印结果：['a', 'b', 'a', 'b', 'b', 'a']
" ... "	将匹配引号内点数量的任意类型字，如'...'将匹配3个任意类型字符，如下： import re print(re.findall("...","12abmpabbcaqq")) #打印结果：['12a', 'bmp', 'abb', 'caq']
" "	转义字符
[]	用于表示一组字符，如[0-9]表示匹配0到9的数字，[a-z]匹配a-z的所有字符，如果带有-必须是ASCII码表中从小到大的顺序进行排列，如[9-0]是错误的。
A	匹配以字符串或字符开头，如下： import re print(re.findall("Aab","abcdavcdsb")) #打印结果：['ab']
d	只匹配数字 import re print(re.findall("d"," abcd12avc4dsb ")) #打印结果：['1', '2', '4']
D	匹配除了数字以外任意字符 import re print(re.findall("D","abcd12_!@#$")) # 打印结果：['a', 'b', 'c', 'd', '_', '!', '@', '#', '$']
s	匹配空白，制表符如[" " fv]等如下： import re print(re.findall("s","ab cd12a vc 4dsb")) #打印结果：['', ' ', ' ']
S	匹配除了空白，制表符[" " fv]以外的任意字符,，如下： import re print(re.findall("S","ab 123 v_# $%^")) #打印结果：['a', 'b', '1', '2', '3', 'v', '_', '#', '$', '%', '^']
w	匹配字母，数字，下划线如下： import re print(re.findall("w","ab_123!@# &* ")) #打印结果：['a', 'b', '_', '1', '2', '3']
W	匹配除了字母,数字,下划线以外的任意字符,如下: import re print(re.findall("W","ab_123!@# &* ")) #打印结果：['!', '@', '#', ' ', '&', '*', ' ']

常用方法

re.compile(pattern, flags=0)：参数pattern是一个表达式规则，返回一个表达式对象相当于一个表达式规则模板。

import re
re_pottern = re.compile("w")
print(re_pottern.findall("abc_$%def"))

# 打印内容如下
['a', 'b', 'c', '_', 'd', 'e', 'f']

re.search(pattern, string, flags=0)：根据表达式规则查找字符串，如果找不到匹配返回None，如果找到返回匹配到的对象。

import re
print(re.search("w+","abc1#$%2abc3"))

# 打印内如下
<re.Match object; span=(0, 4), match='abc1'>

re.match(pattern, string, flags=0)：与search类似。

import re
print(re.match("w+","abc1#$%2abc3"))

#打印内容如下
<re.Match object; span=(0, 4), match='abc1'>

re.split(pattern, string, maxsplit=0, flags=0)：将表达式的参数作为分隔符进行切割，返回切割后的列表。

import re
print(re.split("W+","Words, words, words"))

# 打印内容如下
['Words', 'words', 'words']

re.findall(pattern, string, flags=0)：在整个字符串内匹配表达式，返回匹配到的结果。

import re
print(re.findall("w","abc#$_def"))

# 打印内如如下
['a', 'b', 'c', '_', 'd', 'e', 'f']

re.finditer(pattern, string, flags=0)：匹配整个字符串，返回一个迭代器。

import re
iter_ = re.finditer("w","abc#$_def")
print(iter_.__next__())
print(iter_.__next__())
print(iter_.__next__())

# 打印内容如下
<re.Match object; span=(0, 1), match='a'>
<re.Match object; span=(1, 2), match='b'>
<re.Match object; span=(2, 3), match='c'>

re.sub(pattern, repl, string, count=0, flags=0)：

pattern：表达式。

repl：要替换的参数。

string：要被替换的字符串。

count：替换的次数，默认替换所有。

返回一个字符串。

import re
print(re.sub("w","a","abc#$_def"))
print(re.sub("w","a","abc#$_def",count=2))

# 打印内容如下
aaa#$aaaa
aac#$_def

re.subn(pattern, repl, string, count=0, flags=0)：

pattern：参数是表达式。

repl：要替换的参数。

string：要被替换的字符串。

count：替换的次数，默认替换所有。

返回一个被替换后的字符串和替换次数组成的元组。

import re
print(re.subn("w","a","abc#$_def"))
print(re.subn("w","a","abc#$_def",count=2))

# 打印内容如下
('aaa#$aaaa', 7)
('aac#$_def', 2)

re.purge()：清空正则表达式缓存。

。。。。。。。。。。。。。。待续。。。。。。。。。。。。。。。。。。。。

下一篇：configparser 、random模块简介：https://www.cnblogs.com/caesar-id/p/10478201.html

查看全文

相关阅读:
【win7】安装开发环境
 【php-fpm】启动PHP报错ERROR: [pool www] cannot get uid for user 'apache'
【apache2】AH00543: httpd: bad user name apache
【gedit】显示行号
 关于golang.org/x包问题
 国内的go get问题的解决
 php7函数,声明,返回值等新特性介绍
 php5.6.x到php7.0.x特性
 PHP5.4.0新特性研究
 【git】如何去解决fatal: refusing to merge unrelated histories

原文地址：https://www.cnblogs.com/caesar-id/p/10467396.html