本文不是汇总所有 re 相关属性和方法,仅作为个人工作学习中记录使用
1 字符相关介绍
1.1 普通字符
包括没有显式指定为元字符的所有可打印和不可打印字符
包括所有大写和小写字母、所有数字、所有标点符号和一些其他符号。
1.2 非打印字符
可以是正则表达式的组成部分。
下表列出了表示非打印字符的转义序列:
\cx | 匹配由x指明的控制字符。例如, \cM 匹配一个 Control-M 或回车符。x 的值必须为 A-Z 或 a-z 之一。否则,将 c 视为一个原义的 'c' 字符。 |
\f | 匹配一个换页符。等价于 \x0c 和 \cL。 |
\n | 匹配一个换行符。等价于 \x0a 和 \cJ。 |
\r | 匹配一个回车符。等价于 \x0d 和 \cM。 |
\s | 匹配任何空白字符,包括空格、制表符、换页符等等。等价于 [ \f\n\r\t\v]。注意 Unicode 正则表达式会匹配全角空格符。 |
\S | 匹配任何非空白字符。等价于 [^ \f\n\r\t\v]。 |
\t | 匹配一个制表符。等价于 \x09 和 \cI。 |
\v | 匹配一个垂直制表符。等价于 \x0b 和 \cK。 |
1.3 特殊字符
特殊字符,就是一些有特殊含义的字符,若要匹配这些特殊字符,必须首先使字符"转义",即,将反斜杠字符\ 放在它们前面。
下表列出了正则表达式中的特殊字符:
$ | 匹配输入字符串的结尾位置。如果设置了 RegExp 对象的 Multiline 属性,则 $ 也匹配 '\n' 或 '\r'。要匹配 $ 字符本身,请使用 \$。 |
( ) | 标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。要匹配这些字符,请使用 \( 和 \)。 |
* | 匹配前面的子表达式零次或多次。要匹配 * 字符,请使用 \*。 |
+ | 匹配前面的子表达式一次或多次。要匹配 + 字符,请使用 \+。 |
. | 匹配除换行符 \n 之外的任何单字符。要匹配 . ,请使用 \. 。 |
[ | 标记一个中括号表达式的开始。要匹配 [,请使用 \[。 |
? | 匹配前面的子表达式零次或一次,或指明一个非贪婪限定符。要匹配 ? 字符,请使用 \?。 |
\ | 将下一个字符标记为或特殊字符、或原义字符、或向后引用、或八进制转义符。例如, 'n' 匹配字符 'n'。'\n' 匹配换行符。序列 '\\' 匹配 "\",而 '\(' 则匹配 "("。 |
^ | 匹配输入字符串的开始位置,除非在方括号表达式中使用,当该符号在方括号表达式中使用时,表示不接受该方括号表达式中的字符集合。要匹配 ^ 字符本身,请使用 \^。 |
{ | 标记限定符表达式的开始。要匹配 {,请使用 \{。 |
| | 指明两项之间的一个选择。要匹配 |,请使用 \|。 |
1.4 限定符
限定符用来指定正则表达式的一个给定组件必须要出现多少次才能满足匹配。
* | 匹配前面的子表达式零次或多次。例如,zo* 能匹配 "z" 以及 "zoo"。* 等价于{0,}。 |
+ | 匹配前面的子表达式一次或多次。例如,'zo+' 能匹配 "zo" 以及 "zoo",但不能匹配 "z"。+ 等价于 {1,}。 |
? |
匹配前面的子表达式零次或一次。例如,"do(es)?" 可以匹配 "do" 、 "does" 中的 "does" 、 "doxy" 中的 "do" 。? 等价于 {0,1}。 |
{n} |
n 是一个非负整数。匹配确定的 n 次。例如,'o{2}' 不能匹配 "Bob" 中的 'o',但是能匹配 "food" 中的两个 o。 |
{n,} |
n 是一个非负整数。至少匹配n 次。例如,'o{2,}' 不能匹配 "Bob" 中的 'o',但能匹配 "foooood" 中的所有 o。'o{1,}' 等价于 'o+'。'o{0,}' 则等价于 'o*'。 |
{n,m} |
m 和 n 均为非负整数,其中n <= m。最少匹配 n 次且最多匹配 m 次。例如,"o{1,3}" 将匹配 "fooooood" 中的前三个 o。'o{0,1}' 等价于 'o?'。请注意在逗号和两个数之间不能有空格。 |
1.5 贪婪
*、+ 限定符都是贪婪的,因为它们会尽可能多的匹配文字,只有在它们的后面加上一个?就可以实现非贪婪或最小匹配。
通过在 *、+ 或 ? 限定符之后放置 ?,该表达式从"贪婪"表达式转换为"非贪婪"表达式或者最小匹配。
1.6 定位符
定位符使您能够将正则表达式固定到行首或行尾。它们还使您能够创建这样的正则表达式,这些正则表达式出现在一个单词内、在一个单词的开头或者一个单词的结尾。
^ |
匹配输入字符串开始的位置。如果设置了 RegExp 对象的 Multiline 属性,^ 还会与 \n 或 \r 之后的位置匹配。 |
$ |
匹配输入字符串结尾的位置。如果设置了 RegExp 对象的 Multiline 属性,$ 还会与 \n 或 \r 之前的位置匹配。 |
\b | 匹配一个单词边界,即字与空格间的位置。\b 字符的位置是非常重要的。如果它位于要匹配的字符串的开始,它在单词的开始处查找匹配项。如果它位于字符串的结尾,它在单词的结尾处查找匹配项。 |
\B | 非单词边界匹配。 |
注意:不能将限定符与定位符一起使用。由于在紧靠换行或者单词边界的前面或后面不能有一个以上位置,因此不允许诸如 ^* 之类的表达式。
1.7 选择
用圆括号将所有选择项括起来,相邻的选择项之间用|分隔。
非捕获元:?: ?= ?!
?: | 用圆括号会有一个副作用,使相关的匹配会被缓存,此时可用?:放在第一个选项前来消除这种副作用。 |
?= | 正向预查,在任何开始匹配圆括号内的正则表达式模式的位置来匹配搜索字符串 |
?! | 负向预查,在任何开始不匹配该正则表达式模式的位置来匹配搜索字符串 |
2 方法
2.1 方法介绍
re.compile(pattern) | 编写一个pattern,可以重复使用 |
re.match(pattern, str) |
从字符串起始位置匹配,没有匹配返回None 使用 .group() 返回匹配的字符串 |
re.search(pattern, str) |
匹配整个字符串,返回第一个匹配成功的结果,没有匹配返回None 使用 .group() 返回匹配的字符串 |
re.sub(pattern, repl, str, count=0) |
替换匹配的字符串,返回替换后的字符串 可以指定count替换的数量,默认为0,替换所有匹配成功的字符串 |
re.subn(pattern, repl, str, count=0) | 用法同 re.sub() ,返回的是元组(替换后的字符串,替换的数量) |
re.findall(pattern, str) | 返回所有匹配成功的字符串组成的列表,没有匹配返回空列表 |
re.finditer(pattern, str) | 与 re.findall() 类似,返回的是迭代器 |
re.split(pattern, str, maxsplit=0) | 按照匹配的字符串分割列表,返回分割后的字符串 |
re.escape(pattern) | 去除转义字符,一些文本中可能存在 \d * # 之类会被转义的字符,使用escape可以将这些字符转换为字面意思 |
2.2 代码示例
import re
str1 = 'a1b2c3d4e5'
# 编写一个pattern,可以重复使用
pattern = re.compile(r'[a-z]+')
print(pattern)
# re.compile('[a-z]+')
# 从字符串起始位置匹配,没有匹配返回None使用 .group() 返回匹配的字符串
re_match = re.match(pattern, str1)
print(re_match.group())
# a
# 匹配整个字符串,返回第一个匹配成功的结果,没有匹配返回None使用 .group() 返回匹配的字符串
re_search = re.search(pattern, str1)
print(re_search.group())
# a
# 替换匹配的字符串,返回替换后的字符串可以指定count替换的数量,默认为0,替换所有匹配成功的字符串
re_sub = re.sub(pattern, ' ', str1, count=0)
print(re_sub)
# 1 2 3 4 5
# 用法同 re.sub() ,返回的是元组(替换后的字符串,替换的数量)
re_subn = re.subn(pattern, ' ', str1, count=0)
print(re_subn)
# (' 1 2 3 4 5', 5)
# 返回所有匹配成功的字符串组成的列表,没有匹配返回空列表
re_findall = re.findall(pattern, str1)
print(re_findall)
# ['a', 'b', 'c', 'd', 'e']
# 与 re.findall() 类似,返回的是迭代器
re_finditer = re.finditer(pattern, str1)
print(re_finditer)
# <callable_iterator object at 0x7fec5be32f28>
# 按照匹配的字符串分割列表,返回分割后的字符串
re_split = re.split(pattern, str1, maxsplit=0)
print(re_split)
# ['', '1', '2', '3', '4', '5']
# 去除转义字符,一些文本中可能存在 \d * # 之类会被转义的字符,使用escape可以将这些字符转换为字面意思
str2 = re.escape(r'\d*')
print(str2)
# \\d\*
3 匹配规则
\w | 匹配字母、数字、下划线,等价于[a-zA-Z0-9_] \w可以匹配汉字(python) |
\W | 匹配不是字母、数字、下划线的其他字符 |
\s | 匹配任意空白字符,等价于(\t\n\r\f) |
\S | 匹配任意非空字符 |
\d | 匹配数字,等价于[0-9] |
\D | 匹配不是数字的字符 |
\A | 匹配字符串开头 |
\Z | 匹配字符串结尾的,如果存在换行,只匹配到换行前的结束字符串 |
\z | 匹配字符串结尾的,如果存在换行,同时匹配换行符 |
\G | 匹配最后完成匹配的位置 |
\n | 匹配一个换行符 |
\t | 匹配一个制表符(tab) |
^ | 匹配一行字符串的开头 |
$ | 匹配一行字符串的结尾 |
. | 匹配任意字符,除了换行符.当re.DOTALL标记被指定时,这可以匹配包括换行符在内的任字符 |
[…] | 用来表示一组字符,比如[abc]表示匹配a或b或c,[a-z],[0-9] |
[^…] | 匹配不在[]里面的字符,比如[^abc]匹配除a,b,c以外的字符 |
* | 匹配0个或多个字符 |
+ | 匹配1个或多个字符 |
? | 匹配0个或1个前面的正则表达式片段,(.*?)表示尽可能少地匹配字符(后面详解) |
{n} | 精确匹配前面n个前面的表达式,如\d{5}表示匹配5个数字 |
{n,m} | 匹配前面的表达式n到m次,贪婪模式 |
a|b | 匹配a或者b |
(…) | 匹配括号里的表达式,也可以表示一个组\w |
4 修饰符
正则表达式可以包含一些可选标志修饰符来控制匹配的模式。修饰符被指定为一个可选的标志。多个标志可以通过按位 OR(|) 它们来指定。如 re.I | re.M 被设置成 I 和 M 标志:
re.I | 使匹配对大小写不敏感 |
re.L | 做本地化识别(locale-aware)匹配 |
re.M | 多行匹配,影响 ^ 和 $ |
re.S | 使 . 匹配包括换行在内的所有字符 |
re.U | 根据Unicode字符集解析字符。这个标志影响 \w, \W, \b, \B. |
re.X | 该标志通过给予你更灵活的格式以便你将正则表达式写得更易于理解。 |
5 特殊用法
# 匹配中文字符
pattern = re.compile('[\u4e00-\u9fa5]+')