一、正则表达式

在 Python 中，使用 re 模块来处理正则表达式

1、match函数

re.match 尝试从字符串的起始位置匹配一个模式，如果不是起始位置匹配成功的话，match() 就返回 None。

函数语法：

参数	描述
pattern	匹配的正则表达式
string	要匹配的字符串
flags	标志位，用于控制正则表达式的匹配方式，如：是否区分大小写，多行匹配等等

python

re.match(pattern, string, flags=0)

2、search方法

re.search 扫描整个字符串并返回第一个成功的匹配。

函数语法：

参数	描述
pattern	匹配的正则表达式
string	要匹配的字符串
flags	标志位，用于控制正则表达式的匹配方式，如：是否区分大小写，多行匹配等等

python

re.search(pattern, string, flags=0)

3、findall

在字符串中找到正则表达式所匹配的所有子串，并返回一个列表，如果有多个匹配模式，则返回元组列表，如果没有找到匹配的，则返回空列表。

注意： match 和 search 是匹配一次，findall 匹配所有。

语法格式为：

python

re.findall(pattern, string, flags=0)
或
pattern.findall(string[, pos[, endpos]])

参数：

pattern 匹配模式。
string 待匹配的字符串。
pos 可选参数，指定字符串的起始位置，默认为 0。
endpos 可选参数，指定字符串的结束位置，默认为字符串的长度。

4、split

split 方法按照能够匹配的子串将字符串分割后返回列表，它的使用形式如下：

python

re.split(pattern, string[, maxsplit=0, flags=0])

参数：

参数	描述
pattern	匹配的正则表达式
string	要匹配的字符串。
maxsplit	分割次数，maxsplit=1 分割一次，默认为 0，不限制次数。
flags	标志位，用于控制正则表达式的匹配方式，如：是否区分大小写，多行匹配等等。

5、检索和替换

Python 的re模块提供了re.sub用于替换字符串中的匹配项。

语法：

python

re.sub(pattern, repl, string, count=0, flags=0)

参数：

pattern : 正则中的模式字符串。
repl : 替换的字符串，也可为一个函数。
string : 要被查找替换的原始字符串。
count : 模式匹配后替换的最大次数，默认 0 表示替换所有的匹配。
flags : 编译时用的匹配模式，数字形式。

前三个为必选参数，后两个为可选参数。

6、正则表达式模式

模式字符串使用特殊的语法来表示一个正则表达式。

字母和数字表示他们自身。一个正则表达式模式中的字母和数字匹配同样的字符串。

多数字母和数字前加一个反斜杠时会拥有不同的含义。

标点符号只有被转义时才匹配自身，否则它们表示特殊的含义。

反斜杠本身需要使用反斜杠转义。

由于正则表达式通常都包含反斜杠，所以你最好使用原始字符串来表示它们。模式元素(如 r'\t'，等价于 \t )匹配相应的特殊字符。

下表列出了正则表达式模式语法中的特殊元素。如果你使用模式的同时提供了可选的标志参数，某些模式元素的含义会改变。

模式	描述
`^`	匹配字符串的开头
`$`	匹配字符串的末尾。
`.`	匹配任意字符，除了换行符，当`re.DOTALL`标记被指定时，则可以匹配包括换行符的任意字符。
`[...]`	用来表示一组字符,单独列出：`[amk]` 匹配 `'a'`，`'m'`或`'k'`
`[^...]`	不在[]中的字符：`[^abc]` 匹配除了a,b,c之外的字符。
`re*`	匹配0个或多个的表达式。
`re+`	匹配1个或多个的表达式。
`re?`	匹配0个或1个由前面的正则表达式定义的片段，非贪婪方式
`re{ n}`	匹配n个前面表达式。例如，"`o{2}`"不能匹配`"Bob"`中的`"o"`，但是能匹配`"food"`中的两个`o`。
`re{ n,}`	精确匹配n个前面表达式。例如，`"o{2,}"`不能匹配`"Bob"`中的`"o"`，但能匹配`"foooood"`中的所有`o`。`"o{1,}"`等价于`"o+"`。`"o{0,}"`则等价于`"o*"`。
`re{ n, m}`	匹配 n 到 m 次由前面的正则表达式定义的片段，贪婪方式
`a\|b`	匹配a或b
`(re)`	匹配括号内的表达式，也表示一个组
`(?imx)`	正则表达式包含三种可选标志：i, m, 或 x 。只影响括号中的区域。
`(?-imx)`	正则表达式关闭 i, m, 或 x 可选标志。只影响括号中的区域。
`(?: re)`	类似 (...), 但是不表示一个组
`(?imx: re)`	在括号中使用i, m, 或 x 可选标志
`(?-imx: re)`	在括号中不使用i, m, 或 x 可选标志
`(?#...)`	注释.
`(?= re)`	前向肯定界定符。如果所含正则表达式，以 ... 表示，在当前位置成功匹配时成功，否则失败。但一旦所含表达式已经尝试，匹配引擎根本没有提高；模式的剩余部分还要尝试界定符的右边。
`(?! re)`	前向否定界定符。与肯定界定符相反；当所含表达式不能在字符串当前位置匹配时成功。
`(?> re)`	匹配的独立模式，省去回溯。
`\w`	匹配数字字母下划线
`\W`	匹配非数字字母下划线
`\s`	匹配任意空白字符，等价于 `[\t\n\r\f]`。
`\S`	匹配任意非空字符
`\d`	匹配任意数字，等价于 `[0-9]`。
`\D`	匹配任意非数字
`\A`	匹配字符串开始
`\Z`	匹配字符串结束，如果是存在换行，只匹配到换行前的结束字符串。
`\z`	匹配字符串结束
`\G`	匹配最后匹配完成的位置。
`\b`	匹配一个单词边界，也就是指单词和空格间的位置。例如， `'er\b'` 可以匹配"never" 中的 'er'，但不能匹配 `"verb"`中的 `'er'`。
`\B`	匹配非单词边界。`'er\B'` 能匹配 `"verb"` 中的 `'er'`，但不能匹配 `"never"` 中的 `'er'`。
`\n`, `\t`, 等。	匹配一个换行符。匹配一个制表符, 等
`\1`...`\9`	匹配第n个分组的内容。
`\10`	匹配第n个分组的内容，如果它经匹配。否则指的是八进制字符码的表达式

一、正则表达式 ​

1、match函数 ​

2、search方法 ​

3、findall ​

4、split ​

5、检索和替换 ​

6、正则表达式模式 ​

一、正则表达式

1、match函数

2、search方法

3、findall

4、split

5、检索和替换

6、正则表达式模式