首页 > > 网络编程 > 其它 >

正则表达式

2018-08-17 09:47:29来源：博客园阅读 ()

新老客户大回馈,云服务器低至5折

一丶简介

　　正则表达式本身是一种小型的丶高度专业化的编程语言,而在python中,通过内嵌集成re模块,程序猿们可以直接调用用来实现正则匹配.正则表达式模式被编译成一系列的字节码,然后由用C编写的匹配引擎执行.

二丶正则表达式中常用的字符含义

　　1.字符组

　　　　在同一个位置可能出现的各种字符组成了一个字符组,在正则表达式中用[]表示

正则	待匹配字符	匹配结果	说明
[0123456789]	8	True	在一个字符组里枚举合法的所有字符,字符组里的任意一个字符和"待匹配字符"相同都视为可以匹配
[0123456789]	a	False	由于字符组中没有"a"字符,所以不能匹配
[0-9]	7	True	也可以用-表示范围,[0-9]就和[0123456789]是一个意思
[a-z]	s	True	同样的如果要匹配所有的小写字母,直接用[a-z]就可以表示了
[A-Z]	B	True	[A-Z]就表示所有的大写字母
[0-9a-fA-F]	e	True	可以匹配数字,大小写形式的a-f,用来验证十六进制字符

2.元字符

元字符	匹配内容
\w	匹配字母或数字或下划线
\s	匹配任意的空白符
\d	匹配数字
\n	匹配一个换行符
\t	匹配一个制表符(TAB)
\b	匹配一个单词的结尾
^	匹配字符串的开始
$	匹配字符串的结尾
\W	匹配非字母或数字或下划线
\S	匹配非空白符
\D	匹配非数字
a\|b	匹配字符a或字符b
()	匹配括号内的表达式,也表示一个组
[...]	匹配字符组中的字符
[^...]	匹配除了字符组中字符的所有字符
.	匹配除换行符以外的任意字符

3.量词

量词	用法说明
*	重复零次或更多次
+	重复一次或更多次
?	重复零次或一次
{n}	重复n次
{n,}	重复n次或更多次
{n,m}	重复n到m次

　

.^$

正则	待匹配字符	匹配结果	说明
海.	海燕海角海东	海燕海角海东	匹配所有"海."的字符
^海	海燕海角海东	海燕	只从开头匹配"海."
海.$	海燕海角海东	海东	只匹配结尾的"海.$"

　

　

*+?{}

正则	待匹配字符	匹配结果	说明
李.?	李安和李莲英和李大傻子	李安李莲李大	?表示重复零次或一次,即只匹配"李"后面一个任意字符
李.*	李安和李莲英和李大傻子	李安和李莲英和李大傻子	*表示重复零次或多次,即匹配"李"后面0或多个任意字符
李.+	李安和李莲英和李大傻子	李安和李莲英和李大傻子	+表示重复一次或多次,即只匹配"李"后面1一个或多个任意字符
李.{1,2}	李安和李莲英和李大傻子	李安和李莲英李大傻	{1,2}匹配1到2次任意字符

　　

　　　　注意:前面的*,+,?等都是贪婪匹配.也就是尽可能匹配,后面加?号使其变成惰性匹配

　　4.字符集 [] [^]

正则	待匹配字符	匹配结果	说明
李[杰莲英二棍子]*	李杰和李莲英和李二棍子	李杰李莲英李二棍子	表示匹配"李"字后面[杰莲英二棍子]的字符任意次
李[^和]*	李杰和李莲英和李二棍子	李杰李莲英李二棍子	表示匹配一个不是"和"的字符任意次
[\d]	456bdha3	4 5 6 3	表示匹配任意一个数字,匹配到4个结果
[\d]+	456bdha3	456 3	表示匹配任意个数字,匹配到2个结果

　　

　　　5.分组与或 | [^]

　　身份证号码是一个长度为15或18个字符的字符串，如果是15位则全部由数字组成，首位不能为0；如果是18位，则前17位全部是数字，末位可能是数字或x，下面我们尝试用正则来表示：

正则	待匹配字符	匹配结果	说明
^[1-9]\d{13,16}[0-9x]$	110101198001017032	110101198001017032	表示可以匹配一个正确的身份证号
^[1-9]\d{13,16}[0-9x]$	1101011980010170	110101198001017032	表示也可以匹配这串数字,但这并不是一个正确的身份证号,他是一个16位的数字
^[1-9]\d{14}(\d{2}[0-9x])?$	1101011980010170	False	现在不会匹配错误的身份证号了()表示分组,将\d{2}[0-9x]分成一组,就可以整体约束他们出现的次数为0-1次
^([1-9]\d{16}[0-9x]\|[1-9]\d{14})$	110105199812067023	110105199812067023	表示先匹配[1-9]\d{16}[0-9x]如果没有匹配上就匹配[1-9]\d{14}

　　

　6.转义符 \

　　　　在正则表达式中，有很多有特殊意义的是元字符，比如\d和\s等，如果要在正则中匹配正常的"\d"而不是"数字"就需要对"\"进行转义，变成'\\'。

　　　　在python中，无论是正则表达式，还是待匹配的内容，都是以字符串的形式出现的，在字符串中\也有特殊的含义，本身还需要转义。所以如果匹配一次"\d",字符串中要写成'\\d'，那么正则里就要写成"\\\\d",这样就太麻烦了。这个时候我们就用到了r'\d'这个概念，此时的正则是r'\\d'就可以了。

正则	待匹配字符	匹配结果	说明
\d	\d	False	因为在正则表达式中\是由特殊意义的字符,所以要匹配\d本身,用表达式\d无法匹配
\\d	\d	True	转义\之后变成\\,即可匹配
"\\\\d"	"\\d"	True	如果python中,字符串中的"\"也需要转移,所以每一个字符串"\"又需转义一次
r"\\d"	r"\d"	True	在字符串之前加r,让整个字符串不转义

　7.贪婪匹配

　　贪婪匹配：在满足匹配时，匹配尽可能长的字符串，默认情况下，采用贪婪匹配

正则

待匹配字符

匹配结果

说明

<.*>

<script>...<script>

<script>...<script>

默认为贪婪匹配模式,会匹配尽量长的字符串

<.*?>

r"\d"

<script>

<script>

加上? 为将贪婪匹配模式转为非贪婪匹配模式,会匹配尽量短的字符串

标签：

版权申明：本站文章部分自网络，如有侵权，请联系：west999com@outlook.com
特别注意：本站所有转载文章言论不代表本站观点，本站所提供的摄影照片，插画，设计作品，如需使用，请与原作者联系，版权归原作者所有

上一篇：神破解，Python获取任意QQ历史头像，事实证明都是从屌丝走过来的

下一篇：【leetcode 简单】第三十三题只出现一次的数字

相关文章

IDC资讯：主机资讯注册资讯托管资讯 vps资讯网站建设

网站运营：建站经验策划盈利搜索优化网站推广免费资源

网站联盟：联盟新闻联盟介绍联盟点评网赚技巧

行业资讯：搜索引擎网络游戏电子商务广告传媒

网络编程： Asp.Net编程 Asp编程 Php编程 Xml编程 Access Mssql Mysql 其它

服务器技术： Web服务器 Ftp服务器 Mail服务器 Dns服务器安全防护

软件技巧：其它软件 Word Excel Powerpoint Ghost Vista QQ空间 QQ FlashGet 迅雷

网页制作： FrontPages Dreamweaver Javascript css photoshop fireworks Flash

程序设计： Java技术 C/C++ VB delphi

网络知识：网络协议网络安全网络管理组网方案 Cisco技术

操作系统： Win2000 WinXP Win2003 Mac OS Linux FreeBSD

热门词条

最新资讯

热门关注

热门标签