本文讲述了python实现的正则表达式功能。分享给大家供大家参考,具体如下:
前文:
首先,什么叫正则表达式(Regular Expression)?
例如我们要判断字符串"adi_e32fv,Ls"里面是否含有子串"e32f",又例如我们在一个含百万个姓名的txt文件中找姓“王”,名字以“五”结尾的名字,然后打印出来。结果为:“王五”、“王小五”、“王大五”、“王小小五”……
以前我们是使用字符串函数来查找的,但是代码实现起来会很复杂。如今用正则表达式只需要一句 re.findall('王.*?五',txt1) 就可以了!正则表达式是写网络爬虫的最基本的知识,可以用正则表达式在html中搜集满足某些字串要求的网址。下面是个人对正则表达式基础知识的一些总结。
(操作环境:32位Win8系统,运行工具:python2.7.9+Eclipse.)
正文:
1、首先要导入python的re模块。
2、元字符 . ^ $ * + ? {} [] / | ()
re模块中的findall(str1,str2)方法返回字串str2中匹配str1格式的字串。例如在字符串'dit dot det,dct dit dot'中匹配'dit'结果为:
str1 = 'dit dot det,dct dit dot'print re.findall('dit',str1)
结果:
['dit', 'dit']
|作用:'dit|dct'表示dit或者dct。
str1 = 'dit dot det,dct dit dot'print re.findall('dit|dct',str1)
结果:
['dit', 'dct', 'dit']
[]作用:[ic]表示i或c,例如'd[ic]t'表示dit和dct两者,和'dit|dct'等价:
str1 = 'dit dot det,dct dit dot'print re.findall('d[ic]t',str1)
结果:
['dit', 'dct', 'dit']
^作用一:[^ic]中^表示否定,即除了i和c:
str1 = 'dit dot det,dct dit dot'print re.findall('d[^ic]t',str1)
结果:
['dot', 'det', 'dot']
^作用二:^dit表示子串dit在开头位置,而dct不是在开头:
str1 = 'dit dot det,dct dit dot'print re.findall('^dit',str1)print re.findall('^dct',str1)
结果:
['dit'][]
$作用:dot$表示子串dot要在末尾位置,而dct不是在末尾:
str1 = 'dit dot det,dct dit dot'print re.findall('dot$',str1)print re.findall('dct$',str1)
结果:
['dot'][]
.作用:d.t表示d与t之间省略了一个任意字符:
str1 = 'dit dot det,dct dit dot'print re.findall('d.t',str1)
结果:
['dit', 'dot', 'det', 'dct', 'dit', 'dot']
+作用:di+t表示d与t之间省略了一个或多个'i':
str1 = 'd dt dit diit det'print re.findall('d.+t',str1)
新闻热点
疑难解答