Python 正则表达式(转义问题)

zhengzhongjie0

2019-04-17

先说一个比较宓氖虑椋涸谛聪好滓衾质蕴略仄鞯氖焙蛴龅揭桓鑫侍猓蛭４娴奈募际怯靡衾值谋晏饷模耘龅揭恍┲钊纭峙/out border」等含有非法字符（哼哼，说的就是你 →_→ Windows）的标题的时候，就会保存失败。于是我想起了迅雷的解决方法：把所有的非法字符替换成下划线。

于是就引入了正则表达式的使用。一番搜索囫囵吞枣后，我写下了这样的函数：

代码如下：

def sanitize_filename(filename):

return re.sub('[\/:*?<>|]', '_', filename)

最近意识到了这个函数里的好多问题：

Python 和 Shell 不同，无论单引号还是双引号，反斜杠都是转义符。走狗屎运的是，Python 对于没意义的转义 \/ 的处理是保持原样。
即便如此，sanitize_filename('\\/:*?<>|') 依旧返回 \_______ 而不是全部都是下划线。

于是感觉得正正经经看看文档了。

Raw strings

看了文档后才意识到，Python 正则表达式模块的转义是独立的。例如匹配一个反斜杠字符需要将参数写成：'\\\\'：

Python 将字符串转义：\\\\ 被转义为 \\
re 模块获得传入的 \\ 将其解释为正则表达式，按照正则表达式的转义规则将其转义为 \
如此麻烦的前提下，Raw String 就大有作为了，顾名思义就是（除了结尾的反斜杠）不会被转义的字符串。于是匹配一个反斜杠字符就可以写作 r'\\'。

所以上面的 sanitize_filename 改成了：

代码如下：

def sanitize_filename(filename):

return re.sub(r'[\\/:*?<>|]', '_', filename)

Regex 和 Match

于是正经看看 re 模块吧～以下为流水帐，供急性子观看。

Python 的正则表达式模块 re 中主要的对象其实是这俩：

正则表达式 RegexObject
匹配 MatchObject
RegexObject 是正则表达式对象，所有 match sub 之类的操作都归它所有。由 re.compile(pattern, flag) 生成。

代码如下：

>>> email_pattern = re.compile(r'\w+@\w+\.\w+')

>>> email_pattern.findall('My email is [email protected] and his is [email protected]')

['[email protected]', '[email protected]']

其中的方法：

search 从任意字符开始匹配，返回 MatchObject 或者 None
match 从第一个字符开始匹配，返回 MatchObject 或者 None
split 返回由匹配分割的 List
findall 返回所有匹配的 List
finditr 返回 MatchObject 的迭代器
sub 返回替换后的字符串
subn 返回 (替换后的字符串, 替换次数)
re 模块里提供的函数如 re.sub re.match re.findall 实际上都可以认为是一种省去直接创建正则表达式对象的捷径。而由于 RegexObject 对象本身可以反复使用，这也是它相对于这些捷径函数的优势所在。

MatchObject 则是匹配对象，表示一次正则表达式匹配的结果。由 RegexObject 的一些方法返回。匹配对象永远是 True 的，另外还有一大堆用来取得正则表达式中分组（group）相关信息的方法。

代码如下：

>>> for m in re.finditer(r'(\w+)@\w+\.\w+', 'My email is [email protected] and his is [email protected]'):

... print '%d-%d %s %s' % (m.start(0), m.end(0), m.group(1), m.group(0))

...

12-23 abc [email protected]

35-51 user [email protected]

参考

The Python Standard Library: http://docs.python.org/2/library/re.html

正则表达式 python python函数

安科网

Python 正则表达式(转义问题)

zhengzhongjie0

参考

zhengzhongjie0

相关推荐

shell模糊匹配与正则详解

正则表达式中两个反斜杠的匹配规则详解

正则表达式解决input框固定输入值得格式(金额,特殊字符)

浅析golang 正则表达式

Oracle数据库正则表达式使用场景代码实例

Shell—正则表达式（grep命令、sed工具）

【教程】图文解读正则表达式的使用技巧

如何掌握正则表达式这一开发利器，看这篇就够了

基于xpath选择器、PyQuery、正则表达式的格式清理工具详解

3个助你玩转正则表达式的利器

如何使用Grep命令查找多个字符串

C# 正则表达式

正则表达式常用通配符

正则表达式在NLP中应用

正则表达式匹配样例

正则表达式常用的字符类

用正则表达式验证表格的格式

SHELL正则表达式

02-re模块使用

正则表达式 I

zhengzhongjie0