Structure of RE

正则表达式的构成

简单地说，正则表达式是一种以用于模式匹配和替换的强有力的工具。正则表达式可以让用户通过使用一系列的特殊字符构建匹配模式，然后把匹配模式与数据文件、程序输入以及WEB页面的表单输入等目标对象进行比较，根据比较对象中是否包含匹配模式，执行相应的操作。

我们在处理文本时，经常会遇到一些具有某种特定格式，或者说满足某种规则的文本。比如，一个无符号的整数由一连串的数字构成，而一个Email地址的格式则是“用户名@主机名”，其中用户名是一串字母或数字，主机名则是由若干个由“.”分隔的字母数字串。如果通过正则表达式验证用户邮件地址的格式是正确的，用户所填写的表单信息将会被正常处理；反之，如果用户输入的邮件地址与正则表达的模式不匹配，将会弹出提示信息，要求用户重新输入正确的邮件地址。正则表达式就是用来指定这种规则（模式）的。如果某个字符串满足正则表达式指定的规则，则称该字符串为正则表达式的一个“匹配串”。

使用正则表达式，就可以：

测试字符串的某个模式。例如，可以对一个输入字符串进行测试，看在该字符串是否存在一个电话号码模式或一个信用卡号码模式。这称为数据有效性验证。
替换文本。可以在文档中使用一个正则表达式来标识特定文字，然后可以全部将其删除，或者替换为别的文字。
根据模式匹配从字符串中提取一个子字符串。可以用来在文本或输入字段中查找特定文字。

为了方便理解，让我们先来看看大家比较熟悉的数学表达式，“(x+3)*2+y”是一个典型的数学表达式。一个数学表达式由若干个“项”组成，“项”与“项”之间用加号或减号相连；这里“(x+3)*2”和“y”分别是两个项。每个项又由若干个“因子”组成，因子之间用乘号或除号相连；这里第一个项有两个因子“(x+3)”和“2”，而第二个项只有一个因子“y”。每个因子可以是一个简单的数，一个代数变量，也可以是放在括号里面的另一个表达式。对于最后一种情况，括号中的表达式称为“子表达式”；这里“x+3”就是一个子表达式。

正则表达式的结构与数学表达式很相似。与数学表达式的“项”相对应，正则表达式由若干个“分支”构成，“分支”之间用符号“|”相连。从逻辑上讲，分支之间是一种“或”的关系，一个字符串只要与正则表达式中的任何一个分支相匹配，这个字符串就与整个正则表达式相匹配。比如，“第三人称代词”可以用正则表达式表示为“他|她|它|他们|她们|它们”。

与数学表达式的“因子”相对应，构成正则表达式“分支”的部件称为“原子”。“原子”与“原子”之间没有任何符号相连。从逻辑上讲，原子之间是串接的关系，一个字符串必须与各个原子依次相匹配，才算与这个分支相匹配。比如在上面的例子中，分支“他们”由两个原子“他”和“们”组成。

正则表达式的本质是它的“原子”可以有多种不同的形式。前面的例子是最简单的情形，即每个原子由一个普通字符组成。除此以外，“原子”还可以是特殊符号、通配符、字符集以及子表达式。