//-- 通过正则表达式来替换换行符 var regRN = /\r\n/g; str = str.replace(regRN," ");
//-- 其他场景(分别替换\r和\n) var regR = /\r/g; var regN = /\n/g; str = str.replace(regR,"\\r").replace(regN,"\\n");
三道测试题: 1, var str=“ abbbbacc”; var rs=str.replace(“a”,”0”); (A)0bbbbacc (B)0bbbb0cc 2,var str=“ abbbbacc”; var rs=str.replace(“/a/”,”0”); (A)0bbbbacc (B)0bbbb0cc 3,var str=“ abbbbacc”; var rs=str.replace(“/a/g”,”0”); (A)0bbbbacc (B)0bbbb0cc 附注:String对象的replace方法签名为: replace(regx,str)
一,概述
1,正则表达式,可以说是任何一种编程语言都提供的机制,它主要是提供了对字符串的处理能力。 2,正则表达式在页面处理中的使用场景: 1)表单验证。验证某些域符合某种规则,例如邮件输入框必须输入的是邮件、联系电话输入框输入的必须是数字等等 2)处理DOM模型。例如通过表达式定位DOM中的一个对象或一系列对象,一个例子就是定位id属性中含有某个特殊字符的div对象。 3)纯编程逻辑。直接用于编程的逻辑之中。 3,说明:本部分所举的正则表达式的代码片断,都是经过测试的,但有一点需要注意,对于换行的字符串的定义,我们在表述时使用的是类似如下的形式: var str=“It’s is a beautiful city”; 这种形式直接写在JS代码中是错误的,那如何获取具有换行的字符串呢?简单的办法:在textarea中输入文本并换行,然后将该值赋给JS变量即可。例如: var str=document.forms[0].mytextarea.value;
二,语法与使用
1,定义正则表达式
1)定义正则表达式有两种形式,一种是普通方式,一种是构造函数方式。 2)普通方式:var reg=/表达式/附加参数 表达式:一个字符串,代表了某种规则,其中可以使用某些特殊字符,来代表特殊的规则,后面会详细说明。 附加参数:用来扩展表达式的含义,目前主要有三个参数: g:代表可以进行全局匹配。 i:代表不区分大小写匹配。 m:代表可以进行多行匹配。 上面三个参数,可以任意组合,代表复合含义,当然也可以不加参数。 例子: var reg=/a*b/; var reg=/abc+f/g; 3)构造函数方式:var reg=new RegExp(“表达式”,”附加参数”); 其中“表达式”与“附加参数”的含义与上面那种定义方式中的含义相同。 例子: var reg=new RegExp(“a*b”); var reg=new RegExp(“abc+f”,”g”); 4)普通方式与构造函数方式的区别 普通方式中的表达式必须是一个常量字符串,而构造函数中的表达式可以是常量字符串,也可以是一个js变量,例如根据用户的输入来作为表达式参数等等: var reg=new RegExp(document.forms[0].exprfiled.value,”g”);
2,表达式模式
1)表达式模式,是指表达式的表达方式与样式, 即 var reg=/表达式/附加参数 中的“表达式”怎样去描述? 2)从规范上讲,表达式模式分为简单模式和复合模式。 3)简单模式:是指通过普通字符的组合来表达的模式,例如 var reg=/abc0d/; 可见简单模式只能表示具体的匹配。 4)复合模式:是指含有通配符来表达的模式,例如: var reg=/a+b?w/; 其中的+、?和w都属于通配符,代表着特殊的含义。因此复合模式可以表达更为抽象化的逻辑。 下面我们着重说一下复合模式中各个通配符的含义及其使用。 5)复合模式中特殊字符的讲解:
8>(x):表示匹配x(并非特指字符x或者特指一个字符,x表示一个字符串),而且匹配会被记住,在语法中这种()被称为“capturing parentheses ”,即捕捉用的小括号。 匹配会被记住,是因为在表达式提供的函数中,有些函数返回一个数组,该数组会保存所匹配的所有字符串,例如exec()函数。 另外还要注意()中的x被记住的前提是匹配x。 例子1: var regx=/a(b)c/; var rs=regx.exec(“abcddd”); 从上面可以看出,/a(b)c/匹配“abcddd”中的“abc”,因为()的原因,b也会记录下来,因此rs返回的数字内容为: {abc,b} 例子2: var regx=/a(b)c/; var rs=regx.exec(“acbcddd”); rs返回null,因为/a(b)c/不匹配“acbcddd”,所以()中的b不会被记录下来(尽管字符串中含有b)
9>(?:x):匹配x,但不会记住x,这种格式中的()被称为“non-capturing parentheses ”,即非捕捉用的小括号。 例子: var regx=/a(?:b)c/; var rs=regx.exec(“abcddd”); 从上面可以看出,/a(?:b)c/匹配“abcddd”中的“abc”,因为(?:)的原因,b不会记录下来,因此rs返回的数字内容为: {abc}
10>X(?=y):匹配x,仅当后面紧跟着y时。如果符合匹配,则只有x会被记住,y不会被记住。 例子: var regx=/user(?=name)/; var rs=regx.exec(“The username is Mary”); 结果:匹配成功,而且rs的值为{user}
11>X(?!y):匹配x,仅当后面不紧跟着y时。如果符合匹配,则只有x会被记住,y不会被记住。 例子: var regx=/user(?!name)/; var rs=regx.exec(“The user name is Mary”); 结果:匹配成功,而且rs的值为{user} 例子2: var regx=/d+(?!.)/; var rs=regx.exec(“54.235”); 结果:匹配成果,rs的值为{5},不匹配54是因为54后面跟着“.”号,当然235也匹配,但是由于exec方法的行为,235不会被返回
12>x|y:匹配x或y。注意如果x和y都匹配上了,那么只记住x。 例子: var regx=/beijing|shanghai/; var rs=regx.exec(“I love beijing and shanghai”); 结果:匹配成功,rs的值为{beijing},虽然shanghai也匹配,但不会被记住。
13>{n}:匹配前一个字符的n次出现。 n必须是一个非负数,当然如果是一个负数或小数也不会报语法错误。 例子: var regx=/ab{2}c/; var rs=regx.exec(“abbcd”); 结果:匹配成功,rs的值为:{abbc}。
14>{n,}:匹配前一个字符的至少n次出现。 例子: var regx=/ab{2,}c/; var rs=regx.exec(“abbcdabbbc”); 结果:匹配成功,rs的值为:{abbc}。注意为什么abbbc也符合条件为什么没有被记住,这与exec方法的行为有关,后面会统一讲解。
15>{n,m}:匹配前一个字符的至少n次最多m次的出现。 只要n与m为数字,而且m>=n就不会报语法错误。 例子: var regx=/ab{2,5}c/; var rs=regx.exec(“abbbcd”); 结果:匹配成功,rs的值为:{abbbc}。 例子2: var regx=/ab{2,2}c/; var rs=regx.exec(“abbcd”); 结果:匹配成功,rs的值为:{abbc}。 例子3: var regx=/ab(2,5)/; var rs=regx.exec(“abbbbbbbbbb”); 结果:匹配成功,rs的值为:{abbbbb},这说明,如果前一个字符出现多于m次,则只匹配m次。另外: var regx=/ab(2,5)c/; var rs=regx.exec(“abbbbbbbbbbc”); 结果:匹配失败,rs的值为:null,为什么匹配失败,因为b多于5个则b(2,5)会匹配前5个b,,而表达式/ab(2,5)c/中b后面是c,但字符串中5个b之后还是b所以会报错。
16>[xyz]:xyz表示一个字符串,该模式表示匹配[]中的一个字符,形式上[xyz]等同于[x-z]。 例子: var regx=/a[bc]d/; var rs=regx.exec(“abddgg”); 结果:匹配成功,rs的值为:{abd} 例子2: var regx=/a[bc]d/; var rs=regx.exec(“abcd”); 结果:匹配失败,rs的值为:null,之所以失败,是因为[bc]表示匹配b或c中的一个,但不会同时匹配。
17>[^xyz]:该模式表示匹配非[]中的一个字符,形式上[^xyz]等同于[^x-z]。 例子: var regx=/a[^bc]d/; var rs=regx.exec(“afddgg”); 结果:匹配成功,rs的值为:{afd} 例子2: var regx=/a[^bc]d/; var rs=regx.exec(“abd”); 结果:匹配失败,rs的值为:。
18>[b]:匹配退格键。
19>b:匹配一个词的边界符,例如空格和换行符等等,当然匹配换行符时,表达式应该附加参数m。 例子: var regx=/bc./; var rs=regx.exec(“Beijing is a beautiful city”); 结果:匹配成功,rs的值为:{ci},注意c前边的空格不会匹配到结果中,即{ ci}是不正确的。
20>B:代表一个非单词边界。 例子: var regx=/Bi./; var rs=regx.exec(“Beijing is a beautiful city”); 结果:匹配成功,rs的值为:{ij},即匹配了Beijing中的ij。
21>cX,匹配一个控制字符。例如, cM 匹配一个 Control-M 或 回车符。 x 的值必须为 A-Z 或 a-z 之一。否则,将 c 视为一 个原义的 ’c’ 字符。(实际的例子还需补充)
21>d:匹配一个数字字符,等同于[0-9]。 例子: var regx=/userd/; var rs=regx.exec(“user1”); 结果:匹配成功,rs的值为:{user1}
22>D:匹配一个非数字字符,等同于[^0-9]。 例子: var regx=/userD/; var rs=regx.exec(“userA”); 结果:匹配成功,rs的值为:{userA}
23>f:匹配一个换页符。
24>n:匹配一个换行符。因为是换行符,所以在表达式中要加入m参数。 例子: var regx=/anbc/m; var str=“a bc”; var rs=regx.exec(str); 结果:匹配成功,rs的值为:{ },如果表达式为/anrbc/,则不会被匹配,因此在一般的编辑器中一个”Enter”键代表着“回车换行”,而非“换行回车”,至少在textarea域中是这样的。 25>r:匹配一个回车符
26>s:匹配一个空格符,等同于[ fnrtvu00A0u2028u2029]. 例子: var regx=/si/; var rs=regx.exec(“Beijing is a city”); 结果:匹配成功,rs的值为:{ i}
27>S:匹配一个非空格符,等同于[ ^fnrtvu00A0u2028u2029]. 例子: var regx=/Si/; var rs=regx.exec(“Beijing is a city”); 结果:匹配成功,rs的值为:{ei}
28>t:匹配一个tab 例子: var regx=/atb/; var rs=regx.exec(“a bc”); 结果:匹配成功,rs的值为: {a bc}
29>v:匹配一个竖向的tab
30>w:匹配一个数字、_或字母表字符,即[A-Za-z0-9_ ]。 例子: var regx=/w/; var rs=regx.exec(“$25.23”); 结果:匹配成功,rs的值为:{2}
31>W:匹配一个非数字、_或字母表字符,即[^A-Za-z0-9_ ]。 例子: var regx=/w/; var rs=regx.exec(“$25.23”); 结果:匹配成功,rs的值为:{$}
32>n:注意不是n,这里n是一个正整数,表示匹配第n个()中的字符。 例子: var regx=/user([,-])group1role/; var rs=regx.exec(“user-group-role”); 结果:匹配成功,rs的值为:{user-group-role,-},同样对user,group,role的匹配也是成功的,但像user-group,role等就不对了。
1>exec(str),返回str中与表达式相匹配的第一个字符串,而且以数组的形式表现,当然如果表达式中含有捕捉用的小括号,则返回的数组中也可能含有()中的匹配字符串,例如: var regx=/d+/; var rs=regx.exec(“3432ddf53”); 返回的rs值为:{3432} var regx2=new RegExp(“ab(d+)c”); var rs2=regx2.exec(“ab234c44”); 返回的rs值为:{ab234c,234} 另外,如果有多个合适的匹配,则第一次执行exec返回一个第一个匹配,此时继续执行exec,则依次返回第二个第三个匹配。例如: var regx=/userd/g; var rs=regx.exec(“ddduser1dsfuser2dd”); var rs1=regx.exec(“ddduser1dsfuser2dd”); 则rs的值为{user1},rs的值为{rs2},当然注意regx中的g参数是必须的,否则无论exec执行多少次,都返回第一个匹配。后面还有相关内容涉及到对此想象的解释。
2>test(str),判断字符串str是否匹配表达式,返回一个布尔值。例如: var regx=/userd+/g; var flag=regx.test(“user12dd”); flag的值为true。
3)String对象方法
1>match(expr),返回与expr相匹配的一个字符串数组,如果没有加参数g,则返回第一个匹配,加入参数g则返回所有的匹配 例子: var regx=/userd/g; var str=“user13userddduser345”; var rs=str.match(regx); rs的值为:{user1,user3}
2>search(expr),返回字符串中与expr相匹配的第一个匹配的index值。 例子: var regx=/userd/g; var str=“user13userddduser345”; var rs=str.search(regx); rs的值为:0
3>replace(expr,str),将字符串中匹配expr的部分替换为str。另外在replace方法中,str中可以含有一种变量符号$,格式为$n,代表匹配中被记住的第n的匹配字符串(注意小括号可以记忆匹配)。 例子: var regx=/userd/g; var str=“user13userddduser345”; var rs=str.replace(regx,”00”); rs的值为:003userddd0045 例子2: var regx=/u(se)rd/g; var str=“user13userddduser345”; var rs=str.replace(regx,”$1”); rs的值为:se3userdddse45 对于replace(expr,str)方法还要特别注意一点,如果expr是一个表达式对象则会进行全局替换(此时表达式必须附加参数g,否则也只是替换第一个匹配),如果expr是一个字符串对象,则只会替换第一个匹配的部分,例如: var regx=“user” var str=“user13userddduser345”; var rs=str.replace(regx,”00”); rs的值为: 0013userddduser345
4>split(expr),将字符串以匹配expr的部分做分割,返回一个数组,而且表达式是否附加参数g都没有关系,结果是一样的。 例子: var regx=/userd/g; var str=“user13userddduser345”; var rs=str.split(regx); rs的值为:{3userddd,45}
4,表达式相关属性
1)表达式相关属性,是指和表达式相关的属性,如下面的形式: var regx=/myexpr/; var rs=regx.exec(str); 其中,和表达式自身regx相关的属性有两个,和表达式匹配结果rs相关的属性有三个,下面将逐一介绍。 2)和表达式自身相关的两个属性:
1>lastIndex,返回开始下一个匹配的位置,注意必须是全局匹配(表达式中带有g参数)时,lastIndex才会有不断返回下一个匹配值,否则该值为总是返回第一个下一个匹配位置,例如: var regx=/userd/; var rs=regx.exec(“sdsfuser1dfsfuser2”); var lastIndex1=regx.lastIndex; rs=regx.exec(“sdsfuser1dfsfuser2”); var lastIndex2=regx.lastIndex; rs=regx.exec(“sdsfuser1dfsfuser2”); var lastIndex3=regx.lastIndex; 上面lastIndex1为9,第二个lastIndex2也为9,第三个也是9;如果regx=/userd/g,则第一个为9,第二个为18,第三个为0。
2>source,返回表达式字符串自身。例如: var regx=/userd/; var rs=regx.exec(“sdsfuser1dfsfuser2”); var source=regx.source; source的值为userd 3)和匹配结果相关的三个属性:
1>index,返回当前匹配的位置。例如: var regx=/userd/; var rs=regx.exec(“sdsfuser1dfsfuser2”); var index1=rs.index; rs=regx.exec(“sdsfuser1dfsfuser2”); var index2=rs.index; rs=regx.exec(“sdsfuser1dfsfuser2”); var index3=rs.index; index1为4,index2为4,index3为4,如果表达式加入参数g,则index1为4,index2为13,index3会报错(index为空或不是对象)。
2>input,用于匹配的字符串。例如: var regx=/userd/; var rs=regx.exec(“sdsfuser1dfsfuser2”); var input=rs.input; input的值为sdsfuser1dfsfuser2。
3>[0],返回匹配结果中的第一个匹配值,对于match而言可能返回一个多值的数字,则除了[0]外,还可以取[1]、[2]等等。例如: var regx=/userd/; var rs=regx.exec(“sdsfuser1dfsfuser2”); var value1=rs[0]; rs=regx.exec(“sdsfuser1dfsfuser2”); var value2=rs[0]; value1的值为user1,value2的值为user2
2,为了能够便于大家对前面讲述的内容有一个更为综合和深刻的认识,我将前面的一些关键点和容易犯糊涂的地方再系统总结一下,这部分很关键! 总结1:附件参数g的用法 表达式加上参数g之后,表明可以进行全局匹配,注意这里“可以”的含义。我们详细叙述: 1)对于表达式对象的exec方法,不加入g,则只返回第一个匹配,无论执行多少次均是如此,如果加入g,则第一次执行也返回第一个匹配,再执行返回第二个匹配,依次类推。例如 var regx=/userd/; var str=“user18dsdfuser2dsfsd”; var rs=regx.exec(str);//此时rs的值为{user1} var rs2=regx.exec(str);//此时rs的值依然为{user1} 如果regx=/userd/g;则rs的值为{user1},rs2的值为{user2} 通过这个例子说明:对于exec方法,表达式加入了g,并不是说执行exec方法就可以返回所有的匹配,而是说加入了g之后,我可以通过某种方式得到所有的匹配,这里的“方式”对于exec而言,就是依次执行这个方法即可。 2)对于表达式对象的test方法,加入g于不加上g没有什么区别。 3)对于String对象的match方法,不加入g,也只是返回第一个匹配,一直执行match方法也总是返回第一个匹配,加入g,则一次返回所有的匹配(注意这与表达式对象的exec方法不同,对于exec而言,表达式即使加上了g,也不会一次返回所有的匹配)。例如: var regx=/userd/; var str=“user1sdfsffuser2dfsdf”; var rs=str.match(regx);//此时rs的值为{user1} var rs2=str.match(regx);//此时rs的值依然为{user1} 如果regx=/userd/g,则rs的值为{user1,user2},rs2的值也为{user1,user2} 4)对于String对象的replace方法,表达式不加入g,则只替换第一个匹配,如果加入g,则替换所有匹配。(开头的三道测试题能很好的说明这一点) 5)对于String对象的split方法,加上g与不加g是一样的,即: var sep=/userd/; var array=“user1dfsfuser2dfsf”.split(sep); 则array的值为{dfsf, dfsf} 此时sep=/userd/g,返回值是一样的。 6)对于String对象的search方法,加不加g也是一样的。 总结2:附加参数m的用法 附加参数m,表明可以进行多行匹配,但是这个只有当使用^和$模式时才会起作用,在其他的模式中,加不加入m都可以进行多行匹配(其实说多行的字符串也是一个普通字符串),我们举例说明这一点 1)使用^的例子 var regx=/^b./g; var str=“bd76 dfsdf sdfsdfs dffs b76dsf sdfsdf”; var rs=str.match(regx); 此时加入g和不加入g,都只返回第一个匹配{bd},如果regx=/^b./gm,则返回所有的匹配{bd,b7},注意如果regx=/^b./m,则也只返回第一个匹配。所以,加入m表明可以进行多行匹配,加入g表明可以进行全局匹配,综合到一起就是可以进行多行全局匹配 2)使用其他模式的例子,例如 var regx=/userd/; var str=“sdfsfsdfsdf sdfsuser3 dffs b76dsf user6”; var rs=str.match(regx); 此时不加参数g,则返回{user3},加入参数g返回{user3,user6},加不加入m对此没有影响。 3)因此对于m我们要清楚它的使用,记住它只对^和$模式起作用,在这两种模式中,m的作用为:如果不加入m,则只能在第一行进行匹配,如果加入m则可以在所有的行进行匹配。我们再看一个^的例子 var regx=/^b./; var str=“ret76 dfsdf bjfsdfs dffs b76dsf sdfsdf”; var rs=str.match(regx); 此时rs的值为null,如果加入g,rs的值仍然为null,如果加入m,则rs的值为{bj}(也就是说,在第一行没有找到匹配,因为有参数m,所以可以继续去下面的行去找是否有匹配),如果m和g都加上,则返回{bj,b7}(只加m不加g说明,可以去多行进行匹配,但是找到一个匹配后就返回,加入g 表明将多行中所有的匹配返回,当然对于match方法是如此,对于exec呢,则需要执行多次才能依次返回) 总结3:在HTML的textarea输入域中,按一个Enter键,对应的控制字符为“rn”,即“回车换行”,而不是“nr”,即“换行回车”,我们看一个前面我们举过的例子: var regx=/arnbc/; var str=“a bc”; var rs=regx.exec(str); 结果:匹配成功,rs的值为:{ },如果表达式为/anrbc/,则不会被匹配,因此在一般的编辑器中一个”Enter”键代表着“回车换行”,而非“换行回车”,至少在textarea域中是这样的。