My RegEx Library

5. 删除程序中的各种注释

  • 首先考虑到在字符串中可能存在注释的文本,但是这些注释我们是不需要删除的,
  • 所以可以加一个分支再匹配字符串
  • 这时当匹配字符串开始时候,就会一直匹配到字符串结束
  • 然后下次匹配的时候,是在字符串尾部继续应用正则表达式,所以不会匹配到内部
  • 同理注释中字符串也不算程序中的字符串,因为在更前的位置,已经被当成注释给匹配了
  • 如果既不是字符串也不是注释,传动装置才会驱动到下一个位置继续尝试

匹配注释的表达式

  • 多行注释: /\*[\s\S]*?\*/
  • 单行注释: //.*+

匹配字符串的表达式

  • 单引号或双引号 字符串: (["'])(?:(?!\1)[^\n\\])*+(?:\\.(?:(?!\1)[^\n\\])*+)*+\1

所以整个表达式可以写成

  • (["'])(?:(?!\1)[^\n\\])*+(?:\\.(?:(?!\1)[^\n\\])*+)*+\1|/\*[\s\S]*?\*/|//.*+

表达式的顺序是不重要的,但是文本中那种内容更多可能改变表达式的顺序却可以提高效率
如果要删除注释,则替换的时候替换成字符串匹配到的内容即可,如果注释匹配为空,则无影响,如果字符串为空,则注释将被删除

regex: ((["'])(?:(?!\2)[^\n\\])*+(?:\\.(?:(?!\2)[^\n\\])*+)*+\2)|/\*[\s\S]*?\*/|//.*+
replacement: $1


不使用忽略优先量词和环视来匹配注释的更高效版本

  • regex: ((["'])(?:(?!\2)[^\n\\])*+(?:\\.(?:(?!\2)[^\n\\])*+)*+\2)|/\*[^*]*+(?:\*++[^/*][^*]*+)*+\*++/|//.*+
  • replacement: $1

因为在java中测试,匹配多行注释使用这种办法效率更高,而匹配单引号和双引号不使用多选分支效率更高


进一步优化

  • 在匹配非字符串和注释的时候,这些内容不能被匹配,表达式只能依次尝试完所有的分支报告当前位置失配,然后由传动装置驱动到下一个位置,因为java采用的是传统型nfa引擎,表达式主导,所以可以自己控制表达式的匹配,
  • 在第一个分支加入匹配其他字符的表达式: [^'/"]+, 之所以不使用星号量词是因为*总是能够匹配成功,而当匹配到注释开始时,其不能匹配任何文本,也能报告成功,下一次迭代的时候,传动装置就会从下一个位置继续开始匹配,这将会把注释当成其他内容匹配而保留下来。

([^/'"]++|(["'])(?:(?!\2)[^\n\\])*+(?:\\.(?:(?!\2)[^\n\\])*+)*+\2)|/\*[^*]*+(?:\*++[^/*][^*]*+)*+\*++/|//.*+

  • 然而当匹配完字符串后,接下来很可能又是其他字符,所以可以在其后添加匹配其他字符的表达式: [^'/"]+,因为也可能后面存在的是注释,如
String test = "test"/*middle comments*/;

所以我们应该使用星号量词: [^'/"]*
得到最后的表达式
([^/'"]++|(["'])(?:(?!\2)[^\n\\])*+(?:\\.(?:(?!\2)[^\n\\])*+)*+\2[^/'"]*+)|/\*[^*]*+(?:\*++[^/*][^*]*+)*+\*++/|//.*+


可能还会考虑到优化

  • 可以把其他字符当作普通字符,注释和字符串当作特殊字符
  1. normal: [^/'"]
  2. special: (?:((["'])(?:(?!\2)[^\n\\])*+(?:\\.(?:(?!\2)[^\n\\])*+)*+\2)|(?:/\*[^*]*+(?:\*++[^/*][^*]*+)*+\*++/|//.*+))
  • 注释非捕获,其他和字符串捕获,得到:

  • regex: ([^/'"]*+)(?:(?:((["'])(?:(?!\3)[^\n\\])*+(?:\\.(?:(?!\3)[^\n\\])*+)*+\3)|(?:/\*[^*]*+(?:\*++[^/*][^*]*+)*+\*++/|//.*+))([^/'"]*+))*+
  • replacement: $1$2$4

但实际上这是不正确的$2$4捕获的文本存在于量词限定之中,其捕获的文本时刻在发生改变,每次都为最后一次应用匹配到的文本。

4. 匹配程序中的字符串

  • 程序中的字符串分两种,单引号字符串和双引号字符串
  1. 匹配双引号字符串: "(?:[^\\"\n]|\\.)*+"
  2. 匹配单引号字符串: '(?:[^\\'\n]|\\.)*+'
  • 消除循环
  1. "[^\\"\n]*+(?:\\.[^\\"\n]*+)*+"
  2. '[^\\'\n]*+(?:\\.[^\\'\n]*+)*+'

  • 可以用一个正则表达式来匹配单引号字符串和双引号字符串
    (["'])(?:(?!\1)[^\n\\]|\\.)*+\1
    经测试合并后的表达式相比于多选分支具有更高的效率
  • 消除循环
    (["'])(?:(?!\1)[^\n\\])*+(?:\\.(?:(?!\1)[^\n\\])*+)*+\1

3. 单纯匹配程序多行注释

special部分匹配的内容是normal不能匹配的疑似结束tag的内容,但是special又不会匹配掉结束tag,所以这里可以把诺干个****...[^/*]当作special,****.../当作结束tag,之所以不能把*[^/]当作special,*/当作结束tag,是因为如果结束是**/,这样的字符,会造成special匹配**/被normal部分匹配掉.

不使用忽略优先量词与环视

  • opening: /\*
  • normal: [^*]
  • special: \*+[^*/]
  • closing: \*+/
    regex1: /\*[^*]*+(?:\*++[^/*][^*]*+)*+\*++/
  • opening: /\*
  • normal*: [^*]*\*+
  • special: [^*/]
  • closing: /
    regex2: /\*[^*]*+\*++(?:[^/*][^*]*+\*++)*+/

regex3: /\*(?:(?!\*/)[\s\S])*+\*/
regex4: /\*[\s\S]*?\*/

  • 在java中的效率比较
    1, 2 > 4 > 3

2. 匹配CVS文件的内容

  • 匹配hsdh,"gsg ""gsasg""ga",,gs,"",asghs
  • 得到 hsdh"gsg ""gsasg""ga"gs""asghs

regex1: (?:(?<=,)|^)(?:[^\n,]*+|"(?:[^\n"]|"")*+")
regex2: (?:(?<=,)|^)(?:[^\n,]*+|"[^\n"]*+(?:""[^\n"]*+)*+")

1. 为数值添加逗号

问题:

  • 将类似298444215替换成298,444,215

解决办法:

  1. 前面要存在数字——使用(?<=\d)
  2. 后面要存在数字且是3的整倍数——(?=(?:\d\d\d)+$)

regex: (?<=\d)(?=(?:\d{3})++$)
replacement: ,

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 212,383评论 6 493
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 90,522评论 3 385
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 157,852评论 0 348
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 56,621评论 1 284
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 65,741评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 49,929评论 1 290
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,076评论 3 410
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 37,803评论 0 268
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,265评论 1 303
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 36,582评论 2 327
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 38,716评论 1 341
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,395评论 4 333
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,039评论 3 316
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 30,798评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,027评论 1 266
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 46,488评论 2 361
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 43,612评论 2 350

推荐阅读更多精彩内容

  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 134,637评论 18 139
  • 版权归作者所有,任何形式转载请联系作者。 作者:小山 来源: 喜新厌旧的小唐搬了新家,在搬家前,他把家里的物品,连...
    小山的随思录阅读 248评论 0 2
  • 一楼到十楼的每层电梯门口都放着一颗钻石,钻石大小不一。你乘坐电梯从一楼到十楼,每层楼电梯门都会打开一次,只能拿一次...
    博格体阅读 1,020评论 0 0
  • 来到公司近两周,所在部门正好组织架构中,人不多团队是十人左右,虽人少但也得分组分管,今天就谈谈对它的理解,先说说部...
    易锦风阅读 1,381评论 0 0