java正则匹配HTML

发布于 2020-07-21 10:43:20

今天在做java项目时遇到一个正则表达式的问题:

> <a href='www.baidu.comds=id32434#comment'rewr>特432</a>
> 453543
> <a guhll,,l>a1特123你好123吗?</a>
> <a href=id=32434#comment'ewrer>特2</a>
> <a>标签中的文字</a>

现在要匹配出内容包含中文但标签的属性中不包含comment的标签中的汉字。该怎么解决呢,求大神帮忙处理下。

查看更多

关注者
0
被浏览
360
1 个回答
task
task 2020-07-21
This guy hasn't written anything yet

解决思路如下:

1、首先匹配出不包括comment的标签;

2、在匹配结果中进行二次匹配出中文;

代码如下:

package com.mmq.regex;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
/**
 * @use 匹配HTML的<a>标签中的中文字符
 * @ProjectName stuff
 * @Author mumaoqiang
 * @FullName com.mmq.regex.MatchChineseCharacters.java
 * @JDK 1.6.0
 * @Version 1.0
 */
public class MatchChineseCharacters {
  /**
   * 根据输入的内容,匹配出包含中文但不包含comment的<a>标签中的中文字符
   * @param source 要匹配的内容
   * @return <a>标签中的中文字符
   */
  public static String matchChineseCharacters(String source) {
    //匹配出包含中文但不包含comment的<a>标签
    String reg = "<a((?!comment).)*?>([^<>]*?[\\u4e00-\\u9fa5]+[^<>]*?)+(?=</a>)";
    Pattern pattern = Pattern.compile(reg);
    Matcher matcher = pattern.matcher(source);
    StringBuilder character = new StringBuilder();
    while(matcher.find()){
      String result = matcher.group();
      System.out.println(result);
      //对结果进行二次正则,匹配出中文字符
      String reg1 = "[\\u4e00-\\u9fa5]+";
      Pattern p1 = Pattern.compile(reg1);
      Matcher m1 = p1.matcher(result);
      while(m1.find()){
        character.append(m1.group());
      }
      //System.out.println(character.toString());
    }
    return character.toString();
  }
  public static void main(String[] args) {
    String result = matchChineseCharacters("<a href='www.baidu.comds=id32434#comment'rewr>特432</a>453543<a guhll,,l>a1特123你好123吗?</a><a href=id=32434#comment'ewrer>特2</a><a>标签中的文字</a>");
    System.out.println(result);
  }
}

可以参考这篇教程:https://www.jb51.net/article/102396.htm

撰写答案

请登录后再发布答案,点击登录

发布
问题

分享
好友

手机
浏览

扫码手机浏览