使用Java模式在具有属性的HTML标记之间提取单词

Question

I am using the java Pattern & Matcher to extract the words between two tags. 我正在使用Java Pattern＆Matcher提取两个标签之间的单词。

My code is like: 我的代码是这样的：

final Pattern pattern = Pattern.compile("<([A-Za-z][A-Za-z0-9]*)\\b[^>]*>(.*?)</\\1>");
    List<String> topicArray = new ArrayList<String>();
    final Matcher matcher = pattern.matcher("<City count='1' relevance='0.304' normalized='Shanghai,China'>Shanghai</City>");
    while (matcher.find()) {
        topicArray.add(matcher.group(1));
    }

The system only gives me City as output instead of Shanghai. 系统仅给我输出City而不是Shanghai。 What's wrong with it? 它出什么问题了？

Thanks 谢谢

Answer 1

You can try the next: 您可以尝试下一个：

private static final Pattern REGEX_PATTERN = 
        Pattern.compile("<[^>]*>([^<>]*)<[^>]*>");

public static void main(String[] args) {
    String input = "<City count='1' relevance='0.304' normalized='Shanghai,China'>Shanghai</City>";

    System.out.println(
        REGEX_PATTERN.matcher(input).replaceAll("$1")
    );  // prints "Shanghai"
}

使用Java模式在具有属性的HTML标记之间提取单词

问题描述

1 个解决方案

解决方案1
0 已采纳 2014-03-20 16:31:43

使用Java模式在具有属性的HTML标记之间提取单词

问题描述

1 个解决方案

解决方案1 0 已采纳 2014-03-20 16:31:43

解决方案1
0 已采纳 2014-03-20 16:31:43