如何使用LXML或BeautifulSoup从CDATA标记中删除但保留Python中的实际数据

Question

我正在解析一些XML，其中使用BeautifulSoup作为解析器。 我使用以下代码提取CDATA，但我只需要数据而不是CDATA标记。

    myXML = open("c:\myfile.xml", "r")
    soup = BeautifulSoup(myXML)
    data = soup.find(text=re.compile("CDATA"))

    print data

    <![CDATA[TEST DATA]]>

我想看看是否有以下输出：

测试数据

我不在乎解决方案是在LXML还是BeautifulSoup中。 只想要最好或最简单的方法来完成工作。 谢谢！

这是一个解决方案：

    parser = etree.XMLParser(strip_cdata=False)
    root = etree.parse(self.param1, parser)
    data = root.findall('./config/script')
    for item in data:  # iterate through list to find text contained in elements containing CDATA
        print item.text

Answer 1

基于lxml docs ：

>>> from lxml import etree
>>> parser = etree.XMLParser(strip_cdata=False)
>>> root = etree.XML('<root><data><![CDATA[test]]></data></root>', parser)
>>> data = root.findall('data')
>>> for item in data:  # iterate through list to find text contained in elements containing CDATA
    print item.text

test  # just the text of <![CDATA[test]]>

这可能是完成工作的最佳方法，具体取决于您的xml结构对该方法的适应程度。

Answer 2

基于BeautifulSoup：

>>> str='<xml>  <MsgType><![CDATA[text]]></MsgType>  </xml>'
>>> soup=BeautifulSoup(str, "xml") 
>>> soup.MsgType.get_text()
u'text'
>>> soup.MsgType.string
u'text'
>>> soup.MsgType.text
u'text'

结果，它只打印msgtype中的文本。

如何使用LXML或BeautifulSoup从CDATA标记中删除但保留Python中的实际数据

问题描述

2 个解决方案

解决方案1
2 已采纳 2014-01-30 02:18:08

解决方案2
0 2014-02-14 06:22:42

如何使用LXML或BeautifulSoup从CDATA标记中删除但保留Python中的实际数据

问题描述

2 个解决方案

解决方案1 2 已采纳 2014-01-30 02:18:08

解决方案2 0 2014-02-14 06:22:42

解决方案1
2 已采纳 2014-01-30 02:18:08

解决方案2
0 2014-02-14 06:22:42