將XML解析為python中的字符串列表

Question

編輯：XML文件

-<corpus lang="en" id="subtask2-heterographic">


-<text id="het_1">

  <word id="het_1_1">'</word>

  <word id="het_1_2">'</word>

  <word id="het_1_3">I</word>

  <word id="het_1_4">'</word>

  <word id="het_1_5">m</word>

  <word id="het_1_6">halfway</word>

  <word id="het_1_7">up</word>

  <word id="het_1_8">a</word>

  <word id="het_1_9">mountain</word>

  <word id="het_1_10">,</word>

  <word id="het_1_11">'</word>

  <word id="het_1_12">'</word>

  <word id="het_1_13">Tom</word>

  <word id="het_1_14">alleged</word>

  <word id="het_1_15">.</word>

</text>


-<text id="het_2">

  <word id="het_2_1">I</word>

  <word id="het_2_2">'</word>

  <word id="het_2_3">d</word>

  <word id="het_2_4">like</word>

  <word id="het_2_5">to</word>

  <word id="het_2_6">be</word>

  <word id="het_2_7">a</word>

  <word id="het_2_8">Chinese</word>

  <word id="het_2_9">laborer</word>

  <word id="het_2_10">,</word>

  <word id="het_2_11">said</word>

  <word id="het_2_12">Tom</word>

  <word id="het_2_13">coolly</word>

  <word id="het_2_14">.</word>

 </text>
</corpus>

我在python上解析XML文件並獲取所需的文本。 每個文本標簽代表XML文件中的一個句子，我想將每個句子作為單獨的列表元素放在列表中。

tree = ET.ElementTree(file='subtask2-heterographic-test.xml')
root = tree.getroot()

lst = []

for elem in root:
    for w in elem:
        lst.append(w.text)

>> ["'", "'", 'I', "'", 'm', 'halfway', 'up', 'a', 'mountain', ',', "'", "'", 'Tom', 'alleged', '.', 'I', "'", 'd', 'like', 'to', 'be', 'a', 'Chinese', 'laborer', ',', 'said', 'Tom', 'coolly', '.', 'Dentists', ...]

這僅給出了XML文件中的所有單詞，而沒有分開句子。 如何解決將每個句子作為字符串列表放入列表的問題？

最終預期產出：

>> [["'", "'", 'I', "'", 'm', 'halfway', 'up', 'a', 'mountain', ',', "'", "'", 'Tom', 'alleged', '.'] , ['I', "'", 'd', 'like', 'to', 'be', 'a', 'Chinese', 'laborer', ',', 'said', 'Tom', 'coolly', '.'], ['Dentists', ...] ]

Answer 1

您必須為每個句子創建一個新列表：

sentences = []
for elem in root:
    sentence = []
    for w in elem:
        sentence.append(w.text)
    sentences.append(sentence)

將XML解析為python中的字符串列表

問題描述

1 個解決方案

解決方案1
1 已采納 2017-10-18 18:23:25

將XML解析為python中的字符串列表

問題描述

1 個解決方案

解決方案1 1 已采納 2017-10-18 18:23:25

解決方案1
1 已采納 2017-10-18 18:23:25