Python ElementTree模块：当使用“find”，“findall”方法时，如何忽略XML文件的命名空间以找到匹配的元素

Question

我想使用“findall”方法在ElementTree模块中找到源xml文件的一些元素。

但是，源xml文件（test.xml）具有命名空间。我将部分xml文件截断为样本：

<?xml version="1.0" encoding="iso-8859-1"?>
<XML_HEADER xmlns="http://www.test.com">
    <TYPE>Updates</TYPE>
    <DATE>9/26/2012 10:30:34 AM</DATE>
    <COPYRIGHT_NOTICE>All Rights Reserved.</COPYRIGHT_NOTICE>
    <LICENSE>newlicense.htm</LICENSE>
    <DEAL_LEVEL>
        <PAID_OFF>N</PAID_OFF>
        </DEAL_LEVEL>
</XML_HEADER>

示例python代码如下：

from xml.etree import ElementTree as ET
tree = ET.parse(r"test.xml")
el1 = tree.findall("DEAL_LEVEL/PAID_OFF") # Return None
el2 = tree.findall("{http://www.test.com}DEAL_LEVEL/{http://www.test.com}PAID_OFF") # Return <Element '{http://www.test.com}DEAL_LEVEL/PAID_OFF' at 0xb78b90>

虽然它可以工作，因为有一个名称空间“{http://www.test.com}”，在每个标记前面添加一个名称空间是非常不方便的。

使用“find”，“findall”等方法时，如何忽略命名空间？

Answer 1

而不是修改XML文档本身，最好解析它，然后修改结果中的标记。这样您就可以处理多个名称空间和名称空间别名：

from StringIO import StringIO
import xml.etree.ElementTree as ET

# instead of ET.fromstring(xml)
it = ET.iterparse(StringIO(xml))
for _, el in it:
    if '}' in el.tag:
        el.tag = el.tag.split('}', 1)[1]  # strip all namespaces
root = it.root

这是基于这里的讨论：http://bugs.python.org/issue18304

Answer 2

如果在解析之前从xml中删除xmlns属性，那么树中的每个标记都不会添加名称空间。

import re

xmlstring = re.sub(' xmlns="[^"]+"', '', xmlstring, count=1)

Answer 3

到目前为止，答案明确地将命名空间值放在脚本中。对于更通用的解决方案，我宁愿从xml中提取命名空间：

import re
def get_namespace(element):
  m = re.match('\{.*\}', element.tag)
  return m.group(0) if m else ''

并在find方法中使用它：

namespace = get_namespace(tree.getroot())
print tree.find('./{0}parent/{0}version'.format(namespace)).text

Answer 4

这是对nonagon的答案的扩展，它也删除了属性的名称空间：

from StringIO import StringIO
import xml.etree.ElementTree as ET

# instead of ET.fromstring(xml)
it = ET.iterparse(StringIO(xml))
for _, el in it:
    if '}' in el.tag:
        el.tag = el.tag.split('}', 1)[1]  # strip all namespaces
    for at in el.attrib.keys(): # strip namespaces of attributes too
        if '}' in at:
            newat = at.split('}', 1)[1]
            el.attrib[newat] = el.attrib[at]
            del el.attrib[at]
root = it.root

Answer 5

改进ericspod的答案：

我们可以将它包装在支持with构造的对象中，而不是全局更改解析模式。

from xml.parsers import expat

class DisableXmlNamespaces:
    def __enter__(self):
            self.oldcreate = expat.ParserCreate
            expat.ParserCreate = lambda encoding, sep: self.oldcreate(encoding, None)
    def __exit__(self, type, value, traceback):
            expat.ParserCreate = self.oldcreate

然后可以如下使用

import xml.etree.ElementTree as ET
with DisableXmlNamespaces():
     tree = ET.parse("test.xml")

这种方式的优点在于它不会改变with块之外的无关代码的任何行为。在使用ericspod的版本之后，我在使用expat之后在不相关的库中获得错误后最终创建了这个。

Answer 6

您也可以使用优雅的字符串格式构造：

ns='http://www.test.com'
el2 = tree.findall("{%s}DEAL_LEVEL/{%s}PAID_OFF" %(ns,ns))

或者，如果您确定PAID_OFF仅出现在树中的一个级别：

el2 = tree.findall(".//{%s}PAID_OFF" % ns)

Answer 7

如果您使用的是ElementTree而不是cElementTree，则可以通过替换ParserCreate()强制Expat忽略命名空间处理：

from xml.parsers import expat
oldcreate = expat.ParserCreate
expat.ParserCreate = lambda encoding, sep: oldcreate(encoding, None)

ElementTree尝试通过调用ParserCreate()来使用Expat，但没有提供不提供命名空间分隔符字符串的选项，上面的代码将导致它被忽略但是警告这可能会打破其他事情。

Answer 8

我可能会迟到但我不认为re.sub是一个很好的解决方案。

但是，重写xml.parsers.expat不适用于Python 3.x版本，

主要的罪魁祸首是xml/etree/ElementTree.py看到源代码的底部

# Import the C accelerators
try:
    # Element is going to be shadowed by the C implementation. We need to keep
    # the Python version of it accessible for some "creative" by external code
    # (see tests)
    _Element_Py = Element

    # Element, SubElement, ParseError, TreeBuilder, XMLParser
    from _elementtree import *
except ImportError:
    pass

哪有点难过。

解决方案是首先摆脱它。

import _elementtree
try:
    del _elementtree.XMLParser
except AttributeError:
    # in case deleted twice
    pass
else:
    from xml.parsers import expat  # NOQA: F811
    oldcreate = expat.ParserCreate
    expat.ParserCreate = lambda encoding, sep: oldcreate(encoding, None)

在Python 3.6上测试过。

尝试try语句是有用的，以防你的代码中的某个地方重新加载或导入模块两次，你得到一些奇怪的错误，如

超出最大递归深度
AttributeError：XMLParser

btw该死的etree源代码看起来真的很乱。

Python ElementTree模块：当使用“find”，“findall”方法时，如何忽略XML文件的命名空间以找到匹配的元素

问题描述投票：103回答：8

8个回答

最新问题

Python ElementTree模块：当使用“find”，“findall”方法时，如何忽略XML文件的命名空间以找到匹配的元素

问题描述 投票：103回答：8

8个回答

最新问题

问题描述投票：103回答：8