在使用XMLSerializer()进行序列化之前,从XML中删除无效字符

问题描述 投票:5回答:2

我正在尝试将用户输入存储在客户端(javascript)的XML文档中,并将其传输到服务器以实现持久性。

例如,一个用户粘贴了包含STX字符(0x2)的文本。 XMLSerializer不会转义STX字符,因此也不会序列化为格式正确的XML。或.attr()调用本应转义STX字符,但无论哪种情况,都会生成无效的XML。

[我发现浏览器内XMLSerializer()的输出并不总是格式正确的,(甚至不满足浏览器自己的DOMParser()

此示例显示STX字符未通过XMLSerializer()正确编码:

> doc = $.parseXML('<?xml version="1.0" encoding="utf-8" ?>\n<elem></elem>');
    #document
> $(doc).find("elem").attr("someattr", String.fromCharCode(0x2));
    [ <elem someattr=​"">​</elem>​ ]
> serializedDoc = new XMLSerializer().serializeToString(doc);
    "<?xml version="1.0" encoding="utf-8"?><elem someattr=""/></elem>"
> $.parseXML(serializedDoc);
    Error: Invalid XML: <?xml version="1.0" encoding="utf-8"?><elem someattr=""/></elem>

我应该如何在浏览器中构造XML文档(其参数由任意用户输入确定),以使其始终具有良好的格式(一切都正确地转义了?)?我不需要支持IE8或IE7。

(是的,我确实在服务器端验证了XML,但是如果浏览器将格式不正确的文档交给服务器,则服务器可以做的最好的就是拒绝它,这对服务器没有帮助。不良用户)

javascript xml xmlserializer well-formed
2个回答
12
投票

这里是一个函数sanitizeStringForXML(),可用于在分配之前清理字符串,或者派生函数removeInvalidCharacters(xmlNode),可将其传递给DOM树并自动清理属性和textNodes,因此它们可以安全存储。

var stringWithSTX = "Bad" + String.fromCharCode(2) + "News";
var xmlNode = $("<myelem/>").attr("badattr", stringWithSTX);

var serializer = new XMLSerializer();
var invalidXML = serializer.serializeToString(xmlNode);

// Now cleanse it:
removeInvalidCharacters(xmlNode);
var validXML = serializer.serializeToString(xmlNode);

我基于non-restricted characters section of this wikipedia article中的字符列表,但是补充平面需要5个十六进制的unicode字符,而Javascript regex不包含此语法,因此,我现在只是剥离他们出来(你不会错过太多...):

// WARNING: too painful to include supplementary planes, these characters (0x10000 and higher) 
// will be stripped by this function. See what you are missing (heiroglyphics, emoji, etc) at:
// http://en.wikipedia.org/wiki/Plane_(Unicode)#Supplementary_Multilingual_Plane
var NOT_SAFE_IN_XML_1_0 = /[^\x09\x0A\x0D\x20-\xFF\x85\xA0-\uD7FF\uE000-\uFDCF\uFDE0-\uFFFD]/gm;
function sanitizeStringForXML(theString) {
    "use strict";
    return theString.replace(NOT_SAFE_IN_XML_1_0, '');
}

function removeInvalidCharacters(node) {
    "use strict";

    if (node.attributes) {
        for (var i = 0; i < node.attributes.length; i++) {
            var attribute = node.attributes[i];
            if (attribute.nodeValue) {
                attribute.nodeValue = sanitizeStringForXML(attribute.nodeValue);
            }
        }
    }
    if (node.childNodes) {
        for (var i = 0; i < node.childNodes.length; i++) {
            var childNode = node.childNodes[i];
            if (childNode.nodeType == 1 /* ELEMENT_NODE */) {
                removeInvalidCharacters(childNode);
            } else if (childNode.nodeType == 3 /* TEXT_NODE */) {
                if (childNode.nodeValue) {
                    childNode.nodeValue = sanitizeStringForXML(childNode.nodeValue);
                }
            }
        }
    }
}

注意,这只会从属性和textNodes的nodeValues中删除无效字符。它不检查标签名称或属性名称,注释等。


0
投票

检查https://gist.github.com/john-doherty/b9195065884cdbfd2017a4756e6409cc

非常有用的要点,示例用法:

const resultXml = removeXMLInvalidChars(INPUT_XML_STRING, true);
© www.soinside.com 2019 - 2024. All rights reserved.