如何从字符串中的 XML 加载 org.w3c.dom.Document?

2022-08-31 09:50:03

我在字符串中有一个完整的XML文档,并且想要一个对象。谷歌发现了各种各样的垃圾。最简单的解决方案是什么?(在 Java 1.5 中)Document

溶液感谢 Matt McMinn,我才确定了这个实现。它具有适合我的输入灵活性和异常粒度级别。(很高兴知道错误是否来自格式错误的XML - - 或者只是糟糕的IO - 。SAXExceptionIOException

public static org.w3c.dom.Document loadXMLFrom(String xml)
    throws org.xml.sax.SAXException, java.io.IOException {
    return loadXMLFrom(new java.io.ByteArrayInputStream(xml.getBytes()));
}

public static org.w3c.dom.Document loadXMLFrom(java.io.InputStream is) 
    throws org.xml.sax.SAXException, java.io.IOException {
    javax.xml.parsers.DocumentBuilderFactory factory =
        javax.xml.parsers.DocumentBuilderFactory.newInstance();
    factory.setNamespaceAware(true);
    javax.xml.parsers.DocumentBuilder builder = null;
    try {
        builder = factory.newDocumentBuilder();
    }
    catch (javax.xml.parsers.ParserConfigurationException ex) {
    }  
    org.w3c.dom.Document doc = builder.parse(is);
    is.close();
    return doc;
}

答案 1

哇!

此代码存在一个潜在的严重问题,因为它忽略了 中指定的字符编码(默认情况下为 UTF-8)。调用平台时,默认编码用于将 Unicode 字符编码为字节。因此,解析器可能认为它正在获取 UTF-8 数据,而实际上它正在获取 EBCDIC 或其他数据...不漂亮!StringString.getBytes()

相反,请使用采用 InputSource 的 parse 方法,该方法可以使用 Reader 构造,如下所示:

import java.io.StringReader;
import org.xml.sax.InputSource;
…
        return builder.parse(new InputSource(new StringReader(xml)));

这似乎没什么大不了的,但是对字符编码问题的无知会导致类似于y2k的阴险代码腐烂。


答案 2

这在Java 1.5中适用于我 - 为了可读性,我删除了特定的异常。

import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.parsers.DocumentBuilder;
import org.w3c.dom.Document;
import java.io.ByteArrayInputStream;

public Document loadXMLFromString(String xml) throws Exception
{
    DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();

    factory.setNamespaceAware(true);
    DocumentBuilder builder = factory.newDocumentBuilder();

    return builder.parse(new ByteArrayInputStream(xml.getBytes()));
}

推荐