如何避免在Jsoup解析中包围html头标签

html parsing java jsoup

2022-09-01 22:36:21

使用Jsoup，我试图解析给定的html内容。在 Jsoup.parse（）之后，html 输出将 html、head 和 body 标记附加到输入中。我只想忽略这些。

示例输入：

<p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>

Java 代码：

import java.io.File;
import java.io.IOException;

import org.apache.commons.io.FileUtils;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

public class HTMLParse {

    public static void main(String args[]) throws IOException {
        try{
            File input = new File("/ab.html");
            String html = FileUtils.readFileToString(input, null);

            Document doc = Jsoup.parseBodyFragment(html);
            doc.outputSettings().prettyPrint(false);
            System.out.println(doc.html());
        }
        catch(Exception e){
            e.printStackTrace();
        }
    }
}

实际输出：

<html><head></head><body><p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>
    </body></html>

预期输出：

<p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>

请帮忙。

答案 1

原因：

parseBodyFragment()以及所有其他 -方法默认使用 HTML 解析器。而那些总是添加HTML-Shell（等）。parse()<html>…</html><head>…</head>

解决方案：

只是不要使用HTML解析器，而是使用XML解析器 ;-)

Document doc = Jsoup.parse(html, "", Parser.xmlParser());

更换那一行，您的问题就解决了。

例：

final String html = "<p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>";

Document docHtml = Jsoup.parse(html);
Document docXml = Jsoup.parse(html, "", Parser.xmlParser());

System.out.println("******* HTML *******\n" + docHtml);
System.out.println();
System.out.println("*******  XML *******\n" + docXml);

输出：

******* HTML *******
<html>
 <head></head>
 <body>
  <p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>
 </body>
</html>

*******  XML *******
<p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>

答案 2

要获得预期的输出，它实际上是：

final String html = "<p><b>This <i>is</i></b> <i>my sentence</i> of text.</p>";
Document doc = Jsoup.parseBodyFragment(html);
doc.outputSettings().prettyPrint(false);

System.out.println(doc.body().html());