HotSAX

开源吧 > JAVA开源项目 > 组件类库 > Html解析类库

HotSAX是一个快速，小型的footprint, 用于HTML/XML/XHTML的非确认的SAX2解析。它可以在简单的Web代理、页面抓取器和爬虫程序中使用。它类似于Apache Xerces分析器。

【官方主页】

【下载地址】

网友留言/评论

我要留言/评论

相关开源项目

HTML Parser:HTML Parser实现即时HTML语法分析程序。

HtmlRipper:HtmlRipper是一个Java包能够按照预先定义好的规则设置来从Web页中抽取动态数据.

JTidy:JTidy 是 HTML Tidy用Java实现的移植版本，提供了一个HTML的语法检查器和很好的打印功能。类似它的非Java产品，JTidy可以用来清除格式不好和不对的HTM。此外，JTidy提供了对整个HTML的DOM分析器。程序员可以将JTidy当作一个处理HTML文件的DOM解析器来使用。

Java HTML Parser:HTML Parser提供了一组Tag对象，这些对象可以深入解析一棵可搜索的结构树。

NekoHTML:NekoHTML是一个简单地HTML扫描器和标签补偿器(tag balancer) ,使得程序能解析HTML文档并用标准的XML接口来访问其中的信息。这个解析器能投扫描HTML文件并“修正”许多作者（人或机器）在编写HTML文档过程中常犯的错误。NekoHTML能增补缺失的父元素、自动用结束标签关闭相应的元素，以及不匹配的内嵌元素标签。NekoHTML的开发使用了Xerces Native Interface (XNI)，后者是Xerces2的实现基础。

rendersnake: rendersnake是一个用于生成HTML页面的Java开源类库，能够与标准JSP和Spring MVC集成。利用其编写的Java代码具有可维护、易于复用、类型校验、可测试和简单的特点。

HtmlCleaner:HtmlCleaner是一个开源的Html文档解析器。HtmlCleaner能够重新排序每个元素然后生成结构良好(Well-Formed)的XML文档。默认它遵循的规则是类似于大部份web浏览器为创文档对象模型所使用的规则。然而，用户可以提供自定义tag和规则组来进行过滤和匹配。

TagSoup:TagSoup是一个Java开发符合SAX的HTML解析器.

VietSpider HTMLParser:VietSpider HTMLParser是一个纯Java实现的HTML DOM解析器，支持HTML4.0.1。它是一个快速的语法检查器，利用相对应的结束标签自动关闭元素，能够处理匹配错误的内联元素标签。

Cobra:Cobra是一个HTML工具包。它包含一个纯Java HTML DOM 分析器和一个页面表现引擎。Cobra支持HTML4,Javascript 和CSS2。