HTML Agility Pack 搭配 ScrapySharp,完全解除Html解析的痛苦(转)

自从 Web 应用程序自 1993 年 W3C 设立以来就开始发展,并且 HTML 也历经了数个版本的演化(1.0 – 2.0 – 3.0 – 3.2 – 4.0 – 4.01),如今也已经成为Web网页或应用程序的最基础,想要学习如何设计 Web 网页或开发 Web 应用程序,这已是绝对必需要学的东西了,就算是方便的控件(例如 ASP.NET),但 HTML 仍然有学习它的必要性,所以若是不会 HTML,就等于没学过 Web 网页通常。css

拜 HTML 与 Web 浏览器蓬勃发展之赐,各式各样的应用都在网络上迅速发展,举凡电子商务、企业门户、在线下单、企业间协同应用等,乃至于社交、个性化、Web 2.0 等商务与组织运用等能力,而在信息爆炸的时代,不少信息整合的应用也随之出炉,而这些信息整合的应用程序都会链接到不一样的网站下载其信息,而且在重重的 HTML 中剖析出想要的数据(例如每股价格、涨跌幅、成交量等)。html

可是 HTML 自己并非一个结构严谨的语言,它容许卷标(tag)能够在不 close 的状况下继续使用。这也是由于浏览器设计的高容错性(Fault Tolerance)所致,如此一来,想要依照规则来剖析 HTML 文件几乎变得不可能,并且对方的网站的 HTML 结构也可能会随时变化,在这种状况下,剖析 HTML 变得很是辛苦,虽然 W3C 有另外推展 XHTML(遵照 XML 严谨格式的 HTML),但使用它来设计网页的案例仍为少数,大多数的网站仍然是使用 HTML。所以咱们会须要一个工具,可以有方法快速的解析 HTML 以取出咱们须要的数据。node

你们都知道,HTML 自己其实只是一个 HTML 标记的字符串而已,所以通常说到要解析 HTML,第一个会想到的大概就是字符串比对(string comparison),本身针对 HTML 的结构写一个 pattern,而后由函式去作逐一的比对,例如:正则表达式

[C#]c#

1. string pattern = "";api

2. html.IndexOf(pattern);浏览器

不过传统的字符串比对效能太差,也没有一个规则性,于是才发展出正则表达式(Regular Expression)技术,例以下列这样的语法:网络

[Regular Expression]架构

1. \s]+))?)+\s*|\s*)/?<scrapy

但 Regular Expression 的学习曲线很高,若要使用它来解析 HTML,而且再加以定制化(Customization)的话,对于通常开发人员来讲,实在没有什么亲和力。

HTML 还有一个特点,就是它是具层性(Hierarchy)的,所以浏览器在解译它的时候都会以文件树(document tree)的方式,再用递归(recursive)的方法来处理它,但 Regular Expression 没有支持层级性的剖析,而最接近阶层剖析又好用的工具,莫过于 XML Parser 了,它的 DOM 以及 XPath 的特性,均可以让解析 XML 的工做变得轻松,然而 XML Parser 没法读取通常的 HTML(XHTML 能够),由于通常的 HTML 是结构松散的类型,XML Parser 会在读入时检查语法结构是否完整(也就是 Well-known 的结构),若读入的是结构松散的内容的话会掷出例外讯息,所以没法直接使用 XML Parser 来辅助。

HTML Agility Pack 是由法国的一位软件架构师 Simon Mourier 所开发,而且由 DarthObiwan 以及 Jessynoo 辅助开发出来的一个软件工具,它可让剖析松散格式 HTML 的工做就像剖析 XML 同样简单,它也有相似于 System.Xml 命名空间中的 XML DOM 的许多类别,除了可使用阶层的方式存取 HTML 之外,它也支持使用 XPath 的方式来搜寻 HTML,这会较以往使用文字比对或是 Regular Expression 的比对方式来得更明确。

若要使用 HTML Agility Pack 组件,可先上 Codeplex 的 HTML Agility Pack 网站下载二进制文件(同时也提供源代码、说明文件以及 HAP Explorer 工具程序可下载),并解压缩后,在项目加入对 HtmlAgilityPack.dll 的引用。

Html Agility Pack 源码中的类大概有28个左右,其实不算一个很复杂的类库,但它的功能确不弱,为解析DOM已经提供了足够强大的功能支持,能够跟jQuery操做DOM媲美:)Html Agility Pack最经常使用的基础类其实很少,对解析DOM来讲,就只有HtmlDocument和HtmlNode这两个经常使用的类,还有一个 HtmlNodeCollection集合类。

HTML Agility Pack的操做起来仍是很麻烦,下面咱们要介绍的这个组件是ScrapySharp,他在2个方面针对Html Agility Pack进行了包装,使得解析Html页面再也不痛苦,幸福指数直线上升到90分哈。

ScapySharp有了一个真实的浏览器包装类(处理Reference,Cookie等),另一个就是使用相似于jQuery同样的Css选择器和Linq语法。让咱们使用起来很是的爽。它的代码放在 https://bitbucket.org/rflechner/scrapysharp。也能够经过Nuget添加

image

下面咱们来看一段解析博客园的博客文章的代码:

using System; 
using System.Collections.Generic; 
using System.Linq; 
using System.Text; 
using HtmlAgilityPack; 
using ScrapySharp.Extensions; 
using ScrapySharp.Network;

namespace HTMLAgilityDemo 

class Program 

static void Main(string[] args) 

var uri = new Uri("http://www.cnblogs.com/shanyou/archive/2012/05/20/2509435.html");
var browser1 = new ScrapingBrowser(); 
var html1 = browser1.DownloadString(uri); 
var htmlDocument = new HtmlDocument(); 
htmlDocument.LoadHtml(html1); 
var html = htmlDocument.DocumentNode;

var title = html.CssSelect("title"); 
foreach (var htmlNode in title) 

Console.WriteLine(htmlNode.InnerHtml); 

var divs = html.CssSelect("div.postBody");

foreach (var htmlNode in divs) 

Console.WriteLine(htmlNode.InnerHtml); 
}

divs = html.CssSelect("#cnblogs_post_body"); 
foreach (var htmlNode in divs) 

Console.WriteLine(htmlNode.InnerHtml); 



}

Basic examples of CssSelect usages:

 

var divs = html.CssSelect("div");  //all div elements

var nodes = html.CssSelect("div.content"); //all div elements with css class ‘content’

var nodes = html.CssSelect("div.widget.monthlist"); //all div elements with the both css class

var nodes = html.CssSelect("#postPaging"); //all HTML elements with the id postPaging

var nodes = html.CssSelect("div#postPaging.testClass"); // all HTML elements with the id postPaging and css class testClass

var nodes = html.CssSelect("div.content < p.para"); //p elements who are direct children of div elements with css class ‘content’

var nodes = html.CssSelect("input[type=text].login"); // textbox with css class login

We can also select ancestors of elements:

var nodes = html.CssSelect("p.para").CssSelectAncestors("div.content < div.widget");

参考文章:

HTML Agility Pack:簡單好用的快速 HTML Parser

开源项目Html Agility Pack实现快速解析Html

c#中的jQuery——HtmlAgilityPack

Html Agility Pack基础类介绍及运用

.Net解析html文档类库HtmlAgilityPack完整使用说明--采集软件开发尤为好用

Crawler-Lib Crawler Engine

挖掘百度关键词示例:BaiduTools.zip

原文地址:http://www.cnblogs.com/shanyou/archive/2012/05/27/2520603.html

相关文章
相关标签/搜索