目标是把http://www.gg4493.cn/主页上全部数据爬取下来,得到每一篇新闻的名称、时间、来源以及正文。
接下来分解目标,一步一步地作。
步骤1:将主页上全部连接爬取出来,写到文件里。
python在获取html方面十分方便,寥寥数行代码就能够实现咱们须要的功能。
复制代码代码以下:
def getHtml(url):
page = urllib.urlopen(url)
html = page.read()
page.close()
return html
咱们都知道html连接的标签是“a”,连接的属性是“href”,也就是要得到html中全部tag=a,attrs=href 值。
查阅了资料,一开始我打算用HTMLParser,并且也写出来了。可是它有一个问题,就是遇到中文字符的时候没法处理。
复制代码代码以下:
class parser(HTMLParser.HTMLParser):
def handle_starttag(self, tag, attrs):
if tag == 'a':
for attr, value in attrs:
if attr == 'href':
print value
后来使用了SGMLParser,它就没有这个问题。
复制代码代码以下:
class URLParser(SGMLParser):
def reset(self):
SGMLParser.reset(self)
self.urls = []
def start_a(self,attrs):
href = [v for k,v in attrs if k=='href']
if href:
self.urls.extend(href)
SGMLParser针对某个标签都须要重载它的函数,这里是把全部的连接放到该类的urls里。
复制代码代码以下:
lParser = URLParser()#分析器来的
socket = urllib.urlopen("http://www.gg4493.cn/")#打开这个网页
fout = file('urls.txt', 'w')#要把连接写到这个文件里
lParser.feed(socket.read())#分析啦
reg = 'http://www.gg4493.cn/.*'#这个是用来匹配符合条件的连接,使用正则表达式匹配
pattern = re.compile(reg)
for url in lParser.urls:#连接都存在urls里
if pattern.match(url):
fout.write(url+'\n')
fout.close()html