urllib
学习python完基础,有些迷茫.眼睛一闭,一种空白的窒息源源不断而来.还是缺少练习,遂拿爬虫来练练手.学习完斯巴达python爬虫课程后,将心得整理如下,供后续翻看.整篇笔记主要分以下几个部分:
- 1.做一个简单的爬虫程序
- 2.小试牛刀--抓取百度贴吧图片
- 3.总结
1.做一个简单的爬虫程序
首先环境描述
- Device: Mba 2012 Yosemite 10.10.1
- Python: python 2.7.9
- 编辑器: Sublime Text 3
这个没有什么好说的,直接上代码吧!
'''@ urllib为python自带的一个网络库@ urlopen为urllib的一个方法,用于打开一个连接并抓取网页, 然后通过read()方法把值赋给read()'''import urlliburl = "http://patible; MSIE 9.0; Windows NT 6.1; WOW64; Trident/5.0; Sleipnir/2.9.8)', #因篇幅关系,此处省略N条]random_header = random.choice(headers)# 可以通过print random_header查看提交的header信息req = urllib2.Request(url)req.add_header("User-Agent", random_header)req.add_header('Host', 'blog.csdn.net')req.add_header('Referer', 'http://blog.csdn.net')req.add_header('GET', url)content = urllib2.urlopen(req).read()print content其实很简单,这样我们就完成了对代码的一些优化.