Urllib
1. Urllib.request.urlopen().read().decode()
返回一个二进制的对象,对这个对象进行read()操作,可以得到一个包含网页的二进制字符串,然后用decode()解码成html源码
2. urlretrieve()
将一个网页爬取到本地
3. urlclearup()
清除 urlretrieve()所产生的缓存
4. info()
返回一个httpMessage对象,表示远程服务器的头信息
5. getcode()
获取当前网页的状态码 200代表成功,404网页未找到
6. geturl()
获取当前爬取页面的网址
示例:
from urllib import request# urlretrieve() -- 将一个网页爬取到本地request.urlretrieve("http://").read() print(data)except error.URLError as e: # 进行异常的处理 if hasattr(e,"code"): # 判断是否有状态码 print(e.code) # 状态码 if hasattr(e,"reason"): # 判断是否有异常原因 print(e.reason) # 异常原因以上这篇python爬虫之urllib,伪装,超时设置,异常处理的方法就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。