Python中使用urllib2模块编写爬虫的简单上手示例 - IT知识教程 - 中企动力

登录注册

做网站
做推广
做电商

服务支持
应用与服务
关于中企

中企商学院

查看更多

核心必备

数字门户内贸营销版

全球营销版行业解决方案版

通用版企业域名

企业邮箱

行业应用

外贸客户洞察平台产品导入

数字名片

视觉设计

VR全景视频制作

图片拍摄

网络安全

等保认证 SSL证书

查看更多

核心必备

全球SEO 百度首屏展位

Yandex推广 Google海外推广

解决方案

外贸推广解决方案

查看更多

核心必备

全网商城移动商城

装修服务

电商产品拍摄

解决方案

零售行业OMO解决方案政府采购电商平台解决方案

查看更多

查看更多

查看更多

帮助中心

数字门户产品服务保障服务中心

设计师信息化讲堂

解决方案

外贸数字营销解决方案企业视频直播解决方案

企业安全等保解决方案品牌数字化营销解决方案

品牌零售数字商业解决方案智慧园区解决方案

B2B电商平台建设解决方案数字化政务门户解决方案

开拓型外贸企业解决方案成长型外贸企业解决方案

行业解决方案

实战应用

产品剖析律所行业专家

行业解读

学习中心

电商运营学院网站建设学院

查看更多

应用与服务

VR智能全景个性化场景定制服务

网站安全服务云定制

企业视频直播 Banner设计

产品主图设计图片处理

查看更多

企业概况

关于我们企业文化

发展历程数码庄园

法律隐私

资质荣誉

企业资质所获荣誉

新闻中心

新闻公告媒体报道

社会公益视频中心

行业资讯

联系我们

联系我们工作机会

查看更多

查看更多

网站建设 IT知识 IT知识教程 Python中使用urllib2模块编写爬虫的简单上手示例

Python中使用urllib2模块编写爬虫的简单上手示例

2021-05-22 21:23:36

提起python做网络爬虫就不得不说到强大的组件urllib2。在python中正是使用urllib2这个组件来抓取网页的。urllib2是Python的一个获取URLs(Uniform Resource Locators)的组件。它以urlopen函数的形式提供了一个非常简单的接口。通过下面的代码简单感受一下urllib2的功能；

import urllib2 response = urllib2.urlopen('http:///register.php' user_agent = 'Mozilla/5.0 (Windows NT 6.1; rv:33.0) Gecko/20100101 Firefox/33.0' values = {'useid' : 'user', 'pwd' : '***', 'language' : 'Python' } headers = { 'User-Agent' : user_agent } data = urllib.urlencode(values) req = urllib2.Request(url, data, headers) response = urllib2.urlopen(req) page = response.read()

查阅相关资料后显示Errno 10061表示服务器端主动拒绝。
除此之外还有HTTPError，当客户端与服务器之间建立正常连接时，urllib2将开始处理相关数据。如果遇到不能处理的情况就会产生相应的HTTPError，如网站访问常见的错误码”404″(页面无法找到)，”403″(请求禁止)，和”401″(带验证请求)等……HTTP状态码表示HTTP协议的响应情况，常见的状态码见HTTP状态码详解。
HTTPError会带有一个'code'属性，是服务器发送的错误号。当一个HTTPError产生后服务器会返回一个相关的错误号和错误页面。如下代码验证；

import urllib2 req = urllib2.Request('http://www.python.org/callmewhy') try: urllib2.urlopen(req) except urllib2.URLError, e: print e.code

输出404代码，说明找不到页面。
捕捉异常并处理……实现代码如下；

#-*- coding:utf-8 -*-from urllib2 import Request, urlopen, URLError, HTTPError req = Request('http://www.python.org/callmewhy') try: response = urlopen(req) except URLError, e: if hasattr(e, 'code'): print '服务器不能正常响应这个请求！' print 'Error code: ', e.code elif hasattr(e, 'reason'): print '无法与服务器建立连接' print 'Reason: ', e.reason else: print '没有出现异常'

成功捕捉到异常！

声明：本页内容来源网络，仅供用户参考；我单位不保证亦不表示资料全面及准确无误，也不保证亦不表示这些资料为最新信息，如因任何原因，本网内容或者用户因倚赖本网内容造成任何损失或损害，我单位将不会负任何法律责任。如涉及版权问题，请提交至online#300.cn邮箱联系删除。

相关文章

使用Python编写爬虫的基本模块及框架使用指南

基本模块python爬虫，webspider。爬取网站获取网页数据，并进行分析提取。基本模块使用的是urllib，urllib2，re，等模块基本用法，例子：（

python网络编程学习笔记(六)：Web客户端访问

6.1最简单的爬虫网络爬虫是一个自动提取网页的程序，它为搜索引擎从万维网上下载网页，是搜索引擎的重要组成。python的urllib\urllib2等模块很容易

Python3 requests模块如何模仿浏览器及代理

requests是使用Apache2licensed许可证的HTTP库。用python编写。比urllib2模块更简洁。Request支持HTTP连接保持和连接

python爬虫基础之urllib的使用

一、urllib和urllib2的关系在python2中，主要使用urllib和urllib2，而python3对urllib和urllib2进行了重构，拆分成

Python实现的爬虫功能代码

本文实例讲述了Python实现的爬虫功能。分享给大家供大家参考，具体如下：主要用到urllib2、BeautifulSoup模块#encoding=utf-8i

Copyright © 1999-2026 中企动力科技股份有限公司（300.cn）All Rights Reserved

京公网安备11030102010293号京ICP证010249-2

代理域名注册服务机构：中网瑞吉思（天津）科技有限公司北京新网数码信息技术有限公司

域名注册服务机构许可证编号：京D3-20220007

中企动力域名投诉处理：400-660-5555-9 service4006@300.cn

中国互联网络信息中心（受理范围：“.CN”和“.中国”域名）投诉处理 010-58813000 service@cnnic.cn

7 x 24

全国售后支持
100 倍

故障时长赔付
26 年

26年行业服务经验
70 家

全国售后支持
1600+ 名

超千人的设计、研发团队
150 万

服务企业客户150万家

Copyright © 1999-2026 中企动力科技股份有限公司（300.cn）版权所有京公网安备11030102010293号京ICP证010249-2

在线咨询

建站在线咨询

获取方案

获取建站报价/方案

我们联系您

微信咨询

扫一扫添加
动力姐姐微信

TOP