python网络爬虫 CrawlSpider使用详解 - IT知识教程 - 中企动力

登录注册

做网站
做推广
做电商

服务支持
应用与服务
关于中企

中企商学院

查看更多

核心必备

数字门户内贸营销版

全球营销版通用版

企业域名企业邮箱

行业应用

医院专业版学校专业版

律所专业版数字名片

视觉设计

VR全景视频制作

图片拍摄

网络安全

等保认证 SSL证书

查看更多

核心必备

全球SEO 百度首屏展位

Yandex推广 Google海外推广

解决方案

外贸推广解决方案

查看更多

核心必备

全网商城移动商城

装修服务

电商产品拍摄

解决方案

零售行业OMO解决方案政府采购电商平台解决方案

查看更多

查看更多

查看更多

帮助中心

数字门户产品服务保障服务中心

设计师信息化讲堂

解决方案

外贸数字营销解决方案企业视频直播解决方案

企业安全等保解决方案品牌数字化营销解决方案

品牌零售数字商业解决方案智慧园区解决方案

B2B电商平台建设解决方案数字化政务门户解决方案

开拓型外贸企业解决方案成长型外贸企业解决方案

行业解决方案

实战应用

产品剖析律所行业专家

平台产品导入外贸信息洞察

行业解读

学习中心

电商运营学院网站建设学院

查看更多

应用与服务

VR智能全景个性化场景定制服务

网站安全服务云定制

企业视频直播 Banner设计

产品主图设计图片处理

查看更多

企业概况

关于我们企业文化

发展历程数码庄园

法律隐私

资质荣誉

企业资质所获荣誉

新闻中心

新闻公告媒体报道

社会公益视频中心

行业资讯

联系我们

联系我们全国网点

工作机会

查看更多

查看更多

网站建设 IT知识 IT知识教程 python网络爬虫 CrawlSpider使用详解

python网络爬虫 CrawlSpider使用详解

2021-05-22 21:28:42

CrawlSpider

作用：用于进行全站数据爬取
CrawlSpider就是Spider的一个子类
如何新建一个基于CrawlSpider的爬虫文件
- scrapy genspider -t crawl xxx /index.php/question/questionType?type=4&page='] link = LinkExtractor(allow=r'type=4&page=\d+') # 提取页码连接 link1 = LinkExtractor(allow=r'question/2019\d+/\d+\.shtml') # 提取详情页连接 rules = ( Rule(link, callback='parse_item', follow=False), Rule(link1, callback='parse_detail'), ) # 解析出标题和网友名称数据 def parse_item(self, response): tr_list = response.xpath('//*[@id="morelist"]/div/table[2]//tr/td/table//tr') for tr in tr_list: title = tr.xpath('./td[2]/a[2]/text()').extract_first() net_friend = tr.xpath('./td[4]/text()').extract_first() item = SunlinecrawlItem() item['title'] = title item['net_friend'] = net_friend yield item # 解析出新闻的内容 def parse_detail(self,response): content = response.xpath('/html/body/div[9]/table[2]//tr[1]/td/div[2]//text()').extract() content = ''.join(content) item = ContentItem() item['content'] = content yield item--------------------------------------------------------------------------------# 2.items文件import scrapyclass SunlinecrawlItem(scrapy.Item): title = scrapy.Field() net_friend = scrapy.Field()class ContentItem(scrapy.Item): content = scrapy.Field()--------------------------------------------------------------------------------# 3.pipelines文件class SunlinecrawlPipeline(object): def process_item(self, item, spider): # 确定接受到的item是什么类型（Content/Sunlinecrawl） if item.__class__.__name__ == 'SunlinecrawlItem': print(item['title'],item['net_friend']) else: print(item['content']) return item--------------------------------------------------------------------------------# 4.setting文件BOT_NAME = 'sunLineCrawl'SPIDER_MODULES = ['sunLineCrawl.spiders']NEWSPIDER_MODULE = 'sunLineCrawl.spiders'LOG_LEVEL = 'ERROR'USER_AGENT = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.132 Safari/537.36'ROBOTSTXT_OBEY = FalseITEM_PIPELINES = { 'sunLineCrawl.pipelines.SunlinecrawlPipeline': 300,}
  以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

声明：本页内容来源网络，仅供用户参考；我单位不保证亦不表示资料全面及准确无误，也不保证亦不表示这些资料为最新信息，如因任何原因，本网内容或者用户因倚赖本网内容造成任何损失或损害，我单位将不会负任何法律责任。如涉及版权问题，请提交至online#300.cn邮箱联系删除。

相关文章

Python爬虫制作翻译程序的示例代码

上篇文章给大家介绍了Python爬虫实现百度翻译功能过程详解Python爬虫学习之翻译小程序感兴趣的朋友点击查看。今天给大家介绍Python爬虫制作翻译程序的方

java能写爬虫程序吗

我们经常会使用网络爬虫去爬取需要的内容，提到爬虫，可能大家伙都会想到python，其实除了python，还有java。java的编程语言简单规范，是很好的爬虫工

Python爬虫教程知识点总结

一、为什么使用Python进行网络爬虫？由于Python语言十分简洁，使用起来又非常简单、易学，通过Python进行编写就像使用英语进行写作一样。另外Pytho

Python使用requests及BeautifulSoup构建爬虫实例代码

本文研究的主要是Python使用requests及BeautifulSoup构建一个网络爬虫，具体步骤如下。功能说明在Python下面可使用requests模块

Java 网络爬虫基础知识入门解析

前言说起网络爬虫，大家想起的估计都是Python，诚然爬虫已经是Python的代名词之一，相比Java来说就要逊色不少。有不少人都不知道Java可以做网络爬虫，

7 x 24

全国售后支持
100 倍

故障时长赔付
25 年

25年行业服务经验
70 家

全国售后支持
1600+ 名

超千人的设计、研发团队
150 万

服务企业客户150万家

Copyright © 1999-2025 中企动力科技股份有限公司（300.cn）版权所有京公网安备11030102010293号京ICP证010249-2

在线咨询

建站在线咨询

获取方案

获取建站报价/方案

我们联系您

微信咨询

扫一扫添加
动力姐姐微信

TOP