中企动力 > 商学院 > 数据采集模板
  • ?

    如何做市场调研及经营数据的采集与分析?

    聂誉

    展开

    最近在研究商超零售的数据分析,有不少干货和想法可分享。此前,一直注重店铺管理、商品库存管理、财务绩效管理的数据分析。后来发现,无论是零售商铺的选址,还是百货商场的招商营运,都有不少需要运用到数据管理思维的地方。

    店铺选址前或者招商营运前都要进行市场调研,小规模的店家可能会说,我照自己的经验,观测人流量以及周边店铺的经营情况来判断,这样的方法确实是有迹可寻。但是,店铺不是放着让你来选的,店铺商也是需要去谈的,甚至对于那些成体系的,每年都在扩张的一些企业,必须需要一套成体系的数据分析方法论来指导。

    一、市场调研的要点

    1、着重于项目周边状况调查,如:业态布局、购买力等;

    2、网点及竞争对手调研的要点

    3、收集品牌资源,是否符合定位,有无可备选方案,效益最大化;

    针对选址,

    可采用常用的SWOT分析模型,分析内部环境以及外部环境的优劣势;而后采用3C模型(Company商铺,Customer顾客,Competitor 竞争者)对开店的选址分析;看附近1小时经济圈、2小时经济圈、3小时经济圈的覆盖范围。

    而正式营运之后,最主要关注的就是客流量。

    传统零售的数据是基于交易客流,基本等同于俗称的会员。商超里面的客流其实分为交易客流、返店客流、进店客流、到达客流、潜在客流。这里最容易获取的就是交易客流,因为企业现有的CRM系统或者收银系统基本都能涵盖这部分客流。怎么得顾客数据?这就要建立一整套的全顾客全消费行为管理的客流分析系统。

    客流数据分析建模

    二、如何去经营分析?

    经营分析是指商业运营管理者通过数据采集并运用统计、分析、图表呈现等方式,对商场整体经营情况进行深入解析。

    确定这样一个流程后,经营分析按照时间划分一般分为日、周、月以及一些关键时期,比如活动、法定节假日等等。形式以经营报表为主。

    大体分析内容

    经营分析的指标解析

    做好全百货的经营分析要发挥主观能动性,有了数据和图表,要做好经营分析,还要发挥人的主观能动性,营运人员需根据数据和图表阐述现象并提出相关建议,加强与店铺、品牌负责人的沟通和联系,充分了解店铺的经营现状。

    三、关于品牌店铺活动的分析

    经营分析案例分享及关注点(日经营分析)

    以上每日的客流与销售趋势图,需要关注波动趋势、波动周期和波动异常。比如波峰大多是重大节假日或企划活动,或者特殊事件。

    店铺活动分析

    活动前期搭建好相关指标,收集活动数据,实时监测分析。

    至于如何搭建这样的分析体系,譬如以上用finereport搭建的活动监测模板,这里不多赘述。前提需要明确分析的指标,之后就是数据收集、整合、分析、展现的额工作啦~

  • ?

    365建站器9.0(批量建站站群软件)8月1日正式发布

    夜基

    展开

    一、数据采集功能更新。

    1、升级数据采集功能,完善365建站器数据处理能力。

    升级数据采集功能,可以多个采集规则批量采集,也可以定时批量或单个采集。

    365建站器9.0(批量建站站群软件)

    2、增加数据采集接口功能,可发布文章到支持POST接口的所有系统。

    增加数据采集接口功能,阶支持365批量建站程序外,还支持其它系统的文章发布,只在提供POST接口就可以批量发布文章,支持文章的批量发布,也支持数据(企业信息等各类数据)的更新。

    365建站器9.0(批量建站站群软件)

    3、增加支持多字段采集的功能。

    增加支持多字段采集,用户可以自定义要采集的字段,在使用接口发布时,自动post提交到接口中,比如你自定义的字段是title,接口中会增加一个字段titile,如果字段命名的是中文,软件会自动拼音化提交。

    eg:自定义字段:title,body,senddate,作者,地区

    post提交时 会是这样的:

    &title=…&body-…&senddate=…&zuozhe=…&diqu=…

    365建站器9.0(批量建站站群软件)

    4、增加在线采集翻译功能。

    增加在线采集翻译功能,翻译的内容质量取决于各大平台翻译接口的质量,用户可定义选择。

    365建站器9.0(批量建站站群软件)365建站器9.0(批量建站站群软件)

    5、通过关键词或网址智能化采集,无需写规则。

    通过指定关键词(可以多个,用|隔开)或者网址直接智能化采集,无需写规则,方便小白的用户采集内容。

    365建站器9.0(批量建站站群软件)

    二、增加软文批量发布功能。

    1、增加软文批量发布到各大系统。

    增加软文批量发布到各大系统(dedecms,帝国cms,wordpress等)(需支持POST接口)。

    365建站器9.0(批量建站站群软件)

    2、增加软文使用浏览器模式批量发布到各大推广平台。

    增加软文使用浏览器模式批量发布到各大推广平台,自动填充账号,自动填充要发布的内容,提高效率。

    365建站器9.0(批量建站站群软件)

    3、服务器运行环境ZZphpserver升级。

    1、升级环境安装包兼容php7和php5程序。

    升级环境安装包自带2个版本,用来兼容php7和php5程序。

    365建站器9.0(批量建站站群软件)

    针对365站群用户,支持域名批量开启https功能。

    最新的环境安装包集成批量https开启功能,针对365用户,支持免费域名批量开启https功能。

    365建站器9.0(批量建站站群软件)

    3、ZZphpserver其它功能修正及升级。

    ZZphpserver增加启动和停止,修复检查不对和修复部分bug。

    修正ZZphpserver重置MySQL密码时文件不存在的问题。

    修正ZZphpserver重置MySQL密码时文件不存在的问题,增加mysql修改密码工具。

    三、其它bug修正及功能更新。

    1、优化并升级通过关键词采集内容,通过栏目关键发布内容的功能。

    2、增加通过关键词库的关键词批量采集内容的功能。

    365建站器9.0(批量建站站群软件)

    3、修正数据分析,智能挖掘功能获取数据的错误。

    4、修正开启远程图片本地化,FastCGI进程超过了配置请求超时的问题。

    5、升级404错误页面增加百变功能。

    6、修正环境中引起 500错误 FastCGI 进程意外退出的错误。

    7、优化模板工具,修正模板工具点击网页链接跳出问题。

    8、修正源码模板中底部操作选项在有些浏览器中不显示的问题。

    9、升级数据采集功能,完善365建站器数据处理能力。

    10、修正当模板太多时批量get提交出错,修改成post提交。

    11、修正编辑器中在ie 中不兼容导致无法的上传的情况。

    12、修正网站无栏目时,不能发布的情况(针对宣传页单页用户使用)。

    13、修正获取大量栏目超时的情况,增加搜索同类型栏目获取功能。

    14、修正模板管理中模板过多,批量操作时超时或超时引起的404错误。

    15、优化模板管理,内容管理等,新窗口打开,便于用户操作。

    16、增加网站管理后台可以在浏览器中打开的选项让用户选择。

    17、增加是否开启网站来访统计让用户选择。

    18、修正编辑器在部分页面提交后内容为空的情况。

    19、增加文章库预览功能。

    20、修正云模板工具保存时标签出错的问题。

    21、修正用户反馈的其它问题和建议。

    感谢一直陪伴365软件(soft.365jz)成长的用户,我们一直在为让建站和SEO变得简单而努力,如果有更好的建议,可以提交给我们,我们专注快速批量建站,让建站和seo变得简单,支持全网数据采集。 高效稳定的数据和建站产品服务,为您挖掘无限的商业价值。

  • ?

    如何采集招投标类网站数据

    若烟

    展开

    网上有很多公布招投标信息的网站,招标公告中的信息是有很大的价值的。比如你想了解一个公司的资质,你想了解一个项目的投资资金,你想知道招投标公司之间的关系,这些都能从招投标信息中分析出来,数据是分析的基础,只有获得大量数据,分析才更准确更有说服力。今天教大家如何采集招投标类网站的数据。

    示例网站:http://tjconstruct/zbxx.aspx?type=sjzb

    一.首先打开ForeSpider数据采集软件,点击“采集频道列表”的“+”符号,创建新的频道。然后在采集地址处把准备采集网站的网址粘贴进去。

    频道配置

    二.频道入口地址配置好以后,点击“模板配置”,在右侧模板一处新建一个链接抽取,两个链接抽取,分别起名为“翻页”和“工程抽取”。这两个链接抽取分别抽取页面内的工程项目和翻页链接。

    添加链接抽取

    三.点击采集预览,发现采集预览中没有我想要的项目工程的链接,但是有翻页的链接,那就需要写脚本来抽取工程链接。翻页链接抽取可以通过可视化的操作完成。以前说过链接抽取的脚本如何写,这里就不多介绍了。

    链接抽取教程:http://toutiao/i6454813216395493902/

    链接抽取脚本

    四.通过预览发现每一个翻页链接地址中都包含“page=”这个词,那我将这个词放在“翻页”的地址过滤中,将过滤规则选择为“包含”。

    翻页地址过滤

    链接抽取配置好,可以点击采集预览看一下效果,如果配置的有问题可以及时改正。

    预览效果

    五.可以看到预览效果没有问题,那继续配置下一层模板。下一层为招标公告页,也就是数据页。先建好表单字段,在表单名称处选择建好的表单。

    选择表单

    六.数据页中有一部分字段使用可视化的操作就能完成,有一部分需要脚本,所以我就把需要写脚本的部分分别写在了字段下。字段处理选择“脚本处理”。

    字段下脚本处理

    八.全部字段配置好以后,可以先点击采集预览,看一下效果,如果效果不好可以改正。

    招投标类网站都是实时更新的,ForeSpider数据采集软件有增量采集的功能,可以采集新增数据,长时间时时监控网站新增数据。

    虽然教程看起来简单,最重要的还是多亲自上手实践。多多实践才能更熟练的使用软件采集自己想要的数据。

  • ?

    前嗅的这款数据采集软件和像八爪鱼这类的软件有什么区别,优势在哪?

    皮老九

    展开

    前嗅的这款数据采集软件,这个可以去它官网,好像百度经验不允许粘网址。搜“前嗅”或就可以找到官网。建议大家先在官网注册登录,免费试用前嗅ForeSpider爬虫软件,如果满意的话再使用付费版也不迟。不过小编觉得还是很好用,不信你可以试试,免费体验就可以抓取很多数据信息。

    前嗅采集器logo

    之前小编发现很多公司使用八爪鱼等采集工具互相合作过,但是八爪鱼采集速度太慢,小编是开着服务器用八爪鱼采集,一个月差不多采到100万条数据。后来是朋友介绍知道的前嗅,用前嗅的软件,小编仅仅开着笔记本采,一天给小编采了几百万条,差距还是很明显的。

    他们的ForeSpider数据采集软件很高级,不论是采集速度还是采集的数据全面,都完成的非常好。另外值得一提的是他们可视化的操作,对于小编这种技术白很是方便,几步的配置就能完成采集。有一些比较复杂的网站,也可以用他们自己的爬虫脚本。就算自己不想配置,也可以直接找他们买模板,拿回来自己一点按钮就能采集,小编也是每次都是直接买的模板。

    最主要他们不仅仅能采集,他们还有自己的数据分析系统。数据采集后把数据交给他们,进行分析,然后给小编分析报告也是非常的详细和具体,省了小编很多的事。分析方面给我提供了很多有价值的建议,有效的提升了小编公司的市场竞争力。 小编也是现在跟前嗅合作久了,觉得很是不错,总想着推荐给同行们使用,良心推荐一下。

    数据采集抽象图

    可以采集,案例的话。。。我也没有。。你可以找他们客服要,应该有吧。大家觉得我说的哪里不对的,欢迎大家给小编留言指点,谢谢!

  • ?

    ForeSpider数据采集系统脚本的几个小方法

    阿维娃

    展开

    今天给大家介绍一下我平时使用前嗅forespider数据采集系统配置模板的时候用到的几种方法,以前写过一个链接抽取的教程,今天就不给大家介绍了,没看过的用户可以关注一下我以前的文章,有很多有用的教程。

    首先,大家看一下这是我准备采集数据的网页:

    截图中三个圈起来的地方就是我要取的三个字段,然后分别取到下面每一行的数据,一直到结束。

    像这种多行的数据又不确定行数,我们就要使用循环,先取到最上面一行,然后往下循环。一直到结束。

    上图是我写的数据抽取脚本,这个数据抽取一共有3个字段,名字分别为“word”“inde”“rank”,对应脚本中“re.***”,每一行的脚本上都有绿色的注释,

    解释每一行的作用。

    总结一下脚本中用到的几种方法:

    ① DOM.FindClass:HTML文档的操作方法,通过标签class属性值查找标签节点(还有能通过标签名称和ID属性值查找标签节点的方法,本文未使用)。

    ② DOM.GetTextAll:获取HTML标签节点及所有子节点的可见文本。

    ③ next:返回标签节点的后一节点。

    ④ if、while:常见的判断、循环语句。

    *想了解更详细的使用方法请看软件文档。

    采集示例网址:http://top.chinaz/Html/site_ali213.html

    大家可以根据网页源码,软件帮助文档,对照着脚本看一下,理解每一行的意思。

    也可以看一下往期的文章教程,有兴趣的朋友关注一下,经常会更新教程和有意思的东西,希望大家使用的一切顺利。

    往期精选:

    ForeSpider链接抽取脚本:http://toutiao/item/6454813216395493902/

    ForeSpider如何通过关键词进行采集:http://toutiao/item/6451829518142276110/

    为什么总是入库错误?关于字段属性的问题:http://toutiao/item/6451485277398499853/

    想了解前嗅?ForeSpider到底是做什么的?http://toutiao/i6437323628127191554/

  • ?

    国内五大主流网站内容抓取工具、采集软件大盘点

    咎宛菡

    展开

    大数据技术用了多年时间进行演化,才从一种看起来很炫酷的新技术变成了企业在生产经营中实际部署的服务。其中,数据采集产品迎来了广阔的市场前景,无论国内外,市面上都出现了许多技术不一、良莠不齐的采集软件。

    今天,我们将对比国内五大主流采集软件优缺点,帮助你选择最适合的爬虫,体验数据hunting带来的快感。

    国内篇

    1.火车头

    作为采集界的老前辈,我们火车头是一款互联网数据抓取、处理、分析,挖掘软件,可以抓取网页上散乱分布的数据信息,并通过一系列的分析处理,准确挖掘出所需数据。它的用户定位主要是拥有一定代码基础的人群,适合编程老手。

    采集功能完善,不限网页与内容,任意文件格式都可下载具有智能多识别系统以及可选的验证方式保护安全支持PHP和C#插件扩展,方便修改处理数据具有同义,近义词替换、参数替换,伪原创必备技能Conclusion:火车头适用于编程能手,规则编写容易,软件的定位比较专业而且精准化。

    2.八爪鱼

    一款可视化免编程的网页采集软件,可以从不同网站中快速提取规范化数据,帮助用户实现数据的自动化采集、编辑以及规范化,降低工作成本。云采集是它的一大特色,相比其他采集软件,云采集能够做到更加精准、高效和大规模。

    自定义采集过程中,八爪鱼采集器系统自写的Xpath、自动生成的流程,可能无法满足数据采集需求。对数据质量要求高,则需自写Xpath,调成流程图等,以优化规则。

    使用自定义采集的同学,虽然八爪鱼操作简单,比较容易上手。但是,仍需对八爪鱼采集原理有所了解,看完相关教程,循序渐进,成长周期较长。

    可视化操作,无需编写代码,制作规则采集,适用于零编程基础的用户云采集是其主要功能,支持关机采集,并实现自动定时采集

    Conclusion:八爪鱼是一款适合小白用户尝试的采集软件,云功能强大,当然爬虫老手也能开拓它的高级功能。

    3.集搜客

    一款简单易用的网页信息抓取软件,能够抓取网页文字、图表、超链接等多种网页元素。同样可通过简单可视化流程进行采集,服务于任何对数据有采集需求的人群。

    可视化流程操作,与八爪鱼不同,集搜客的流程重在定义所抓取的数据和爬虫路线,八爪鱼的规则流程十分明确,由用户决定软件的每一步操作

    支持抓取在指数图表上悬浮显示的数据,还可以抓取手机网站上的数据

    会员可以互助抓取,提升采集效率,同时还有模板资源可以套用

    Conclusion:集搜客操作较简单,适用于初级用户,功能方面没有太大的特色,后续付费要求比较多。

    4.神箭手云爬虫

    一款新颖的云端在线智能爬虫/采集器,基于神箭手分布式云爬虫框架,帮助用户快速获取大量规范化的网页数据。

    直接接入代理IP,避免IP封锁

    自动登录验证码识别,网站自动完成验证码输入

    可在线生成图标,采集结果以丰富表格化形式展现本地化隐私保护,云端采集,可隐藏用户IP

    Conclusion: 神箭手类似一个爬虫系统框架,具体采集还需用户自写爬虫,需要代码基础。

    5.狂人采集器

    一套专业的网站内容采集软件,支持各类论坛的帖子和回复采集,网站和博客文章内容抓取,分论坛采集器、CMS采集器和博客采集器三类。

    支持对文章内容中的文字、链接批量替换和过滤可以同时向网站或论坛的多个版块一起批量发文具备采集或发帖任务完成后自动关机功能

    Conclusion: 专注论坛、博客文本内容的抓取,对于全网数据的采集通用性不高。

    注:给火车采集器的新手们一点学习建议

    火车采集器是一个非常专业的数据抓取和数据处理软件,对软件使用者有较高的技术要求, 使用者要有基本的HTML基础,能看得懂网页源码,网页结构。

    同时如果用到web发布或数据库发布,则对自己文章系统及数据存储结构要非常了解。

  • ?

    AO2011SP1版(ETP)采集模板制作流程

    美洛蒂

    展开

    一、采集模板结构

    1、变量

    这六个变量是每个模板都必须要有的,可直接Copy。

    第一个变量@DbSourceFilePath表示的是数据源路径。由用户选择数据源时赋值。若对源数据进行了预处理,则在预处理代码中需要对该变量进行重新赋值。

    变量@年度、@单位名称、@电子数据编号、@电子数据名称表示的是会计数据的基本信息。由AO2011建立会计数据时赋值。

    变量@临时电子数据编号,用于多套会计数据从AOExtract数据库采集到AOFinance数据库时,用于标识具体的每套会计数据。

    1.2 数据库连接

    SourceDbConnection表示源数据的连接。如果源数据是SQL Server,那么ConnectionType就是SqlConnection;如果源数据是Access或者是Txt文本,那么ConnectionType就是OleDbConnection。

    AOExtractTempConnection表示AO采集模块临时库的连接,也就是AOExtract数据库的连接。

    AOFinanceConnection表示AO财务数据库的连接,即AOFinance数据库的连接。

    1.3预处理

    如图所示,对源数据进行预处理,或者清空临时数据库等操作,放到PreProccesss该元素下。

    1.4批量建账接口

    DllAccoutList表示批量建账的接口,其中,TypeName为反射的类名,FileName表示动态链接库DLL的名称。

    1.5 Tasks和UpdateTask

    1.5.1 Tasks

    Tasks元素中主要是针对AOExtract数据库的操作,如数据从源数据中批量采集到AOExtract数据库。由于有多套会计数据采集的情况,AO是循环执行Tasks中的任务,所以BulkCopy中的SrcSql元素,SQL语句中都要有“@电子数据编号 as 电子数据编号”这句,并且针对源数据的预处理操作不能够放在Tasks中,而要放到PreProccesss元素下。

    1.5.2 UpdateTask

    UpdateTask元素主要是针对AOFinance数据库的操作,如数据从AOExtract数据库批量采集到AOFinance数据库,或数据从源数据中批量采集到AOFinance数据库。由于有多套会计数据采集的情况,AO是循环执行UpdateTask中的任务,所以若是数据从AOExtract数据库批量采集AOFinance数据库,BulkCopy中的SrcSql元素,SQL语句中都要增加一个where条件“where 电子数据编号=@临时电子数据编号”。另外,在UpdateTask元素的最后,要增加一个Task。用于将临时的电子数据编号,更新为创建会计数据时实际的电子数据编号。如下图所示:

    1.6 任务Task

    Task元素包括三种类型,分别是SqlTask,SqlBulkCopyTask和DllImportTask。

    1.6.1 SqlTask

    SqlTask用于执行SQL语句,例如Insert、Update、Delete、Truncate等。如下图所示:

    1.6.2 SqlBulkCopyT

    1.6.2 SqlBulkCopyTask

    SqlBulkCopyTask用于批量拷贝数据。该元素下可以有多个BulkCopy元素。BulkCopy表示批量拷贝的SQL查询语句。其中,ColumnMappings中的字段要与查询语句中的字段数相对应,字段的顺序要一致。并且,SQL语句中的字段类型和目标字段类型要一致。如果SQL语句中的查询结果,与目标表完全一致,那么可以去掉ColumnMappings元素。如下图所示:

    1.6.3 DllImportTask

    DllImportTask表示通过DLL处理的任务。其中,TypeName为反射的类名,FileName表示动态链接库DLL的名称。

    二、数据采集转换

    1.1 财务表采集

    参照Template.mdb中TBConvertWay表,根据字段对应关系和数据存储方式,编写SQL语句。其中,年度、单位名称、电子数据编号和电子数据名称这四个字段是每张表都必填的。

    1.1.1 会计科目表

    会计科目表必填的字段有科目编码、科目名称、科目级别以及四个变量字段,余额方向不为必填字段,原始数据中有则填,没有的话账表重建时会根据AO基础库中的标准会计科目表自动生成。若Template.mdb中,TBConvertWay表的ISAccountBalDirection字段为1,那么表示源数据中会计科目表里有余额方向的字段。AccountBalDebit和AccountBalCredit字段分别表示借方和贷方对应的值。例如,AccountBalDebit的值为J,AccountBalCredit的值为D,那么余额方向的SQL语句应为:case when 余额方向字段 = ‘J’ then 1 when 余额方向字段 = ‘D’ then -1 else 0 end as 余额方向。Access中为iif(余额方向字段 = ‘J’, 1, iif(余额方向字段 = ‘D’, -1, 0)) as 余额方向。Template.mdb中,通过SourceFieldName as CNTargetFieldName的方式,编写出SQL语句,AccountTableName表示会计科目表的表名。如果IsAccountFilter为1,则要加上AccountFilter中的过滤条件(where…)例如:select ccode as 科目编码,

    ccode_name as 科目名称,igrade as 科目级别,case when bproperty = -1 then 1 when bproperty = 0 then -1 else 0 end as 余额方向,

    @年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称 from code;

    没有科目级别字段,则根据科目编码生成科目级别。例如:select ccode as 科目编码,ccode_name as 科目名称,(select count(*) from code b

    where a.ccode like b.ccode + '%') as 科目级别,case when bproperty = -1 then 1 when bproperty = 0 then -1 else 0 end as 余额方向,

    @年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号, @电子数据名称as 电子数据名称 from code as a;

    2.1.2 科目余额期初表

    科目余额期初表必填的字段有科目编码、本币期初余额、余额方向、会计月份以及四个变量字段。通过SourceFieldName as CNTargetFieldName的方式,编写出SQL语句,BalTableName表示科目余额表的表名。如果IsBalFilter为1,则要加上BalFilter中的过滤条件(where…)例如:select ccode as 科目编码,mb as 本币期初余额,case when cbegind_c = '借' then 1 when cbegind_c = '贷' then -1 else 0 end as 余额方向,@年度as 会计年份,1 as 会计月份,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称 from GL_accsum where iperiod=(select min(iperiod) from GL_accsum) and cbegind_c <> '平';若BalType为1,则需要对上级科目的本币期初余额进行汇总,例如:select 科目编码,abs(isnull(本币期初余额,0)) 本币期初余额,case when isnull(本币期初余额,0) = 0 then 0 when 本币期初余额> 0 then 1 else -1 end 余额方向,@年度as 会计年份,1 会计月份,@年度as 年度,@单位名称单位名称,@电子数据编号电子数据编号,@电子数据名称电子数据名称

    from(select a.科目编码, (select sum(本币期初余额* 余额方向)本币期初余额from 科目余额期初表_Temp b where a.科目编码= substring(b.科目编码, 1, len(a.科目编码)) and b.电子数据编号=@临时电子数据编号) 本币期初余额 from 会计科目表a) aBalDirctionType表示余额方向的存储类型,0表示字段显示借贷,1表示金额字段正负显示借贷,2表示根据科目类型显示借贷,3表示根据借余额和贷余额字段显示借贷。0:若BalDebitSign字段为’J’, BalCreditSign字段为’D’,那么SQL语句为case when 余额方向字段=’J’ then 1 when余额方向字段= ‘D’ then -1 else 0 end as 余额方向

    1:select abs(金额字段) as 期初余额, case when 金额字段>0 then 1, when 金额字段<0 then -1, else 0 end as 余额方向。

    2:case when 科目编码 like ‘1%’ or 科目编码 like ‘5%’ then 1, else -1 end as 余额方向。

    3:select case when借方期初-贷方期初>0 then 1 when 借方期初-贷方期初<0 then -1 else 0 end as 余额方向, abs(借方期初-贷方期初) as 本币期初余额

    2.1.3 凭证库

    凭证库必填的字段有分录序号,凭证类型名称,借方金额,贷方金额,科目编码,摘要,凭证号,凭证日期和四个变量字段。若Template.mdb数据库的TBConvertWay表的IsHaveDebitCreditSign字段为1,表示凭证库中金额的存储方式为金额和借贷方向。例如DebitSign为“J”, CreditSign 为“D”。那么SQL语句应为case when 借贷方向字段 = ‘J’ then 金额字段 else 0 end as 借方金额, case when 借贷方向字段 = ‘D’ then 金额字段 else 0 end as 贷方金额。通过SourceFieldName as CNTargetFieldName的方式,编写出SQL语句,VoucherTableName表示凭证库的表名。如果IsVoucherFilter为1,则要加上VoucherFilter中的过滤条件(where…)例如:select convert(varchar, i_id) as 分录序号,ccode as 科目编码,

    md as 借方金额,mc as 贷方金额,ccashier as 出纳人,convert(varchar,idoc) as 附件数,cbook as 记账人,csign as 凭证类型名称,convert(varchar,ino_id) as 凭证号,dbill_date as 凭证日期,ccheck as 审核人,cdigest as 摘要,cbill as 制单人,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称 from GL_accvouch where iperiod < 13 and iperiod > 0 and YEAR(GL_accvouch.dbill_date)=@年度and iflag is null;若凭证库由主从表构成,则需要关联为一个表,用从表left join 主表。若凭证库中,没有唯一标识字段作为分录序号,那么需要在AOExtract库中建一个临时的凭证库表(凭证库_temp)。这张临时表需要创建一个自增长字段,作为分录序号。最后从这张表中采集凭证库。若凭证库中不包含凭证辅助明细,那么必然有一个或几个关联字段,关联凭证库和凭证辅助明细这两张表。这一个或几个关联字段的值,合并起来作为分录序号。

    2.1.4 科目设置

    先在临时库(AOExtract库)中插入科目层级表数据,然后根据科目层级表在AO财务库(AOFinance库)中插入科目设置数据。SQL语句应为:

    科目层级表:select a.[ccode] as [科目编码], b.[ccode] as [第父级科目编码]

    , @电子数据编号 as 电子数据编号from [code] as aleft join [code] as b on a.[ccode] like b.[ccode] + '%'

    科目设置:select sum((case when 级别= 1 then 1 else 0 end) * 本级长度) 第一级科目长度,sum((case when 级别= 2 then 1 else 0 end) * 本级长度) 第二级科目长度,sum((case when 级别= 3 then 1 else 0 end) * 本级长度) 第三级科目长度,sum((case when 级别= 4 then 1 else 0 end) * 本级长度) 第四级科目长度,sum((case when 级别= 5 then 1 else 0 end) * 本级长度) 第五级科目长度,sum((case when 级别= 6 then 1 else 0 end) * 本级长度) 第六级科目长度,sum((case when 级别= 7 then 1 else 0 end) * 本级长度) 第七级科目长度,sum((case when 级别= 8 then 1 else 0 end) * 本级长度) 第八级科目长度,sum((case when 级别= 9 then 1 else 0 end) * 本级长度) 第九级科目长度,sum((case when 级别= 10 then 1 else 0 end) * 本级长度) 第十级科目长度,sum((case when 级别= 11 then 1 else 0 end) * 本级长度) 第十一级科目长度,sum((case when 级别= 12 then 1 else 0 end) * 本级长度) 第十二级科目长度,sum((case when 级别= 13 then 1 else 0 end) * 本级长度) 第十三级科目长度,sum((case when 级别= 14 then 1 else 0 end) * 本级长度) 第十四级科目长度,sum((case when 级别= 15 then 1 else 0 end) * 本级长度) 第十五级科目长度,sum((case when 级别= 16 then 1 else 0 end) * 本级长度) 第十六级科目长度,sum((case when 级别= 17 then 1 else 0 end) * 本级长度) 第十七级科目长度,sum((case when 级别= 18 then 1 else 0 end) * 本级长度) 第十八级科目长度,sum((case when 级别= 19 then 1 else 0 end) * 本级长度) 第十九级科目长度,sum((case when 级别= 20 then 1 else 0 end) * 本级长度) 第二十级科目长度,'' as 编码分隔符,a.科目编码,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称from (select a.科目编码,a.第父级科目编码,c.级别,c.本级长度,a.电子数据编号from 科目层级表aleft join (select a.科目编码,count(*) 级别,len(科目编码) - isnull((select max(len([第父级科目编码]))from 科目层级表bwhere a.科目编码= b.科目编码and a.科目编码<> b.第父级科目编码) ,0) 本级长度from 科目层级表awhere 电子数据编号=@临时电子数据编号group by a.科目编码) c on a.第父级科目编码= c.科目编码) awhere 电子数据编号=@临时电子数据编号group by a.科目编码order by a.科目编码

    2.1.5 辅助账

    若Template.mdb数据库的TBConvertWay表的AidFlag字段为1,表示数据中有辅助账。需要处理辅助信息表、辅助余额期初表和凭证辅助明细表。

    2.1.5.1 辅助信息表

    辅助信息表需要参考Delphi的数据预处理代码。代码中会创建一个aidInfo表,包括AidType,AidCode,AidName,AidDec,AidVouSourceFiledName,AidBalSourceFiledName这几个字段。其中只需要用前三个字段。AidType对应辅助类型,AidCode 对应辅助编码,AidName 对应辅助名称。SQL语句应为:select '部门' as 辅助类型,cDepCode as 辅助编码,cDepName as 辅助名称,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称 from Departmentunion select '人员' as 辅助类型,cPersonCode as 辅助编码,cPersonName as 辅助名称,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称from PerSon

    若数据包含多级辅助账,则还需要加入上级辅助编码和辅助级别两个字段,SQL语句例子:select t1.辅助类型,t1.辅助编码,t1.辅助名称,t1.辅助级别,t2.辅助编码as 上级辅助编码,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电子数据名称as 电子数据名称 from(select '部门' as 辅助类型,a.strDepartmentCode as 辅助编码,a.strDepartmentName as 辅助名称,(select count(*) from Department as c where a.strDepartmentCode like c.strDepartmentCode + '%') as 辅助级别from Department as a) as t1 left join(select '部门' as 辅助类型,a.strDepartmentCode as 辅助编码,a.strDepartmentName as 辅助名称,(select count(*) from Department as c where a.strDepartmentCode like c.strDepartmentCode + '%') as 辅助级别from Department as a) as t2 on t1.辅助级别=t2.辅助级别+1 and t1.辅助编码like t2.辅助编码+ '%'

    unionselect t1.辅助类型,t1.辅助编码,t1.辅助名称,t1.辅助级别,t2.辅助编码as 上级辅助编码,@年度as 年度,@单位名称as 单位名称,@电子数据编号as 电子数据编号,@电...

  • ?

    一口气做了218个采集模板,从此我们将是爬虫采集界的美图秀秀

    怜晴

    展开

    我觉得今天应该出来吹下牛逼,因为我们觉得都快被自已感动哭了。近期我们整个运营团队天天加班一口气做了这218个采集模板,放到我们神奇的八爪鱼简易采集里面去,覆盖140个以上的网站,采集模板字段全配齐,适应不同用户不同场景下的需求,从此用户只需要输入几个参数,点一下启动采集即可获取数据。

    简易采集三步即可采集数据

    一张图是无法将logo全摆上的!

    本地生活

    大众点评 携程 美团 房天下

    百姓网 赶集网 黄页88 58同城

    51JOB 安居客 瓜子 驴妈妈

    蚂蜂窝 穷游网 微医 搜房网

    途牛网 房多多 春雨医生 下厨房

    育儿网 寻医问 饿了么 爱彼迎

    链家 馒友帮

    电子商务

    京东 天猫 淘宝 amazon

    阿里巴巴 唯品会 当当网 1号店

    ebay 速卖通 蘑茹街 苏宁易购

    媒体阅读

    腾讯网 微博网页 东方财经 新浪新闻

    新浪财经 悟空问答 猎云网 铅笔道

    人民网 时光网 文玩迷 VR186

    一点资讯 雅虎 雪球 凤凰网

    新浪汽车 新华社 部落 线报屋

    太平洋 果壳网 中新网 虎嗅网

    I黑马 IT桔子 东方财富 百度百家

    好奇心 华尔街 环球网 简书

    界面 今日头条 梨视频 36Kr

    她生活 搜狐新闻 搜狐新车 B站

    搜索与社交

    百度 搜狗 豆瓣 糗百

    博客园 网易 多玩 家长帮

    天涯网

    其他

    好大夫 39健康网 智联 英雄联盟

    站长之家 87870 音频应用 中国政府采集网

    虾米音乐 AcFun 爱奇艺 雪球

    应用宝 优酷 字幕组 360

    QQ音乐 爱游网 拉勾

    *以上网站的采集规则都配置好模板,大家可以直接使用即可采集。

    未完待续,敬请期待

    除了以上100多个网站的218个模板外,我们后续还会再制作上百个网站数百个模板,让用户从此采集更多网站无需配置采集规则。

    大众点评简易采集模版

    这些模板对应的网站,都是用户大多数想要采集的网站,以大众点评为例,大多数都在采集商家列表,商家详情,团购详情等等,我们运营的同学先帮大家把这些采集规则配置好,大家只需要填入一些参数(如城市入口地址,翻多少页等等)即可进行采集,页面上所有字段几乎都会包含,如遇到不需要的删除即可。

    并且有些模板还帮用户做了特殊处理,进行了云优化与云突破,可以在云端无限采集,无需担心封IP等防采集策略。

    八爪鱼智能防封采集模版

    简易采集界面也对采集字段,参数配置,样例数据做了详细的说明,保证每个点都说到位,并且运营同学还会对规则做定期的维护与更新,最后达到一个效果,你只需点击一个“立即使用”,即可获取数据。

    我们运营的同学戏称,从前我们是图片处理界的PS,功能强大,从此,我们是图片处理界的美图秀秀,不仅功能强大还简易,大家可以直接开挂采集数据了。

  • ?

    数据采集过程中的常见问题

    丹珍

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    前嗅:手把手教你数据采集

    青丝

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

数据采集模板

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP