中企动力 > 商学院 > 表格数据采集
  • ?

    表格数据差距再大,也难不倒Excel!

    Yi

    展开

    朋友们

    不知道你们会不会遇到

    这样的问题

    当你制作Excel图表时

    因为表格中数据

    的值相差太大

    导致生成的图表中

    数据较小的值的内容

    根本无法显示

    就像下面这个表格

    生成的柱形图是这样的

    因为表格中

    不同的销售人员

    之间的销售业绩差距很大

    所以销售较低的人员

    几乎看不到柱形图

    那么

    要怎么解决这个问题

    怎样才能更直观的显示图表呢

    这个

    就是今天小编

    要教给大家的啦

    通过制作

    数值差异柱形图

    让差距很大的表格数据

    在图表中多组显示

    首先

    调整表格数据

    将表格数据中

    销售额高的人员放一起

    销售额低的人员放一起

    中间空出一行

    并且两者销售数据放在不同列

    选中调整后的数据表格

    点击【插入】—【图表】—

    【插入柱形图或条形图】—

    【二维柱形图】—【簇状柱形图】

    选中图表上的灰色数据条

    右击

    选择【设置数据系列格式】

    在【设置数据系列格式】中

    将【系列绘制在】

    勾选为【次坐标轴】

    选中图表上黄色数据条

    按照上述操作

    做同样的更改

    选中图表

    点击【图表工具】—【设计】

    —【图表布局】—【添加图表元素】

    —【坐标轴】—【次要横坐标轴】

    点击后效果如下

    选中图表上方的横坐标

    右击

    选择【设置坐标轴格式】

    在【设置坐标轴格式】下的

    【坐标轴选项】中

    将【纵坐标轴交叉】中的

    【分类编号】设置为【4】

    (前面有3项)

    在【设置坐标轴格式】下的

    【标签】中

    将【标签位置】设置为【无】

    选中刚生成的次纵坐标

    右击

    选择【设置坐标轴格式】

    在【设置坐标轴格式】下的

    【坐标轴选项】中

    将【横坐标轴交叉】

    设置为【自动】

    完成上述操作后的效果如下

    接下来

    给图表稍微修饰一下

    点击【图表工具】—【设计】

    在【图表样式】中

    选择你喜欢的样式

    选中图表中的横线

    右击

    选择【删除】

    将最下面的横线也

    右击【删除】

    删除后图表如下

    选中主纵坐标

    右击

    选择【设置坐标轴格式】

    在【设置坐标轴格式】下的

    【刻度线】中

    将【主刻度线类型】设置为【内部】

    再次选中主纵坐标

    点击【图表工具】—【格式】—【形状轮廓】

    将轮廓颜色设置为灰色

    选中次纵坐标

    根据上述操作

    做同样的更改

    最后

    写上标题

    这样

    我们的数值差异柱形图

    就大功告成了

    因为原表格数据的差异过大

    所以在制作图表时

    将数据分成两组对比显示

    从而形成数值差异柱形图

    所以

    朋友们

    现在的图表

    数据是不是更清晰

    图表显示是不是更直观

    查看起来是不是不费力了

    关注

    技能视界

    马上进入职场新境界

    越专注 越幸运

    心事留言,小编答你

  • ?

    前嗅forespider数据采集软件使用教程之字段属性

    Ivie

    展开

    关于表单字段属性问题

    常见的表单字段分为以下几种不同的类型,包括:网页主键、文字文本、网页地址、图片、采集时间、网页源码等。

    网页主键是采集网页地址的MD5值,以标识数据的唯一性。

    主键字段

    采集表格数据时,表格每一行都需要主键,不能采用网页主键作为主键值,取值类型应为“空”,字段属性为“自动字段”。

    多行表格主键字段

    文字文本字段的取值类型一般设为“选区内全部文本”,变量类型为“string”,当从内置浏览器上为字段取值时,大多数情况都选择这一取值类型。采集选区内所有节点的文本内容。字符串长度根据自己选区的文本长度设置,最大255;再长的文本可以把字段属性设置为“变长字段”同时字符串长度设置为0。

    文字文本字段

    网页地址字段的取值类型选择“网页地址”,变量类型为“string”,字符串长度根据网址长度设置。

    url地址字段

    图片字段取值类型分为两种,当图片在网页的固定位置时,取值类型为“图片”,当图片不在固定的位置时取值类型为“原始数据流”,变量类型都是“stream”,配合扩展主类型和子类型选择。

    图片字段

    采集时间字段的取值类型选为“网页获取时间”,其它默认,取到的是ForeSpider下载该网页的时间。

    采集时间字段

    网页源码的取值类型为“选区网页源码(包含当前标签)”,变量类型为“string”,这里可以设置个变长字段,采集到的是整个页面的所有文本包括不可见的文档结构标签等。

    页面源码字段

    以上是几个经常用到的字段,大家要采集的内容类型复杂的话最好不要使用快速建表,手动新建更准确。

    祝大家使用愉快!

    前嗅forespider是一款专业的数据采集软件,完全的可视化操作,可以采集全网公开数据,并且前嗅还拥有数据挖掘分析系统,对全网数据进行精准的挖掘并分析用户所需。前嗅致力于做大数据行业最领先的技术供应商,打造国内第一家深度大数据平台,为客户提供深度大数据服务。

  • ?

    表格设计&创建表

    克劳瑞丝

    展开

    声明:本栏目所使用的素材都是凯哥学堂VIP学员所写,学员有权匿名,对文章有最终解释权;凯哥学堂旨在促进VIP学员互相学习的基础上公开笔记。 声明:本栏目所使用的素材都是凯哥学堂VIP学员所写,学员有权匿名,对文章有最终解释权;凯哥学堂旨在促进VIP学员互相学习的基础上公开笔记。

    表格设计:

    1.信息一定要分析详细,列多一点没关系

    表格上列越详细越好,方便以后数据的采集,如下图:

    2.不到万不得已不要轻易增加和减少列

    如下图:如果要你增加一个班级进去,你不要这样加

    3.表格多、没关系 你可以多申请一张表,然后写上班级编号关联,以后想改java班改成javaee班的话,直接在班级里面改,这样的话你所有应对那个班级都会发生改变,这样就方便多了,如下图:

    4.一个列中最好是独立值,不能有多值,除非没有修改的需求

    5.要设计一个唯一列,就是主键列

    主键:就是说此列的值是唯一值,此查询速度最快,所以每个表格中必须有一个主键列,无论今后删除修改,都要依赖于这个列作为条件去删除修改的,如果没有这个列速度就快不起来

    创建表:

    DDL 数据结构定义语句,表创建、数据库创建

    create table 表名 (列的类型和列名) 引擎或字符

    create table student(sid int,sname varchar(10));

    创建表的时候加上NOT NULL的话,就是不能为空的列,以后必须填写数据

    加上DEFAULT的话就是说给你一个默认值

    写上PRIMARY KEY 关键字就说明你这个是主键列

    还有这种写法也可以定制主键,最后才说明sid是主键,跟上面的效果是一样的

    联合主键,是两个或者多个列组合起来与其他组合列唯一就可以了

    提醒:以后操作的时候,也要两个列都用上才有效果

    CHARACTER指定表格的字符集

    ENGINE引擎选择

    引擎加字符编码

    TEMPORARY临时表创建,重启服务器就没了

    drop temporary table; 删除临时表

    drop table 名字; 删除表

    DCL 数据库操作语句 创建授权用户

    show databases; 显示你当前用户授权的数据库出来

    show tables; 查看此数据库中的表

    use 库名; 是选择此库进行操作

    desc 表名; 用于表结构查询

  • ?

    Excel数据表的管理利器:表格工具

    毕瑛

    展开

    三表结构中的数据表是整个数据文件的基石。

    还记得那些要求么?

    1、标题行在第一行

    2、标题明确,不为空

    3、数据整洁、格式一致、不缺、补漏、不重复

    4、不合并任何单元格

    5、数据表可延展,可以不断增加数据

    基本上是这个样子:

    如果你要经常通过数据表查询数据,

    那还要注意将查询的主键放在第一列,

    并且保证主键唯一。

    其实Excel提供了专门的表格工具来管理数据表:

    一、激活

    激活这个工具的方法是套用表格格式:

    具体的操作方法看动图:

    1、全选表格

    2、点击套用表格格式

    3、勾选标题行

    4、给表格命名

    套用表格格式后,整个表格变成一个整体,自动斑马纹不容易看错行。

    二、表格的计算

    套用表格格式后,数据是按列计算引用数据是引用列的名称:

    =[@成本价格]*[@数量]

    三、表格的切片器

    和透视表一样,套用表格后支持切片器功能:

    这个切片器实际就是筛选功能,不过更加直观。

    四、表格删除重复项

    表格工具也提供了删除工具,和数据里面的删除工具一样的操作方法:

    看来又多了一个删除重复项的方法了。

    五、表格的透视

    表格透视和普通数据表透视是一样,只是原来的选区,变成了表格名字:

    表格工具,是Excel的一个进化,必须要熟练掌握的技能。

    因为,表格是后面Power Query、Power Pivot中的基本概念。

    如果不能领悟表格的概念,学习Power Query、Power Pivot就会变得很困难。

  • ?

    学会使用PowerBI/Excel批量采集网页数据

    Gaby

    展开

    前面介绍PowerBI数据获取的时候,曾举了一个从网页中获取数据的例子,但当时只是爬取了其中一页数据,这篇文章来介绍如何用PowerBI批量采集多个网页的数据。

    本文以智联招聘网站为例,采集工作地点在上海的职位发布信息。

    下面是详细操作步骤:

    (一)分析网址结构

    打开智联招聘网站,搜索工作地点在上海的数据,

    下拉页面到最下面,找到显示页码的地方,点击前三页,网址分别如下,

    http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=1http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=2http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p=3

    可以看出最后一个数字就是页码的ID,是控制分页数据的变量。

    (二)使用PowerBI采集第一页的数据

    打开PowerBI Desktop,从网页获取数据,从弹出的窗口中选择【高级】,根据上面分析的网址结构,把除了最后一个页码ID的网址输入第一行,页码输入第二行,

    从URL预览中可以看出,已经自动把上面两行的网址合并到一起;这里分开输入只是为了后面更清晰的区分页码变量,其实直接输入全网址也是一样可以操作的。

    (如果页码变量不是最后一位,而是在中间,应该分三行输入网址)

    点击确定后,发现出来很多表,

    从这里可以看出,智联招聘网站上每一条招聘信息都是一个表格,不用管它,任意选择一个表格,比如勾选Table0,点击编辑进入Power Query编辑器。

    在PQ编辑器中直接删除掉【源】之后的所有步骤,然后展开数据,并把前面没有的几列数据删除。

    这样第一页的数据就采集过来了。然后对这一页的数据进行整理,删除掉无用信息,添加字段名,可以看出一页包含60条招聘信息。

    这里整理好第一页数据以后,下面进行采集其他页面时,数据结构都会和第一页整理后的数据结构一致,采集的数据可以直接拿来用;这里不整理也没关系,可以等到采集所有网页数据后一起整理。

    如果要大批量的抓取网页数据,为了节省时间,对第一页的数据可以先不整理,直接进入下一步。

    (三)根据页码参数设置自定义函数

    这是最重要的一步。

    还是刚才第一页数据的PQ编辑器窗口,打开【高级编辑器】,在let前输入:

    (p as number) as table =>

    并把let后面第一行的网址中,&后面的"1"改为(这就是第二步使用高级选项分两行输入网址的好处):

    (Number.ToText(p))

    更改后【源】的网址变为:

    "http://sou.zhaopin/jobs/searchresult.ashx?jl=%e4%b8%8a%e6%b5%b7&sm=0&sg=fe782ca83bfa4b018d27de559d0a5db0&p="&(Number.ToText(p)))),

    确定以后,刚才第一页数据的查询窗口直接变成了自定义函数的输入参数窗口,Table0表格也变成了函数的样式。为了更直观,把这个函数重命名为Data_Zhaopin.

    到这里自定义函数完成,p是该函数的变量,用来控制页码,随便输入一个数字,比如7,将抓取第7页的数据,

    输入参数只能一次抓取一个网页,要想批量抓取,还需要下面这一步。

    (四)批量调用自定义函数

    首先使用空查询建立一个数字序列,如果想抓取前100页的数据,就建立从1到100的序列,在空查询中输入

    ={1..100}

    回车就生成了从1到100的序列,然后转为表格。gif操作图如下:

    然后调用自定义函数,

    在弹出的窗口中点击【功能查询】下拉框,选择刚才建立的自定义函数Data_Zhaopin,其他都按默认就行,

    点击确定,就开始批量抓取网页了,因为100页数据比较多,耗时5分钟左右,这也是我第二步提前数据整理造成的后果,导致抓取比较慢。展开这一个表格,就是这100页的数据,

    至此,批量抓取智联招聘100页的信息完成,上面的步骤看起来很多,实际上熟练掌握以后,10分钟左右就可以搞定,最大块的时间还是最后一步进行抓取数据的过程比较耗时。

    网页的数据是不断更新的,在操作完以上的步骤之后,在PQ中点击刷新,可以随时一键提取网站实时的数据,一次做好,终生受益!

    以上主要使用的是PowerBI中的Power Query功能,在可以使用PQ功能的Excel中也是可以同样操作的。

    当然PowerBI并不是专业的爬取工具,如果网页比较复杂或者有防爬机制,还是得用专业的工具,比如R或者Python。在用PowerBI批量抓取某网站数据之前,先尝试着采集一页试试,如果可以采集到,再使用以上的步骤,如果采集不到,就不用再耽误工夫了。

    现在就打开PowerBI/,尝试着抓取你感兴趣的网站数据吧。

  • ?

    亿信华辰数据采集平台i@Report这样抓取数据

    子车莺

    展开

    数据抓取方案是从指定网址上抓取数据,存储到用户使用的i@Report产品中。对于数据抓取的创建,使用者需要了解其基本的功能使用。跟着小亿的介绍,一起来了解一下。

    数据抓取方案

    系统会自动生成一个dadmin帐号(默认密码dadmin),使用该帐号登录系统,可以看到数据抓取模块,该用户的权限已经初始化完成。

    创建抓取方案,需要进行抓取的相关设置。

    基本属性设置

    【抓取地址】抓取的目标网址。

    【关键字】目标表格的表头文字、表格里面的文字(协助定位表格的文字),支持多个关键字定位,关键字之间的分割符可以设置为空格,英文的分号、逗号。

    【方案名称】抓取方案的名称。如果不填写,点击“测试”,会默认取抓取目标网址的标题。

    【数据起始行】标志数据起始的行号,行号之前的会被识别为表头,行号及之后的数据被识别为数据。

    基本配置完成之后,点击"测试"按钮,会根据默认的抓取规则,从目标地址中将

    标签的内容抓取出来重新渲染。

    高级属性设置

    【表格ID】数据所在表格DOM元素的id属性值。在网页上的表格无明显关键字或者有多个同样标题的表格时,可以考虑取表格的ID来定位表格。

    【表格名称】用途与表格ID一致,对应DOM对象的name属性。

    【分页参数】在目标网站支持分页,且数据有多页的情况下,可以设置分页参数,这里指参数名。

    例如:

    http://192.168.1.200/bbs//forumdisplay.php?fid=30&page=2 该地址的分页参数就是page。

    【页码起止】配置抓取的起止码,从第几页抓到第几页,可以只填写分页起始行,不填写截止行。

    【取数去重】设置是否去除重复数据。勾选后将不再抓取重复的数据到数据库,数据是否重复的范围是所有期的数据中去比较是否有重复,默认不去重。

    登录属性设置

    以BI的登录地址为例

    【登录地址】执行登录的地址。

    【用户名参数】用户名对应的参数名。

    【用户名】用户的ID。

    【密码参数】用户密码的参数名。

    【密码】用户的密码。

    【登出地址】执行登出的地址。

    执行属性设置

    【取数频率】执行数据抓取的频率设置。

    【启动】是否启动自动抓取。

    根据实际需要配置完成后,点击“保存”,可以将当前配置保存,并生成对应的抓取方案。一个方案会同步生成一个irpt的任务和一个计划任务,任务保存在数据抓取任务组,计划任务保存到数据抓取分组。

    保存完成后,会提示是否执行数据抓取,点击“确认”可以执行一次数据抓取,也可以在树形抓取方案上,右键"执行"来执行抓取。

    编辑抓取方案

    点击左树上的方案配置,可以查看抓取方案的配置,

    可以对执行设置等配置进行编辑,其中目标地址、关键字、表格id、表格名称无法编辑。

    查看抓取数据

    点击左树抓取方案下的"数据"节点,可以查看抓取到的数据,

    抓取一次将生成一期数据,数据只能查看,不能编辑。数据由2张表组成,一张基本表,一张数据表,基本表记录抓取的一些基本信息。

    查看日志

    点击左树抓取方案下的"日志"节点,可以查看抓取数据的日志信息。

  • ?

    表单处理|这五款软件能够精准提取数据

    阿曼达

    展开

    对于企业和职场人士,特别是HR、财务等经常处理表单和数据的职位,日常工作中一定会接触到一些数据收集和分析的工作任务。多数情况下,用户需要从大量相同表单里提取一两项关键数据,针对这种场景,假若用户使用传统手工录入的方式,往往会有大量重复动作,毫无工作效率。

    其实,用对工具,能极大提升工作效率。这篇文章里,为大家推荐5款数据处理软件。

    1、Formtalk

    Formtalk 提供企业级一站式办公应用定制平台,它不仅具备数据采集和管理,而且还能够满足企业内外部包括报名、登记、预约、投票、调查等在内的数据采集需求。这款软件能够帮助用户实时跟踪需要采集的数据,呈现为可视化报表,同时,它的PC表单设计引擎、移动表单设计引擎、安全引擎和数据集成接口四项核心技术能够为用户提供表单复制、表单授权及表单提取功能,让用户能够有效提高工作效率。

    2、PDFelement

    PDFelement 在处理 PDF 表单和提取数据这一块可谓占领行业制高点。 它能帮助用户一键识别表单域(交互式表单域和非交互式表单域皆可识别),也能帮助用户自定义创建个性表单,比如单选、多选、下拉表、文本框、数字签名等。 当用户面对海量 PDF 表单,需要提取其中一项或者多项关键数据时,它能帮助用户准确提取表单数据,批量处理为用户节省了大量时间和精力。

    用户仅需将大量 PDF 拖入程序中,选择需要提取的区域,这些数据将会导入到Excel中。 如果这些 PDF 文档是扫描文件,也无需担心,PDFelement 执行 OCR,将文档转换为可编辑的文档,再进行数据提取操作。

    3、金数据

    这款表单处理工具是通用型的表单工具,主要功能聚集于数据收集和数据提取上,在数据统计和数据分析上有所欠缺。用金数据生成的表单不仅能以 Excel 表格的形式呈现,而且能够以链接或者 HTML 代码的形式嵌入到网页、微信文章之中。除此之外,这款软件在收集、提取数据的同时能够接入不同的支付端口,非常适合微店订单、用户反馈等业务数据的收集和提取。

    4、易表

    这款软件的功能介于电子表格与数据库软件之间,拥有类似电子表格的界面,也具备数据库软件特有的功能和灵活性。易表在数据处理上是非常优秀的软件,能够帮助用户完美完成复杂的数据管理和统计分析工作。但是,它的功能要求用户具备一定的开发能力,只有了解基本的编程知识才能快速建立属于自己的数据管理系统,比较适合专业性较强的用户,普通用户使用这款软件的学习成本过高。

    5、Foxtable

    这款软件将 Excel、Access、Foxpro、VB 等软件的优势融合在一起,无论是数据录入、提取,还是报表生成,用户都无需编写代码即可完成以上这些复杂的数据管理工作。这款软件的亮点之一是内置了 HTTP 服务和手机网页功能,用户无需任何专业知识就能够开发出自己移动端的管理软件,做到 PC 端与移动端的数据联通。相比于其他数据处理软件,这款软件更像是一个高效开发工具,让用户在开发属于自己的数据库时更关注商业逻辑,导致具体功能的实现比较艰难。同时,由于Foxtable支持外部数据源,也就意味着用户提供的数据有一定的安全风险。

    你是否也有兴趣看看《身在职场不会处理这5种文档,还谈涨薪?》

  • ?

    超实用:通过Excel进行数据采集

    紫安

    展开

    前言

    IBM大中华区总经理胡世忠曾说:数据构成了智慧地球的三大元素——智能化、互联化和物联化,而这三大元素又改变了数据来源、传送方式和利用方式,带来“大数据”这场信息社会的变革。

    从上可见,时代的变革是源于对数据的利用,对企业而言,数据也同样是其发展、转型的命脉。在工作中,我的前辈不止一次地强调,数据是公司的资产,而且举足轻重。我们对待数据,一定要严谨,经得起考验,对自己的数据负责,这是一个数据人的基本要求。

    数据资源

    大数据时代,数据虽然很多,但是也不是随意得来的,需要利用各种渠道和方式获得。不管从哪个角度来说,数据可分为内部数据和外部数据。内部数据是企业在日积月累的经营中得来的,我们应该对这些数据挖掘、收集有价值的东西,形成企业的数据资产。内部数据重在后期的处理和分析上。

    下面先说外部数据的获取方式,以及通过Excel操作来获取外部数据。

    外部数据获取方式

    1、专业网站看数据(某一个行业、某一件产品)2、通过收费渠道买数据(第三方数据平台等)3、通过特殊形式引数据(网站爬虫,统计网站等)4、自身积累数据(时间久、跨度长)

    Excel获取外部数据

    作为一个数据分析师以及想更进一步成长为数据科学家,熟练操作基本的办公软件以及SQL查询是很重要的。请看下面通过Excel获取外部数据的步骤。

    第1步:打开“新建web查询”框。新建Excel工作簿,在打开的工作表中单击“数据”选项卡,然后在“获取外部数据”组中单击“自网站”按钮,如下图。

    第2步:输入网址并选择要导入的表格数据。在弹出的“新建web查询”对话框中的“地址”文本框中复制粘贴上述网页的网址,然后单击“转到”,找到网站中的表格数据后单击表格左上角的箭头→,图标变成选中状态的复选框√。如下图。最后单击下方的“导入”按钮。

    第3步:选择数据的放置区域。点击导入后,Excel会出现“导入数据”对话框,如下图,选中你想放置的单元格,单击“确定”开始导入。

    第4步:美化导入的数据。由于导入的数据多且乱,要调整格式使数据规范,并启用冻结窗格功能方便浏览。如下图。

    好了,上面就是通过Excel操作来获取网站上的外部数据,很简单吧,但网站中的数据并非都是以表格的形式呈现,现在大部分是以json格式呈现,Excel不是万能的,而且现在很多网站需要付费才能导数据(上面说过数据就是企业的资产)。

    小结

    希望通过上面的操作能帮助大家。如果你有什么好的意见,建议,或者有不同的看法,我都希望你留言和我们进行交流、讨论。

    End.

  • 表格数据采集