中企动力 > 商学院 > 数据采集方法
  • ?

    简述全景数据采集中所遇问题及解决方法

    喻冥

    展开

    导语:在全景数据采集过程中,由于VR全景数据是全方位采集,所以经常会遇到大光比的场景。按照单反相机的手动(m档)测光拍摄,经常会出现全景局部曝光不足或曝光过度。那么,这种情况的出现是怎么形成的?又该如何解决这种问题的发生?

    面对具有高动态范围的场景时,人类的视觉系统在不同的光量下能自动调整适应,这个效果称为场景适应(locale adaptation)。当我们的注意力从深色阴影跳跃到明亮的高光时,视觉系统会进行快速调整,可以看清楚内容的每一个细节。而相机却不能以完全令人满意的方式来模仿我们视觉系统对亮度的感受,只能忠实记录景物的明暗。全景相机的传感器对于光线的反应是线性的,这意味着它生成的电荷与接收的光线量完全成正比。VR全景数据采集时,明亮的高光和深色的阴影细节会非常突兀地消失。这就是为什么在拍摄高动态范围的场景时,我们拍摄的全景照片成品和眼睛看到的实物相差很远的原因。以黄柏山风景区VR全景普贤殿场景为例,如图1所示;

    全景采集数据时最好拍摄2圈场景,以备后期制作。对于被采集数据场景光比范围很大,全景局部曝光不足或曝光过度的现象,后期可以使用包围曝光合成HDR的方法解决。如图2、3、4所示;

    如果使用相机2EV,0, -2EV包围曝光后,堂外还是曝光过度。建议先补拍一张2EV,0, -2EV室外环境的全景鱼眼图,如图5所示;

    将补拍的一张室外曝光正常细节的全景图通过PS抠图手法与室内曝光正常的鱼眼图进行拼接合成一张正常的全景鱼眼图;最后在用PTGui软件进行拼合大图。如图6、7所示:

    通过以上方法就能完美的把全景数据影像曝光过度区域采集全。如图8所示:

    黄柏山风景区VR全景案例赏析:http://expoon/9998

  • ?

    审计数据采集中的问题及解决方法

    Kerwin

    展开

    前言:个人数据采集经验总结,也许在审计过程中会遇到很多数据无法采集到AO审计软件的情况,就目前来说,随着各类业务软件、财务软件的不断更新,在数据采集上,AO已经无法满足要求了。当然,作为审计人员,不应该将数据采集作为无法开展工作的借口。只有多学习,多研究数据结构,在了解底层数据库结构的情况下,才能更好的提取所需数据。以下数据采集方法,仅为大家抛砖引玉,更多的是依靠大家多思考、多总结。

    审计数据采集中的问题及解决方法

    审计信息化给审计工作带来便捷、高效的同时,也带来了一些问题和挑战。审计软件开发已经跟不上财务软件的更新速度。目前市场占有率较大的“用友”“金碟”等财务软件几乎每年更新一次版本,如果数据结构没有调整,对审计数据采集的影响不大,一旦结构调整之后,审计软件没有做出对应的更新,那么“过时”的审计软件难以驾驭更新后的财务软件,尤其是在基层审计机关,没有专业人员,仅依靠自身学习和互联网查询,难以解决其遇到的问题。同时,各种数据库软件的导出方法都有所不同,数据采集操作的方式多种多样,很难掌握。针对类似问题,结合自身数据采集经验,提出以下解决办法。

    一、借助互联网。互联网是最好的老师,在采集过程中遇到问题,多向网络请教,根据采集过程中的问题提示,以问题找答案,大部分采集问题都能得到解决。

    二、多思考。依靠自身学习的计算机应用技术,对数据进行全方位,多维度的分析,力争找到能够突破的点。

    三、多用转换工具。很多数据我们无法直接进行采集,但可以通过在网络上查找转换工具,将数据转换后,以其他格式进行采集。比如oracle数据库,我们并不熟悉,但可以通过使用工具转换为SQL数据库,然后再对数据进行分析采集。

    四、多看开发文档。对于没有见过的小众财务软件或者更新后的财务软件,在数据结构有改动或者不熟悉的情况下,多看开发文档,了解后台数据表、结构。再使用“找表”采集或者使用采集模块采集。

    五、多向软件公司技术人员请教。在数据采集过程中,向软件公司人员请教问题,是最好的学习途径,不仅对解决问题有帮助,还能让自己学到更多的技术。

  • ?

    「科技日刊」研究人员开发了种新高质量人工智能训练数据采集方法

    诗兰

    展开

    转载自百家号作者:梦之爱雨

    微软必应团队的研究人员开发了一种为训练机器学习模型生成高质量数据的新方法。在.博客帖子和纸在盐湖城举行的计算机视觉和模式识别会议(CVPR)之前,他们描述了一种能够区分标记准确的数据和标记错误的数据的系统,其一致性令人印象深刻。

    研究人员写道:“获取足够高质量的培训数据往往是构建基于人工智能的服务最具挑战性的部分。”“通常,被人类标记的数据是高质量的(错误相对较少),但代价很高-无论是金钱还是时间。另一方面,自动方法可以大量生成更便宜的数据,但会导致更多的标签错误(“标签噪声”)。“

    正如Bing团队所解释的那样,训练算法需要收集数十万甚至数百万的数据样本,并将这些样本分类-这是一项艰巨的任务,由数据科学家手工完成。一种常用的快捷方式是从搜索引擎中“抓取”数据,方法是列出一个类别列表,对列表中的每一项进行网络搜索,并收集结果。(例如,在构建计算机视觉算法的语料库过程中,您可以对不同种类的食物进行图像搜索。)

    但并不是每个结果都与搜索类别相关,训练数据中的错误会导致机器学习模型中的偏差和不准确。减少错误标记问题的一种方法是训练第二种算法来查找不匹配并纠正它们,但这是一个处理密集型的解决方案;必须为每个类别训练一个模型。

    必应团队的方法采用了一个人工智能模型,可以对错误进行实时校正。在训练过程中,系统的一部分-类嵌入向量-学会自动选择最能代表每个类别的图像。同时,模型的另一部分-查询嵌入向量-学习将示例图像嵌入到同一个向量中。随着训练的进行,系统的设计方法使得类嵌入向量和查询图像向量在图像属于类别的情况下变得越来越相似,如果不是的话,则更接近于类嵌入向量和查询图像向量。

    该系统最终确定了用于为每个类别查找具有高度代表性的图像的模式。研究小组说,它甚至在没有经过人工验证的标签的情况下可靠工作。

    “该方法讨论了…已经被证明是非常有效的,为图像相关的任务产生干净的培训数据,“该小组写道。“我们相信它将是同样有用的…适用于视频、文字或语音。“

  • ?

    数据分析的8种方法详解

    马里矣尔

    展开

    对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。

    1 数字和趋势

    看数字、看趋势是最基础展示数据信息的方式。

    在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。

    对于电子商务网站,流量是非常重要的指标。

    上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。

    这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。

    2 维度分解

    当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。

    在选择维度时,需要仔细思考其对于分析结果的影响。

    举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。

    3 用户分群

    针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。

    我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。

    而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。

    在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。

    上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。

    这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。

    4 转化漏斗

    绝大部分商业变现的流程,都可以归纳为漏斗。

    漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。

    通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。  其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少?  第二,每一步的转化率是多少?  第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?

    上图中注册流程分为 3 个步骤,总体转化率为45.5%;

    也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。

    但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。

    显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。

    5 行为轨迹

    关注行为轨迹,是为了真实了解用户行为。

    数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。

    上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。

    网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。

    6 留存分析

    在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。

    每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。

    我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。

    在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。

    这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。

    7 A/B 测试

    A/B 测试用来对比不同产品设计/算法对结果的影响。

    产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。

    举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:

    第一,有足够的时间进行测试;

    第二,数据量和数据密度较高。

    因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。

    8 数学建模

    当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。

    作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。

    利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。

    我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。

    当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。

  • ?

    数据分析师需要掌握的知识:数据采集内容与程序

    庞沛儿

    展开

    数据采集内容

    数据采集包括历史数据的采集和当前市场数据的采集,是科学进行数据分析的基础,数据采集的准确与否直接决定了数据分析的价值。

    在企业运营过程中,假设企业环境基础不稳定,项目发展的规律在运营期间内没有大的变化,我们可以通过搜集准确的历史数据或可比历史数据,根据以往的发展规律,运用定量预测技术对未来收入和成本加以预测,直接推算出预测的相关数据。当运营环境略有改变时,可以利用定性预测技术对预测结果加以修正。因而,这类项目的数据采集主要是对历史数据的有效采集。

    对于新开的发的项目,由于缺乏可比性历史数据,或者市场发展规律不明确或不稳定,我们则先需要通过市场调研甄别影响市场需要求的主要市场因素的变量,根据项目具体情况选择市场调研的途径和方法,进而采集相关的市场数据,形成预测主要市场因素间关系的数据基础。

    企业所在的市场不同,影响需求的主要因素不同,数据采集的途径也不同。

    数据采集程序

    1、制定市场研究的具体计划

    在市场研究工作中数据采集是最重要的部分,它帮助解决投资与经营中相关的重要数据的确定和决策的改进。然而,数据采集工作是要花费资金的,尽量其带来的益处不言而喻,但是,如果要采集数据,就一定要让这笔费用华的物超所值。为了达到这一目标,需要周密的计划、安排和监控。这样做,不仅从协调计划的方面看是很重要的,而且也确保在预计时间内获得重要的数据,同时也可将成本监控在一定的范围内。

    2、明确数据来源

    在数据采集前,必须要对数据资料来源进行选择。数据资料按其来源不同,可分为第一首资料和第二手资料。第一手资料指为了一定的目的采集所得的原始资料。采集第一手资料的费用比较高,但资料的价值相当大。这种资料常常来自现场的调查,其准确度高且针对性强。第二手资料是指采集现成的资料,包括互联网上的信息,各种报刊

    文献上的资料,还有各类权戚机构发布的统计和研究报告等等,在现代项目研究中,由于互联网应用的普及,获取各种二手资料比起以往变得更加便捷,内容也异常丰富,所以二手资料的采集成为非常重要的调研手段.它有方便、快捷.成本较低的优点。数据分析人员还可以从内部资料中提取第二手资料.也可以利用外部资料间接获取。常见的内部资料往往来自企业的财务报表.比如.资金平衡表、销售统计以及其他报表档案。项目数据分析的起点始于采集第二手资料.但是这样的二手资料必须经过仔细统计、筛选及甄别.以尽可能保证资料的精确、可靠和真实。

    3、明确抽样方案及样本容量

    在一手数据的采集中,根据项目所属的特定行业及特定市场定位,许多数据可以通过直接采集得到全部样本,尤其对于成本、费用等可控制的要素;然而,对于其他数据的采集,比如说产销硫及其趋势变化数据,其总体范围很广,很难直接获取全部数据。这时我们常采川抽样技术,从拟采集数据的总体中抽取有代表性的部分单位作为样本,对样本进行调查或观察,并根据样本统计城估计总体参数,对所猫投资数据进行顶测

    4、明确数据采集方法

    数据采集往往采用三种方法:访问调查法、实验法和观察法。访问调查法通过访问代表性样本而获得数据,强调语言应答。而观察法强调非语言方式,通过调研人员在事件发生时或在过去已发生事件的记录中采集信息 · 与上述两种方法相比,实验法能够有效控制调研环境,在实际项目数据采集中,可根据项目特点、数据采集成本费用预算标准、时间及精度要求,采用不同的方法。

    5、问卷设计

    为了达到采集数据的目的,采川问卷方式进行调査是近年应用最广的一种调査手段。问卷设计的好坏,在很大程度上取决于调查问卷的回收率和有效率。另外,—张好的调查问卷必须满足后期数据分析的两个基本标准:相关性与准确性。

    问卷设计部分包括了对问卷结构、问卷设计原则、问卷的问题格式等问题的讨论与分析。

    6、数据处理及分析

    原始数据收集回来后,可能出现虚假、差错、冗余等现象,如果简单地把这些数据投 入预测分析,可能会导致错误的分析结论,从而使整个分析工作失去意义。因此,首先要对数据进行整理和加工,才能进行分析研究并得出科学的结论。数据的处理是指运用科学的方法,将调査所得的原始资料按调査目的进行审核、编码、录人及预分析的过程

  • ?

    金蝶AIR格式数据采集方法

    仇闭月

    展开

    如果是* .air先通过解压文件解压为*.ais。

    步骤一:建立数据库连接。 打开ACCESS2003,选择“工具->安全->工作组管理员”,打开一个对话框,点击“加入-浏览”,在“工作组名称”中输入AO中System.mda的安装路径: D:\现场审计实施系统2011版\XXBCJ\System.mda,确定后退出。

    步骤二:打开账套文件。打开ACCESS,文件→ 打开,选择金蝶账套所在文件夹,在文件类型中选择“所有文件”,在列出的文件中选择“*.ais”,在出现的对话框中输入ACCESS用户名: morningstar,口令:ypbwkfyjhyhgzj,确定。打开过程中有安全警告,忽略。

    步骤三:找到三张基本表,导出为EXCEL工作簿。注意要放在一个工作簿里,分别为以下三张:GLAcct(科目表)、GLBal(科目余额表)、GLVch(凭证表)。

    步骤四:数据整理后导入。由于软件币种设置的原因,金蝶KIS迷你版的科目余额表会出现重复值,每一个科目的余额分别以“RMB”和“*”两种币种金额显示,结果会导致科目代码的不唯一,可以使EXCEL的筛选功能,筛选出币种(FCyID字段)为 “*”的记录,予以删除,也可以直接在AO的数据查看对话框中执行以下语句:DELETE FROM [GLBal] WHERE FCyID<>'RMB' 以上两种方式可以将重复值全部消除。 然后,生成财务数据临时表(源数据凭证为一个表)

    ——辅助导入-会计期间设置(如2013年)-保存-关闭;

    ——辅助导入-源科目余额表GLBal-不存储多年余额-只存储余额,根据余额正负决定余额借贷方向-期初余额字段Fbegbal-科目编码FacctID-科目余额月存储-会计月Fperiod-年初余额在1月-导入余额表成功;

    ——辅助导入-源会计科目表GLAcct-不存储多年会计科目-科目编码FacctID-科目名称FAcctName-导入借贷方向FDC-C为贷,D为借-导入会计科目表成功;

    ——辅助导入-批量生成科目编码-验证-保存;

    ——辅助导入-源凭证表GLvch-不存储多年凭证-凭证日期Fdate-凭证流水号Fnum-凭证类型FGroup-分别存储借方发生额和贷方发生额-借方发生额字段Fdebit,贷方发生额字段FCredit-摘要Fexp-科目编码FacctID-自动生成源凭证库分录序号-导入凭证库成功-关闭生成财务数据临时表向导。

    步骤五:改回ACESS原来的工作组默认设置即:C:\Documents and Settings\Administrator\Application Data\Microsoft\Access\System.mda,否则以后打开所有的ACESS文件都要输入金蝶的用户名和密码。

    将以上导入过程保存为采集模板,便于以后直接使用。在进行会计科目调整完成账表重建后,就可以打开电子账簿、进行账表分析了。

  • ?

    浅谈工业生产现场数据采集

    老杰

    展开

    工业生产现场数据采集原则有两点:一是目的性,二是经济性;

    目的性是指在做设备的数据采集之前,先要明确所要采集的数据是否具有可观的价值。工业现场其实已经有很多的数据采集系统了,SCADA、HMI什么的也都是应用很广泛了,但是,其中又有多少数据被充分的分析,挖掘其潜在的价值的呢?

    大部分情况是,采集了数据后并不知道怎么去利用。国内大部分的工业现场还处在解决生产过程可见性的阶段,能够先把数据采集上来是当务之急,至少能够实时地了解到现场都发生了什么。在智能制造背景下,要将目光放长远,在做数据采集之前,尽可能地多去思考一下什么样的数据对我们的业务改进帮助最大,这样也许会让我们在数据采集方面的投资回报率更好看一些。

    经济性是指投资的回报效益。对于工业现场的数据采集,很多人第一个想法就是装传感器。不管什么样的项目,我们首先需要考虑的是投资回报率的问题,装传感器的方式可能是投资最大的一种。因此,做设备层的数据采集,一定要结合我们的数采目标,充分利用设备的现有条件(比如,设备已经具备的上位机系统、已经具备的通讯协议等)用最经济高效的方式来做数采技术路线的设计。

    工业数据采集设备分类:有上位机系统的设备(设备自带的监控系统)、基于非TCP/IP通讯协议的设备、基于TCP/IP通讯协议的设备、不具备通讯接口的设备。

    自动化系统设备数据采集系统采集方法主要是通过Web系统、生产线工作站系统、OPC服务器等配置对生产线上的各个设备的生产数据进行监控。同时将有效数据采集仓储在数据库中。这对整个生产系统进行生产线、工序参数、工作流程、设备参数、设备类型、OPC服务、通讯协议的全方位设置、管理。

    如需增加设备,只要在中心管理系统增加相应的设备类型,配置好相关的采集参数即可,可有效节约成本;生产过程中通过缓存交互数据,不直接和数据库交互,极大的提高了数据采集的性能;通过心跳检测程序,实时反馈生产设备的异常,保证生产数据完整性。

    一种自动化生产线设备数据采集方法,可以是如下步骤:

    1.根据自动化生产线上各种设备的不同协议类型,将支持OPC相关协议的设备与OPC连接;将支持TCP开放协议的设备与生产线工作站系统中的网口交换机连接;将支持COM开放协议的设备与生产线工作站系统中的串口交换机连接;

    2.通过Web系统配置生产线的全局属性;

    3.生产线工作站系统启动时从Web系统中同步本生产线所有相关配置,并存入缓存;

    4.生产线工作站初始化时,根据设备在Web系统的协议类型,连接每个设备,并启用OPC监听、TCP监听或COM监听。对于“基于TCP/IP通讯协议”,比较常用的有OPC Classic、Siemens S7、Modbus-TCP等通用协议,也有设备厂商自行定义的私有协议。这些协议的特点是都是基于TCP/IP协议簇,只是应用层协议不同。采用这些协议的设备一般都会有RJ45的接口,也就是以太网口,都可以直接通过以太网接入到车间网络中。对这些设备的数据采集,我们需要做的就是对上述协议的解析。对于OPC等通用协议,已经有很多成熟的SCADA产品可以利用,近些年,也有很多开源框架、商业化的组件可以应用,比如Eclipse neoSCADA,Kepware等等,都能够在完成上述协议的解析的同时,将其转换为一些IT领域常用的接口(RESTful API),方便其他信息系统的对接。

    5、将监听到的每个设备数据写入工作站数据库。

    设备数据分析,可以通过多种查询工具可以快速查询生产实时数据、相关历史数据。给管理人员重要决策提供有效数据基础。可以对数据进行横向比较,可以对历史数据进行分析。通过系统统计分析没太机器的运转率,故障时间累计以及车间设备总体利用率。系统可以提供柱状图、饼图、报表等分析工具,展现现场设备运转统计分析数据。自动统计每天限的产量数据,可以按照不同的班组、时间段等多种条件进行综合查询。

    同时对于设备的故障管理也可以进行相关数据记录,比如不同的设备及其台号,故障类型、时间段等多种条件进行历史查询赛选。这样可以进行历史数据查询,更好的帮助技术人员进行设备故障原因分分析,提高问题解决效率。

  • ?

    绩效考核数据收集困难繁琐,这几步让你掌握采集方法和思路

    凌乱

    展开

    在辅导企业开展绩效考核的过程中,发现绩效数据的提供是一项工程量浩大、繁琐的工作,也是考核中最容易出问题的地方,对于考核数据到底应该由谁提供,每个企业有着不同的认知,在操作中也各有不同,因此一个规范、严谨的程序是必须建立的。

    今天在跟踪A公司绩效考评时发生了一件事引起了笔者的反思,事情的经过是这样的:人力资源部小张将各部门的考核打分表和考核数据汇总起来后,上报给分管领导审核,结果被分管领导一顿狠批,认为其中有几项考核指标的打分非常不合理,明明这个月已经接到了几个客户的投诉电话,可是现场服务的得分还是很高。小张非常的委屈,这些数据都是各个部门之间互相提供给对方的,双方也都签字确认了,人力资源部只是一个二传手,怎么可能知道数据是否准确,如果人力资源部要参与所有数据的提供和审核,那人力资源部还有什么精力去干别的?

    但是在有些企业情况恰恰相反,一到考核打分的阶段,绩效专员就忙得团团转,因为各个部门的打分都找他要数据,甚至有些企业干脆就是由人力资源部给各部门打分的。绩效专员为了给各部门搜集数据,就只能找这个要、找那个要,找谁要谁都觉得你影响了我的工作,不积极配合,或者干脆推脱没有数据、应该由别人提供等等,数据好不容易收集上来了,人力资源部还得一一的审核和反复的确认,搞得绩效专员很头大,很无奈。

    这两个现象很有意思,它们虽然是两个极端,但其实都是因为人力资源部没有梳理清楚自身在绩效管理过程中所能发挥的作用和应该履行的职责,人力资源部在整个绩效管理过程中仅承担组织者、技术支持者、信息提供者、监控者的作用,而不是亲力亲为者。一方面是因为人力资源部不可能对公司的所有业务和所有管理行为都了如指掌,另一方面也是因为各个部门自身必须对本部门的绩效负责任,而不能让人力资源部负责任。

    具体到绩效管理的各个阶段,绩效计划阶段,人力资源部负责组织各部门制定绩效计划,并将各部门的绩效计划汇总起来,审视其对公司战略目标的支撑性,相互之间的牵制性、平衡性等问题,但对具体指标和标准只能是提供建议而已。绩效实施阶段,人力资源部负责跟踪各部门绩效管理日志的记录、绩效数据的积累工作,并不能参与其绩效实施过程。绩效评估阶段,人力资源部负责组织各部门考核打分,在这个过程中,人力资源部要负责为各部门的绩效打分提供数据平台,但不应该代替各部门打分。绩效改进阶段,人力资源部要负责跟踪各部门对绩差的指标或个人制定改进计划,并跟踪改进计划的实施情况,而不能对改进的结果负责。

    其他几个方面的责任其实还是比较好界定的,大多数的企业也都能做到人力资源部和运营部门各尽其责,就在绩效数据到底由谁提供方面还存在着分歧。各部门在考核打分时,部分绩效数据必须来源于第三方,这是客观事实,也是绩效管理的要求。各部门通常既是数据的提供方,也是数据的需求方,这样就形成了纵横交错的一个网,如果不能梳理清楚,就会存在较大问题。

    如A公司在刚开始实行绩效考评时,为了减轻人力资源部的工作量,没有采用笔者提出的数据采集程序和工具,而是让数据提供方和需求方自行对接,结果第一个月考核时,发现几乎没有一个部门有扣分或加分现象。究其原因,各部门有的是并没有找其他部门要数据,有的是去要了,对方没给,反正都是应付着打的分。因此第二个月考核时,人力资源部要求各部门在考核时,必须让数据提供部门在考核表上签字确认,这样情况确实好多了,基本真实反映了各部门的实际工作情况,但是繁琐的程序让各部门抱怨不断,对绩效考核的配合度也一直不高。

    而另外一家公司就是相反的情况,有些考核指标是需要在各部门提供的数据基础上进行进一步计算的,例如成本降低额,是需要将当月的各产品成本按照不变价重新核算后与公司核定的标准成本进行比较,而财务部仅提供根据当月市场价格结算的成本,人力资源部必须根据不变价重新计算,造成了大量的工作量,并且被考核部门也总是在质疑人力资源部考核打分的合理性。

    这两家公司我们都建议他们实施绩效数据的统一采集、集中审核流程,具体操作方式分为以下几步:

    1、人力资源部在组织各部门建立考核指标时,就要求各部门明确其数据的来源部门,如果数据来源不明的,由人力资源部组织相关部门共同讨论确定。

    2、人力资源部编制《绩效考核数据一览表》,按部门分类,将各个部门应该提供给其他部门的数据列示清楚,包括需求岗位、考核指标、指标说明、计算公式等,要求各部门分析提供的可能性后签字确认。

    3、人力资源部根据考核周期收集各部门的《绩效考核数据一览表》,并根据重要程度排序,分别上报至相应的分管领导处审核,并采集部分来源自高层的考核信息,如客户的抱怨、各种分析报告的质量等。

    4、人力资源部将审核汇总后的考核数据重新整理,按照数据需求部门分类反馈。

    在上述流程中,人力资源部统一采集汇总数据,避免了各部门交叉提供数据的混乱和遗漏;分管领导对数据的审核,确保了数据的准确和高层信息的及时补充,提高了考核质量和效率;人力资源部统一将数据反馈给各部门,确保了各部门数据来源的客观和可信,简化了后续审核。

    大家有好的想法,欢迎在评论区给我留言

  • ?

    前嗅:手把手教你数据采集

    利布斯特

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    干货丨大数据是如何被采集及应用的

    猜不透

    展开

    尽管“大数据”一词近年来屡遭热捧

    但很多人都还不知道什么是大数据

    更不知道大数据有甚卵用

    这两年,发现“大数据”这个词出现的越来越频繁了

    不仅企业,连国家都在部署大数据战略

    一番百度了之后

    Oh~ emmmmmmmmm~ +_+

    还是没搞懂大数据到底是个什么玩意儿

    直到有一天

    我发现一个秘密

    不管我在网上搜索什么

    页面都会跳出我要搜索的相关产品或关联事物

    然后,我恍然大悟!

    所谓大数据,就是算法!

    它能够“算”出我们“心中所想”

    那么问题来了

    大数据技术是如何采集到我们的信息的呢?

    数据采集,又称数据获取,是利用一种装置,从系统外部采集数据并输入到系统内部的一个接口。在互联网行业快速发展的今天,数据采集已经被广泛应用于互联网及分布式领域,比如摄像头,麦克风,都是数据采集工具。

    数据采集系统整合了信号、传感器、激励器、信号调理、数据采集设备和应用软件。在数据大爆炸的互联网时代,数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。结构化最常见,就是具有模式的数据。非结构化数据是数据结构不规则或不完整,没有预定义的数据模型,包括所有格式的办公文档、文本、图片、XML, HTML、各类报表、图像和音频/视频信息等等。大数据采集,是大数据分析的入口,所以是相当重要的一个环节。

    我们首先来了解一下数据采集的三大要点:

    一、数据采集的三大要点

    (1)全面性

    数据量足够具有分析价值、数据面足够支撑分析需求。

    比如对于“查看商品详情”这一行为,需要采集用户触发时的环境信息、会话、以及背后的用户id,最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。

    (2)多维性

    数据更重要的是能满足分析需求。灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标。

    比如“查看商品详情”这一行为,通过埋点,我们才能知道用户查看的商品是什么、价格、类型、商品id等多个属性。从而知道用户看过哪些商品、什么类型的商品被查看的多、某一个商品被查看了多少次。而不仅仅是知道用户进入了商品详情页。

    (3)高效性

    高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。也就是说采集数据一定要明确采集目的,带着问题搜集信息,使信息采集更高效、更有针对性。此外,还要考虑数据的及时性。

    不同应用领域的大数据其特点、数据量、用户群体均不相同。不同领域根据数据源的物理性质及数据分析的目标采取不同的数据采集方法。

    那么,接下来我们再来了解一下常用的数据采集的方法。

    常用的数据采集方法归结为以下三类:传感器、日志文件、网络爬虫。

    (1)传感器

    传感器通常用于测量物理变量,一般包括声音、温湿度、距离、电流等,将测量值转化为数字信号,传送到数据采集点,让物体有了触觉、味觉和嗅觉等感官,让物体慢慢变得活了起来。

    (2)系统日志采集方法

    日志文件数据一般由数据源系统产生,用于记录数据源的执行的各种操作活动,比如网络监控的流量管理、金融应用的股票记账和 web 服务器记录的用户访问行为。

    很多互联网企业都有自己的海量数据采集工具,多用于系统日志采集,如Hadoop的Chukwa,Cloudera的Flume,Facebook的Scribe等,这些工具均采用分布式架构,能满足每秒数百MB的日志数据采集和传输需求。

    (3)Web 爬虫

    网络爬虫是指为搜索引擎下载并存储网页的程序,它是搜索引擎和 web 缓存的主要的数据采集方式。通过网络爬虫或网站公开API等方式从网站上获取数据信息。该方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。

    此外,对于企业生产经营数据上的客户数据,财务数据等保密性要求较高的数据,可以通过与数据技术服务商合作,使用特定系统接口等相关方式采集数据。比如八度云计算的数企BDSaaS,无论是数据采集技术、BI数据分析,还是数据的安全性和保密性,都做的很好。

    数据的采集是挖掘数据价值的第一步,当数据量越来越大时,可提取出来的有用数据必然也就更多。只要善用数据化处理平台,便能够保证数据分析结果的有效性,助力企业实现数据驱动。

数据采集方法

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP