- ?
【独家】移动互联网大数据助力金融风控
梅希约内斯
展开
[导读]为了让清华大学大数据能力提升项目的学生在基础学习和科研的基础之上,更好地了解大数据技术行业领域中的应用,清华-青岛数据科学研究院支持开设了金融大数据方向《量化金融信用与风控分析》课程(课号:80470193)。本课程由清华大学交叉信息研究院助理院长、清华大数据能力提升项目教育指导委员会委员徐葳老师开设,并且聘任加州大学伯克利分校计算机博士黄铃和美国卡内基·梅隆大学高性能计算研究教学中心创始人、联席总监种骥科博士联袂任教。在讨论课上,同学们会深度接触互联网金融行业中建立信用和风控模型的理论和实践案例,并了解关键学术挑战和应对挑战的解决方案。同学们还将亲手设计实现信用和风控模型,通过讲座了解世界上最先进的信用分析和反欺诈的方法,优秀项目成果还有望投稿一流的学术会议。本文来自该课程中的第四次讲座内容。
注:本文为精华摘录,后台回复关键词“清华大数据”,可下载本节课程PPT全文。(限时七天,不想错过更多内容,就请持续关注数据派THU!)中国信用体系正处于建设完善阶段,大量人群不在覆盖范围内,难以享受信用服务,金融机构对信用用户的人群下探推动了行为大数据在风控过程中的使用。移动互联网用户行为数据作为自然人的指端延展具有数量大、维度多、动态好等特点,正在逐渐成为白户人群的信用信息替代品。本次清华大数据“技术·前沿”讲座,嘉宾陈雷从移动互联网数据的采集、初步加工、特征因子工程、模型与数据评估等方面完整阐述了TalkingData在金融风控领域应用上的数据价值探索与心路历程。
陈雷TalkingData FinTech总经理陈雷拥有20多年IT行业的业务及技术咨询和服务经验。现就职于中国最大的独立第三方移动数据服务平台TalkingData,任FinTech总经理,负责金融科技大数据应用产品。之前陈雷曾经服务于Oracle, IBM, DWL等企业,历任Oracle中国区大数据技术总监,大客户技术总监, IBM 首席架构师等职务,负责电信、金融、零售、物流等多个行业的业务和技术咨询工作。陈雷毕业于浙江大学、约克大学,拥有多项职业技术认证和技术专利。PPT+课程精华笔记▼
一、风控、征信、反欺诈行业与业务背景
通过几个报道对整个行业现状做一些了解,我们就可以理解为什么现在风控如此之火,征信、反欺诈为什么尤其重要。
1. 银行业务的下沉
过去银行只在线下发放实体信用卡,而现在中国有很多家的银行都在尝试虚拟信用卡。虚拟信用卡的推出对市场意味着什么呢?过去我们办理实体卡往往是需要一个线下的过程,而虚拟卡是完全在线上完成。这是银行在攻占整个的消费分期以及往下层的金融市场,我们可以看到很多家银行在进入这个市场。
2. 从投资角度看消费金融的火热
现在很多的VC都在投资消费金融领域的团队,为什么VC如此看好这个领域?因为这里面可以有很多想象的空间。
3. 现金贷遭受严格监管
比如说现金贷,年化利率最高可以达到600%。
如此高利率的原因主要有以下几点:
第一,这些现金贷面向的客户群体,质量较低,是属于急需用钱类型的。在这种情况下可能会不择手段,风险系数很高。
第二,这些平台没有足够的风控能力,同时面临着大量的欺诈团伙,造成坏账率高,只能用高利率才能抵消风控不足的成本。
4. 个人征信牌照的暂停
中国目前为何还没有发出征信牌照?央行的解读给所有的征信公司泼了一盆冷水:目前所有的征信公司都没有达到要求,引发行业哗然。
行业趋势总结
中国金融企业的金字塔:顶端是五大行,其次是股份制,再往下是城商行、信用社,之后是信托、担保,最下面的是p2p、现金贷等。最下面的市场监管越来越严,期望能改变劣币驱逐良币的现象,与此同时,主流金融机构的业务与用户正在下探。这些趋势意味着金融企业将会越来越重视风控,这可能是未来的一个风口。二、机会与挑战 探索隐藏价值
作为大数据行业的从业者,我们看到行业的变化带来了很多挑战与机会。
人行的征信体系,据统计大概4.7亿人有征信记录(银行账户、信用卡等),市场上存在大量的白户人群没有被人行征信覆盖,征信过程中缺少数据的支撑。
信用越来越场景化,需要对用户做精准匹配,而银行交易数据覆盖面窄,回流周期长,在使用时可能已经效果很低。 风控不仅仅是点,需要覆盖到用户的整个生命周期,从用户触达、授信、消费、离开等全流程提供风控支持。
于此同时市场上数据混杂,各种灰产、黑产导致各种数据安全与数据质量问题。6月1日实施的个人隐私保护法规,对数据交换、数据使用的监管更加严格。
诸多的机会与挑战给风控的从业人员与企业提出了更高的要求。从科技公司角度看风控能力:
第一块是数据,数据是风控的基础,能拿到什么样的数据很重要;
第二块是工具,风控与反欺诈的需求对实时分析与响应提出了很高的要求,提供相应的技术工具的支撑;
第三块是应用,根据不同的商业模式和业务流程,会存在多个应用维度,应用时更是需要将技术与人工相结合,机器学习能解决一些问题;更多时候需要将各种数据集合到一起,让风控专家来看,会得到很多机器学习不能获得的信息与洞察。
接下来我们看一下对金融数据的理解,在风控领域,数据的使用遵循这样的金字塔结构。
第一行是人行的征信数据。
第二行是消费的数据,代表了消费能力,偿还能力等。
第三行是运营商数据,虽然不一定与金融强相关,但包括多种多样用户的行为数据。运营商数据获取并不容易,需要对接33家运营商机构。(中国移动有31家机构,还有中国联通、电信)
第四行是社交数据,最大的是腾讯,由于BAT体系相对封闭,这部分的数据获取难度也极大。
第五行是行为数据,过去大家认为行为数据与金融是弱相关,但通过实践我们发现这部分数据还是很有意义的。行为数据的覆盖量大, 维度多且复杂,给数据处理的方式与能力提出了新的要求。
用户数据应用的能力正在从传统的扁平化向互联网立体信息转化。过去用户数据是扁平化的标签。现在有了大量立体化的数据采集手段可以更加立体化的描述一个用户的行为。比如大家使用的手机在应用过程中都会产生大量的应用数据,这些数据会被收集用于分析,随身设备中的传感器,比如手机里的陀螺仪,记录了大家的行走、运动行为。同时线下也有大量的数据收集技术,比如商场里的wifi流量探针,判断商场人流量。有很多这样的数据孤岛,如果打通了,就可以形成线上线下行为的立体化认知。
数据是每家公司一项很重要的资产,TalkingData提出了数据三重门的数据经营理念。 帮助我们的客户全方面理解自己的数据潜能,把传统交易数据的采集推进到交互门的数据采集。建立自有数据与公开市场门数据的交换能力, 真正把企业数据当作重要资产经营起来。
TalkingData也正在依托过去五年多时间通过运营积累的大量的数据,与我们的用户合作共同探索数据价值,同时依托自己在大数据领域的影响力,建立起大数据的生态圈,在合理合法的前提下,结合生态数据源加工、处理并利用数据,发掘数据价值。
数据的处理的5个级别:
基础数据,数据初步加工后的信息,信息经过整合联接,形成知识,知识之上形成洞察,最后成为智慧。数据的特征加工就是这5个层次的数据应用过程。
数据特征处理示例:
手机的出口IP,可以通过归因与地理位置匹配,形成一个用户的漫游情况。IP更可以使用时间来形成更复杂的认知。 例如一个晚间WI-FI IP出口可能是一个家庭, 白天则可能是个工作场所。
设备与IP的关系通过时间与空间的交叉关联,可以帮助我们发现两个设备之间的逻辑关系。下图中,我们看到两台设备在同一时间在两个相距甚远的两个地方同时出现,我们猜测这两台设备可能属于同一个人。下图为设备时空特征关联的知识图谱。
三、基于数据之上的风控应用
1. 营销反欺诈
这是一张很经典的图,最左边是用户,最右边是金融机构,中间有两个括号,一个是市场(market),一个是产品(products)。金融公司制定的产品(product),通过市场(market)触达及转化目标用户,通过自己的渠道为用户服务,实现目标用户向客户的转化。
在这个中间过程中,就存在很多欺诈的可能,比如流量作假,骗取公司的市场费用;假app流量及活跃度,欺诈投资人的投资;产品推广及运营则会吸引团伙来薅羊毛,骗取公司的运营费用和经营成本。
下图展示了一个营销反欺诈能力的框架。
首先需要整合多维度的数据,包括:物理地址、app信息、交易信息和跨app信息等;接着抽取特征,做特征工程方面的工作;在此之上做聚类分析,识别出数据样本的特征模型, 最后通过分类与回归算法对样本用户进行分类与预测。知识图谱技术作为一个高效的互动工具,辅助业务人员进行数据探索,实现人与人工智能的高效结合。
2. 用户反欺诈
用户欺诈主要是针对信贷类产品,对用户欺诈的防治可以发生在用户的获取、授信、交易,及贷后的每一个核心环节。用户反欺诈,希望能做到风控前置,在用户进来之时,就能识别欺诈。根绝欺诈很难,有效的方式是提高欺诈集团的欺诈成本,让其无利可图。
反欺诈服务完全是数据驱动,需要获取很多的信息,包括:设备数据、客户数据、运营商数据、关系人信息、银行信息等。
典型的欺诈异常包括:设备异常、账号异常、行为异常和交易异常等。
反欺诈系统是一个典型的规则驱动的系统, 已知规则形成规则集,直接使用,比如三要素验证、OCR人脸识别、验证银行卡、运营商等等。
更多的欺诈特征因子, 通过使用非监督机器学习技术做异常检测,并形成对欺诈行为的综合评判。图数据作为重要的社交图谱能力及技术帮助业务人员发现更加复杂的信息关联。
3. 用户授信辅助
用户授信辅助主要发生在金融产品的营销环节、贷前审批环节及贷后管理环节。授信能力的前置,可以有效判断用户的信用能力,对用户实现精准营销推送,提升转化率。
TalkingData深度发掘自有移动互联网行为数据,通过多种特征工程,机器学习等技术,形成了一个稳定的行为数据机器学习模型, 达到了很好的行为评分结果。这些能力已经投入实用,为用户的授信提供辅助决策支持。
目前大数据人才,尤其是数据科学家非常短缺,这类人才既要懂编码,还要懂数据分析之道,对行业知识也要有深刻的洞察力,为此,TalkingData推出“数据科学经营夏令营”活动,包吃包住,还有硅谷游学机会,欢迎各位同学参加,点击文末“阅读原文”了解入营细节。
问答精选
Q:金融行业,比如银行要求可解释性,这块你们是如何处理的?
A:在模型中我们应用了近千个行为数据因子,由于因子过多,饱和度参差不齐,我们首先对特征因子进行了降维处理,筛选了两百多个因子入模型。同时我们输出了对Y值影响较高的数据因子供业务专家判读。这些因子的数据表征与专家认知基本匹配,为金融行业的客户提供可解释性。
量化金融信用与风控分析课程号:80470193课程简介金融与互联网行业的深度结合带来了金融信贷模型的变革,这些变革对于普惠金融、个人和企业信贷带来了很多便利和新的市场形式。然而,新的互联网数据源也给征信模型的设计带来了新的科研问题,同时,互联网中广泛存在的欺诈行为也给这一新的信用模式带来了挑战。该课程目的在于让学生理解这一领域的科研和实践最新进展,为学生开展这一方向的深入研究打下基础。
本课程包括的模块有:1.信贷模型的架构与设计;2.反欺诈模型的架构与设计;3.行业实践案例。在这一课程中,学生需要平均每周阅读2篇本领域最新论文,并且实际动手设计两个项目,包括一个基于LendingClub信贷数据的信用数据建模项目和一个自由选题的团队研发项目。
任课教授种骥科博士,现任宜信宜人贷首席数据科学家。曾任美国卡内基·梅隆大学教授与博士生导师,开创了卡内基·梅隆大学高性能计算研究教学中心,任联席总监。种骥科有多年互联网、大数据及金融创新经验。。在加入宜人贷之前,曾任职于美国Simply Hired招聘平台,创建了数据科学部,并应邀为白宫科技办公室参谋大数据技术产品设计。种骥科曾就职于美国Silver Lake 私募公司任Kraftwerk基金数据科学架构师,负责大数据技术应用。种骥科持有加州大学伯克利分校电子工程和计算机科学系博士学位,卡内基梅隆大学电子和计算机工程系硕士及本科学位,并持有9项专利。黄铃博士,AHI Fintech创始人、CEO,加州大学伯克利分校计算机博士。黄铃是DataVisor 公司创始成员和大数据总监 (2014-2016),曾在美国英特尔研究院任资深科学家七年(2007-2014)。黄铃在人工智能、大数据分析和金融科技相关领域有近十五年的研究和开发经验,在世界顶尖会议上发表近50篇论文,总引...
- ?
移动采集,现场营销,展会人群资源一手掌握!
南晴
展开
展会人流量大,客户多,如何在展会上抢占先机?云立方拓客宝,移动无感采集,十分钟匹配上千个电话号码,及时进行精准营销.
只需三步!
场景应用:
家居博览城,展会,商圈,楼盘收楼现场,竞争对手门店,小区......
一年一度的陶瓷博览会,全国各地的经销商汇集佛山,如何在陶博会上抢占先机?
拓客宝,插电即用,只需派人前往展会,在展会里随处走动,便可采集人群信息,手机app可同步查看人群信息,立刻进行现场营销,多个手机可同时登录一个账号,并同时拨打电话发短信。
经销商如何在各种应用场景使用拓客宝?
在竞争对手门店,活动现场,楼盘售楼现场,小区等地方,只需派业务员随身携带拓客宝走动,插电即可采集,其余营销人员就可以在办公室直接登录账号即可同步拨打电话和群发短信。
替换高清大图
移动数据采集,佛山陶博会人群信息,喜好偏好,人流数据,必备信息一应俱全
- ?
网络分流器-网络分流器-移动互联网采集器部署方案
青寒
展开
网络分流器-戎腾网络汇聚分流器-移动互联网采集方案
当前市场主流的移动互联网数据采集通常是10G的,随着市场的飞速发展,流量升级势在必行! 作为国内固网以及移动互联网分流器,采集设备,汇聚分流设备领导者戎腾网络,率先推出了100G的移动互联网采集设备,下面介绍几个比较简易的移动互联网采集方案!
一. 戎腾网络应用方案
戎腾移动互联网采集器部署方案戎腾移动互联网采集器部署方案戎腾RTL6401此设备为RTL6401 支持120个10G,支持IPV4 和 IPV6双线解析,支持3200万用户,关联成功率达99%
戎腾网络RTL9807此设备为戎腾RTL9807,支持160个10G或者20个100G,支持IPV4 和 IPV6 双线解析,支持4800万用户,关联成功率达99%
二: 方案流程:
S1-MME、S10/11、S5/S8和Gn多接口信令按用户关联,输出XDR信息。
S1-U、S8用户面数据经过五元组过滤后,与用户信息关联并负载均衡输出。
网络分流器
网络分流器网络分流器戎腾网络分流器 - ?
网络分流器|移动互联网采集方案
阿德格拉斯
展开
网络分流器采集方案戎腾网络.通常我们将网络分成固网和移动互联网二大类
与传统互联网相比,移动互联网存在两个显著的特性:移动性、控制与承载的分离。移动性要求电信运营商为用户提供随时随地接入互联网的能力。控制与承载的分离带来了复杂的网络结构和承载协议。在LTE核心网EPC中,S11和S10接口上承载了GTPv2-C协议,S1-MME和S6a接口上分别基于SCTP承载了S1AP和Diameter协议,在S1-U接口上存在了GTP-U协议。需要解析和关联多个接口的协议才能得到一个用户的完整信息,这为数据溯源带来了巨大挑战。
网络分流器针对网络分流器及移动互联网采集器的需求和上述技术特点,戎腾网络研制的系列采集器采用FPGA+NPU架构;完成信令的解析与关联,生成XDR格式的用户上下线信息;实现基于五元组规则、手机号规则和DPI规则的数据过滤和下放,并在下放报文的尾部打上包含用户信息(包含IMSI、IMEI、MSISDN和ECGI等信息,可定制)的数据标签。后端分析系统分析出任何有价值情报时,均可实时关联到应用所在的位置、手机号、设备号等信息。
警用移动互联网采集器的典型组网方式如最下方图所示。从EPC的S1-MME、S11、S10、S1-U和S6a接口分光后,可直接输入到采集器,也可经汇聚设备汇聚后再输入到采集器;采集器输出数据可以直接输出到后端还原系统,也可在两者之间部署分流交换机根据DMAC进行二次负载均衡分流。
网络分流器戎腾网络研制的移动互联网系列采集器能够为客户带来几大优势:
1) 在下放的用户面报文尾部携带数据标签,使得后端服务器无须解析信令面数据和对用户面数据进行关联溯源,减少后端服务器对资源的需求;
2) 单台移动互联网采集器可以同时处理多家运营商数据,报文处理过程互不影响,并将不同运营商的数据按照各自的输出组独立下放,互不干扰,从而大幅节省用户的设备投资;
3) 交换卡采用FPGA+NPU的架构,在完成数据交换的同时完成信令的处理与关联,无须单独的信令解析板,进一步降低设备成本;
精准和丰富的多级报文下放机制,使得分流器能最大限度的过滤无关流量,准确下放客户关心和需要的数据。
网络分流器 - ?
升级万亿机械加工产业,「智能云科」要做机加工领域的工业互联网平台
思想家
展开
2017年中国机加工市场规模达8万亿元,其中1000家的机床生产企业,80万家机床使用企业。庞大的机加工市场同时存在着很大痛点,高端控制系统被国外垄断、客户分散、订单不稳定、设备闲置率高、同质化竞争利润低、人力成本高等,国内的加工制造业已经在外流,行业急需升级。
智能云科是一家聚焦机加工领域的工业互联网平台公司,由沈阳机床联合神州控股、光大金控于2015年在上海共同投资设立。
工业互联网平台有很多家在做,可以从以下几个关键维度去快速理解智能云科在做的事情。
行业方面,智能云科聚焦在机加工领域。服务对象,核心是上游机床厂商、下游加工厂。服务内容,从设备、生产数据联网,到产能交易、设备运维、租赁、供应链金融、工业APP等产业全生命周期服务。
有了框架,下面来具体看看,智能云科的iSESOL工业互联网平台是怎么做的,如何产生价值。
可以把智能云科的服务粗略分为两个大类:数据采集联网、数据应用。
数据采集联网:不止是采集,还能直接产生客户价值
朱志浩曾带领团队历时7年,于2014年推出了自主研发的机床控制系统i5,并于同年开始销售搭载i5系统的i5智能机床。
“这件事情的意义,类似于将传统手机升级为智能手机,智能机床通过i5系统,可以快速开发上层应用,从而将宝贵的工业机理、经验持续沉淀下来”朱志浩告诉36氪。
此前,机床厂商做的是一次性买卖生意,现在通过智能机床,能持续提供增值服务,例如零部件的故障预测,帮助客户及时更换,避免生产故障。这样,设备厂商能够从设备使用全周期的角度做这门生意,提高附加值,促使不断提高产品、服务质量,产生良性循环。
更进一步,朱志浩希望能把此项能力开放给市面上更多设备制造厂商。2017年,团队将i5机床控制系统进行独立封装,推出i5OS。可以将i5理解成苹果手机专属的iOS系统,而i5OS则是面向所有设备厂商的Android系统。
智能云科的数据采集联网业务,对于i5智能机床,或者搭载i5OS的设备,可以通过标准接口协议快速获取丰富的加工数据,对于其他机床,智能云科提供iSESOL BOX产品,进行数据采集和联网。
与市面大多数据采集联网设备不同,iSESOL BOX自带操作系统和边缘计算能力,可以直接支持APP应用,如耗电优化、刀具切削优化、温度补偿等。客户付出了连接成本,可以直接获得相应价值,不是为了连接而连接,从而增强客户买单动力。
以上说的是设备层面的数据采集和联网问题,而对于设备的使用方加工厂,智能云科提供iSESOL WIS产品帮助中小微加工厂完成企业信息化。
iSESOL WIS可以理解为轻量化的云MES系统,甚至不需要接入数据采集硬件,直接通过移动设备录入信息方式,将生产过程和结果信息化、可视化。
“工厂老板最关心的是生产情况如何,哪些订单要交货,已经完成了多少,是否有风险。WIS系统不做很复杂的东西,就聚焦在客户最核心的痛点,让他们用得起。”朱志浩告诉36氪。
总结来看,智能云科通过i5 OS、iSESOL BOX、iSESOL WIS产品,将设备和生产数据采集联网,并在连接的同时,直接产生了客户价值。
产业生态应用:基于真实数据,提供精准服务
有了数据,联了网,这只是开始。
智能云科提供了工业APP、产能交易、设备运维、租赁、供应链金融等一系列产业生态应用服务。
工业APP今年很火热,在朱志浩看来,工业互联网平台单纯的汇聚APP没有意义,一定要有承载体。对智能云科来说,承载体就是i5 OS和iSESOL BOX产品,能够与底层制造装备紧密对接,向上为APP提供开发平台。设备商、工厂、研究机构,都可以将自己对于工业机理的理解,以APP的方式沉淀下来,借助平台轻量化、低成本的推广到机加工行业,获取回报。
基于工厂真实透明的生产数据,可以形成较精准的工厂画像,包括每家工厂擅长加工哪些东西,产能情况,需要哪些工业品,经营状况等。智能云科可以更精准的对接订单加工方和需求方,对接工业品的供应方和购买方,对接金融机构和中小微加工厂等。
对于设备厂商来说,基于设备数据,可以进行远程运维、分时租赁等服务,降本增效,创新商业模式。
行业落地和挑战
智能云科的整套服务覆盖面很广,要怎么逐步实现呢?
朱志浩告诉36氪,智能云科从2015年成立,先用了3年时间,把核心产品和整套商业模式架构搭建起来,并通过i5数控机床进行了内部试验验证。当前阶段以及2019年要重点实现社会化落地,先以iSESOL BOX和iSESOL WIS为核心业务,把数据问题解决,再不断延伸产业生态服务。
官方信息显示,截至2018年11月,iSESOL服务范围已涵盖26省、161市,服务企业客户3000余家,已连接智能设备22000多台,累计服务机时5000多千时,覆盖汽车刹车盘、铝雕、消费电子、珠宝等行业。
36氪还了解到,智能云科目前正在准备A轮融资,总金额在亿元以上。
目前,国内已有数十家工业互联网平台公司,包括树根互联、徐工信息、海尔、富士康、智能云科等工业背景公司,浪潮、运营商等ICT巨头,阿里等互联网巨头,用友等IT公司,以及众多科技创业公司等。
智能云科的特点是基于深厚的机加工装备背景,聚焦机加工垂直领域。相比于通用平台,能从机床内部机理入手,更深入的挖掘数据价值。同时具备机加工行业较广泛的客户基础、市场基础(已销售3万台i5智能机床)。
当然,智能云科也面临着很多挑战,包括其i5 OS以及iSESOL BOX能多快多广的覆盖到行业客户,实现工业互联网平台的构建。以及其他设备厂商的接受意愿,是否有竞争顾虑,是否能接受智能机床的新模式等。
——————
我是36氪记者陈绍元,关注物联网、AI、科技,交流或寻求报道(不收费)加微信:963757163,请注明公司、职位、姓名,否则不加。
- ?
仓储管理设备——数据采集器
微风
展开
数据采集器是一种常见的仓储管理设备,相信很多仓库管理人员或快递员都有接触过,随着物联网科技的进步,仓储信息化数据管理不仅错综复杂、而且数据非常庞大,传统人工录入管理数据不仅效率低下,数据的准确性和时效性都不能得到实时保证,因此使用条码数据化管理就显得非常有必要了。
那么企业仓储管理使用移动数据采集器有啥好处呢?首先工作效率的提高,在仓库管理中应用条码技术,实现数据的自动化采集,去掉了手工书写单据和送到机房输入的步骤,能大大提高工作效率。其次降低了仓储工作人员的工作强度,将单据所需的大量纸张文字信息转换成电子数据,简化了日后的查询步骤,工作人员不用再手工翻阅查找各种登记册和单据本,只需输入查询条件,计算机在很短的时间内就会查到所需记录,并将内容显示在屏幕上,大大加快了查询速度。提高生产数据统计的速度和准确性,减轻汇总统计人员的工作难度。
手工盘点与数据采集器盘点比较:
(1)数据的准确性比较
手工输入经常会产生抄写错误和键入错误,产生很多无效劳动和重复工作,导致仓库盘点信息不准确,使企业承担附加的库存量。而利用盘点机扫描服装的商品条码即可完成盘点工作,大大降低了盘点出错的概率,确保得到精准的数据。
(2)盘点周期的比较
一张单据从填写、收集到键盘输入,需要一天或更长的时间。这使得生产调度员只能根据前几天甚至一周前的库存信息,为用户定下交货日期。而使用数据采集器进行仓库库存盘点,可以使管理人员快速高效地进行盘点,原本手工盘点几天的工作量,用采集器往往数小时就能完成。
(3)数据的时效性比较
运用人工的计算方法需要先根据产品的包装清单逐个列出计算,当要计算多种产品,中间又嵌套半成品时将是件非常繁琐的事,并且很难做到准确、及时的核算,并还要核对库存最后才能得出库存报表。而使用盘点机进行仓库库存盘点,将现场采集的数据上传到仓库管理系统中,自动更新系统中的数据。同时也可以将系统中更新已后的数据下载到手持终端中,以便在现场进行查询和调用。
- ?
携程用户数据采集与分析系统
忘了爱
展开
一、携程实时用户数据采集系统设计实践
随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。
我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。
1、技术选型和设计方案:
一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:
图1、数据平台处理流程
其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。
为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:
图2(数据采集分析平台系统架构)
其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。
(1)基于NIO的Netty网络框架方案
要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。
图3(Netty框架内部组件逻辑结构)
Netty的优点有:
a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。
b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。
c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。
d、易用性,API使用简单。
e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。
Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:
图4(Netty三层网络逻辑架构)
第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。
第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。
第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。
我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。
在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。
在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:
a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。
b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。
c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。
在数据序列化方面,影响序列化性能的主要因素有:
a、序列化后的码流大小(网络带宽占用)。
b、序列化和反序列化操作的性能(CPU资源占用)。
c、并发调用时的性能表现:稳定性、线性增长等。
Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。
通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。
》》点击阅读全文
- ?
移动数据终端不知道怎么选?不妨先看看这七点!
醉阳
展开
移动数据终端,又称为智能移动数据采集终端、手持终端、PDA,是指具有操作系统、内存、CPU、显卡、屏幕、键盘以及具有数据传输处理能力,带有电池、可移动使用携带的数据处理终端。
移动数据终端移动数据终端在高速发展的现代社会应用范围非常广泛,怎样更好的选择移动数据终端,如何去比较不同移动数据终端产品之间的优劣,一直是令用户困扰的问题。那么我们今天就从行业应用、操作系统、屏幕分辨率、防护等级、内存容量、续航能力、接口要求等方面进行分析讲解。
一、应用领域
移动数据终端的应用领域十分广泛,用户可根据自身不同的使用情况,选择不同的移动数据终端。以仓库为例,若用在大型立体式仓库,物品的存放位置较高,离操作人员较远,就应选择扫描景深大,读取距离远且首读率高的移动数据终端。对于中小型仓库的使用者,可选择功能齐备、便于操作的移动数据终端即可。
二、操作系统
操作系统有安卓、Windows CE。不同的操作系统的选择会有不同的操作体验。不过目前国内而言,普遍使用的是安卓系统。
三、屏幕分辨率
较高的分辨率可以更好地支持软件,显示操作界面,提升用户体验度。适宜的亮度和对比度对操作人员的视力也具有保护作用。
四、防护等级
较高的防护等级能够保证移动数据终端在恶劣的行业环境中稳定运行,保证工作效率。比如东集的移动数据终端,IP67防护等级,防尘防水防摔。
移动数据终端五、内存容量
移动数据终端的内存容量决定数据容量,其内存容量要与CPU处理速度相对应。如果采用低性能CPU的移动数据终端,盲目提高其内存容量,会增加用户使用时的处理、等待时间。
六、续航能力
电池容量越大,整机功耗越低,使用时间就越长。比如东集的移动数据终端,5200mAh超大容量锂离子智能电池,12小时续航。
七、接口要求
用户在选择时要了解清楚操作环境、接口方式等情况,选择适当的移动数据终端,以适应不同的操作环境和接口。
- ?
移动数据采集器PDA在商品流通中所起到的作用
风雅颂
展开
移动数据采集器—PDA将条码扫描引擎,RFID技术与 数据终端一体化,带有电池可离线操作的终端电脑设备。具备实时采集、自动存储、即时显示、即时反馈、自动处理、自动传输功能。为现场数据的真实性、有效性、实时性、可用性提供了保证。适于手持进行扫描。对商品条码的扫描具有快速、准确、易于操作等特点,那么它是如何在商品流通中进行应用的呢?
移动数据采集器PDA于商品流通中的应用方案
1、商品的入库验收
根据订货合同(或订货单)将订货数据传送给PDA数据采集器,没有原包装商品条码的商品准备好内部条码,货到后先将内部条码标贴到没有原条码的相应商品包装上,用数据采集器扫描一种商品的条码后,PDA数据采集器的显示屏上可以自动显示出该商品应到货的数量,经核对无误后可直接确认,否则用键盘输入实际到货数量。
2、到货确认
应用PDA数据采集器可以方便地进行到货确认处理。申请补货的商品到货后,用数据采集器进行每种商品条码的读入并输入到货数量,将本次到货数据传入计算机系统后,按补货单确认该批到货商品。
3、商品的出库发货
根据各分店的补货申请,由计算机系统对照库存相应商品数量,制定出各分店的补货指示书,将需补货的商品集中后,使用已存储好该批出库数据的手持终端,扫描商品的条码和确认出库的数量,完成后将PDA数据采集器数据传送至计算机系统。
4、库存盘点
使用数据采集器依次扫描仓库货架上的商品条码,并输入实际库存数量,操作完成后将实际库存数传送至计算机系统,由计算机系统进行处理,做出各种库存损益报告和分析报告。
5、商品卖场中的应用
商品卖场用来完成商品的补货、到货、销售、盘点等处理,对原包装没有通用商品条码的商品须标贴自制的内部条码。
6、自动补充订货
用数据采集器进行自动补货处理。首先将商品货架上的商品条码读入,然后根据商品在架数量用键盘再输入补货数;将取得的数据通过通讯座传送给计算机主机。可以防止商品编码的输入错误,通过网络进行补货可以发挥系统的效率,缩短从要求补货到到货的时间。
7、盘点管理
用数据采集器将在架的所有商品的条码和数量读人,然后传送到计算机系统中,与计算机中的在架商品进行比较,就可以进行盘点处理,并由计算机做出损益报告。
PDA协助商品的仓储及配送中心的入出库。库存、配送等管理中、以及商品卖场的管理环节中引入条码,能够使管理工作节省人力。减少差错、提高工作效率,并保障商品流转的顺利进行。
厦门远景达作为移动数据采集器供应商,自2001年以来相继与TSC、Newland、Poslab、Zebra、Honeywell、COGNEX、DATALOGIC、TEC、Postek等国际知名企业建立战略合作关系,提供的PDA质量和售后服务有保证,如果您有需要欢迎前来咨询。
- ?
产品信息 | 移动统计无埋点技术,让数据采集再无障碍
柳晓凡
展开
手动埋点一直是广大数据工作者们的烦恼之一。也许,您会对下边的对话感到熟悉: 产品:“我们想看看用户在这个页面的访问数据,研发同学千万记得埋点哟” 研发:“埋哪里?埋哪里?没找到呢?(疑惑脸)” 运营:“我们想看看这个button的点击量,亲爱的研发哥哥帮我埋个点吧!” 研发:“新版已经上线啦,再埋点的话需要重新发版,很麻烦的,等下个月吧(郁闷脸)。。。” 产品:”呼叫研发哥哥,麻烦帮我看看这个指标怎么没有统计上呢?“ 研发:“咦?怎么会没数据呢? 完了,发版的时候忘埋点了(惊恐脸)。。。”
今天起,百度移动统计推出无埋点功能,让这些疑惑、郁闷、惊恐的日常成为过去。只需激活无需埋点,彻底告别繁琐埋点工作。
百度移动统计无埋点SDK是建立在现有的手动埋点SDK上的功能升级。智能结合手动埋点习惯,避免繁琐接入过程。通过一行代码激活SDK即可采集准确、丰富的用户数据。几乎省去工程师90%工作量,高效完成数据采集操作。
无埋点可以帮助您: 1、自动收集基本的页面和事件信息,线上简单设置与操控,无需再耗费大量的时间和精力对需要统计的页面和事件挨个单独埋点。 2、自动全量收集数据,无需再次发版。不再为少埋点、漏埋点而发愁。 无埋点SDK的解决方案就在眼前,你还在等什么呢? 现在报名体验(只能新用户申请体验哦)!欢迎发送邮件到apptongji@baidu,机会难得,先到先得!申请时请注明您的姓名、公司职务、app名称、手机等联系方式,对无埋点有任何疑问也欢迎来信咨询,感谢您对百度移动统计的支持!
移动数据采集
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并