中企动力 > 商学院 > 用户数据采集
  • ?

    小程序触手可及、用完即走,用户数据都归腾讯了吗?

    晓曼

    展开

    2017年小程序披露的投资约7亿元,而截止今年4月份,投资金额差不多是70亿元人民币。资本繁荣是对微信生态圈流量的认可,但对于小程序的用户流量,真正的从业者们却是有苦说不出。

    根据微信小程序数据披露,截至2018年1月份,上线的小程序已经达到58万个。 到现在,怕是破百万了吧?

    手机APP刚开始流行的时候,用户都是拼命安装体验,而到现在,用户都是拼命删减,只留下各品类里最喜欢的1-2个产品。APP买量的成本,也从最早的几分钱一个用户到现在动辄几十甚至几百元。

    小程序虽然在微信生态圈里有着天然流量优势,但随着小程序的爆发式增长,后续流量的竞争怕是比APP还要激烈。而且小程序的几个天然特性,决定了用户的留存与促活比APP还要难以运营。

    小程序拉新的5种方式:

    1. 小程序二维码:朋友圈分享、小程序互推、线下推广、微信群推广

    2. 搜索:类似于ASO与SEO

    3. 转发:可以转发给朋友或微信群,无法直接分享到朋友圈

    4. 公众号推荐:利用大流量公众号导流

    5. 小程序盒子:最常见的是集合了各种小游戏的游戏盒子

    小程序留存的4大难点:

    1. 无需安装、用完即走:进入的门槛低,流失的门槛就更低

    2. 无需注册、无需登录:如果用户没有第一时间通过手机号注册,留下的账号信息就只有微信id

    3. 无关注功能、不能推送消息:无法联系曝光、无法促进活跃

    4. 不能内嵌外链、不能直接分享到朋友圈:给二次传播、用户流量应用设置了障碍

    在这种情况下,没有好的运营策略,即使是迅速爆火的谷歌猜画小歌,热度散去后用户也会断崖式流失。

    那么如何利用好小程序的流量红利呢?

    首先,积累全面的用户数据。包括用户账号数据、属性数据、行为数据,以将来之不易的“微信访客”真正的转化为企业用户。

    其次,进行深度的用户分析。包括多维用户分群,灵活的用户事件、留存、转化、行为序列分析,寻找用户规律、产品障碍,及时调整运营策略、完善产品功能。

    最后,测试有效的运营方式。有了用户数据并进行过多维、灵活、深度的探究性分析之后,针对发现的规律,制定多种运营方式,并在用户中进行测试,寻找到针对不同用户类型的最有效运营方式。

    我们都知道小程序的用户都在微信生态圈内,微信也针对小程序推出了统一的分析后台。也正是因为这样,用户数据无法全面、实时的保存到企业自己的服务器,对数据的分析维度,也无法支撑精细运营分析,尤其是游戏类、电商类等需要对用户行为进行深度下钻分析的产品。

    那么如何将小程序用户数据也实现私有化存储,并且像针对APP、网站产品一样,实现对用户的多维分群与深度行为分析呢?

    数数科技近期推出了针对微信小程序/小游戏的数据分析解决方案,如下:

    小程序/小游戏数据分析解决方案

    1. 全端数据采集:数数科技正式推出了微信小程序/小游戏的数据采集SDK,至此可真正实现小程序、APP、Web、服务器的全端数据采集,为企业客户构建统一用户数据仓库,积累用户数据资产;

    2. 私有化部署:数数科技TA用户行为分析系统,可私有化部署,并支持二次开发,可成为企业用户数据资产管理的核心系统。流式计算框架也可保障百亿级数据的秒级分析;

    3. 多维实时分析:可在ThinkingAnalytics系统内灵活实现用户分群、元数据管理、用户属性与事件自定义管理,系统同时内置了事件、留存、漏斗、行为序列、行为路径等多种分析模型,上手即用,可成为运营、产品、数据分析团队的高效工具。

    你是否也想保护用户数据资产?

    也想打造统一用户数据仓库?

    也想提早掌握小程序精细运营方法?

  • ?

    线下大数据智能采集投放平台

    苻剑通

    展开

    智能硬件结合大数据优势,全方位挖掘用户线下、线上行为,精准定义目标客群特征、消费偏好、地域分布,为零售客户提供选址招商、运营管理、客群洞察、推广营销、实现 营销的“点对点”高效精准的传播,是新一代人工智能思维下的营销新武器。

    店内优化

    客流实时监测

    顾客质量和转化率

    顾客运动轨迹热点动图

    店内商品试用、转化率

    新客招募

    厘米级精准定位新客,信息采集分析

    对接各个广告平台,精准投放

    广告效果评估

    提高活动效果

    展示真实人流,轨迹动图,客观评估活动效果

    场景式营销,广告实时送达

    用户画像

    了解品牌受众,帮助品牌定位

    进店顾客人群画像采集

    人员、物品管理

    优化员工管理系统,监测到岗及工作时间

    贵重物品定位,防盗防损

    优化库存管理

    探针

    集探针,iBeacon,商品触碰探测为一体

    wifi与gprs两种上报信息方式

    搭载gps模块,采集地理位置信息

    出色的定位技术

    手机号与mac地址绑定方案

    平台化运作,提供丰富的上层接口给集成商

    解决方案

    购买地址:https://detail.1688/offer/551150997804.html?spm=b26110380.sw1688.mof001.1.b4WnET

    或阿里巴巴搜索:58数云、潜客宝

  • ?

    「用户行为分析」产品页面埋点数据采集

    弗恩

    展开

    写在前面

    在互联网企业的日常运营工作,采集用户数据分析已经是作为运营岗必备的技能。页面埋点采集用户行为数据也是最常用的手段。埋点采集一般会通过事件埋点采集完成,事件埋点采集即通过在产品页面加入一段代码,来记录用户的使用行为数据并返回给服务端进行可视化记录。以此来方便企业运营人员做用户行为数据分析、优化产品和精准定位营销方式。

    常见埋点方式

    页面整体埋点采集(页面跳转采集);控件埋点采集(包括:Button、文本框、downMenu等);在产品研发上线运营过程中,页面埋点、控件埋点,用户的行为数据都会先在本地缓存并回传到服务端,前端埋点的方式会受到网络状态、缓存清理和回传数据丢包等客观因素的影响,使采集的数据无法达到精准。因此所得到的数据在分析后对产品界面、用户偏好等领域的影响不会很好。

    如果企业产品对采集数据的要求较高时,可采用服务端直接记录(比如服务器Session池);

    数据采集常见的日志格式

    通常记录用户行为的基本要素采用4W+1H的方式,即人物(Who)、时间(When)、地点(Where)、行为(What)、方式(How)。用户在什么时间什么地点使用什么方式产生了什么样的行为来记录。

    人物(Who):参与事件的用户,一般使用开发过程中对用户定义的唯一ID,包含用户的设备ID、UserID、等非敏感信息。对用户的姓名、手机号、身份证号码等敏感信息不建议直接采集,如必须采集可采用脱敏的方式进行。

    时间(When):记录行为发生的时间,常见标准的YYYY-MM-DD HH-MM-SS的时间戳以外还可以使用服务端的Session或登录序号等。记录值将用于区分用户的登陆次数,界定活跃次数和行为归属。

    地点(Where):记录行为发生的地点,包括用户的IP地址、GPS位置、场景或来源(WEB/微信/APP)。

    行为(What):事件的内容,即发生的细节,可以采用记录事件的属性/参数生成记录值,常见格式为Key-Value模式。

    方式(How):事件所处环境和发生方式,常见的记录值有:网络环境(WIFI/4G)、系统版本(iOS 12.0.1/Android 8.0)、设备型号(HUAWEI/XIAOMI/Apple)。

    埋点数据的应用

    个性化推荐

    根据数据分析用户近期行为,针对用户个体进行专属页面布局、商品和活动推荐。笔者近期在淘宝发现,该方式已被深度应用。

    以上就是在产品运营中的产品页面埋点数据采集,相关文章后持续更新,请各位看官持续支持。

  • ?

    实时数据采集 将平台资源匹配

    宛丝

    展开

    匹配算法实现,通过将用户属性、用户学习状态属性、用户操作行为统计属性与资源属性进行匹配,数据容量大,遥测距离远,人机界面友好,可靠性高的优点,可广泛用于学校和社区小区域范围环境服务。

    也适合于气象、海洋、环境、机场、港口、工及等领域使用.实时数据采集与上传该模块主要功能是通过无线方式获取环境观测站采集的实时数据并显示.数据采集的基本算法如下:首先判断是否到发送数据时间,若到了执行数据发送命令。

    为了方便学习者查找资源以及系统推送资源,须对学习者和资源的属性进行标记,即创建属性元数据.本研究采用标签技术分别建立学习者和资源的属性元数据.学习者的属性标签主要来自于用户注册时的信息(用户属性)、学习者的学习状态属性以及学习者系统操作行为统计属性(对上传、下载、浏览、评论等操作的统计)。

    资源的属性标签主要来自于资源提供者根据学科和关键字分类的标签以及资源使用者对资源的评价、标记等.根据研究性学习的主题、用户学习进度,系统可以将用户可能感兴趣,其他用户感兴趣或评分高、浏览次数多,相同领域的最优资源或相似领域的最佳资源推送给用户,系统根据学习者的学习主题,将平台中评价最高的相关资源、教师指定的资源和拓展的相关资源进行匹配,

  • ?

    APP数据采集是怎么实现的

    凌曼荷

    展开

    最近半年,我们八爪鱼陆续接到好几个APP数据采集的项目需求,我在群里面,偶尔也看到有些用户在问,有没有APP数据采集的工具。鉴于我们做过的几个APP数据采集项目的经验,我可以告诉大家,现在APP数据采集,市面上还没有通用的工具。我们八爪鱼内部是有一套工具,但由于使用的难度较高,需要编写脚本,所以不对普通用户公开,我们仅接受项目定制。

    虽然不对外公开,但并不妨碍我们将技术分享出来,APP数据采集,一般走以下两种方式:

    1.两种思路

    1. 抓包

    2. HOOK

    2.抓包

    有代码经验或APP开发的同学都很容易理解,其实很多APP,走的都是webservice通讯协议的方式,并且由于是公开数据,而且大部分是无加密的。所以只要对网络端口进行监测,对APP进行模拟操作,即可知道APP里面的数据是如何获取的。

    我们只需要写代码模拟请求,无论POST还是GET,即可得到该请求所返回的信息。再通过对返回的信息结构化解析,即可得到我们想要的数据。

    public static void main(String[] args) {

    Spider.create(new GithubRepoPageProcessor())

    //从https://github/****开始抓

    .addUrl("https://github/****")

    //设置Scheduler,使用Redis来管理URL队列

    .setScheduler(new RedisScheduler("localhost"))

    //设置Pipeline,将结果以json方式保存到文件

    .addPipeline(new JsonFilePipeline("D:\\data\\webmagic"))

    //开启5个线程同时执行

    .thread(5)

    //启动爬虫

    .run();

    }

    以模拟采集“meizu”应用市场为例

    应用市场产品

    抓包返回参数

    整个抓包过程

    3.HOOK技术

    HOOK技术是一种走操作系统内核的技术,由于安卓系统是开源的,所以可以借助一些框架修改内核,从而实现你要的功能。HOOK的形式,我们走的是Xposed框架。Xposed是一款可以在不修改任何其他开发者开发的应用(包括系统服务)的情况下,改变程序运行的一个开源框架服务。基于它可以制作出许多功能强大的模块,以此来达到应用程序按照你的意愿运行的目的。

    如果把安卓手机看做一座城堡,那Xposed可以让你拥有一个上帝视角,城里的运作细节尽收你眼底,还能让你插一手改变城堡的运作规律。

    什么意思呢?简单的说就是你可以通过他,自动化的控制你的APP。如果将我们的APP开在模拟器上,我们可以通过编码,通过他告诉APP这一步干什么,下一步干什么。你把它理解成类似游戏打怪外挂就可以了。

    而他每走一步,APP与服务端交互的数据,均可获取下来。这种方式广泛用于一些成熟的APP。比如某信采集。

    public class HookActivity implements IXposedHookLoadPackage {

    @Override

    public void handleLoadPackage(LoadPackageParam lpparam) throws Throwable {

    final String packageName = lpparam.packageName;

    XposedBridge.log("--------------------: " + packageName);

    try {

    XposedBridge.hookAllMethods

    (Activity.class, "onCreate", new XC_MethodHook() {

    @Override

    protected void afterHookedMethod(MethodHookParam param)

    throws Throwable {

    XposedBridge.log("=== Activity onCreate: " + param.thisObject);

    }

    });

    } catch (Throwable error) {

    XposedBridge.log("xxxxxxxxxxxx: " + error);

    }

    }

    }

    其实我们八爪鱼曾经也想开发一款通用的APP数据采集工具,并且两年前在这块投入研究了小半年,我们做出了一款APP采集脚本编辑工具,可以让一款APP的数据采集项目缩减到3-5天即可开发完成。但我们认为,这个工具需要编写脚本一般用户是比较难上手的,所以仅作为内部项目使用。

    以HOOK某APP为例:

    HOOK指令打开某

    4.这些年走过的坑

    聊完APP采集的思路,我们跟大家分享一些遇过的坑吧,让大家乐一乐

    坑一:签名算法

    以某信的文章列表页及某信息页为例,对其http访问进行抓包,会发现其url的一个核心参数是我们无法知道如何生成的,这就导致,我们不可能直接用该url进行信息爬取;签名算法如果无法破解,HTTP这条路就是死路了。

    坑二:http爬取回来的信息和页面显示不一致

    以某信的某信息页为例,对比直接访问某信页面及http爬取的信息,可明显发现http爬取到的信息较少。造成得两种方式都用,才能既照顾速度又照顾完整性。

    坑三:模拟器中的坑

    APP自动识别你的运行环境进行屏蔽,最厉害的还是某信,连你是用模拟器打开还是真机打开,是什么内核的,全部进行限制。曾经见过牛人,找某手机厂商专门定做真机来配合。

    坑四:帐号的坑

    这个坑就有点大了,要找号、养号,都不是件容易的事情,更惨的是封号,真真让你一夜回到解放前。

  • ?

    90天150亿数据采集,得出互联网主要用户已不再是人类,而是机器

    惜蕊

    展开

    人们都知道人口学的马尔萨斯假设——粮食生产呈算数增长,人口呈几何数增长。在单位亩产不可能有大突破的状况下,以粮食为主的生产资料只能依靠土地扩张。工业革命、农业科技和人口管理缓解了马尔萨斯问题。今天这个类似的危机又在虚拟世界里出现了。

    大数据世界的马尔萨斯定律可以这样描述:人口以算数极数增长,数据以几何级数增长。数据量以线性规律增加,计算量以非线性规律增长。

    世界所产生的数据始终在高速增长。这是因为数据赋能使所有人、所有人人类活动都在产生数据,只要想记录,就有无数的数据可以“无中生有”。

    很多电商网站早期只追求抢地盘、抢用户,重运营、清数据,并不在意数据布局。举个例子,用户如果只关闭了一个订单,过去电商系统并不记录这个行为,只会直接删除这个下单数据。但是后来发现记录和分析用户的失败交易数据也是有商业价值的,可以用于统计用户信用、喜好等,于是决定记录下来。每个行为都有被记录,数据量就开始成倍增长。

    数据的存储一直是一个大问题。根据市场研究公司Forrester估计,每部智能手机产生的数据平均可达1G。全球智能手机用户数量保守估计达20多亿。每天可产生20多亿G数据。如果用普通的1TB硬盘存储,每天所需的硬盘数量就达200多万块,1年就需要近8亿块硬盘。这已经远远超过全球硬盘生产商的产能。

    更恐怖的是,产生数据的主要还不是人类活动,incapsula在全世界2万个每天至少有10个访问量的网站,统计了90天150亿的访问数据后得出了这样一个数据:56%的网页浏览量都是爬虫机器人贡献。话句话说主要的互联网用户已经不是人类。大部分点击数据都是机器程序产生的。

    非人类访问中,近一半来自善意机器人,如搜索引擎的内容爬虫,它们能够对网页建立索引,方便人们快速查找到对应的网页内容。百度和谷歌就是使用这种方法整理全世界的信息。另外超过一半的浏览量就来自恶意机器人,比如盗取内容的爬虫、各种黑客工具、垃圾邮件等,而且比例还在不断增加。这就是互联网另一面的真实写照。这只是网页浏览状况,在整个人类社会,随着信息化和物联网的快速发展,连接入网的所有硬件都在时刻产生数据,互相通信。发电机组上的监测芯片时刻侦测运行状况并把数据发回服务器。

    遍布城市的摄像头把监控数据上传指挥中心,家里的智能电视,冰箱等都在采集和上传数据,即使全人类都沉沉睡去,世界也依然在数据海洋中律动。

  • ?

    程序员道德准则将出炉 但用户数据采集不能停止

    家凌青

    展开

      【PConline资讯】2月11日消息 科技行业正进行自我反思。就连扎克伯格和库克都在公开谈论软件和算法在我们生活中所带来的负面影响。虽然已经有越来越多的人向一些业内人士游说,想要阻止他们或试图制定任何行业规则,但这些业内人士正制定自我管理的准则。有一个想法值得人们探讨:掌控程序的程序员和数据科学家是否应该立下一个数字的希波克拉底誓言,作为行业道德的要求和行为准则?  

    图:希波克拉底誓言

      上个月,微软发布了一份关于人工智能对社会的影响的报告。该报告认为,约束编程人员,像医生们一样也立下“不伤害他人”的承诺,“这是有意义的”。周二在旧金山,数十名来自科技公司、政府和非营利组织的数据科学家开始为他们的职业起草一份道德规范。

      这次会议的普遍感觉是,是时候让那些在统计分析方面有才能的人意识到他们自身的力量,并将其用于实现更大的利益。曾在奥巴马时期任美国首席数据科学家的DJ·帕蒂尔告诉记者:“我们必须让从事技术工作的人们说‘等一下,这是不对的。'”

      帕蒂尔启动了这个活动,称之为“数据交换”(Data For Good Exchange)。与会人士包括微软、拼趣(Pinterest)和谷歌的员工。

      帕蒂尔设想的是让被道德准则约束的数据科学家们来反对企业和机构的安排,以防止有违行业道德准则的情况出现。这一愿景吸引了一些专门从事数据分析的人。来自企业软件初创公司“数据科学”的戴夫·古德史密斯周二写到:“作为一门学科,我们正处于起步阶段,我们比任何人都更能通过人工智能领域的机遇和挑战来引导社会。”

      其他人则有些犹疑。市场营销公司Valassis的高级数据科学家Schaun Wheeler通过Slack和一个实时视频流也观看了周二的会议。这一会议开始之前他就有所怀疑,完会后疑虑更甚。他说,这份草案看起来像是一份没有人会反对的一般性原则的列表,而且正应用于一个缺乏相关权力机构或法规来规定实施这些原则的行业。尽管为数据科学家提供的正式培训项目越来越多,但包括Wheeler在内的许多人都是自学成才。

      周二的讨论结果便是一份原则清单,且未来几周内将对这些原则进行评估和发布,以获得更广泛的反馈。其中包括“肯定会有偏见。衡量它。为它做出计划”,“尊重人类尊严”和“运用道德想象力。” 该项目的组织者希望能看到10万人签署最终版本的誓言。

      Wheeler说:“科技行业最近受到了批评,我认为这是理所当然的,因为它天真地认为它可以修复这个世界。你若是认为可以通过某种道德准则来解决整个复杂的问题,比如数据泄露,这就是狂妄自大。”

      周二会议的一个辩论主题是,一个不具约束力的自愿准则是否真的能保护那些敢于在工作中提出道德问题的数据科学家。另一个主题则是,这是否会产生很大的影响。

      美国电话电报公司的数据科学家里希拉·贾拉罕说,他对于起草一份道德承诺的所作出的种种努力持支持的态度。他描述了在他和一个同事拒绝加入一个有他们认为没有行业道德的公司参与的项目之后,他们的愿望得到了尊重。但是调换了一些工作人员之后,项目还是继续进行。

      现有证据表明,科技公司通常只有在意识到道德问题会对其资产负债表构成直接威胁的时候,才会将其放在心上。扎克伯格可能对其公司控制信息传播的方面表现出了悔意,但这也是因为Facebook遭受了政治压力,因其在俄罗斯干涉2016年美国大选中所扮演的角色。

      通过为他人提供平台而赚钱的科技公司可以有更多的理由不去规范道德。任何在搭建自己的平台过程中能吓跑客户的东西都是有风险的。

      微软关于人工智能和社会的宣言讨论了程序员应当作出的“希波克拉底誓言 ” ,以及对人工智能新用途的伦理审查过程。但微软总裁布拉德·史密斯表示,微软不会指望用微软的云服务构建人工智能系统的用户也一定要达到同样的道德标准。他说:“这是一个非常重要的问题,我们自己都还没有回答出来。我们创造了微软文字处理软件,并且知道人们可以用它来写好的东西或者是可怕的内容。”

      隐私权激进分子阿拉尔·巴尔干认为,本周起草的这一份道德规范实际上 可能会加剧技术所造成的社会危害。 他担心,公司会把它作为一种美德的标志,但他们还是会像从前一样继续经营。他说:“ 我们应该探索的是,我们如何才能阻止这种因利益而进行的大规模的人类数据采集工作。 ”他指出,欧盟的《全面数据保护条例》(General Data Protection Regulation)将于今年生效,这是防止算法的坏处的更好模式。  

      帕蒂尔曾经是LinkedIn的首席科学家,但他有点像巴尔干,对科技公司是否有能力仔细思考自己的个人数据驱动产品的影响持怀疑态度。他说:“我不认为我们现在的社会可以依赖于这一法规,因为我们在社交平台看到的和科技公司的行为都是由利润驱动的。”

      从长远来看,帕蒂尔说,他对道德规范草案的希望之一是,它有助于激励政策制定者制定更坚定、但也是经过充分考虑的限制标准。他说:“我希望看到,周二的会议能够开始定义真正的行业内政策。”

  • ?

    前嗅:手把手教你数据采集

    杂神

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    携程用户数据采集与分析系统

    深夜

    展开

    一、携程实时用户数据采集系统设计实践

    随着移动互联网的兴起,特别是近年来,智能手机、pad等移动设备凭借便捷、高效的特点风靡全球,同时各类APP的快速发展进一步降低了移动互联网的接入门槛,越来越多的网民开始从传统PC转移至移动终端上。但传统的基于PC网站和访问日志的用户数据采集系统已经无法满足实时分析用户行为、实时统计流量属性和基于位置服务(LBS)等方面的需求。

    我们针对传统用户数据采集系统在实时性、吞吐量、终端覆盖率等方面的不足,分析了在移动互联网流量剧增的背景下,用户数据采集系统的需求,研究在多种访问终端和多种网络类型的场景下,用户数据实时、高效采集的方法,并在此基础上设计和实现实时、有序和健壮的用户数据采集系统。此系统基于Java NIO网络通信框架(Netty)和分布式消息队列(Kafka)存储框架实现,其具有实时性、高吞吐、通用性好等优点。

    1、技术选型和设计方案:

    一个典型的数据采集分析统计平台,对数据的处理,主要由如下五个步骤组成:

    图1、数据平台处理流程

    其中,数据采集步骤是最核心的问题,数据采集是否丰富、准确和实时,都直接影响整个数据分析平台的应用的效果。本论文关注的步骤主要在数据采集、数据传输和数据建模存储这三部分。

    为满足数据采集服务实时、高效性、高吞吐量和安全性等方面的要求,同时能借鉴互联网大数据行业一些优秀开源的解决方案,所以整个系统都将基于Java技术栈进行设计和实现。整个数据采集分析平台系统架构如下图所示:

    图2(数据采集分析平台系统架构)

    其中整个平台系统主要包括以上五部分:客户端数据采集SDK以Http(s)/Tcp/Udp协议根据不同的网络环境按一定策略将数据发送到Mechanic(UBT-Collector)服务器。服务器对采集的数据进行一系列处理之后将数据异步写入Hermes(Kafka)分布式消息队列系统。为了关联业务服务端用户业务操作埋点、日志,业务服务器需要获取由客户端SDK统一生成的用户标识(C-GUID),然后业务服务器将用户业务操作埋点、日志信息以异步方式写入Hermes(Kafka)队列。最后数据消费分析平台,都从Hermes(Kafka)中消费采集数据,进行数据实时或者离线分析。其中Mechanic(UBT-Collector)系统还包括对采集数据和自身系统的监控,这些监控信息先写入Hbase集群,然后通过Dashboard界面进行实时监控。

    (1)基于NIO的Netty网络框架方案

    要满足前面提到的高吞吐、高并发和多协议支持等方面的要求。我们调研了几种开源异步IO网络服务组件(如Netty、MINI、xSocket),用它们和NginxWeb服务器进行了性能对比,决定采用Netty作为采集服务网络组件。下面对它进行一些概要介绍:Netty是一个高性能、异步事件驱动的NIO框架,它提供了对TCP、UDP和文件传输的支持,Netty的所有IO操作都是异步非阻塞的,通过Future-Listener机制,用户可以方便的主动获取或者通过通知机制获得IO操作结果。

    图3(Netty框架内部组件逻辑结构)

    Netty的优点有:

    a、功能丰富,内置了多种数据编解码功能、支持多种网络协议。

    b、高性能,通过与其它主流NIO网络框架对比,它的综合性能最佳。

    c、可扩展性好,可通过它提供的ChannelHandler组件对网络通信方面进行灵活扩展。

    d、易用性,API使用简单。

    e、经过了许多商业应用的考验,在互联网、网络游戏、大数据、电信软件等众多行业得到成功商用。

    Netty采用了典型的三层网络架构进行设计,逻辑架构图如下:

    图4(Netty三层网络逻辑架构)

    第一层:Reactor通信调度层。该层的主要职责就是监听网络的连接和读写操作,负责将网络层的数据读取到内存缓冲区中,然后触发各种网络事件,例如连接创建、连接激活、读事件、写事件等,将这些事件触发到Pipeline中,再由Pipeline充当的职责链来进行后续的处理。

    第二层:职责链Pipeline层。负责事件在职责链中有序的向前(后)传播,同时负责动态的编排职责链。Pipeline可以选择监听和处理自己关心的事件。

    第三层:业务逻辑处理层,一般可分为两类:a. 纯粹的业务逻辑处理,例如日志、订单处理。b. 应用层协议管理,例如HTTP(S)协议、FTP协议等。

    我们都知道影响网络服务通信性能的主要因素有:网络I/O模型、线程(进程)调度模型和数据序列化方式。

    在网络I/O模型方面,Netty采用基于非阻塞I/O的实现,底层依赖的是JDKNIO框架的Selector。

    在线程调度模型方面,Netty采用Reactor线程模型。常用的Reactor线程模型有三种,分别是:

    a、Reactor单线程模型:Reactor单线程模型,指的是所有的I/O操作都在同一个NIO线程上面完成。对于一些小容量应用场景,可以使用单线程模型。

    b、Reactor多线程模型:Rector多线程模型与单线程模型最大的区别就是有一组NIO线程处理I/O操作。主要用于高并发、大业务量场景。

    c、主从Reactor多线程模型:主从Reactor线程模型的特点是服务端用于接收客户端连接的不再是一个单独的NIO线程,而是一个独立的NIO线程池。利用主从NIO线程模型,可以解决一个服务端监听线程无法有效处理所有客户端连接的性能不足问题。Netty线程模型并非固定不变的,它可以支持三种Reactor线程模型。

    在数据序列化方面,影响序列化性能的主要因素有:

    a、序列化后的码流大小(网络带宽占用)。

    b、序列化和反序列化操作的性能(CPU资源占用)。

    c、并发调用时的性能表现:稳定性、线性增长等。

    Netty默认提供了对GoogleProtobuf二进制序列化框架的支持,但通过扩展Netty的编解码接口,可以实现其它的高性能序列化框架,例如Avro、Thrift的压缩二进制编解码框架。

    通过对Netty网络框架的分析研究以及对比测试(见后面的可行性分析测试报告)可判断,基于Netty的数据采集方案能解决高数据吞吐量和数据实时收集的难点。

    》》点击阅读全文

用户数据采集

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP