中企动力 > 商学院 > 数据采集供应商
  • ?

    数据平台合作引领新潮流

    Yuan

    展开

    “独脚难行,孤掌难鸣”,在当今社会是最好的例证。唯有合作共赢,才能持续发展,大数据领域也不例外。

    继华南城牵手腾讯,银泰拥抱阿里巴巴之后,恒大与阿里巴巴在广州也达成共同“玩足球”的协议。企业们纷纷拥抱大数据,选择与大数据企业合作。

    据相关行业分析师分析,中国大数据技术应用方面将处于国际领先地位。据权威分析机构IDC预测,大数据技术和服务在中国市场的复合年增长率将达到38.7%,增至8.5亿美元。

    引用国家统计局局长马建堂的话来说明未来与数据平台合作的重要性:“大数据的时代正在来临,滚滚的浪潮不可阻挡”世界发达国家纷纷将大数据的利用提高到了战略层面,视之为企业乃至国家的战略资源。

    我们必须要适应这一大趋势,主动引爆大数据的时代,积极应对大数据的机遇和挑战”。在这方面,百度与万科的携手是很好的例子。

    【案例分享】

    百度万科商业地产携手

    2014年6月5日,万科与百度在北京确立了战略合作关系、百度将基于大数据和云计算技术,为万科商业地产提供智能化升级解决方案,这将是大数据在地产行业的首次落地。

    双方联合打造的首个项目“北京昌平的金隅万科广场”有望于今年8月底完成智能化升级,成为万科旗下的首个智能Mall。

    据悉,此次和百度的合作,将为万科的商业系列带来“定位引擎、大数据、营销工具”三类核心技术。

    升级完成后的金隅万科广场将通过手机应用为消费者提供该广场的实时信息,比如周边交通是否拥堵、停车无空位数,以及商场内路线规划和停车场导航等。

    万科更是宣称未来将基于移动互联的大数据挖掘和人工智能算法等技术,将在万科“城市配套服务商”平台上的经济主体消费行为中得到应用,实现良性的“运营商、商户、消费者”生态系统,从而为消费者提供更优质的智能服务。

    大数据时代和互联网思维,正在打乱传统所有模式,各行各业都会产生关联。在这样一个数据称霸的时代,一切都是精准推送,只有拥抱大数据才能及时了解客户最真实的需要。

    在大数据应用和互联网的作用下,除了使企业的合作变得更便捷、更动态外,企业为了弥补自身大数据能力从而充分应用大数据,与互联网企业合作也成为未来发展趋势。

    因此,“数据平台合作”的模式也正在为企业和技术协同合作发展创造了无限可能。

    前嗅大数据——深度大数据专家

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

  • ?

    企业进入大数据信息采集时代

    飞虫

    展开

    做网络营销

    不论是个人还是公司都想要实现产品的渠道拓展和推广宣传

    但绝大多数的企业都不能达成想要的效果

    其实原因有很多

    一、想要做好网络营销

    客户是王道

    没有强大的客户群做后盾

    网络营销的销量不过是空想罢了

    当下客户渠道大多以网络大数据信息采集的方式来获取

    如云速数据挖掘

    通过输入行业关键字

    就能一键采集指定区域的客户信息和联系方式

    省时高效

    二、通过客户信息

    从分考虑分析目标群体的生活轨迹和习惯

    来预测客户下一步的消费行为

    以正确的时间正确的方式传达产品信息

    从而完成营销活动

    三、产品文案的策划一定要以客户需求为重点

    并且简单易懂、快速吸引客户眼球

    才能使转化率达到最佳

  • ?

    大数据采集与加工项目招商

    凌芸遥

    展开

    一、项目名称:贵安新区大数据采集与加工项目

    二、招引方向:大数据采集与加工企业

    三、建设性质:新建

    四、项目现状:

    1、建设条件:

    贵安新区积极推进数据清洗加工基地建设,规范各类数据的采集、清洗、共享、开放、应用、安全等工作,充分利用贝格大数据的引领作用,做好数据加工、清洗、脱敏等大数据加工业务工作,促进数据资源的优化配置和有效利用。同时,贵安新区持续推进数据增值服务产业发展,以大数据“聚通用”为目标,依托贵安数据中心形成联合多行业的数据增值服务体系,实现数据价值提升。

    贵安新区已经与上海贝格计算机数据服务有限公司签署《贵安贝格大数据小镇项目合作投资协议》。双方将合作共建贵安大数据小镇,规划年产值30亿元,力争打造成为中国最大的大数据采集与清洗基地。贵安大数据小镇将以打造数据加工基地、大数据产业园、人才培训、数据出口基地等为主要内容,项目建成投运后3年内,预计将有100家以上大数据相关企业入驻,带动就业1万人。

    2、产业条件:

    贵安新区充分发挥作为全国首个大数据产业集聚区的优势,重点推进知名企业发展,大力挖掘数据价值。目前,数据宝已获得18个国家部委级授权数据加工资质,成功抢占了最重要数据源头,先后接入近万种API接口,整合104家央企、120个国家部委局直属机构、335个地市州盟、前1000家重点国企科研院所资源。贝格大数据与新华社合作,为新华社建设财经信息中心及产品。白山云完成新产品“云聚合”发布工作,2017年产值约6.09亿元,同比增长209%。

    3、市场前景预测:

    未来贵安新区将积极推进数据清洗加工基地建设,规范各类数据的采集、清洗、共享、开放、应用、安全等工作,充分利用贝格大数据的引领作用,做好数据加工、清洗、脱敏等大数据加工业务工作,促进数据资源的优化配置和有效利用。

    4、项目选址及规模:

    项目拟选址于贵安新区花溪大学城双创园大楼内

    五、项目建设内容:招商引进大数据采集与加工企业,完善大数据核心业态。

    六、优惠政策及扶持条件:按照从优不重复的原则享受国家级、省级、贵安新区的优惠政策,包含《关于加大总部经济财政扶持的意见》、《贵安新区直管区企业入驻标准厂房优惠政策》、《贵阳?贵安新区大数据集聚区创建三年行动计划》、《贵安新区关于鼓励入驻已建数据中心实施办法》等。还可在产业、人才、科技、教育及生产生活配套等方面定制个性化政策,一事一议,在手续办理、产业扶持等方面提供优质服务。

    招商联系电话:400-788-9798 18026938795

  • ?

    六大主流大数据采集平台架构分析

    滕姒

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    前嗅:手把手教你数据采集

    景骁

    展开

    ForeSpider 前嗅:手把手教你数据采集

    ForeSpider是一款非常好用的数据采集软件,因为属于专业性工具,除了帮助文档外很少有使用教程。所有有很多人在使用的过程中遇到问题难以解决,今天给大家介绍ForeSpider数据采集系统的使用教程,希望能对大家的工作有所帮助。

    教程的示例网站是大众点评,要得到50页内所有医院名称,该医院评论总数,医院总体星级,各项评分,医院评论的用户名,评论内容,评论时间,用户点评星级,获赞数量和回应数量。

    首先我们先新建一个频道,我给它命名为大众点评,然后在频道配置里输入我们想要爬取数据的网址,需要在频道配置处输入想要得到数据的网址,大众点评需要开启cookie,从右面可以开启,网站不同有的不需要,视情况而定。 现在默认模板(1)就是我们要的网站页面,鼠标放在医院标题处如图,从左下角能看到医院的网址链接。

    现在点一下右上角的采集预览,我们能得到整个页面的所有网页链接,下拉滚动条到这个位置就会发现跟上图相同格式的链接,这就是我们需要的所有医院的链接。

    我们用不到的需要过滤一下,可以通过地址过滤和标题过滤方法筛选。点击软件右上角模板抽取配置里面的链接抽取,里面有地址过滤和标题过滤两个选项,点击地址过滤,软件右下角如图:

    过滤规则选择包含,过滤串内输入想要得到的医院链接,后面这串数字我们用“\d”表示,用“\e”表示结束,例如https://dianping/shop/\d\e,这样就能采集网页内所有这种格式的网页链接。

    当我们想要采集的网页下面有翻页的链接,就必须配置翻页。除了在右上角默认模板处抽取我们想要的得到的医院链接外,还要再新建一个链接抽取,抽取页面翻页的地址。

    我们继续从采集预览处得到翻页的链接,过滤规则选择包含,通过观察发现几个链接的相同点,输入到过滤串里就能得到想要的翻页链接了。

    第一层级的模板建好了,下面我们随便点进一个医院主页内,复制链接建立下一层级模板。在默认模板(2)的示例地址内输入医院主页的链接。

    因为我们需要采集该医院所有用户评论,所以我们找到下面的“更多点评”,通过刚刚地址过滤的方法,过滤出更多点评的链接,并建立模板(3),示例地址输入刚刚过滤的得到的“更多点评”的网址。

    注:点击链接抽取,看左下角关联模板处,一定要关联到下一层级的模板,如果是翻页的链接抽取,要关联自身模板,否则会数据采集失败。这点一定要注意。

    这样模板的基本配置就完成了,下一步是建立表单,下图是我们的需求,红色字体我们能从模板二采集到,蓝色字体我们能从模板三采集到,所以我们需要建立两个表单。

    点击表单配置,新建一个表单,添加一个网页主键如图,一定要勾选索引字段,键值唯一,主键字段三个选项,取值类型选择网页主键点击确定。

    然后添加下一个字段如标题“title”

    取值类型选择“选区内全部文本”,变量类型选择“string”,选择合适的字符长度点击确定。依次建立所有字段。

    这是我建立的两个表单的所有字段,表单名称分别为“大众点评1”、“大众点评2”,建立好以后点击保存即可。点开模板配置,每一个模板对应相应的表单,右键模板二“添加数据抽取”,表单名称选择“大众点评1”。

    同样在模板三处再添加另外一个数据抽取表单,添加好后如下图所示:

    单击“title”,然后按住ctrl键同时鼠标左键点击对应标题,内容过多的话按住shift可以调整内容大小,选好后点击保存。

    全部选取完后点击左上角的文件,然后全部保存。

    下一步点击数据,连接数据库,然后再次点击数据,选择数据表,选择刚刚新建两个数据表的字段后创建表,创建好后勾选并确定,就可以进行数据采集了(如果表单有问题需要更改,改好后需要重新创建表单),速度慢可以点击设置里面的线程设置,设置多线程。

    这只是一个简单的教程,软件还有很多强大的功能,祝大家使用愉快!

  • ?

    中国排名前50的大数据公司(排名不分先后)

    天荒

    展开

    国内大数据服务企业主力阵营:

    1、TakingData

    TakingData以SmartDP为核心的数据智能应用生态为企业赋能,帮助企业逐步实现以数据为驱动力的数字化转型。

    2、友盟+

    友盟+基于全域数据、数据技术和商业场景,构建以7亿消费者为核心,覆盖数据化运营、数据营销、新零售数据服务、金融及手机解决方案的数据智能服务体系,驱动业务持续增长。

    3、精准科技

    精准科技是一家以用户画像为特色的大数据技术公司,致力于推动大数据在营销场景中的使用,业务主要涵盖汽车、金融、房产三大领域。

    4、浪潮

    浪潮互联网大数据采集中心已经采集超过2PB数据,并已建立5大类数据分类处理算法。近日成功发布海量存储系统的最新代表产品AS130000。

    5、腾讯

    腾讯拥有用户关系数据和基于此产生的社交数据,腾讯的思路主要是用数据改进产品,注重QZONE、微信、电商等产品的后端数据打通。

    6、 探码科技

    探码科技自主研发的DYSON只能分析系统,可以完整的实现大数据的采集、分析、处理。一直做的国外项目美国最大的律师平台、医生平台和酒店、机票预订平台的数据采集、分析、处理。将在国内推出一系列面向政务、企业的创新型大数据研究项目与合作,为各大企业提供高端信息技术咨询服务。

    7、中兴通讯

    中兴通讯推出的“聚焦ICT服务的高效数据中心整体服务解决方案”,可帮助运营商有效解决大数据时代建设IDC面临的大部分问题,提升运营商ICT融合服务能力。

    8、神州融

    神州融整合了国内权威的第三方征信机构和电商平台等信贷应用场景的征信大数据,通过覆盖信贷全生命周期管理的顶尖风控技术,为微金融机构提供大数据驱动的信贷风控决策服务。

    9、中科曙光

    中科曙光XData大数据一体机可实现任务自动分解,并在多数据模块上并行执行,全面提高了复杂查询条件下的效率。

    10、华胜天成

    华胜天成自主研发的大数据产品“i维数据”,颇具创新,近期又与IBM达成战略合作关系,涵盖Linux on Power市场、智慧城市、存储业务、管理服务、咨询与应用管理服务。

    11、神州数码

    “神州数码”启动了“智慧城市”战略布局,先后推出了市民融合服务平台、自助终端服务平台等产品,并在佛山、武汉等“智慧城市”建设中实践运用。

    12、用友

    用友在商业分析、大数据处理等领域进行研发,先后推出了用友BQ、用友AE等产品。

    13、东软

    东软大数据战略以医疗行业为突破口,凭借在社保、医疗行业积累的资源,搭建了东软熙康这一智慧医疗平台。

    14、金蝶

    金蝶KBI与金蝶ERP无缝集成,实现BI数据采集——集成——分析决策支持的一体化应用。

    15、宝德

    宝德大数据云备份,是一个专为大数据而设的云备份方案,支持实体机及虚拟机备份,而且具有无限扩充的可能,并且完全自动。

    16、启明星辰

    大数据时代的IP治理和审计,启明星辰提供了终端审计、终端数据防泄露、日志审计,通过综合审计平台来帮助用户解决IP治理需求等解决方案。

    17、拓尔思

    拓尔思通过收购天行网安,可以拓展在公安行业的应用,目前正着力开拓行业应用市场,挖掘各个产业链中的大数据价值。

    18、荣之联

    零售、证券、生物、政府等都是荣之联大数据业务的主要目标行业,已为零售业提供了大数据分析的解决方案,解决了库存问题。

    19、中科金财

    中科金财作为国内领先的高端IT综合服务商,主要服务于金融业的大数据。

    20、美亚柏科

    美亚柏科专注于公安市场,其业务包括电子数据取证、电子数据鉴定、网络舆情分析、数字维权、公证云、搜索云以及取证云服务。

    21、赛思信安

    国内存储技术与服务供应商赛思信安推出了自主研发的大数据管理系统,适用范围包括互联网、公众服务、商业智能、金融、医疗卫生、能源等多个行业。

    22、华宇软件

    华宇软件作为大数据、食品安全、法务软件等相关热门行业软件,同时也是公安领域大数据的上市公司。

    23、天玑科技

    天玑科技的数据中心运维管理服务,为大数据的分析能力提供了强大的后台支撑和保障。

    24、东方国信

    东方国信主营业务为企业商业智能软件及系统解决方案,收购北科亿力和科瑞明,有效拓展了工业和金融大数据领域。

    25、华三

    华三全融合虚拟化网络技术能够极大简化网络结构,减轻网络管理和维护量,为企业数据中心大规模建设提供最强有力的技术支持。

    26、海康威视

    海康威视基于英特尔Hadoop发行版,并融合可以灵活按需调配IT资源对应用和服务进行支持的开放架构云计算技术,打造出了视频智能云计算方案。

    27、高德

    高德与阿里将在地图搜索、产品商业化、数据共享、云计算等领域展开合作,特别是在数据共享方面,高德和阿里巴巴将共建一个大数据服务体系,

    28、四维图新

    作为提供导航地图、地理信息系统软件建设的内容提供商,现在已尝试使用大数据为政府部门提供决策。

    29、海捷科技

    专注于商业智能领域(BI)、数据仓库领域、数据库领域的专业咨询、项目实施、软件开发、系统集成等方面,为金融、电信、快速消费品等行业提供相应方案。

    30、北京信合运通

    信合运通专注于为运营商和行业客户提供基于大数据的深度分析和挖掘技术、渠道支撑服务及行业解决方案。

    31、海云数据

    海云数据专注于从事数据可视化,可为客户提供数据可视化的创意设计、制作和软硬件集成系统服务。

    32、九次方金融数据

    九次方金融数据在国内唯一以企业大数据分析的角度对有投资价值和并购价值的企业进行价值判断,持续跟踪企业动态变化的金融大数据公司。

    33、永洪科技

    永洪BI通过完全自主知识产权的数据集市产品(Z-Data Mart)支持大数据,Z-Data Mart汇聚了数十项自有专利,涵盖了分布式存储和计算、分布式传输和实时通信等关键领域。

    34、集奥聚合

    集奥聚合作为大数据服务提供商,其DataQuate解决方案主要用于解决运营商大数据的接入、挖掘及应用,为运营商大数据的价值转化提供端到端服务。

    35、华院数云

    华院数云以数据挖掘为核心、以商业智能和精准营销为主线、以SAAS云平台为主要服务模式,目前专注于电商领域,为客户提供行业领先的数据分析和精准营销平台服务。

    36、杭州诚道科技

    杭州诚道科技致力于为浙江、全国公安交通管理行业提供一流的信息化服务、产品和方案解决能力,其借助英特尔Hadoop分发版,已解决了大数据的采集和处理问题。

    37、勒卡斯

    勒卡斯是致力于为客户提供全方位直复营销解决方案和服务的大数据公司,主要有潜客沟通、会员管理、CRM软件定制及客户市场调研四大业务。

    38、北京阿尔泰科技

    北京阿尔泰科技专业数据采集系统的制造商。

    39、智拓通达

    智拓通达主要做中国主流社交平台的“大数据”分析,通过整合各大社交平台的用户数据、行为数据和 UGC 内容,为企业和个人用户提供定制化服务。

    40、国双科技

    国双科技数据中心拥有基于OLAP技术的强大交互式数据挖掘平台,可提供不同深度的分析报告,满足不同视角的数据挖掘和分析需求。

    41、时云医疗科技

    时云医疗科技今日发布了医疗领域的大数据“未病”预警云服务“康诺云”,有针对个人健康管理而设计的云律血压节律仪、云悦体质分析仪和云动智能健康监测腕表3款智能硬件。

    42、百分点

    百分点主要为电子商务企业提供站内流量转化和商业智能分析的整体优化解决方案,旗下有推荐引擎技术平台以及跨网站消费偏好平台。产品主要有BRE和BAE。

    43、精硕科技

    精硕科技是国内少有的第三方数字营销监测和调研机构,专注于为广告主提供全流程的网络广告效果监测、分析评估、媒介优化咨询和技术解决方案等服务。

    44、神策数据

    神策数据立足大数据及用户行为分析的技术与实践前沿,业务现已覆盖以互联网、金融、零售快消、高科技、制造等为代表的十多个主要行业、并可支持企业多个职能部门。

    45、百度

    百度的优势体现在海量的数据、沉淀十多年的用户行为数据、自然语言处理能力和深度学习领域的前沿研究。近来百度正式发布大数据引擎,将在政府、医疗、金融、零售、教育等传统领域率先开展对外合作。

    46、阿里巴巴

    阿里巴巴拥有交易数据和信用数据,更多是在搭建数据的流通、收集和分享的底层架构。

    47、华为华为云服务

    整合了高性能的计算和存储能力,为大数据的挖掘和分析提供专业稳定的IT基础设施平台,近来华为大数据存储实现了统一管理40PB文件系统。

    48、同盾科技

    同盾科技将人工智能与业务场景深度结合,为银行、保险、汽车金融、非银行信贷、基金理财、三方支付、航旅、电商、O2O、游戏、社交平台等十余个行业客户提供高效智能的风控、反欺诈及营销分析服务。

    49、国双科技

    国双科技是中国的企业级大数据和人工智能解决方案提供商。

    50、智慧足迹

    智慧足迹是由中国联通和西班牙电信合资成立的专业大数据公司,依托中国联通的数据能力,提供位置信息洞察及相关大数据业务。

  • ?

    智慧工厂中如何进行工业生产数据采集?

    Negro

    展开

    企业进行智慧工厂升级,核心问题便是,它能给企业带来怎样的变化(效益),能节能降本多少。可以肯定的是,从传统制造到智能制造,绝不仅仅是简单的效率提升,包括生产效率、监管效率、仓储效率以及整个生产流程均有提升,它会在DNA层面改变一家企业。

    目前,想要做好传统制造到智能制造的过渡,当务之急是将流程数字化,这是智慧工厂的必经步骤,现在我国大部分企业连数字化工厂都称不上,更不要谈智慧工厂了。

    即使想完成企业数字化,对于我国大多数企业依旧是大难题。需要高层领导有足够大的魄力。首先企业需要明确自己做智慧工厂的目标,包括数字化愿景、对企业进行评估发现不足,最后做出详细规格化。然后进行:企业设计(规划)、具体执行、数字管控系统等等多个领域的融合,最终实现数据通源、虚实融合、绿能高效及智能制造。

    然而,企业数字化中的产品配置,制造流程越复杂越多变,越需要人的参与;工人更多地是处理异常情况,调整设备。其中,数据采集一直是困扰着所有制造工厂的传统痛点,自动化设备品牌类型繁多,厂家和数据接口各异,只要还有其他人工参与环节,这些数据就不完整。

    工业生产数据采集方式

    工业生产设备数据采集有三种方式:分别是数据系统直接联网通信,通过工业网关进行采集和通过远程IO进行采集。

    1、直接联网通信

    直接联网是指借助数控系统自身的通信协议、通信网口,不添加任何硬件,直接与车间的局域网进行连接,与数据采集服务器进行通信,服务器上的软件进行数据的展示、统计、分析,一般可实现对机床开机、关机、运行、暂停、报警状态的采集,及报警信息的记录。

    高端数控系统都自带有用于进行数据通信的以太网口,通过不同的数据传输协议,即可实现对数控机床运行状态的实时监测。发那科0i\31i\18i系列的数控系统在操作面板背面都配置有网口,通过发那科的FOCAS协议,就可以进行直接联网通信;西门子840D系统,PCU50版本以上的也可以通过OPC协议进行设备的直接联网通信。

    2、工业网关采集

    对于没有以太网通信接口,或不支持以太网通信的数控系统,可以借助工业以太网关的方式连接数控机床的PLC控制器,实现对设备数据的采集,实时获取设备的开机、关机、运行、暂停、报警状态。

    工业通信网关可以在各种网络协议间做报文转换,即将车间内各种不同种类的PLC的通信协议转换成一种标准协议,通过该协议实现数据采集服务器对现场PLC设备信息的实时获取。

    3、远程IO采集

    对于不能直接进行以太网口通信,又没有PLC控制单元的设备,可以通过部署远程IO进行设备运行数据的采集,通过远程IO的方式可以实时采集到设备的开机、关机、运行、报警、暂停状态。

    远程IO模块,是工业级远程采集与控制模块,可提供了无源节点的开关量输入采集,通过对设备电气系统的分析,确定需要的电气信号,连接入远程IO模块,由模块将电气系统的开关量、模拟量转化成网络数据,通过车间局域网传送给数据采集服务器。

    编辑:Nistone乐石科技(乐渠 | 泛家居新零售解决方案供应商)

  • ?

    浅析工业数据采集产业发展现状

    奥琳娜

    展开

    (一) 工业数据采集产业综述

    1. 市场规模潜力巨大:

    中国作为世界第一制造大国,随着工业互联网市场的不断发展和完善,企业对工业数据采集的实时性、可靠性和专业解决方案需求日益增强,中国工业数据采集市场呈现巨大潜力,相关软硬件和服务提供商迎来了良好的发展机遇。

    2. 市场各方积极参与

    从消化政策、推出工业数据采集解决方案,到发布工业互联网平台,各市场参与方努力寻求业务转型,外资企业和本土企业均在积极部署工业数据采集产品体系和解决方案,谋划市11场布局。

    3. 技术产品和解决方案持续推进与完善

    当前,工业数据采集技术产品和解决方案仍处于发展阶段,但已有部分厂商推出了一些多样化的解决方案,比如通过构建兼容转换协议的技术产品体系,实现工业数据互联互通;或是通过部署边缘计算模块,实现数据在机器设备端的轻量级运算和实时分析。

    点击上方“关注”,共同学习工业互联网相关知识!

    (二) 工业数据采集产业规模和预测

    整体市场情况2017 年,中国工业数据采集产业市场规模达到 570 亿元,同比增长 16.3%。预计未来 2-3 年,中国工业数据采集市场将保持稳定增长趋势。

    图:2015-2020 年中国工业数据采集市场规模

    2. 细分产品市场情况

    图:2017 年中国工业数据采集细分产品市场规模

    备注 1:传感器包括光电传感器、接近传感器、视觉传感器、位移传感器、速度传感器、加速度传感器等。读码设备包括条码设备、射频识别等。工业通讯模块包含工业串口卡、总线卡、串口服务器、工业电源、以太网模块等。

    3. 细分行业市场情况

    图:2017 年中国工业数据采集细分行业市场规模

    点击上方“关注”,共同学习工业互联网相关知识!

    (三) 工业数据采集存在的主要问题

    当前工业数据采集面临的突出问题可以总结为“三不”:不敢传(数据安全问题)、不能传(协议标准不统一)、不需传(本地化和实时性问题),无法支撑实时数据采集和实时分析、智能优化和科学决策。

    (1) 工业数据采集存在数据安全隐患

    工业数据采集会涉及到大量重要工业数据和用户隐私信息,在传输和存储时都会存在一定的数据安全隐患,也存在黑客窃取数据、攻击企业生产系统的风险。急需从技术、管理和法律法规等多方面保障数据安全。

    (2) 工业协议标准不统一且数据开放性不够

    目前在工业数据采集领域,存在 Profibus、Modbus、CAN、LonWorks、HART、Profinet、EthernetIP 等多种工业协议标准,各个自动化设备生产及集成商还会自己开发各种私有的工业协议,各种协议标准不统一、互不兼容;同时很多设备和系统的数据开放性不够,缺乏数据开放接口及文档说明。导致协议适配、协议解析和数据互联互通困难。

    (3) 工业数据采集实时性要求难以保证

    生产线的高速运转,精密生产和运动控制等场景则对数据采集的实时性要求不断提高,传统数据采集技术对于高精度、低时延的工业场景难以保证重要的信息实时采集和上传,无法满足生产过程的实时监控需求。

    (四) 我国工业数据采集产业格局

    当前,工业数据采集发展越来越快,工业互联网的跑道越来越宽,工业自动化企业、网络通信企业、信息技术企业身影已纷纷出现。就当前情况而言,工业自动化企业具备先天竞争优势,起步和前期推广相对容易,可以在原有系统客户上深度耕耘。信息技术企业和网络通信企业在技术架构的高度上更有比较优势,战略构想和规划能力更为突出。

    目前,工业数据采集产业供应侧主要有以下三类企业:

    一是工业自动化企业,从自身核心产品能力出发,主要为工业数据采集提供接入设备,作为工业数据采集的源头,例如15西门子、研华、霍尼韦尔、安控等;

    二是工业网络服务企业,主要为工业数据采集提供工业网络协议转换、传输、安全等配套设备和服务,部分企业从原有优势领域正在积极向制造业领域延伸发展,例如中国电信、中兴通讯、华为等;

    三是工业数据采集解决方案企业,主要提供工业数据采集解决方案、系统开发、项目实施、系统集成等服务,例如北自所、和利时、明匠智能等。

    已阅读完毕,点击上方“关注”,共同学习工业互联网相关知识!

  • ?

    如何采集招投标类网站数据

    雅雯

    展开

    网上有很多公布招投标信息的网站,招标公告中的信息是有很大的价值的。比如你想了解一个公司的资质,你想了解一个项目的投资资金,你想知道招投标公司之间的关系,这些都能从招投标信息中分析出来,数据是分析的基础,只有获得大量数据,分析才更准确更有说服力。今天教大家如何采集招投标类网站的数据。

    示例网站:http://tjconstruct/zbxx.aspx?type=sjzb

    一.首先打开ForeSpider数据采集软件,点击“采集频道列表”的“+”符号,创建新的频道。然后在采集地址处把准备采集网站的网址粘贴进去。

    频道配置

    二.频道入口地址配置好以后,点击“模板配置”,在右侧模板一处新建一个链接抽取,两个链接抽取,分别起名为“翻页”和“工程抽取”。这两个链接抽取分别抽取页面内的工程项目和翻页链接。

    添加链接抽取

    三.点击采集预览,发现采集预览中没有我想要的项目工程的链接,但是有翻页的链接,那就需要写脚本来抽取工程链接。翻页链接抽取可以通过可视化的操作完成。以前说过链接抽取的脚本如何写,这里就不多介绍了。

    链接抽取教程:http://toutiao/i6454813216395493902/

    链接抽取脚本

    四.通过预览发现每一个翻页链接地址中都包含“page=”这个词,那我将这个词放在“翻页”的地址过滤中,将过滤规则选择为“包含”。

    翻页地址过滤

    链接抽取配置好,可以点击采集预览看一下效果,如果配置的有问题可以及时改正。

    预览效果

    五.可以看到预览效果没有问题,那继续配置下一层模板。下一层为招标公告页,也就是数据页。先建好表单字段,在表单名称处选择建好的表单。

    选择表单

    六.数据页中有一部分字段使用可视化的操作就能完成,有一部分需要脚本,所以我就把需要写脚本的部分分别写在了字段下。字段处理选择“脚本处理”。

    字段下脚本处理

    八.全部字段配置好以后,可以先点击采集预览,看一下效果,如果效果不好可以改正。

    招投标类网站都是实时更新的,ForeSpider数据采集软件有增量采集的功能,可以采集新增数据,长时间时时监控网站新增数据。

    虽然教程看起来简单,最重要的还是多亲自上手实践。多多实践才能更熟练的使用软件采集自己想要的数据。

  • ?

    数据采集过程中的常见问题

    元以蓝

    展开

    经过两周的整理总结,沉淀出来好多数据采集的经验与大家分享。

    前嗅免费模板共享链接:http://forenose/help/collection/template/cases.html

    1.如何进行数据采集?

    ①下载安装软件后,登录到软件上。

    ②准备好模板:在前嗅的官网上下载免费的模板或自己配置好的模板

    ③将下载的官网导入到软件中。

    点击文件---点击导入采集文件(将采集文件导入,自己配置的模板请忽略这一步)

    ④在数据建表中建关联数据表

    选中需要采集模板下的表单---点击创建关联数据表,所创表名不能为汉字,点击确定---在所创数据表前的方框打勾即可关联数据表。详情见下图。

    此时在数据浏览中就存在了刚刚建的关联数据表。

    ⑤进行数据采集。

    在需要进行数据采集的模板前打勾--点击允许采集--点击开始按钮即可进行数据采集。详情见下图。

    ⑥数据预览及导出

    选中关联表---点击刷新按钮即可查看数据---点击导出按钮即可导出数据。详情见下图。

    多种导出方式:

    a.可以将采集到的数据全部导出。

    b.可以将数据分割导出,设置特定数目后数据会分别储存放在文件夹中。

    c.可以将每个字段所采集到的内容分别导出到不同文件夹,方便查看。

    数据导出教程:

    http://forenose/help/guildbook/crawler_new/5-2.html

    2.所采集的网站弹验证码是怎么回事?

    弹验证码分为四种情况:

    ①登录需要验证码:登录时只需要一个验证码,所以直接手动填写配置即可。

    ②多账号登录:每次账号登录都需要验证码,此时应该接第三方打码平台。

    前嗅(forenose)是首个深度大数据专家。

    提供数据采集-分析-处理-管理-营销-应用,自主知识产权的全套大数据产品 。

数据采集供应商

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP