玩转大数据,你须要了解这8种项目类型!

【编者按】本文做者为大数据咨询公司 Mammoth Data 的创始人 Andrew Oliver,主要介绍适宜应用大数据的8大项目类型。文章系国内 ITOM 管理平台 OneAPM 编译呈现,如下为正文。html

在过去的 12 个月里,笔者一直在大数据的战壕里挖掘。好吧,其实大部分时间我只是坐在比我更聪明的人旁边,看他们怎么在战壕里挖掘数据,再把所作的事情进行简化以上报给管理层。前端

不多有真正独具一格的 IT 项目,那些听起来比较特别的项目最终也只是大同小异。不过大家今天有眼福了,由于我决定出来冒个泡儿,跟你们分享一下过去 12 个月里接触到的8大项目类型。java

一、探索交易周期

那些作电子商务的公司想固然地认为,装几个工具就能掌握网页访客从销售到付款的成交状况。可是不少公司处理的数据集远远不止网页成交率,并且这些数据集主要来自经销商。数据库

每一个经销商提供格式各异的不一样数据集。固然,从根本上说,这是一个带有BI/可视化前端的核心ETL/数据整合项目。可是,对许多公司而言,要真正了解交易的生命周期(从开始、进展到结束)比想象中要困难。你须要整合大量的 CRM 数据、网站分析数据和财务数据,最后才能确定地说:“是的,PPC(点击付费广告)带来了交易,可是40%的客户连第一笔交易都未能成功走到付款,那么……”安全

二、挖掘潜在客户

不少公司都想知道你在作什么,而后再根据你的活动状况向你推销产品。例如,你手机上可能装了一个提供遥测数据的 app,这样公司就会知道你在商场的哪一个位置。凭借这些大数据,他们就能预测你在任意时刻的购买需求。服务器

三、衡量营销效果

营销人员作事讲求效益,他们想知道具体要作哪些事情,以及这些事情对KPI有何影响。从本质上说,这又是一个 BI 项目,并且每每涉及到大量的变动数据捕获(CDC)和 ETL 数据整合工做。他们测量的实际KPI变化很大,有时还涉及到 Kylin 或 Greenplum 等工具中的数据库。至于其余状况,可能属于下一个类别——社交媒体。网络

四、测量社交媒体热度

一般,公众会在公开或半公开的社交网络上谈论你(或你的公司)。在这些地方你能够获取不少有用的信息,好比你们怎么看待你的品牌,你的营销活动是否有成效。既然美国地震勘探局能够经过 Twitter 探测到地震和震级,那么你也能够经过这样的平台了解刚推出的广告活动效果如何。随着愈来愈多的专业社交平台出现,对于某些垂直行业而言,其数据采集范围远远不止 Twitter 和 Facebook。app

五、专攻日志文件

不管是为了入侵检测仍是应对安全审计,你都须要捕获并收集日志文件并使其可检索。在这一领域,Splunk 无疑大赚了一笔。固然,在大数据中还有其余更灵活的选择。框架

六、由于不想买Teradata!

如今已经不是 Teradata 独统天下的时代了,大数据正在从边缘向核心发展,并且 Apache Kylin 的数据库已对全部人开放。得益于 Impala、HAWQ 和 Greenplum,MPP 分布式系统的地位也更加剧要。那些价格昂贵、功能单一并且还不能兼容其余数据分析的工具,其发展空间愈来愈小——更别说是那些只能依靠某单一供应商的私有云。分布式

七、经久不衰的ETL

ETL (Extract-Transform-Load)可能依旧是现在最多见的Hadoop工做负载——并且我敢说,ETL 是适用于 Spark 的最多见的非流式工做负载。顺便提一下,如今已经有上百个创业公司冒出来讲本身可以处理这种任务了。

八、先捕获传感器数据再想办法处理

不论是电网、制造业、水泵,仍是老司机开的车,都在向咱们传递信息。这些信息都须要捕获。甚至有些人已经弄清了该如何处理这些数据。可是,及时捕获数据才是最重要的一步,由于不少人都以为从技术上来讲捕获数据并不那么容易。

此外,笔者还常常督促你们在大数据项目初期就要考虑数据分析问题。为何呢?由于预先设计并肯定好数据流的大小,远比数据已经准备好时再从新考虑总体布局要容易得多。可是有时候仍是得细细咀嚼,作最好的打算。

近一年来,笔者见过很多其余项目类型,可是大多数用例都属于以上八种之一。不知各位老司机是否还有补充?

OneAPM 能为您提供端到端的 Java 应用性能解决方案,咱们支持全部常见的 Java 框架及应用服务器,助您快速发现系统瓶颈,定位异常根本缘由。分钟级部署,即刻体验,Java 监控历来没有如此简单。想阅读更多技术文章,请访问 OneAPM 官方技术博客

本文转自 OneAPM 官方博客

相关文章
相关标签/搜索