在线客服
扫描二维码
下载博学谷APP扫描二维码
关注博学谷微信公众号
大数据的属性是什么?如何划分?拥有大数据是件令人兴奋的事,但在实践中处理大数据存在一定的困难,如数据量过大事情就会变得更困难。为了处理大数据要采用高性能算法,这些算法也已展现出惊人的优越性。
数据通常由一个矩阵表示,矩阵的行表示不同的条目或记录,列则表示这些条目的不同属性特征。例如,关于美国的城市数据集中每一行代表一个城市,每列则代表州、人口和地区等特征。
大数据的属性是什么?
一、结构化与非结构化数据
某些数据集具有很好的结构性,就像数据库中的数据表或电子表程序中一样。而其他的数据以更多样的形式记录着有关世界状况的信息。它们可能是像维基百科这样包含图像和超级链接的文本语料库,也可能是个人医疗记录中出现的复杂的注释和测试结果的混合数据。
数据通常由一个矩阵表示,矩阵的行表示不同的条目或记录,列则表示这些条目的不同属性特征。例如,关于美国的城市数据集中每一行代表一个城市,每列则代表州、人口和地区等特征。
当面对一个非结构化数据源时,我们通常首先要构建一个矩阵以使这些数据结构化。词袋模型可以构建一个矩阵,每条推文对应矩阵中的一行,每个常用词汇对应矩阵中的一列。矩阵项M[i, j]则表示推文i中单词j出现的次数。
二、定量数据与类别数据
定量数据由数值组成,如高度和重量。这些数据可以被直接带入代数公式和数学模型,也可以在传统的图表中进行表示。相比之下,类别数据则由描述被调查对象属性的标签组成,如性别、头发颜色和职业。这种描述性信息可以像数值型数据一样精确而有意义,但不能使用相同的方法进行处理。
类别数据通常可以进行数字化编码。例如,性别可以表示为男=0或女=1。但如果每个特性包含两个以上字符,尤其当它们之间没有隐序时,事情会变得更加复杂。我们可以对头发的颜色进行数字化编码,即为不同颜色匹配不同的数值,如灰色头发=0、红色头发=1以及金色头发=2。然而,除了单纯地进行特征识别之外,我们并不能真正将这些值视为数字。讨论头发的最大或最小颜色有什么意义呢?又如何解释我的头发颜色减去你的头发颜色的含义呢?
三、大数据与小数据
在大众眼中数据科学已经与大数据混为一谈,数据科学以计算机日志和传感器设备产生的海量数据集为分析对象。原则上,拥有更多的数据总是比数据少要好,因为如果有必要,可以通过抽样来舍弃其中的一些数据,从而得到一个更小的数据集。
拥有大数据是件令人兴奋的事。但在实践中,处理大数据存在一定的困难。一般来说,一旦数据量过大,事情就会变得更困难。大数据的挑战包括:
一个分析周期所用的时间随着数据规模的增长而变长:对数据集的计算性操作会随着数据量的增加而花费更长的时间。电子表格可以提供即时响应,允许用户进行实验测试以及验证各种假设。但计算大型电子表格时,会变得笨拙而缓慢。处理大规模数据集可能需要数小时或数天才能得到结果。为了处理大数据,要采用高性能算法,这些算法也已展现出惊人的优越性。但是绝不能为了获得更快的计算速度而将大数据拆分为小数据。
大型数据集复杂的可视化过程:在计算机屏幕或打印的图像上不可能将大数据中的数百万个要点全部绘制出来,更不要说对这些数据进行概念性的理解了。我们无法满怀希望地去深入理解一个根本无法看到的东西。
简单的模型不需要大量的数据来匹配或评估:典型的数据科学任务是基于一小部分变量做出决策,比如,根据年龄、性别、身高、体重以及现有的医疗水平来决定是否应该为投保人提供人寿保险。
如果有100万人的生活相关数据,那么应该能够建立一个具有较好保险责任的一般模型。但是当数据量扩充到几千万人时,可能对于优化模型就不再产生作用了。基于少数几个变量(如年龄和婚姻状况)的决策准则不能太复杂,而且在覆盖大量的保险申请人数据时呈现出鲁棒性。那些不易被察觉的发现,需要大量数据才能被巧妙地获得,而这却与数据体量的大小无关。
大数据有时被称为坏数据。它们作为已有系统或程序的副产品被收集起来,而不是为了回答我们手头已经设计好的问题而有目的地收集来的。这就使得我们可能不得不努力去解释一些现象,仅仅是因为我们拥有了这些数据。
总统候选人如何从分析选民偏好中获得收益?大数据方法可能会分析大量的Twitter或Facebook上的网络数据,并从文本中推测出选民的观点。而小数据方法则通过民意调查,对特定的问题询问几百人并将结果制成表格。哪种方法更准确呢?正确的数据集与要完成的任务具有直接相关性,而不一定是那个数量最大的数据集。
不要盲目地渴望分析大型数据集。寻找正确的数据来回答给定的问题,而不是做没有必要参与的“大事情”。
— 申请免费试学名额 —
在职想转行提升,担心学不会?根据个人情况规划学习路线,闯关式自适应学习模式保证学习效果
讲师一对一辅导,在线答疑解惑,指导就业!
相关推荐 更多
学大数据技术必须了解的大数据经典应用案例
我们已经进入了数据化的时代,大数据开发技术、数据分析已经成为目前企业最核心的关注点。数据为企业提供了更加可靠的支撑,对于优化产业结构、提升生产效率有非常明显的作用。在企业纷纷布局大数据业务的同时,大数据相关人才缺口逐渐扩大。目前国内大数据相关从业人员已经超过20万,作为大数据从业人员,必须了解一些大数据相关的经典应用案例。
6357
2019-08-22 18:03:14
大数据培训班跟不上怎么办?零基础可以学大数据吗?
在大数据浪潮的裹挟下,不断有学习者涌入大数据培训机构,因而这些学习者的能力也是参差不齐的。这样一来,不少初学者会有这样的疑问:大数据培训班跟不上怎么办?零基础可以学大数据吗?其实大数据的学习只要肯用心,不存在什么学习的门槛。如果零基础的同学跟不上学习进度,自身和培训班都有问题。下面来看看如何解决吧!
6187
2019-09-11 12:49:47
大数据工程师加班多吗?工作强度大不大?
大数据时代的来临,使得大数据工程师一职也变得火爆起来。许多想要学习大数据并今后投身于此的伙伴,在羡慕这一行广阔发展前景和高额薪资待遇的同时,难免也会担心这样的问题:大数据工程师加班多吗?工作强度大不大?其实我们都明白高薪的工作肯定不轻松的道理,但是大数据工程师的工作强度,也远远没有大家想象的没那么大。而且不同的公司,加班的强度也是不一样的,因此不能一概而论。
13448
2019-12-05 20:33:40
云计算的基本特征是什么?云计算的七大特征总结
云计算的基本特征是什么?在回答这个问题之前,我们先来看看云计算的概念。云计算简单来说,就是不被地域所限制,向用户提供实现大规模计算的软件服务。因此云计算的基本特征主要要以下几点,即资源池化、快速弹性、灵活便捷性、可靠性强、高性价比和可扩展性。接下来小编将为大家依次总结云计算的七大特征,大家一起来看看吧!
14440
2020-01-11 16:01:15
大数据开发和大数据分析该怎么选择?
大数据开发主要是负责大数据挖掘,大数据清洗处理,大数据建模等,负责大规模数据的处理和应用,工作以开发为主与大数据可视化分析工程师相互配合,从数据中挖掘出价值为企业业务发展提供支持。
3960
2021-01-15 10:09:54