在线客服
扫描二维码
下载博学谷APP
扫描二维码
关注博学谷微信公众号
本文将从Hadoop简介、Hadoop设计概念、Hadoop组件三大方面帮助大家从零开始认识Hadoop,下面赶紧进入正题吧!

一、Hadoop简介
Apache Hadoop是目前最流行的软件框架,可使用简单的高级编程模型实现大型数据集的分布式存储和处理。Hadoop是Apache Software Foundation的一个开源项目,可以安装在服务器集群上,以便这些服务器可以通信并协同工作来存储和处理大型数据集。Hadoop近年来因其有效处理大数据的能力而变得非常成功。它允许公司将所有数据存储在一个系统中,并对这些数据进行分析,否则传统解决方案不可能或非常昂贵。
围绕Hadoop构建的许多配套工具提供了各种各样的处理技术。与辅助系统和实用程序的集成非常出色,使Hadoop的实际工作更轻松,更高效。这些工具共同构成了Hadoop生态系统。
大家可以将Hadoop视为大数据操作系统,从而可以在所有庞大的数据集上运行不同类型的工作负载。其范围从离线批处理到机器学习再到实时流处理。
二、Hadoop设计概念
为了解决处理和存储大型数据集的挑战,Hadoop是根据以下核心特征构建的:
1、分布 - 存储和处理不是构建一台大型超级计算机,而是分布在一组通信和协同工作的小型机器上。
2、横向可扩展性 - 只需添加新计算机即可轻松扩展Hadoop集群。每台新机器都会按比例增加Hadoop集群的总存储和处理能力。
3、容错 - 即使少数硬件或软件组件无法正常工作,Hadoop仍可继续运行。
4、成本优化 - Hadoop不需要昂贵的高端服务器,无需商业许可即可正常工作。
5、编程抽象 - Hadoop负责处理与分布式计算相关的所有混乱细节。借助高级API,用户可以专注于实现解决现实问题的业务逻辑。
6、数据位置 - Hadoop不会将大型数据集移动到运行应用程序的位置,而是运行数据已经存在的应用程序。
三、Hadoop组件
Hadoop分为两个核心组件:HDFS分布式文件系统;YARN集群资源管理技术。
1、HDFS:
HDFS是一个Hadoop分布式文件系统。它可以在您需要的任意数量的服务器上运行 - HDFS可以轻松扩展到数千个节点和数PB的数据。HDFS设置越大,某些磁盘,服务器或网络交换机出现故障的概率就越大。HDFS通过在多个服务器上复制数据来幸免于这些类型的故障。HDFS自动检测给定组件是否已发生故障,并采取对用户透明发生的必要恢复操作。
HDFS设计用于存储数百兆字节或千兆字节的大型文件,并为它们提供高吞吐量的流数据访问。最后但同样重要的是,HDFS支持一次写入多次读取模型。对于这个用例,HDFS就像一个魅力。但是,如果您需要存储大量具有随机读写访问权限的小文件,那么其他系统(如RDBMS和Apache HBase)可以做得更好。
2、YARN:
YARN(Yet Another Resource Negotiator)负责管理Hadoop集群上的资源,并支持运行处理存储在HDFS上的数据的各种分布式应用程序。与HDFS类似,YARN遵循主从设计,ResourceManager进程充当主节点,多个NodeManager充当工作者。他们有以下责任:
(1)ResourceManager
跟踪实时NodeManagers以及群集中每台服务器上的可用计算资源量。为应用程序分配可用资源。监视Hadoop集群上所有应用程序的执行情况。
(2)节点管理器
管理Hadoop集群中单个节点上的计算资源(RAM和CPU)。运行各种应用程序的任务,并强制它们在指定的计算资源的限制范围内。
YARN以资源容器的形式将集群资源分配给各种应用程序,资源容器表示RAM量和CPU核心数量的组合。
Hadoop = HDFS + YARN
在同一群集上运行的HDFS和YARN守护程序为我们提供了一个用于存储和处理大型数据集的强大平台。
以上就是从零开始认识Hadoop的内容,不知道各位小伙伴都弄懂了吗?博学谷有Hadoop相关的在线课程,有兴趣的小伙伴可以在博学谷官网咨询。
— 申请免费试学名额 —
在职想转行提升,担心学不会?根据个人情况规划学习路线,闯关式自适应学习模式保证学习效果
讲师一对一辅导,在线答疑解惑,指导就业!
相关推荐 更多
博学谷线上零基础大数据培训班课程大纲内容学什么?
零基础大数据培训课程分为十个阶段主要的学习内容:Java基础、JavaWeb、主流框架、流行框架、大数据基础增强、大数据Hadoop离线分布式系统、就业课(2.0)-网站点击流项目、大数据Storm实时计算系统、大数据Spark内存计算系统、大数据Flink实时计算系统、机器学习(拓展课程)等内容
9961
2019-06-06 13:33:30
大数据培训需要什么基础吗?
随着2020年大数据的应用在各个领域的落地发展,大数据技术成为各大企业公司竞争的新焦点,就业市场对于大数据人才的需求也在持续扩大。相信不少大数据初学者都好奇,大数据培训需要什么基础吗?以博学谷的培训经验来看,大多数学员都是从零基础开始学习,并不一定需要什么相关技术的基础。当然,Java在大数据开发方面十分有优势,也是大数据课程必学的编程语言,具备Java编程基础可以节省不少学习时间。
5811
2020-06-15 10:55:54
零基础学大数据难吗?
零基础学大数据难吗?通过各大招聘平台我们可以看到,同样都是互联网技术岗位,大数据技术岗位的薪资普遍较高,不仅仅是因为目前布局大数据技术是各个企业的战略目标,同时也因为大数据技术有一定的难度,那对于零基础的同学能学会大数据技术吗?
6060
2020-08-24 14:31:50
大数据之Spark框架中RDD和DataFrame的区别
大数据之Spark框架中RDD和DataFrame的区别是什么?RDD(提供了一种高度受限的共享内存模型;DataFrame是一种分布式的数据集,并且以列的方式组合的。在spark中RDD、DataFrame是最常用的数据类型,在使用的过程中你知道两者的区别和各自的优势吗?关于如何具体的应用我们今天就好好的分析一下。
4168
2022-02-18 11:32:22
大数据的核心价值是什么? 本质是什么?
大数据的核心价值是什么? 其本质是量变产生了质变,其实问了这个问题,我们就已经能够知道,数据是真的具有价值的,并且价值不菲。那数据是今天才有的么? 为什么加上大字就有了无法估量的价值呢?
3816
2022-04-27 09:49:19
