文章目录
- 0. 相关视频
- 1. 引子
- 2. 大数据为什么必须基于 Linux?
- 2.1 系统性能优势
- 2.2 开源生态完全适配
- 2.3 权限与集群管理
- 3. 主流 Linux 发行版本概述
- 3.1 Ubuntu(乌班图)
- 3.2 CentOS
- 3.3 RedHat(RHEL)
- 3.4 Debian
- 3.5 SUSE
- 3.6 Kali Linux
- 4. 大数据学习为什么选 CentOS7?
- 4.1 极致稳定,适配所有大数据框架
- 4.2 超长生命周期,教学场景成熟
- 4.3 企业通用性极高
- 4.4 命令统一、学习成本最低
- 4.5 资源占用低,适合虚拟机学习
- 5. VMware 虚拟机安装 CentOS7 完整步骤
- 5.1 前期准备
- 5.2 新建虚拟机
- 5.3 配置虚拟机硬件
- 5.4 挂载 ISO 镜像
- 5.5 开机安装系统
- 5.6 设置 root 密码与用户
- 5.7 开机验证
- 6. 小结
0. 相关视频
视频实操:安装CentOS7操作系统
1. 引子
很多初学大数据的同学,都会有一个疑惑:
我学的是大数据、Hadoop、Spark、Flink,为什么还要先学 Linux?Windows 不能跑大数据组件吗?
刚开始学的时候,我也有这个疑问。Windows 系统简单、可视化强、上手快,日常娱乐、办公、写代码都很舒服。
但真正接触大数据集群部署后才明白:大数据的底层,几乎全部依赖 Linux 操作系统。
不学 Linux,你的大数据学习永远只能停留在“理论阶段”。
今天这篇文章,我们通俗讲清楚:大数据和 Linux 的关系、主流 Linux 发行版区别、为什么学习大数据首选 CentOS7,以及完整的虚拟机安装步骤。
2. 大数据为什么必须基于 Linux?
很多新手以为大数据是一套独立软件,其实大数据是一整套分布式服务集群。
Hadoop、Spark、Flink、Kafka、HBase 等所有主流大数据框架,全部原生适配 Linux 环境。
2.1 系统性能优势
大数据需要持续读写海量数据、长期后台运行服务。
Windows 偏向桌面交互,后台服务稳定性、资源占用控制不如 Linux。
Linux 占用资源低、运行稳定、长期不宕机,非常适合服务器、集群环境。
2.2 开源生态完全适配
大数据技术全部是开源技术,而开源技术的原生开发、测试、部署环境都是 Linux。
Windows 运行大数据组件会出现各种兼容报错、路径问题、权限问题,几乎无法搭建正式集群。
2.3 权限与集群管理
大数据集群涉及多节点通信、文件权限配置、进程启停、脚本调度。
Linux 完善的权限机制、命令行管理、Shell 脚本能力,是大数据运维、开发的基础。
简单总结:Windows 适合学习编程,Linux 适合学习服务、集群、大数据。
3. 主流 Linux 发行版本概述
Linux 只是系统内核,我们日常安装使用的是基于内核封装的「发行版本」。
不同版本定位不同,适合的场景也完全不一样。
3.1 Ubuntu(乌班图)
最热门的桌面 Linux 系统,界面美观、软件丰富、适合新手入门、适合开发、人工智能、日常学习。
优点:生态丰富、教程多、可视化友好
缺点:服务器稳定性不如企业级系统,不适合大数据集群生产环境
3.2 CentOS
基于 RedHat 源码编译,完全免费、企业级稳定、主打服务器场景。
CentOS 分为 CentOS7、CentOS8、CentOS9 Stream。
是互联网、大数据、云计算企业最主流的服务器系统。
3.3 RedHat(RHEL)
商业版企业 Linux,稳定性极强、官方有技术支持。
企业生产环境大量使用,需要付费授权,学生学习不推荐。
3.4 Debian
极其稳定、更新保守,适合服务器,生态不如 Ubuntu、CentOS 丰富。
3.5 SUSE
多用于传统政企、金融服务器,国内大数据行业使用极少。
3.6 Kali Linux
专门为网络安全、渗透测试打造,和大数据学习毫无关系,不要选错系统。
4. 大数据学习为什么选 CentOS7?
既然有这么多 Linux 版本,为什么全网大数据教程、高校教学、企业实训,很多都是使用 CentOS7?
4.1 极致稳定,适配所有大数据框架
CentOS7 版本成熟、bug 极少,Hadoop、Spark、Flink、Kafka 所有版本完美兼容。
新版本 CentOS8/9 迭代太快,部分旧版大数据组件会出现兼容问题。
4.2 超长生命周期,教学场景成熟
CentOS7 拥有十年长期维护周期,积累了全网最全的大数据教程、踩坑方案、问题解决案例。
学习过程中遇到任何报错,网上基本都有现成解决方案。
4.3 企业通用性极高
市面很多大数据生产集群,底层都是 CentOS7。
学生阶段学会 CentOS7,毕业入职可以直接无缝适配企业环境,不需要重新适应系统。
4.4 命令统一、学习成本最低
CentOS7 采用 yum 包管理器,命令统一、简单好记。
大数据学习需要频繁安装软件、配置环境、启停服务,CentOS7 的操作方式最适合新手。
4.5 资源占用低,适合虚拟机学习
学生基本都是用 VMware 虚拟机搭建学习环境。
CentOS7 配置要求低、运行流畅,低配电脑也能轻松跑通单节点、伪分布式、完全分布式集群。
一句话总结:学大数据选 CentOS7,随大流,稳妥!
5. VMware 虚拟机安装 CentOS7 完整步骤
新手学习大数据,不建议直接装物理机系统,虚拟机是最安全、最方便、可反复重装的学习环境。
5.1 前期准备
- 安装好 VMware Workstation 虚拟机软件
- 下载 CentOS7 DVD 标准镜像文件(.iso)
- 电脑内存至少 8G(4G 也能跑,容易卡顿)
5.2 新建虚拟机
- 打开 VMware,点击「创建新的虚拟机」
- 选择「典型(推荐)」模式,下一步
- 选择「稍后安装操作系统」
- 客户机操作系统选择:Linux → CentOS7 64位
- 自定义虚拟机名称、存放路径(建议纯英文路径,不要中文、不要空格)
5.3 配置虚拟机硬件
- 处理器:核心数推荐 2核及以上
- 内存:推荐 2G~4G
- 硬盘:分配 20G 以上,默认存储为单个文件
- 完成创建,不要立即开机
5.4 挂载 ISO 镜像
- 选中新建的虚拟机,点击「编辑虚拟机设置」
- CD/DVD 选项中,选择「使用 ISO 镜像文件」
- 选中下载好的 CentOS7 镜像,确定
5.5 开机安装系统
- 开启虚拟机,选择第一项「Install CentOS 7」
- 等待加载完成,选择语言(推荐英文,避免中文乱码问题)
- 进入安装界面,只需配置三项:
- 时间时区:Asia/Shanghai 上海
- 软件安装:最小化安装(Minimal),大数据学习够用、占用资源少
- 安装位置:选中磁盘,自动分区
5.6 设置 root 密码与用户
- 点击开始安装
- 设置 root 超级管理员密码(务必记住,后续所有操作都需要)
- 可创建普通用户(可选)
- 等待安装完成,重启虚拟机
5.7 开机验证
重启后输入账号密码,成功进入命令行界面,即代表安装成功。
后续我们所有的大数据环境搭建、集群配置、命令练习,都在这个系统中完成。
6. 小结
Linux 是大数据的地基,没有 Linux 基础,根本无法开展大数据实战学习。
市面上 Linux 发行版众多,但CentOS7 凭借稳定、兼容、通用、资料多,成为大数据学习的推荐操作系统。
建议大家跟着教程亲手安装一遍虚拟机系统,熟悉命令行环境,为后续 Hadoop、Spark 学习打好基础。