机器学习基础:监督学习、无监督学习与强化学习全面解析
2026/9/6 2:08:51 网站建设 项目流程

机器学习基础:监督学习、无监督学习与强化学习全面解析

1. 什么是机器学习?

机器学习(Machine Learning, ML)是人工智能(Artificial Intelligence, AI)的一个重要分支。

传统程序设计通常是:

输入数据 + 人工设计规则 → 输出结果

例如:

图片 ↓ 人工设计规则 ↓ 判断是否包含车辆

而机器学习的思想是:

输入数据 + 结果反馈 ↓ 学习规律 ↓ 自动预测

也就是说:

机器学习的核心目标是让计算机通过数据自动学习规律,而不是依靠人工编写所有规则。


2. 机器学习的主要分类

机器学习通常分为三大类:

机器学习 Machine Learning ├── 监督学习 Supervised Learning │ ├── 无监督学习 Unsupervised Learning │ └── 强化学习 Reinforcement Learning

三者最大的区别:

类型是否有标签核心思想
监督学习学习输入和输出之间的关系
无监督学习发现数据内部结构
强化学习无直接标签,但有奖励反馈通过试错学习最优策略

3. 监督学习(Supervised Learning)

3.1 基本思想

监督学习的特点是:

训练数据中包含正确答案(标签)。

数据形式:

[
(X,Y)
]

其中:

  • X:输入数据
  • Y:对应标签

例如图像分类:

输入: 一张猫的图片 标签: 猫

模型学习:

[
X \rightarrow Y
]

最终能够预测未知数据。


4. 监督学习主要任务

监督学习主要包括:

监督学习 ├── 分类 Classification │ └── 回归 Regression

4.1 分类任务

分类用于预测类别。

例如:

邮件 ↓ 垃圾邮件 / 正常邮件

输出:

类别标签

常见算法:

  • SVM
  • KNN
  • 决策树
  • 随机森林
  • 朴素贝叶斯

4.2 回归任务

回归用于预测连续数值。

例如:

房屋面积 ↓ 预测房价

输出:

600000元

常见算法:

  • 线性回归
  • 决策树回归
  • 随机森林回归

5. 监督学习经典算法介绍


5.1 线性回归(Linear Regression)

线性回归用于预测连续值。

基本形式:

[
y=wx+b
]

其中:

  • w:权重
  • b:偏置

例如:

房屋面积 ↓ 线性模型 ↓ 预测价格

模型目标:

让预测值与真实值尽可能接近。

常用损失:

[
MSE=
\frac{1}{N}
\sum(y_i-\hat y_i)^2
]


5.2 逻辑回归(Logistic Regression)

虽然名字叫“回归”,但主要用于分类。

核心思想:

通过 Sigmoid 函数输出概率:

[
\sigma(z)=
\frac{1}{1+e^{-z}}
]

例如:

邮件 ↓ 逻辑回归 ↓ 垃圾邮件概率 0.95

表示:

该邮件属于垃圾邮件的概率约为95%。


5.3 K近邻算法(KNN)

KNN:

根据距离最近的几个样本判断类别。

例如:

已知: ● ● ● ○ ○ ○ 新样本: ? 查看附近K个点: 多数属于● 因此预测为●

核心:

计算样本之间的距离:

[
d(x,y)=
\sqrt{\sum_i(x_i-y_i)^2}
]

优点:

  • 简单
  • 易理解

缺点:

  • 数据量大时计算慢
  • 高维数据效果下降

5.4 决策树(Decision Tree)

决策树类似人类决策过程。

例如:

收入 > 9000? 是 | 年龄 > 30? 是 | 买车

模型不断寻找:

哪个特征可以最好地区分数据。

常用划分指标:

  • 信息增益
  • 信息增益率
  • 基尼指数

5.5 随机森林(Random Forest)

随机森林:

多棵决策树共同进行预测。

结构:

数据 ┌─────┼─────┐ 树1 树2 树3 ↓ ↓ ↓ 猫 猫 狗 ↓ 投票 ↓ 猫

随机森林包含两个随机:

(1)随机采样数据

通过 Bootstrap:

训练数据 ↓ 随机抽取 ↓ 生成不同训练集

(2)随机选择特征

每棵树只观察部分特征:

树1: 年龄、收入 树2: 学历、工作经验 树3: 收入、房产

优点:

  • 降低过拟合
  • 泛化能力强

5.6 支持向量机(SVM)

SVM:

Support Vector Machine

中文:

支持向量机。

核心思想:

找到一个最大间隔的分类边界。

例如:

○ ○ ○ ------------ ● ● ●

SVM希望:

分类边界距离两类样本尽可能远。

这个距离称为:

[
Margin
]


什么是支持向量?

支持向量:

距离分类边界最近,并决定边界位置的样本。

例如:

○ ○ ○ ★ ----------- ★ ● ● ●

两个 ★ 就是支持向量。

如果删除远处样本:

分类边界基本不变。

但是删除支持向量:

边界会发生变化。

因此称为:

Support Vector。


6. SVM核函数(Kernel Function)

6.1 为什么需要核函数?

普通SVM只能处理线性分类:

○ ○ ○ ------------ ● ● ●

但是现实数据可能:

● ● ● ● ○ ● ● ● ●

无法用直线分开。


6.2 核技巧(Kernel Trick)

思想:

将低维数据映射到高维空间。

例如:

二维:

[
(x_1,x_2)
]

映射:

[
(x_1,x_2,x_12+x_22)
]

在高维空间中可能变得线性可分。


6.3 常见核函数

Linear Kernel

线性核:

[
K(x,z)=x^Tz
]

适合:

数据本身接近线性。


Polynomial Kernel

多项式核:

[
K(x,z)

(\gamma xTz+r)d
]

可以产生更复杂边界。


RBF Kernel

径向基核:

[
K(x,z)

exp(-\gamma ||x-z||^2)
]

核心思想:

计算两个样本之间的相似度。

距离越近:

[
K(x,z)\approx1
]

距离越远:

[
K(x,z)\approx0
]


RBF中的参数γ

γ控制:

一个样本影响范围大小。

γ大:

影响范围小 边界复杂 容易过拟合

γ小:

影响范围大 边界平滑 容易欠拟合

7. 无监督学习(Unsupervised Learning)

7.1 什么是无监督学习?

无监督学习:

不提供标签,让模型自己发现数据规律。

数据形式:

[
X
]

没有:

[
Y
]

例如:

10000张图片 ↓ 自动发现图片结构

8. 无监督学习主要任务

无监督学习 ├── 聚类 Clustering └── 降维 Dimensionality Reduction

8.1 聚类(Clustering)

目标:

将相似的数据自动分到同一组。

例如:

● ● ● ▲ ▲ ▲ ■ ■ ■

模型自动发现:

Cluster 1 Cluster 2 Cluster 3

K-Means

K-Means:

将数据划分为K个簇。

流程:

初始化中心 ↓ 计算距离 ↓ 重新分配类别 ↓ 更新中心 ↓ 重复

目标:

最小化簇内距离:

[
\sum ||x_i-\mu_k||^2
]


8.2 DBSCAN

DBSCAN基于密度进行聚类。

特点:

  • 不需要提前指定类别数量
  • 可以发现异常点

例如:

●●●● × ●●●

×可能被认为是异常点。


9. 降维(Dimensionality Reduction)

降维:

用更少的特征表示原始数据。

例如:

1000维 ↓ 20维

注意:

降维不等于无监督。

判断是否无监督:

关键看:

是否使用标签。


9.1 PCA(Principal Component Analysis)

PCA:

主成分分析。

核心:

寻找数据变化最大的方向。

例如:

二维:

● ● ●

主要变化方向:

压缩到这个方向即可。


10. 强化学习(Reinforcement Learning)

强化学习也是机器学习的重要分支。

核心:

智能体通过环境反馈不断试错,学习最佳策略。

主要元素:

Agent 智能体 Environment 环境 State 状态 Action 动作 Reward 奖励

流程:

状态 ↓ Agent选择动作 ↓ 环境反馈 ↓ 奖励 ↓ 更新策略

11. 强化学习与监督学习区别

监督学习:

输入 ↓ 正确答案 ↓ 学习

强化学习:

尝试动作 ↓ 获得奖励 ↓ 调整策略

12. 强化学习经典算法

Q-Learning

学习:

[
Q(s,a)
]

表示:

某个状态下采取某动作的价值。


深度强化学习

结合神经网络:

状态 ↓ 神经网络 ↓ 动作

代表算法:

  • DQN
  • PPO
  • Actor-Critic

13. 三大机器学习范式总结

类型是否有标签目标
监督学习预测结果
无监督学习发现数据结构
强化学习奖励反馈学习策略

14. 最终机器学习体系

人工智能 AI ↓ 机器学习 ML ├──监督学习 │ │ ├──SVM │ ├──随机森林 │ ├──KNN │ └──神经网络 │ ├──无监督学习 │ │ ├──K-Means │ ├──DBSCAN │ └──PCA │ └──强化学习 │ ├──Q-Learning ├──DQN └──PPO

总结

机器学习的核心可以概括为:

  • 监督学习:有答案,学习预测关系
  • 无监督学习:没有答案,寻找数据结构
  • 强化学习:通过奖励反馈学习决策策略

其中:

  • SVM通过最大间隔寻找分类边界;
  • 随机森林通过多个决策树投票提高稳定性;
  • K-Means通过相似性自动聚类;
  • PCA通过寻找主要变化方向实现降维;
  • 强化学习通过不断试错获得最优策略。

理解这些基础算法,是进一步学习深度学习、CNN、Transformer、YOLO、SAM等现代视觉模型的重要基础。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询