机器学习基础:监督学习、无监督学习与强化学习全面解析
1. 什么是机器学习?
机器学习(Machine Learning, ML)是人工智能(Artificial Intelligence, AI)的一个重要分支。
传统程序设计通常是:
输入数据 + 人工设计规则 → 输出结果例如:
图片 ↓ 人工设计规则 ↓ 判断是否包含车辆而机器学习的思想是:
输入数据 + 结果反馈 ↓ 学习规律 ↓ 自动预测也就是说:
机器学习的核心目标是让计算机通过数据自动学习规律,而不是依靠人工编写所有规则。
2. 机器学习的主要分类
机器学习通常分为三大类:
机器学习 Machine Learning ├── 监督学习 Supervised Learning │ ├── 无监督学习 Unsupervised Learning │ └── 强化学习 Reinforcement Learning三者最大的区别:
| 类型 | 是否有标签 | 核心思想 |
|---|---|---|
| 监督学习 | 有 | 学习输入和输出之间的关系 |
| 无监督学习 | 无 | 发现数据内部结构 |
| 强化学习 | 无直接标签,但有奖励反馈 | 通过试错学习最优策略 |
3. 监督学习(Supervised Learning)
3.1 基本思想
监督学习的特点是:
训练数据中包含正确答案(标签)。
数据形式:
[
(X,Y)
]
其中:
- X:输入数据
- Y:对应标签
例如图像分类:
输入: 一张猫的图片 标签: 猫模型学习:
[
X \rightarrow Y
]
最终能够预测未知数据。
4. 监督学习主要任务
监督学习主要包括:
监督学习 ├── 分类 Classification │ └── 回归 Regression4.1 分类任务
分类用于预测类别。
例如:
邮件 ↓ 垃圾邮件 / 正常邮件输出:
类别标签常见算法:
- SVM
- KNN
- 决策树
- 随机森林
- 朴素贝叶斯
4.2 回归任务
回归用于预测连续数值。
例如:
房屋面积 ↓ 预测房价输出:
600000元常见算法:
- 线性回归
- 决策树回归
- 随机森林回归
5. 监督学习经典算法介绍
5.1 线性回归(Linear Regression)
线性回归用于预测连续值。
基本形式:
[
y=wx+b
]
其中:
- w:权重
- b:偏置
例如:
房屋面积 ↓ 线性模型 ↓ 预测价格模型目标:
让预测值与真实值尽可能接近。
常用损失:
[
MSE=
\frac{1}{N}
\sum(y_i-\hat y_i)^2
]
5.2 逻辑回归(Logistic Regression)
虽然名字叫“回归”,但主要用于分类。
核心思想:
通过 Sigmoid 函数输出概率:
[
\sigma(z)=
\frac{1}{1+e^{-z}}
]
例如:
邮件 ↓ 逻辑回归 ↓ 垃圾邮件概率 0.95表示:
该邮件属于垃圾邮件的概率约为95%。
5.3 K近邻算法(KNN)
KNN:
根据距离最近的几个样本判断类别。
例如:
已知: ● ● ● ○ ○ ○ 新样本: ? 查看附近K个点: 多数属于● 因此预测为●核心:
计算样本之间的距离:
[
d(x,y)=
\sqrt{\sum_i(x_i-y_i)^2}
]
优点:
- 简单
- 易理解
缺点:
- 数据量大时计算慢
- 高维数据效果下降
5.4 决策树(Decision Tree)
决策树类似人类决策过程。
例如:
收入 > 9000? 是 | 年龄 > 30? 是 | 买车模型不断寻找:
哪个特征可以最好地区分数据。
常用划分指标:
- 信息增益
- 信息增益率
- 基尼指数
5.5 随机森林(Random Forest)
随机森林:
多棵决策树共同进行预测。
结构:
数据 ┌─────┼─────┐ 树1 树2 树3 ↓ ↓ ↓ 猫 猫 狗 ↓ 投票 ↓ 猫随机森林包含两个随机:
(1)随机采样数据
通过 Bootstrap:
训练数据 ↓ 随机抽取 ↓ 生成不同训练集(2)随机选择特征
每棵树只观察部分特征:
树1: 年龄、收入 树2: 学历、工作经验 树3: 收入、房产优点:
- 降低过拟合
- 泛化能力强
5.6 支持向量机(SVM)
SVM:
Support Vector Machine
中文:
支持向量机。
核心思想:
找到一个最大间隔的分类边界。
例如:
○ ○ ○ ------------ ● ● ●SVM希望:
分类边界距离两类样本尽可能远。
这个距离称为:
[
Margin
]
什么是支持向量?
支持向量:
距离分类边界最近,并决定边界位置的样本。
例如:
○ ○ ○ ★ ----------- ★ ● ● ●两个 ★ 就是支持向量。
如果删除远处样本:
分类边界基本不变。
但是删除支持向量:
边界会发生变化。
因此称为:
Support Vector。
6. SVM核函数(Kernel Function)
6.1 为什么需要核函数?
普通SVM只能处理线性分类:
○ ○ ○ ------------ ● ● ●但是现实数据可能:
● ● ● ● ○ ● ● ● ●无法用直线分开。
6.2 核技巧(Kernel Trick)
思想:
将低维数据映射到高维空间。
例如:
二维:
[
(x_1,x_2)
]
映射:
[
(x_1,x_2,x_12+x_22)
]
在高维空间中可能变得线性可分。
6.3 常见核函数
Linear Kernel
线性核:
[
K(x,z)=x^Tz
]
适合:
数据本身接近线性。
Polynomial Kernel
多项式核:
[
K(x,z)
(\gamma xTz+r)d
]
可以产生更复杂边界。
RBF Kernel
径向基核:
[
K(x,z)
exp(-\gamma ||x-z||^2)
]
核心思想:
计算两个样本之间的相似度。
距离越近:
[
K(x,z)\approx1
]
距离越远:
[
K(x,z)\approx0
]
RBF中的参数γ
γ控制:
一个样本影响范围大小。
γ大:
影响范围小 边界复杂 容易过拟合γ小:
影响范围大 边界平滑 容易欠拟合7. 无监督学习(Unsupervised Learning)
7.1 什么是无监督学习?
无监督学习:
不提供标签,让模型自己发现数据规律。
数据形式:
[
X
]
没有:
[
Y
]
例如:
10000张图片 ↓ 自动发现图片结构8. 无监督学习主要任务
无监督学习 ├── 聚类 Clustering └── 降维 Dimensionality Reduction8.1 聚类(Clustering)
目标:
将相似的数据自动分到同一组。
例如:
● ● ● ▲ ▲ ▲ ■ ■ ■模型自动发现:
Cluster 1 Cluster 2 Cluster 3K-Means
K-Means:
将数据划分为K个簇。
流程:
初始化中心 ↓ 计算距离 ↓ 重新分配类别 ↓ 更新中心 ↓ 重复目标:
最小化簇内距离:
[
\sum ||x_i-\mu_k||^2
]
8.2 DBSCAN
DBSCAN基于密度进行聚类。
特点:
- 不需要提前指定类别数量
- 可以发现异常点
例如:
●●●● × ●●●×可能被认为是异常点。
9. 降维(Dimensionality Reduction)
降维:
用更少的特征表示原始数据。
例如:
1000维 ↓ 20维注意:
降维不等于无监督。
判断是否无监督:
关键看:
是否使用标签。
9.1 PCA(Principal Component Analysis)
PCA:
主成分分析。
核心:
寻找数据变化最大的方向。
例如:
二维:
● ● ●主要变化方向:
↗压缩到这个方向即可。
10. 强化学习(Reinforcement Learning)
强化学习也是机器学习的重要分支。
核心:
智能体通过环境反馈不断试错,学习最佳策略。
主要元素:
Agent 智能体 Environment 环境 State 状态 Action 动作 Reward 奖励流程:
状态 ↓ Agent选择动作 ↓ 环境反馈 ↓ 奖励 ↓ 更新策略11. 强化学习与监督学习区别
监督学习:
输入 ↓ 正确答案 ↓ 学习强化学习:
尝试动作 ↓ 获得奖励 ↓ 调整策略12. 强化学习经典算法
Q-Learning
学习:
[
Q(s,a)
]
表示:
某个状态下采取某动作的价值。
深度强化学习
结合神经网络:
状态 ↓ 神经网络 ↓ 动作代表算法:
- DQN
- PPO
- Actor-Critic
13. 三大机器学习范式总结
| 类型 | 是否有标签 | 目标 |
|---|---|---|
| 监督学习 | 有 | 预测结果 |
| 无监督学习 | 无 | 发现数据结构 |
| 强化学习 | 奖励反馈 | 学习策略 |
14. 最终机器学习体系
人工智能 AI ↓ 机器学习 ML ├──监督学习 │ │ ├──SVM │ ├──随机森林 │ ├──KNN │ └──神经网络 │ ├──无监督学习 │ │ ├──K-Means │ ├──DBSCAN │ └──PCA │ └──强化学习 │ ├──Q-Learning ├──DQN └──PPO总结
机器学习的核心可以概括为:
- 监督学习:有答案,学习预测关系
- 无监督学习:没有答案,寻找数据结构
- 强化学习:通过奖励反馈学习决策策略
其中:
- SVM通过最大间隔寻找分类边界;
- 随机森林通过多个决策树投票提高稳定性;
- K-Means通过相似性自动聚类;
- PCA通过寻找主要变化方向实现降维;
- 强化学习通过不断试错获得最优策略。
理解这些基础算法,是进一步学习深度学习、CNN、Transformer、YOLO、SAM等现代视觉模型的重要基础。