☰
PyTorch实战:CNN猫狗图像分类从数据管线到模型部署全流程
2026/10/9 23:37:33 网站建设 项目流程

简介:这份资源是面向计算机相关专业学生与深度学习入门者的猫狗图像分类实战项目,基于Python卷积神经网络CNN实现,可作为毕业设计、课程设计或期末大作业的参考方案,难度适中,适合需要完整项目练手的同学。压缩包共2000个文件,约86.82MB,其中1992个jpg为猫狗训练与测试图像,7个py脚本负责数据读取、模型搭建、训练与预测,另有1个md说明文档,便于快速理解项目结构与运行方式。目前已有207人学习下载,具备一定参考热度。项目源码经本地编译调试,可正常运行,并附完整数据集,读者可据此掌握CNN卷积、池化、全连接等核心环节,理解图像预处理、模型训练与分类评估的完整流程,也能在此基础上调整网络结构或超参数,完成自己的实验与论文写作,省去从零搜集数据与搭建框架的时间。

1. 猫狗分类这个"入门题",为什么成了很多人的翻车现场

基于Python卷积神经网络CNN的猫狗图像分类,几乎是每个想入门深度学习的人都会碰到的第一个项目。数据集规模不大、标签干净、任务定义清晰,看起来是最适合练手的题目。但真正动手做过的人都知道,这个项目里藏着一堆让人抓狂的细节:训练集准确率冲到 0.98,验证集却卡在 0.6 死活上不去;换了三层卷积改成五层,loss 直接变成 nan;好不容易跑出一个能用的模型,想拿一张自家猫的照片测一下,结果预测结果离谱得让人怀疑人生。

问题不在于 CNN 本身有多难,而在于大多数人跳过了数据管线和训练策略这两块,直接抄了一份网络结构就开始跑。这个项目真正要解决的问题是:如何用一套可复现的流程,从原始图片目录出发,经过数据清洗、增强、模型搭建、训练调参,最终得到一个在未见数据上表现稳定的二分类器。它适合已经会写 Python、了解 NumPy 基本操作、想系统走一遍深度学习落地流程的开发者。下面我会按实际做项目的顺序,把每一步的选择理由、代码和参数都讲清楚。

2. 数据管线先立住:从原始图片到可训练张量的完整路径

2.1 为什么数据划分不能随便 split

很多人拿到猫狗图片目录后,直接train_test_split按 8:2 切一刀就开跑。这种做法在图片来自同一批采集源时问题不大,但如果你的数据是从不同渠道拼凑的——比如一部分来自公开数据集,一部分是自己爬的——随机切分会导致训练集和验证集的分布不一致。更隐蔽的问题是:如果同一只猫的多张照片分别落进了训练集和验证集,验证集准确率会被严重高估。

我一般会先检查文件名或目录结构里有没有可以标识"来源"或"个体"的信息。如果有,按个体划分而不是按图片划分。如果没有,至少保证随机种子固定,并且在切分前把整个数据集打乱一次。

import os import random import shutil def split_dataset(src_dir, dst_dir, split_ratio=0.8, seed=42): """ 按类别将图片划分为训练集和验证集 src_dir: 原始目录,结构为 src_dir/猫/xxx.jpg, src_dir/狗/xxx.jpg dst_dir: 输出目录,会生成 dst_dir/train/猫, dst_dir/val/猫 等 """ random.seed(seed) classes = [d for d in os.listdir(src_dir) if os.path.isdir(os.path.join(src_dir, d))] for cls in classes: cls_dir = os.path.join(src_dir, cls) images = [f for f in os.listdir(cls_dir) if f.lower().endswith(('.jpg', '.jpeg', '.png'))] random.shuffle(images) split_idx = int(len(images) * split_ratio) train_imgs = images[:split_idx] val_imgs = images[split_idx:] for subset, img_list in [('train', train_imgs), ('val', val_imgs)]: out_dir = os.path.join(dst_dir, subset, cls) os.makedirs(out_dir, exist_ok=True) for img in img_list: shutil.copy2(os.path.join(cls_dir, img), os.path.join(out_dir, img)) print(f"{cls}: 训练集 {len(train_imgs)} 张, 验证集 {len(val_imgs)} 张") split_dataset('./raw_data', './dataset', split_ratio=0.8, seed=42)

这段代码的核心逻辑是按类别分别切分,保证每个类别的训练/验证比例一致。seed=42是为了让每次运行结果可复现,这在调参阶段非常重要——否则你改了模型结构,验证集变了,根本分不清是模型变好了还是数据变简单了。split_ratio=0.8是常见起点,但如果你的数据总量少于 2000 张,建议改成 0.7,给验证集留出足够的统计意义。

2.2 ImageFolder 与 DataLoader 的配合方式

PyTorch 的ImageFolder要求目录结构严格按类别分文件夹,这正好匹配上一步的输出。但直接用ImageFolder有个坑:它默认按文件夹名的字母顺序分配标签,猫和狗的标签顺序取决于拼音还是英文,不同机器上可能不一致。我一般会显式打印class_to_idx确认一下。

import torch from torchvision import datasets, transforms from torch.utils.data import DataLoader # 训练集增强策略 train_transform = transforms.Compose([ transforms.Resize((256, 256)), # 先放大再裁剪,保留更多信息 transforms.RandomResizedCrop(224), # 随机裁剪到 224,增加尺度多样性 transforms.RandomHorizontalFlip(p=0.5), # 水平翻转,猫狗都适用 transforms.RandomRotation(15), # 小角度旋转,模拟拍摄角度变化 transforms.ColorJitter(brightness=0.2, contrast=0.2, saturation=0.2), transforms.ToTensor(), transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]) ]) # 验证集只做确定性变换 val_transform = transforms.Compose([ transforms.Resize((256, 256)), transforms.CenterCrop(224), transforms.ToTensor(), transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]) ]) train_dataset = datasets.ImageFolder('./dataset/train', transform=train_transform) val_dataset = datasets.ImageFolder('./dataset/val', transform=val_transform) print("类别映射:", train_dataset.class_to_idx) train_loader = DataLoader(train_dataset, batch_size=32, shuffle=True, num_workers=4, pin_memory=True) val_loader = DataLoader(val_dataset, batch_size=32, shuffle=False, num_workers=4, pin_memory=True)

这里有几个参数值得展开说。RandomResizedCrop(224)和前面的Resize((256, 256))配合使用,先统一放大到 256 再随机裁到 224,比直接Resize((224, 224))效果更好,因为随机裁剪引入了平移不变性。Normalize用的均值方差是 ImageNet 的统计值,如果你从零训练而不是用预训练权重,理论上应该用自己的数据集算一遍,但实践中直接用 ImageNet 的值影响很小。num_workers=4在 Windows 上如果报错,改成 0 即可,这是多进程加载在 Windows 上的已知限制。

2.3 数据量不够时,增强策略怎么调

猫狗分类的公开数据集通常有两万多张,但很多人手头只有几百到几千张。数据量少的时候,增强策略要更激进,但也不能乱加。我见过有人在猫狗分类里加RandomVerticalFlip,结果模型把倒过来的猫也学成了猫,验证集上正常图片反而识别率下降——因为自然场景里猫狗很少倒立出现。

一个实用的判断标准是:增强后的图片,你自己还能不能一眼认出类别。如果翻转、旋转、颜色抖动之后你都得犹豫一下,那这个增强就是在制造噪声。对于猫狗这个任务,水平翻转、小角度旋转(±15度以内)、轻微颜色抖动是安全的;垂直翻转、大角度旋转、随机擦除要谨慎使用。

3. 模型选型:从零搭 CNN 还是用预训练 backbone

3.1 一个四层 CNN 的最小可用结构

如果目的是学习 CNN 原理,从零搭一个四层卷积网络是合理的起点。结构不用太复杂,但要保证每一层的输出尺寸和通道数变化有清晰的逻辑。

import torch.nn as nn class SimpleCNN(nn.Module): def __init__(self, num_classes=2): super(SimpleCNN, self).__init__() self.features = nn.Sequential( # 输入 3x224x224 nn.Conv2d(3, 32, kernel_size=3, padding=1), nn.BatchNorm2d(32), nn.ReLU(inplace=True), nn.MaxPool2d(2), # 32x112x112 nn.Conv2d(32, 64, kernel_size=3, padding=1), nn.BatchNorm2d(64), nn.ReLU(inplace=True), nn.MaxPool2d(2), # 64x56x56 nn.Conv2d(64, 128, kernel_size=3, padding=1), nn.BatchNorm2d(128), nn.ReLU(inplace=True), nn.MaxPool2d(2), # 128x28x28 nn.Conv2d(128, 256, kernel_size=3, padding=1), nn.BatchNorm2d(256), nn.ReLU(inplace=True), nn.MaxPool2d(2), # 256x14x14 ) self.classifier = nn.Sequential( nn.AdaptiveAvgPool2d(1), # 256x1x1 nn.Flatten(), nn.Dropout(0.5), nn.Linear(256, num_classes) ) def forward(self, x): x = self.features(x) x = self.classifier(x) return x

这个结构的关键设计点:每个卷积块后面都跟了BatchNorm2d,这在从零训练时能显著加快收敛;AdaptiveAvgPool2d(1)替代了传统的view展平,好处是不管输入尺寸怎么变,输出都是固定维度,避免了全连接层参数量爆炸;Dropout(0.5)放在分类头前面,是防止过拟合的第一道防线。

3.2 预训练模型微调:什么时候该用,怎么用

从零训练一个四层 CNN,在两千张图上大概能跑到 85% 左右的验证准确率。但如果换成 ResNet18 预训练权重,同样的数据量,准确率通常能到 95% 以上。差距来自 ImageNet 上百万张图学到的底层特征——边缘、纹理、简单形状——这些特征对猫狗分类同样有效。

import torchvision.models as models import torch.nn as nn def build_pretrained_model(num_classes=2, freeze_backbone=True): model = models.resnet18(weights=models.ResNet18_Weights.IMAGENET1K_V1) if freeze_backbone: # 冻结除最后全连接层外的所有参数 for param in model.parameters(): param.requires_grad = False # 替换分类头 in_features = model.fc.in_features model.fc = nn.Sequential( nn.Dropout(0.3), nn.Linear(in_features, num_classes) ) return model model = build_pretrained_model(num_classes=2, freeze_backbone=True)

freeze_backbone=True适合数据量小于一千张的情况,只训练最后的分类头,训练速度快且不容易过拟合。如果数据量在两千张以上,可以把freeze_backbone设为False,但要用更小的学习率——通常比从头训练小一个数量级。我一般会分两阶段:先冻结训练 5 个 epoch,再解冻全部参数用 1e-4 的学习率微调 10 个 epoch。

3.3 两种方案的对比与选择依据

维度从零搭 CNN预训练微调
数据需求至少 2000 张500 张即可起步
训练时间较长,需 50+ epoch较短,10-20 epoch
最终准确率85%-90%95%+
学习价值理解卷积、池化、BN理解迁移学习
过拟合风险高低(冻结时)

选择逻辑很简单:如果目标是交作业或快速出结果,直接用预训练;如果目标是搞懂 CNN 每一层在干什么,从零搭一遍再对比预训练的效果,收获更大。我自己的习惯是先用预训练跑一个 baseline,确认数据管线没问题,再换从零搭建的版本,这样能把数据问题和模型问题分开排查。

4. 训练循环里的关键参数与常见报错排查

4.1 学习率、batch size 和优化器的组合逻辑

训练不收敛,十有八九是学习率的问题。Adam 的默认学习率 1e-3 在从零训练时经常太大,loss 会震荡甚至发散;而 SGD 用 1e-3 又太小,收敛慢得让人想砸键盘。我一般从零训练时用 Adam + 1e-4,微调时用 SGD + 1e-3 配合余弦退火。

import torch.optim as optim from torch.optim.lr_scheduler import CosineAnnealingLR def train_one_epoch(model, loader, criterion, optimizer, device): model.train() running_loss = 0.0 correct = 0 total = 0 for images, labels in loader: images, labels = images.to(device), labels.to(device) optimizer.zero_grad() outputs = model(images) loss = criterion(outputs, labels) loss.backward() optimizer.step() running_loss += loss.item() * images.size(0) _, predicted = outputs.max(1) correct += predicted.eq(labels).sum().item() total += labels.size(0) return running_loss / total, correct / total # 训练配置 device = torch.device('cuda' if torch.cuda.is_available() else 'cpu') model = model.to(device) criterion = nn.CrossEntropyLoss() optimizer = optim.Adam(filter(lambda p: p.requires_grad, model.parameters()), lr=1e-4) scheduler = CosineAnnealingLR(optimizer, T_max=30, eta_min=1e-6) for epoch in range(30): train_loss, train_acc = train_one_epoch(model, train_loader, criterion, optimizer, device) scheduler.step() print(f"Epoch {epoch+1}: loss={train_loss:.4f}, acc={train_acc:.4f}")

filter(lambda p: p.requires_grad, ...)这个写法是为了在冻结 backbone 时只更新分类头的参数,避免优化器把冻结层的参数也纳入更新。CosineAnnealingLR的T_max设成总 epoch 数,学习率会从初始值余弦下降到eta_min,这个策略在微调时特别好用,能避免后期学习率过大导致在最优解附近震荡。

4.2 验证集准确率不涨的三种典型原因

第一种是数据标签有问题。我遇到过文件夹名写错导致猫和狗的标签反了,模型训练 loss 正常下降但验证准确率始终在 50% 附近。排查方法是打印一批验证集的图片和对应标签,肉眼确认。

第二种是 BatchNorm 在小 batch 下统计量不准。如果 batch size 小于 16,BatchNorm 的 running mean 和 variance 会波动很大,验证时表现不稳定。解决办法是增大 batch size,或者改用 GroupNorm。

第三种是过拟合。训练准确率 99%,验证准确率 70%,这是典型的过拟合信号。对策按优先级排序:增加数据增强、加 Dropout、加权重衰减、减少模型参数量。不要一上来就加数据,先确认增强策略是否已经用满。

4.3 显存不够时的降级方案

显存不够报CUDA out of memory时,按以下顺序尝试:先把 batch size 减半;如果还不行,把输入尺寸从 224 降到 128;再不行就换更小的模型(ResNet18 换 MobileNetV3);最后才考虑用梯度累积模拟大 batch。

# 梯度累积示例:模拟 batch_size=64 的效果,实际每次只放 16 张 accumulation_steps = 4 optimizer.zero_grad() for i, (images, labels) in enumerate(train_loader): images, labels = images.to(device), labels.to(device) outputs = model(images) loss = criterion(outputs, labels) / accumulation_steps loss.backward() if (i + 1) % accumulation_steps == 0: optimizer.step() optimizer.zero_grad()

注意 loss 要除以accumulation_steps,否则梯度会放大对应倍数。这种写法在显存受限但想用大 batch 稳定训练时非常实用。

5. 避坑指南:五个让猫狗分类翻车的细节

现象一:训练 loss 正常下降,验证准确率始终在 50%。原因通常是标签映射错了,或者验证集的 transform 里混入了随机增强。解决方法是打印class_to_idx和验证集的前几张图,确认标签和图像对应关系正确,并检查验证集的 transform 是否只包含确定性操作。

现象二:第二个 epoch 开始 loss 变成 nan。原因多半是学习率太大导致梯度爆炸,或者数据里有损坏的图片。先把学习率降到 1e-5 试一个 epoch,如果还是 nan,用 PIL 逐张打开图片检查是否有截断文件。另外检查Normalize的均值和方差是否写反了。

现象三:模型在验证集上表现很好,但用手机拍的猫照片预测全错。这是域偏移问题。训练集的猫狗图片通常是正面、光照均匀的,而手机拍的照片角度随意、背景复杂。解决办法是在训练增强里加入更多的随机裁剪和颜色抖动,或者在推理前对输入图片做更严格的预处理——先检测并裁剪出主体区域,再送入模型。

现象四:多进程加载数据时报 BrokenPipeError。这是num_workers设置过大或磁盘 I/O 瓶颈导致的。把num_workers降到 2 或 0,如果问题消失就说明是资源竞争。长期方案是把数据集预处理好存成内存映射文件,避免每次 epoch 都从磁盘读原始 JPEG。

现象五:换了随机种子后结果波动超过 5%。说明模型对初始化敏感,训练不够稳定。对策是增加 epoch 数让模型充分收敛,或者用交叉验证取平均。如果数据量小于一千张,这种波动是正常的,不要试图通过调参完全消除。

6. 把模型用起来:推理脚本与置信度阈值的一个实用技巧

训练完模型只是走完了一半路,真正要用起来还得写推理脚本。很多人直接把model.eval()一开,图片一传就完事,但实际部署时有两个细节值得注意。

第一个是预处理必须和验证集完全一致。训练时用了Resize((256, 256))+CenterCrop(224),推理时也要一模一样,少一步或者顺序错了,准确率就会掉。我一般会把验证集的 transform 单独存成一个变量,推理脚本直接复用。

from PIL import Image import torch import torch.nn.functional as F def predict(image_path, model, transform, class_names, device): model.eval() image = Image.open(image_path).convert('RGB') tensor = transform(image).unsqueeze(0).to(device) with torch.no_grad(): logits = model(tensor) probs = F.softmax(logits, dim=1) confidence, pred_idx = probs.max(1) return class_names[pred_idx.item()], confidence.item() # 使用示例 class_names = ['cat', 'dog'] label, conf = predict('./test.jpg', model, val_transform, class_names, device) print(f"预测: {label}, 置信度: {conf:.4f}")

第二个技巧是关于置信度阈值的。二分类模型输出的 softmax 概率在 0.5 附近时,实际可靠性很低。我一般会设一个阈值,比如 0.7,低于这个值的样本标记为"不确定",而不是强行给出猫或狗的结论。这在真实场景里比强行分类更有用——用户看到"不确定"会重新拍一张,而不是得到一个错误答案。

def predict_with_threshold(image_path, model, transform, class_names, device, threshold=0.7): label, conf = predict(image_path, model, transform, class_names, device) if conf < threshold: return "不确定", conf return label, conf

这个阈值怎么定?拿验证集跑一遍,画出置信度分布图,看看正确预测的样本置信度集中在哪个区间,错误预测的又在哪里。通常正确预测的置信度在 0.85 以上,错误预测的在 0.6 以下,阈值取中间偏保守的位置就行。我自己的习惯是宁可多报"不确定",也不要给用户一个高置信度的错误答案——后者对信任的伤害更大。

最后说一个我踩过的坑:模型训练完保存时,一定要把class_to_idx一起存下来。我见过有人只存了state_dict,换台机器加载时类别顺序反了,猫被预测成狗,排查了半天才发现是标签映射的问题。保存时用torch.save({'model_state': model.state_dict(), 'class_to_idx': train_dataset.class_to_idx}, 'model.pth'),加载时先恢复映射再推理,这个习惯帮我省了很多后悔药。希望帮到你。

本文还有配套的精品资源,点击获取

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询