☰
基于ResNet 的端到端的视觉空间定位方法研究大数据专业毕业设计深度学习图像识别
2026/9/28 4:42:18 网站建设 项目流程

✅源码获取:
🍅--------------------【点击左上方头像,在置顶文章上方的wx】联系我们-----------------🍅

✌网站介绍:✌10年+项目辅导经验、专注于计算机技术领域学生项目实战辅导。

✌服务范围:大数据、机器学习、Java(SpringBoo/SSM)、Python、PHP、Nodejs、爬虫、数据可视化、小程序、安卓app等设计与开发。

✅优秀相关专栏推荐✅

2024-2025年最全的计算机软件毕业设计选题大全:1000个热门选题推荐✅

Java精品实战项目1000+

Python精品实战项目1000+

ASP.NET精品实战项目1000+

PHP精品实战项目1000+

APP精品实战项目1000+

微信小程序精品实战项目1000+

Node.js精品实战项目1000+

随着移动机器人、自主导航、增强现实和智慧空间等应用的发展,基于图像的视觉空间定位技术受到越来越多关注。针对传统定位方法在复杂建筑场景中部署成本高、流程复杂等问题,本文围绕端到端视觉空间定位方法展开研究,设计并实现了一个基于单张场景图像预测相机三维位置的实验系统。系统采用 Cambridge Landmarks 数据集中的 Kings College 场景作为实验对象,输入为单张 RGB 图像,输出为相机在场景坐标系下的三维位置坐标 x、y、z。本文首先完成数据集解析、图像预处理和坐标标准化处理;然后构建 ResNet18 空间位置回归基线模型、改进 ResNet 空间位置回归模型和 YOLO11 改造空间位置回归模型,并进行对比实验。改进 ResNet 模型在 ResNet18 骨干网络基础上引入门控残差修正结构,使模型能够在稳定主预测基础上学习细粒度位置偏差。实验结果表明,改进 ResNet 模型平均定位误差为 1.208 m,低于 ResNet18 基线模型的 1.333 m,Success@1m 达到 61.8%,优于基线模型的 59.8%;YOLO11 改造模型平均误差为 4.016 m,说明目标检测模型直接迁移到整图空间坐标回归任务时适配性较弱。最后,本文基于 FastAPI 和 Vue 实现了视觉空间定位实验系统,支持数据集展示、图像推理、训练指标可视化和模型对比分析。实验结果验证了端到端视觉空间定位方法的可行性,也说明门控残差修正结构能够提升连续空间坐标回归效果。

    1. 模型搭建

本文围绕单张图像视觉空间定位任务搭建三类模型,分别为 ResNet18 空间位置回归基线模型、改进 ResNet 空间位置回归模型和 YOLO11 改造空间位置回归模型。三类模型均以 Kings College 场景图像作为输入,以相机三维空间位置坐标 x、y、z 作为输出目标。由于本文当前阶段不进行姿态预测,因此标注文件中的四元数字段 w、p、q、r 仅作为原始数据保留,不参与模型训练和评价。

      1. ResNet18 空间位置回归基线模型

ResNet18 空间位置回归基线模型以 ResNet18 作为视觉特征提取骨干。原始 ResNet18 主要用于图像分类任务,其输出为类别概率。本文将其最后的分类层替换为空间位置回归头,使模型能够从整张图像中提取全局视觉特征,并输出三维位置坐标 x、y、z。该模型的基本流程为:输入图像经过 ResNet18 卷积骨干网络得到 512 维全局特征,再通过全连接回归头映射为 3 维坐标输出。回归头结构为 Linear(512,256) -> ReLU -> Dropout(0.2) -> Linear(256,3)。该模型结构相对简单、训练稳定,主要用于提供基础对比结果,验证卷积神经网络进行空间位置回归的可行性。

      1. 改进 ResNet 空间位置回归模型

改进 ResNet 空间位置回归模型是本文的主要模型。该模型同样采用 ResNet18 作为视觉特征提取骨干,但在回归头部分引入门控残差修正结构。模型首先通过 ResNet18 提取 512 维全局视觉特征,然后将特征同时输入主回归分支和残差修正分支。主回归分支保持与基线模型相同的结构,用于输出基础位置预测;残差修正分支采用轻量结构学习主预测之外的坐标修正量。最终输出形式为 position = base(features) + residual_scale * residual(features)。其中,residual_scale 由可学习门控参数控制,残差分支最后一层采用零初始化,使模型训练初期接近基线预测,随后逐步学习细粒度位置偏差。该结构能够在保持训练稳定性的同时增强坐标修正能力。

      1. YOLO11 改造空间位置回归模型

YOLO11 改造空间位置回归模型用于对比分析目标检测骨干在视觉定位任务中的适配性。YOLO11 原本面向目标检测任务,主要输出目标框和类别信息,而本文任务不涉及目标框和类别预测,因此需要将其改造为三维位置回归模型。本文保留 YOLO11 的特征提取能力,并将输出目标调整为相机位置坐标 x、y、z,使其能够完成整图到连续坐标的预测。由于 YOLO 系列模型更强调局部目标检测特征,而视觉空间定位更依赖整张图像的全局场景结构,因此该模型主要作为可行性对比方案,用于说明检测模型直接迁移到空间定位任务时可能存在的局限。

    1. 模型训练与优化

本文模型训练目标是最小化预测位置与真实位置之间的误差。训练时,模型输入为经过预处理的场景图像,输出为标准化后的三维位置坐标。系统根据模型输出与真实标注计算损失,并通过反向传播更新模型参数。

损失函数方面,本文以 SmoothL1 损失作为基础位置回归损失。SmoothL1 损失在误差较小时具有较高回归精度,在误差较大时对异常值不敏感,因此适合用于视觉空间定位这种连续坐标回归任务。除此之外,训练过程中还结合真实米制位置误差和定位成功阈值约束,使模型优化目标更加贴近最终评价指标。

优化器方面,本文采用 AdamW 优化器。AdamW 具有较好的训练稳定性,并能通过权重衰减降低模型过拟合风险。学习率调度方面,本文采用余弦退火策略,使学习率随着训练逐渐减小,从而帮助模型在训练后期稳定收敛。

训练过程中记录每一轮的训练损失、验证损失、平均位置误差、中位位置误差、P90 误差、Success@0.5m、Success@1m、Success@2m 和训练耗时等指标。同时,系统根据验证结果保存表现最优的模型权重,并生成训练日志和训练曲线,便于后续进行实验分析和系统展示。

      1. 训练数据加载

模型训练入口位于 training/train.py 文件中。程序运行后首先对训练参数进行解析,主要包括模型名称、训练轮数、批量大小、学习率、随机种子以及运行设备等内容。为保证实验结果的稳定性和可复现性,程序调用 seed_everything() 函数,对 Python、NumPy 和 PyTorch 中的随机种子进行统一固定,从而减少随机初始化和数据加载顺序对实验结果的影响。

在数据加载阶段,训练集和测试集分别通过 KingsCollegePoseDataset("train") 和 KingsCollegePoseDataset("test") 构建,并进一步利用 DataLoader 进行批量化读取。其中,训练集设置 shuffle=True,以增强样本输入顺序的随机性;测试集设置 shuffle=False,保证评估结果的一致性。根据项目配置文件,模型训练默认批量大小为 8。经过数据加载后,每个批次均包含输入图像张量及其对应的三维位置标签,为后续模型前向传播和损失计算提供数据基础。

      1. 训练曲线展示

训练曲线展示用于反映模型在训练过程中的收敛情况。系统读取训练过程中保存的日志和指标文件,将训练损失、验证损失、位置误差等信息展示在前端页面中。通过训练曲线,用户可以观察模型是否稳定收敛,以及不同模型之间的训练趋势差异。

在本文实验中,ResNet18 基线模型和改进 ResNet 模型整体收敛较为稳定,验证误差随着训练轮次增加逐渐下降。YOLO11 改造模型虽然也能够完成训练,但误差波动相对明显,最终定位精度明显低于 ResNet 系列模型。这说明对于本文的整图空间位置回归任务,ResNet 系列模型更适合作为视觉特征提取骨干。

图4-1 模型训练损失曲线展示页面

      1. 定位误差指标展示

定位误差指标展示用于直观呈现模型的空间定位精度。系统主要展示平均位置误差、中位位置误差、P90 误差、Success@0.5m、Success@1m 和 Success@2m 等指标。平均误差反映模型整体预测偏差,中位误差能够降低极端异常样本影响,P90 误差用于观察大部分样本的误差范围,Success 指标则用于衡量不同精度阈值下的定位成功率。

根据实验结果,改进 ResNet 模型的平均误差为 1.208m,低于 ResNet18 基线模型的 1.333m;改进 ResNet 的 Success@1m 为 61.8%,高于 ResNet18 的 59.8%。这说明改进模型在整体定位误差和 1m 精度阈值下均有提升。YOLO11 改造模型平均误差为 4.016m,Success@2m 仅为 23.6%,明显低于 ResNet 系列模型。

图4-2 定位误差指标展示页面

      1. 单图预测结果展示

单图预测结果展示是系统的重要交互功能。用户可以在前端选择数据集中的测试图像,或上传本地图像,系统调用后端推理接口完成模型预测。对于数据集测试图像,系统可以同时展示预测坐标、真实坐标、位置误差和推理耗时;对于用户上传图像,由于没有真实标注,系统只展示预测坐标和推理耗时。

该功能使用户能够直观观察模型对单张图像的定位效果。对于测试集图像,预测结果可以直接与真实坐标进行比较,从而判断模型定位是否准确。对于上传图像,需要注意模型学习的是 Kings College 场景坐标系,如果上传其他场景图像,模型仍会输出数值,但该结果不一定具有可靠空间意义。

图4-3 单张图像定位预测结果展示页面

      1. 模型对比结果展示

模型对比结果展示用于比较不同模型在同一数据集上的定位效果。系统将 ResNet18 基线模型、改进 ResNet 模型和 YOLO11 改造模型的训练结果进行统一展示,包括验证损失、平均误差、中位误差、P90 误差和不同阈值下的成功率。

通过对比可以看出,改进 ResNet 模型在综合误差指标上优于 ResNet18 基线模型,说明门控残差修正结构能够提升连续坐标回归效果。YOLO11 改造模型表现明显较弱,说明目标检测模型并不适合直接作为本文整图视觉空间定位任务的主模型。因此,系统最终选择改进 ResNet 作为默认推理模型。

图4-4 三类模型实验结果对比页面

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询