CVAT LiDAR 点云标注实战指南:从导入到交付的 5 个关键步骤
2026/9/10 16:07:30 网站建设 项目流程

CVAT LiDAR 点云标注实战指南:从导入到交付的 5 个关键步骤

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

早上收到一批路测 LiDAR 点云,500 帧,周五要交付。你从没做过 3D 标注,打开 CVAT 不知道从哪下手。这篇文章就用这个场景,带你把数据打包、四视图标 3D 框、导出交付这条 LiDAR 点云标注的完整流程走一遍。LiDAR 就是会向四周"喷点"的激光雷达,一帧路测数据里能有几十万个点。

先搞清楚 3D 标注难在哪

点云标注的难点不在操作,而在三点:

  • 数据量与维度。一帧点云有几十万个点,每个点都带三维空间坐标。2D 任务标的是图片里的框,3D 任务标的是整幅空间场景,你必须能"转着看"才能确认物体在哪。
  • 精度要求高。一个 3D 框包含位置、尺寸、朝向共 9 个参数,高度差 5 厘米或者车头朝向标错,框在检测模型那里都算废的。
  • 单靠点云信息不足。深色车和浅色车在点云里长得几乎一样,不借助参照无法分辨。所以实际项目里点云几乎总要与同帧的相机画面配合,CVAT 把这类图片叫related images,标注时右侧能直接看到对应画面。

想清楚这三点,后面整理数据、做质检时你就知道各自在解决什么问题。

整理数据:一帧对应一份点云

📁 在 CVAT 里建 3D 任务前,需要先把点云和图像打包成约定的目录结构。常见两种:

格式目录结构特点
PCD + 关联图像pointcloud/00001.pcd+related_images/00001_pcd/*.png通用点云格式,按帧号关联相机图
Velodyne 原始数据velodyne_points/data/*.bin+data/*.png自动驾驶数据集常见,保留原始激光雷达二进制

点云和图像的帧号对应上,CVAT 就能自动配对。如果不想按上面两个目录摆,也可以把同名的.pcd.png直接放进同一个data/文件夹:

data/ 00001.pcd 00001.png

具体命名规则以官方文档为准,细节可看 3D 任务的数据格式说明。

创建 3D 任务:一次调用完成

数据整理好后,从网页界面或 SDK 建任务都可以,脚本方式更适合批量路测数据。核心就两件事:定义标签、上传压缩包:

from cvat_sdk import Client client = Client() task = client.tasks.create({ 'name': 'road_test_500', 'labels': [{'name': 'car'}, {'name': 'pedestrian'}, {'name': 'cyclist'}], }) task.upload_data(['velodyne_points.zip'])

上传的是 3D 数据时,任务会被自动识别为 3D,不用额外勾选。上传完成后打开任务对应的 job,看到的标注界面如下:

上方大窗是透视视图,下方三个小窗是顶视、侧视、前视投影,右侧面板是对象列表和标签、属性设置。前端渲染由 3D 画布模块 完成,大点云也能流畅缩放和旋转。

四视图怎么配合标一个 3D 框

🎯 标注界面是"一大三小"布局,三个小窗显示的是当前选中对象的投影,不是三幅独立画面。标好一个 3D 框的协作方式:

  1. 透视主视图放初框:对象面板选"Draw new cuboid",选好标签,框跟着光标走,放到目标上确认。
  2. 顶视图校平面位置:投影里框要贴合目标点云,拖动边缘调整 X/Y 位置。
  3. 侧视图调高度与尺寸:侧投影能清楚看到框底与地面的距离,顺便改尺寸。
  4. 前视图验朝向:确认车头朝向和车身宽度没标歪。

调整完成后四个视图联动更新,主视图里的红色框和三个投影窗里的框是同一个对象:

工具怎么选:车辆、行人、路锥这类刚体目标用立方体(cuboid),它是自动驾驶数据集的主力工具;要标关节关系(人体姿态、车辆部件)时用关键点/骨骼工具;需要点云做逐点语义划分时用分割工具(3D 任务下的支持范围以官方文档为准)。对一辆贯穿几十帧的车,用Track模式只标关键帧、中间帧交给插值,比逐帧修正省力得多。

提效与质检:预标注和质量指标看什么

⚡ 500 帧数据纯手标最慢,常规组合是:

  • 预标注:先用训练好的模型给部分帧生成初始标注(CVAT 支持 AI 辅助标注),你只做修正和微调,修正量通常远低于从零画起。
  • 跟踪插值:对跨多帧的目标只标关键帧,CVAT 自动插出中间帧位置,同一物体还会获得一致的 ID。

标完之后的质检不是"再人肉看一遍",而是看指标:

指标回答的问题
位置 IoU框和目标的点云重合度,错位是否超差
尺寸与朝向误差长宽高是否接近真实物体、车头朝向是否标反
类别与属性误分类对象、漏标的遮挡/截断属性是否为 0

CVAT 的 质量控制模块 提供自动化质检报告,交付前可以批量核对上面这些指标。

点云标注的流程是固定的,难在每一帧的细节。建议先拿 100 帧、场景简单的数据把打包、建任务、四视图标注、导出整条流程跑通,能流畅标对一个 3D 框之后,扩到 500 帧、5000 帧只是时间和预标注的问题。

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询