CVAT计算机视觉标注工具指南:从本地部署到完成第一次数据集导出
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
做视觉模型最容易卡在数据标注环节:用看图软件一张张开图、画框、改名,既慢又难保证一致性。CVAT(Computer Vision Annotation Tool)是一个可自托管的标注平台,用 Docker Compose 部署到本机后,在浏览器里建任务、画框和多边形、标掩膜,再导出 COCO、YOLO 等标准格式,供训练直接使用。
CVAT标注能做什么:能力清单一览
上手之前,先明确它解决哪些问题:
- 支持图像、视频和三维点云标注,标注类型包括矩形框、多边形、掩膜、关键点和立方体
- 项目、任务、作业三级结构,可指派给不同成员并跟踪进度
- 接入自有模型自动标注,先生成结果再由人工修正
- 导入导出 COCO、YOLO、Pascal VOC、KITTI 等 20 多种格式
- REST API、Python SDK、CLI 全面可编程,便于嵌入训练流程
从克隆到打开页面:最小部署跑通
官方部署基于 Docker Compose 文件,本机装好 Docker 即可。
- 克隆仓库并启动服务:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d这样做是因为一条命令就能把前端、后端、数据库和任务 worker 一起拉起,无需逐项配置。
- 等待服务就绪。首次运行要拉取多个镜像,通常 5~10 分钟,用
docker compose ps确认容器均为 Up 状态即可。 - 浏览器打开 http://localhost:8080 直接注册账号(默认配置开放了注册)。若希望先建超级用户,执行下面的命令创建,后续权限与成员邀请都以它管理:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'一个真实任务:从上传图片到导出数据集
接着走一遍典型流程:给一组图片标出"人"和"车"两类,并导出结果。
- 创建任务:Tasks 页 → New task,选择本地文件上传,放入几张图片或一个压缩包。
- 定义标签:在任务详情页用 Add label 添加 person 和 car,可继续给标签配置颜色、遮挡等属性。
- 开始标注:Jobs 列表里点进作业进入标注界面,左侧选矩形工具,右侧选标签,在图上拉框,按 Tab 跳到下一帧继续。
- 可选:让模型先画。右上角 AI Tools 入口选 YOLO v7 等模型,把模型类别与任务标签对应后点 Annotate,方框一次性生成,人工只需修正。这一步需要部署时加入 serverless 组件(components/serverless/ 目录)并部署对应模型函数。
- 导出数据集:回到任务页的导出区,选 COCO(JSON)或 YOLO(TXT),导出下载后即可投入训练。
新手最容易踩的四个坑与常见疑问
卡住是正常过程,下面四个问题覆盖了大部分卡点:
启动后打不开页面或很慢?首启要拉镜像和构建服务,等 5~10 分钟属正常;仍不行就用docker compose logs server看日志,并确认 8080 端口未被占用。
上传了视频却要求逐帧标注?视频任务会自动切分成若干作业;在作业内改用 track 类型并开启插值,只需标出几帧关键位置,中间帧会自动补全。
标注界面看不到自动标注按钮?默认部署不含模型服务,需要先以 serverless 组件启动,并用 nuctl 部署所需模型函数(如 SAM、YOLO)后,界面才会出现该入口。
导出发现格式选错了?按训练框架需要选择:COCO 是 JSON,检测与分割最常用;YOLO 是 TXT,对应 Ultralytics 系框架;Pascal VOC 是 XML。总共有 20 多种格式,可在导出页随时换格式重新导出。
部署之后:接下来往哪走
第一个任务完成后,下一步是把它变成团队流程:用组织和角色分工标注与审核,用 Webhook 把标注进度同步到其他系统,用 SDK 批量处理数据。仓库内 site/content/en/docs/ 收录了各工作流与 API 的章节,cvat-sdk/ 提供了批量创建任务与导出的示例,想加快标注速度可参考 serverless/ 里的模型案例。当这个小型数据集标注完并导出为 COCO 时,从原始图片到可用训练集的闭环已经跑通。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考