VIA:一个用单个 HTML 文件运行的离线图像、音频和视频注释工具
2026/8/21 23:46:00 网站建设 项目流程

VIA:一个用单个 HTML 文件运行的离线图像、音频和视频注释工具

【免费下载链接】via(MIRROR) see https://gitlab.com/vgg/via/项目地址: https://gitcode.com/gh_mirrors/via/via

给图片画框、给视频打时间点,这类"人工标注"是训练模型前绕不开的一步。大多数标注工具要么要装服务器,要么要配数据库,对只想快速标几百张图的个人用户来说负担太重。VIA(VGG Image Annotator,牛津大学视觉几何组出品的注释工具)把整个软件压缩进一个不到 400KB 的 HTML 页面,浏览器打开即用,不联网也能标。

拿到它之后如何开始使用

不需要安装任何依赖。克隆仓库后在本地浏览器打开对应版本的 HTML 入口即可,例如 3 版对应 via-3.x.y 源码目录中的各注释器页面。想从源码构建,可以用仓库内的打包脚本合并 HTML/CSS/JS,例如 via-3.x.y/scripts/pack_via.py。

如果需要离线拿到完整代码:

git clone https://gitcode.com/gh_mirrors/via/via

仓库按大版本分成 via-1.x.y、via-2.x.y、via-3.x.y 三个目录,选 3.x.y 就是最新的功能集。仓库里还带了预置示例数据的 demo 页面(如via-3.x.y/data/demo/下的图像、视频、音频注释 demo),打开就能直接上手练习,不用自己先准备素材。

三种媒体一次搞定

VIA 的覆盖范围比"图片标注工具"这个常见定位要宽:

  • 图像:支持矩形、圆、椭圆、多边形、折线、点等多种区域形状,每个区域还能挂属性(如下拉框、单选、复选、文本),标注时不用反复切页面。
  • 视频:既能做时间轴切分("第 3.2 秒到 8.7 秒发生了什么"),也能在某一帧上画空间区域,两类信息关联在一起记录。
  • 音频:按时间段划分说话人或事件,3.0.9 版本还加入了字幕编辑和波形相关功能。

上图为 1.x 版界面:左侧选择区域形状,右侧在图片上直接绘制,下方表格集中管理所有区域的属性值。

标注结果能导出哪些格式

这是判断标注工具实用性的关键。VIA 导出以 CSV 为主(含空间区域和时间段两类 CSV),同时支持 JSON 项目文件的导入导出,3.0.8 起还提供把视频逐帧标注转成 COCO 格式的导出页(via3_video_annotation_to_coco.html),方便直接对接下游训练框架。导入侧也兼容 COCO 格式,已有 COCO 数据集的用户可以先导入再用 VIA 人工修正。另外,标注项目可保存到浏览器本地存储,也支持多人协作共享项目并做三方合并,避免同一批数据被反复标注。

上图是 2.x 版的人脸轨迹模式:同一个人在 165 帧里的区域被自动归为一组,只需在底部表格填一次名字和属性,适合做跨帧跟踪类标注。

它适合谁、不适合谁

适合:需要快速人工标注图像、音频、视频的算法学生、研究团队;想要零成本、可商用(BSD-2 协议,学术和商业均可用)标注方案的个人开发者;以及标注量在几百到几万条之间、无需团队协作后台的小型项目。

不适合:需要权限管理、任务分发的企业级标注平台;对像素级精细分割(如逐像素 mask)有强需求的场景,VIA 的区域以边界框和多边形为主。

背后是牛津 VGG,且更新节奏清晰

VIA 由牛津大学视觉几何组(VGG)开发,2016 年 8 月立项,v1 于 2017 年 4 月发布,v2(2018 年 6 月)扩展了图像标注能力,v3(2019 年 5 月)加入音频和视频支持;到 2019 年 7 月累计使用已超 100 万次。技术实现刻意保持"纯 HTML + CSS + JavaScript、零外部库依赖",via-3.x.y/CodeDoc.md 对代码结构和项目 JSON 格式都有说明,想二次开发的读者从这里入手成本很低。

如果你只是想给一批图片或一段音视频做人工标注、且希望过程完全不依赖网络和安装,VIA 基本是同类工具里启动成本最低的选择;反过来,若你的核心诉求是团队协作流程管理,则需要另找平台型工具。

【免费下载链接】via(MIRROR) see https://gitlab.com/vgg/via/项目地址: https://gitcode.com/gh_mirrors/via/via

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询