ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

CVAT 图像视频标注平台完整指南:如何快速自建并接入 AI 自动标注

2026/9/10 11:39:14 拓冰建站 浏览量
CVAT 图像视频标注平台完整指南:如何快速自建并接入 AI 自动标注 CVAT 图像视频标注平台完整指南如何快速自建并接入 AI 自动标注【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvatCVATComputer Vision Annotation Tool是一个面向图像、视频和 3D 点云的开源标注平台。你可以用它画框、画多边形、描掩码、标 3D 立方体还能接入自己的模型做自动标注。它适合需要自建高质量视觉数据集的研究者、算法工程师和数据团队。本文基于开源的 CVAT Community 版讲清楚从部署到 AI 辅助标注的完整路径。它解决什么问题训练视觉模型时最耗时的环节往往不是调参而是标注几十张图还好几十万张就得靠人工一帧帧画速度慢、口径不一、结果难管理。CVAT 把整条标注流程搬到了 Web 端——上传数据、定义标签、手工绘制、质量审核、按格式导出、多人分工都在同一个界面里完成。数据存在你自己的服务器上不出内网标注完直接导出 COCO、YOLO 这类训练框架认的格式。核心能力拆解 形状标注从 2D 到 3D支持矩形框、多边形、掩码、关键点、标签、骨架等标注类型视频里还能用插值和跟踪减少逐帧工作量标第 0 帧和第 100 帧中间的帧由插值补出来。3D 点云标注上传 PCD、BIN 等点云数据后可在顶视、侧视、前视三个视图联动画 3D 立方体适合 LiDAR 数据。点云相关的格式实现见 cvat/apps/engine/。AI 自动标注仓库内置了 9 个开箱即用的 serverless 模型基于 Nuclio 部署交互式分割SAM、IOG——点一下前景自动生成掩码检测YOLO v7、RetinaNet R101、Faster RCNN、Mask RCNN、人脸检测姿态与跟踪HRNet32 全身姿态、TransT 目标跟踪模型清单和源码在 serverless/ 下。自动标注的结果不是直接入库而是变成待人工确认的形状只留校对这一环节给标注员。能力典型场景产出手工绘制图像/视频中任意形状目标框、多边形、掩码、track 标注3D 立方体自动驾驶 LiDAR 数据KITTI / Velodyne 格式点云标注AI 自动标注大批量数据集冷启动一键生成检测结果人工只需校对团队评审多人协作或外包标注consensus 对比、质量报告快速上手 准备环境装好Docker Engine、Docker Compose 和 Git浏览器用 Chrome 或 Edge。获取源码git clone https://gitcode.com/GitHub_Trending/cvat/cvat启动服务cd cvat docker compose up -d可选export CVAT_HOST你的域名指定访问地址。创建管理员docker exec -it cvat_server bash -ic python3 ~/manage.py createsuperuser登录开干打开http://localhost:8080建一个 project 或 task上传图像、视频或点云定义标签开始标注。版本与方式选择官方提供四种使用方式对应不同预算和数据敏感度方式是什么适合谁关键点CVAT Online官方托管云有免费档个人尝鲜免部署浏览器直接用CVAT CommunityMIT 协议开源自托管版中小团队数据全在自己服务器可定制CVAT Enterprise企业自托管 支持服务企业SSO、SLA、安全合规Labeling Services官方标注服务外包不想自建团队项目期可试用 CVAT Online一句话建议个人先用 Online 免费版验证想法团队对数据有保密要求就上 Community 自托管企业需要 SSO 和 SLA 时再上 Enterprise。实战落地自动驾驶对行车视频标车辆、行人、交通标志LiDAR 数据用 3D 立方体直接导出 KITTI 格式喂给 3D 检测模型。目标检测训练矩形、多边形批量标注导出 COCO 或 YOLO 格式接进现有训练流水线。姿态估计关键点工具画骨架导出姿态相关数据集构建动作分析样本。精细分割用掩码和多边形逐像素标病灶或产品缺陷导出与分割框架对接。多人协作任务拆成 job 分配给不同标注员评审用 consensus 比对结果问题在审核环节就暴露出来。生态与扩展输入格式图像、视频FFmpeg 负责拆帧、3D 点云PCD/BIN。导入导出 20 格式CVATXML、COCOJSON、YOLOTXT、Pascal VOC、KITTI、MOT、Cityscapes、CAMVID 等实现都在 cvat/apps/dataset_manager/formats/。云存储接入 S3、Azure Blob、Google Cloud大文件直接从云读不走本地上传。开发者接口Python SDKpip install cvat-sdk、命令行工具cvat-cli、完整 REST API见 cvat-sdk/ 和 cvat-cli/。可观测与集成Grafana 仪表盘 监控标注进度、用户活动和服务器日志webhook 推送 可把任务状态变化回调给外部系统。避坑与技巧 ⚠️Safari 打开页面异常CVAT 主要测试 Chromium 内核Chrome/Edge不支持 Safari → 用 Chrome 或 Edge 访问。升级后视频拆帧对不上2.47.0 版本 FFmpeg 从 4.3.1 升到 8.0个别视频拆出的帧可能不同 → 用 utils/ffmpeg_compatibility/ 里的脚本把任务切回静态分块用旧版 FFmpeg 重新生成帧。界面里找不到自动标注模型serverless 组件默认不启动 → 用docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d启动再用 nuctl 部署需要的函数。本地上传大图像集很慢改接 S3/Azure/GCP 云存储任务直接从云端拉数据。不同人标出口径不一开 consensus 副本让两人标同一段再配合 Ground Truth、Honeypot 检查差异在评审时就能看出来。导出格式和训练框架不匹配别急着找转换脚本先看导出列表COCO、YOLO、Pascal VOC、KITTI 等 20 格式都能直接选。进阶路线先把手工标注用熟矩形、多边形、属性定义标出一批基础数据集。学视频标注的效率技巧插值、track 跟踪和快捷键。接入自动标注部署 serverless试 SAM 交互式分割和 YOLO 检测。把团队拉进来建组织、分配角色、用评论和 issue 做评审。用 SDK、CLI 和 REST API 写脚本把标注流程接进数据管线。CVAT 把标注从纯手工活变成了一条可管理的数据流水线手工绘制打底AI 加速冷启动评审保证质量导出一步到位。今天就可以动手克隆仓库、跑docker compose up -d十几分钟后就能在浏览器里画出第一组标注。第一批数据标完再挂一个检测模型上来第二批的速度会完全不同。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考