Daily

AsmBB
登录

计算机视觉的标注与训练技术:从人工画框到自监督时代
0

#63 (ツ) admin
创建于 03:38, 浏览:4 次。

计算机视觉的标注与训练技术:从人工画框到自监督时代


引言

计算机视觉模型的能力上限,很大程度上取决于两件事:数据被标注得有多好,以及训练方式有多聪明。过去十年,标注从纯手工画框演进到半自动预标注,训练从监督学习扩展到自监督与多模态对齐。这篇文章梳理这两条线索上的关键技术,帮助你理解一个视觉模型从“看见”到“看懂”的完整过程。


一、标注的基本形态

不同的视觉任务对应不同的标注形式,标注的复杂度直接决定了数据成本。

任务类型

标注形式

典型代表

图像分类

整张图一个类别标签

ImageNet

目标检测

矩形框 + 类别

COCO、VOC

语义分割

逐像素类别

Cityscapes

实例分割

每个对象的像素掩码

COCO Mask

关键点

人体/物体的关节点坐标

COCO Keypoints

全景分割

语义 + 实例统一

ADE20K

标注粒度越细,单张图的成本越高。一张分类标签可能只需几秒,而一张精细的实例分割掩码可能需要几分钟甚至更久。


二、标注工具与流程

2.1 常见标注工具

  • LabelImg:轻量级目标检测标注工具,输出 PASCAL VOC 或 YOLO 格式

  • CVAT:支持检测、分割、关键点、追踪的多人协作平台

  • Label Studio:通用标注框架,支持图像、文本、音频多模态

  • Supervisely:面向企业的全流程标注与数据管理方案

  • Roboflow:在线标注 + 数据增强 + 格式转换一体化

2.2 标注流程的关键环节

  1. 制定标注规范:明确边界框贴合程度、遮挡处理、类别定义等细则

  2. 预标注:用已有模型生成初稿,人工只需修正

  3. 交叉验证:多人标注同一批数据,计算一致性指标

  4. 质量抽检:按比例随机抽查,控制整体错误率

  5. 版本管理:标注结果与模型版本对应,保证可复现

其中预标注是近年来降低成本的核心理念。先用一个基础模型跑出候选框,人工从“画框”变成“改框”,效率通常能提升三到五倍。


三、半自动与自动标注

3.1 主动学习

主动学习的思路是:让模型自己挑出“最不确定”的样本交给人工标注。常见的不确定性度量包括:

  • 分类置信度低

  • 多模型预测分歧大

  • 特征空间中远离已标注样本

  • 对损失函数贡献大

这样可以用更少的标注量达到相同的模型精度,在工业质检、医学影像等标注昂贵的场景中尤其有效。

3.2 自训练与伪标签

先用少量标注数据训练一个教师模型,用它给大量未标注数据打伪标签,再让学生模型在这些伪标签上继续训练。关键是设置置信度阈值和类别平衡策略,避免错误标签被放大。

3.3 基础模型辅助标注

SAM 系列分割模型出现后,标注方式发生了明显变化。给一个点或一个框,模型就能输出精细掩码,人工只需判断是否准确。这类“提示式标注”大幅降低了分割任务的成本。


四、训练技术主线

4.1 监督学习

最经典的方式:有标注数据 + 损失函数 + 反向传播。目标检测中常用的损失包括分类损失和回归损失,例如:

# 简化的检测损失示意
loss_cls = F.cross_entropy(cls_pred, cls_target)
loss_box = F.smooth_l1_loss(box_pred, box_target)
loss = loss_cls + lambda_box * loss_box

4.2 数据增强

数据增强是提升视觉模型泛化能力最便宜的手段。常见方法:

  • 几何变换:翻转、旋转、裁剪、缩放

  • 色彩变换:亮度、对比度、饱和度抖动

  • 遮挡类:Random Erasing、Cutout、GridMask

  • 混合类:MixUp、CutMix、Mosaic

  • 自动增强:AutoAugment、RandAugment、TrivialAugment

其中 Mosaic 和 MixUp 在检测任务中尤为常用,能显著提升小目标与遮挡场景的表现。

4.3 迁移学习与微调

在大规模数据集上预训练的骨干网络,通常比从头训练效果更好。微调策略包括:

  • 冻结骨干,只训练头部

  • 分层学习率,浅层小、深层大

  • 全量微调

  • LoRA 等参数高效微调方法

4.4 自监督学习

自监督的核心思想是:不需要人工标签,从数据本身构造监督信号。主要路线有两条:

对比学习:让同一图像的不同增强视图在特征空间中靠近,不同图像远离。代表方法有 SimCLR、MoCo、BYOL。

掩码建模:遮住图像的一部分,让模型预测被遮住的内容。代表方法有 MAE、BEiT、SimMIM。

自监督预训练 + 少量标注微调,已经成为视觉领域的主流范式之一。


五、多模态与视觉语言训练

CLIP 的出现改变了视觉模型的训练方式。它用海量图文对做对比学习,让图像和文本映射到同一特征空间。带来的直接好处是:

  • 零样本分类:用文本描述当分类器

  • 开放词汇检测:检测任意文本指定的类别

  • 图文检索:跨模态搜索

  • 为下游任务提供更强的初始化

后续的 BLIP、LLaVA、Qwen-VL 等模型进一步把视觉编码器与大语言模型连接,使视觉任务可以用自然语言指令驱动。


六、训练中的常见问题与对策

问题

表现

常见对策

过拟合

训练集好、验证集差

增强、正则、早停、更多数据

类别不平衡

少数类召回低

重采样、Focal Loss、类别权重

小目标漏检

小物体 AP 低

高分辨率、FPN、Mosaic、切片推理

标注噪声

指标虚高、泛化差

标签清洗、鲁棒损失、一致性检查

域偏移

换场景后性能骤降

域随机化、域适应、持续学习


七、一条典型的落地流程

  1. 明确任务与评价指标

  2. 收集并清洗数据

  3. 制定标注规范,小批量试标

  4. 预标注 + 人工修正,形成初版数据集

  5. 选择预训练骨干,搭建训练 pipeline

  6. 数据增强与损失函数调优

  7. 主动学习迭代,补充难例

  8. 模型压缩与部署

  9. 线上监控与回流再训练


总结

标注和训练是计算机视觉的两条腿。标注决定了模型能看到什么,训练决定了模型能学到什么。当前的趋势很清晰:标注侧靠基础模型和主动学习降低人工成本,训练侧靠自监督和多模态预训练减少对标注的依赖。两者结合,正在把视觉模型的落地门槛一步步拉低。

延伸阅读方向

如果你想深入某个方向,可以从这几条线切入:

  • 标注质量评估:Kappa 系数、标注一致性分析

  • 主动学习策略:不确定性采样、多样性采样、混合策略

  • 自监督方法对比:对比学习 vs 掩码建模的适用场景

  • 视觉语言模型:CLIP 之后的对齐方法与指令微调

  • 高效训练:混合精度、梯度累积、分布式数据并行

计算机视觉的标注与训练技术:从人工画框到自监督时代
0

AsmBB v3.0 (check-in: 3df85ed0b218e51a); SQLite v (check-in: 831d0fb2836b71c9);
©2016..2020 John Found; Licensed under EUPL. Powered by Assembly language Created with Fresh IDE