如何为计算机视觉准备一个大规模数据集:一张图片中可能同时出现多辆车,车牌从不同角度拍摄,字符可能被污泥、反光或眩光部分遮挡,而且车辆来自不同国家?本文介绍 US-DATA 为自动车牌识别系统标注 50,000 多张图片的项目。

项目目标

US-DATA 团队收到了一批超过 50,000 张车辆图片,用于为计算机视觉系统准备训练数据集。

模型的任务不仅是检测车辆或车牌。系统还需要学习如何定位图片中的车牌、识别其字符,并考虑与对象相关的其他属性。

该数据集不能按照“每张图片只有一辆车”的方式处理。部分图片中同时出现多辆车辆,因此需要检测并正确描述每一个相关对象。

数据的地域多样性进一步增加了项目难度:样本中包含来自不同国家的车牌,它们在格式、字符排列、国家标识和视觉设计上均存在差异。

需要标注哪些内容

对于每个符合要求的对象,都需要完成多项相互关联的标注操作。

1. 车牌定位

标注员需要确定车牌在图片中的位置,并使用边界框进行标注。这类标注用于训练目标检测模型:算法不仅要判断画面中是否存在车牌,还要准确知道车牌位于何处。

2. 车牌字符转写

车牌上的文字会被转写为结构化文本值。实际上,这一步标注同时为后续 OCR(光学字符识别)准备训练数据。

例如,系统需要学会区分视觉上非常相似的字符,如 С/C、Р/P、У/Y,以及 Y/V、0/O 等组合,尤其是在图片质量较低的情况下。

3. 国家识别

每个车牌都需要标注所属国家。如果车牌上的国家代码存在且清晰可读,则直接使用该信息。

在更复杂的情况下,则需要根据车牌的结构和格式判断其所属国家。

4. 车辆类型识别

此外,还需要对对象进行车辆类型分类,例如乘用车、卡车或摩托车。

因此,一张图片中可能同时包含多个对象,而每个对象又对应多种相互关联的标注类型。

为什么 50,000 张图片并不等于 50,000 个简单任务

图片数量本身并不能反映项目的真实复杂度。

如果一张图片中有三辆车,标注员就需要检测并检查多个对象。如果车牌难以辨认,需要做出的判断和复核也会进一步增加。

因此,在计算机视觉项目中,不应只评估文件数量,还需要考虑对象密度、属性数量以及每张图片的复杂程度。

在这个项目中,以下几类数据最具挑战性。

污损和受损的车牌

真实道路场景中的图片与公开数据集中整洁、清晰的示例差异很大。

车牌上可能出现:

• 泥污;

• 积雪;

• 道路融雪剂和化学残留;

• 磨损;

• 机械损坏;

• 薄膜或其他覆盖物;

• 部分字符几乎消失。

在某些情况下,车牌的一部分在视觉上几乎完全不可见。

对于训练真实环境中的识别系统而言,这类图片尤其有价值,因为模型上线后正会遇到类似情况。

反光、过曝与夜间拍摄

另一项挑战来自光照条件。

车牌的反光表面在白天对人眼而言很容易辨认,但在闪光灯或其他强光源照射下,车牌在图片中可能几乎变成一块纯白区域。

因此,夜间图片需要额外关注。

重要的是明确界限:哪些字符仍然可以可靠读取,哪些情况下继续恢复字符内容就已经变成了猜测。

对于数据集而言,这一点至关重要:标注员不能凭空补充原始数据中客观不存在的信息。

非标准拍摄角度与透视变形

车辆并不总是以正面、标准角度被拍摄。

数据集中包括以下图片:

• 大角度倾斜拍摄;

• 接近地面高度拍摄;

• 俯拍;

• 侧面拍摄;

• 存在明显透视变形;

• 车辆被部分遮挡;

• 车牌距离相机较远。

因此,原本呈矩形的车牌在图片中可能表现为严重变形的四边形,只占画面很小的一部分,或者被车辆部件部分遮挡。

这些样本对模型十分必要,因为未来系统需要在不同摄像机位置和拍摄角度下都能检测到车牌。

西里尔字母与拉丁字母混淆

还有一类错误并不是由图片质量造成,而是来自字符本身。

俄罗斯车牌使用的一些西里尔字母,在视觉上与拉丁字母完全相同或非常相似。当图片分辨率较低时,字符之间的差异会变得非常小。

例如:

С / C

Р / P

У / Y

与此同时,国际数据集中还会同时出现来自不同国家的车牌。

人类可以借助上下文快速判断正确字符,而对模型而言,这类标注的质量会直接决定它是否能够学会区分这些情况。

一张图片中包含多辆车

另一个重要场景是一张图片中同时出现多辆车辆。

在这种画面中,不能只寻找“主要”车辆。需要系统地检查整个场景,确定所有目标对象,并将每个车牌与对应车辆及其属性正确关联。

这使任务从简单的单对象识别,升级为完整的复杂场景计算机视觉标注。

这类图片尤其能体现普通图片分类与专业对象级标注之间的区别。

如何组织大规模数据集标注

项目扩展时最重要的任务,是确保第 1 张、第 10,000 张和第 50,000 张图片都遵循同一套标注逻辑。

因此,在正式大规模标注开始前,需要建立统一的规则体系。规则中会明确:

• 什么应被视为车牌;

• 如何确定车牌边界;

• 如何处理被部分遮挡的对象;

• 如何处理无法辨认的字符;

• 如何记录存在歧义的情况;

• 如何确定国家;

• 使用哪些车辆类型;

• 在什么情况下需要将图片或对象提交进一步复核。

复杂样本会单独讨论,并转化为供整个团队参考的标准案例。

这样,标注指南可以随着项目推进不断完善,而非标准场景也不会导致同一数据集中出现多套相互矛盾的规则。

质量控制

在大规模项目中,单个标注员的一处错误很容易演变为系统性问题。

如果团队中的一部分人按照一种规则标注同一类车牌,而另一部分人采用另一种规则,神经网络就会收到相互矛盾的训练样本。

因此,本项目采用统一的操作规范,并对标注结果进行额外复核。

以下边界情况会被重点检查:

• 难以辨认的字符;

• 非标准车牌;

• 异常拍摄角度;

• 低质量图片;

• 国家判断存在歧义;

• 同一画面中存在多个对象。

如有必要,争议样本会被单独讨论;确定处理方式后,该样本将作为后续工作的参考案例。

客户最终获得了什么

项目最终交付的是一个由超过 50,000 张已标注图片组成的结构化数据集,可用于后续计算机视觉系统训练。

数据集中整合了多个层级的信息:

图片 → 车辆 → 车牌 → 车牌文本 → 国家 → 车辆类型

这种结构意味着数据并不局限于单一任务。

同一个准备好的数据集可用于训练和测试系统中的多个组件:

• 车牌检测器;

• 字符识别算法;

• 车辆类型分类器;

• 车牌所属国家识别模块;

• 综合自动车牌识别系统。

为什么真实世界数据对车牌识别尤其重要

如果所有车辆都在白天正面拍摄,并且所有车牌都干净、清晰易读,模型很容易在这样的图片集上取得漂亮的结果。

但生产环境完全不同。

摄像机可能安装得过高或过低;车辆处于运动中;可能下雨或下雪;车牌可能被污染;部分字符处于阴影中;同一画面里可能有多辆车;系统还可能需要在夜间工作。

因此,准备数据集的目标并不是构建一个尽可能“漂亮”的样本集。

恰恰相反,高质量数据集应反映系统部署后会遇到的真实世界多样性。

只有在这样的数据上训练,模型才能不仅在实验环境中表现良好,也能适应实际生产场景。

这类标注适用于哪些项目

车辆与车牌标注可用于以下项目:

• 自动车牌识别(ANPR/ALPR);

• 智能交通系统;

• 出入口管理;

• 停车管理系统;

• 收费公路;

• 城市视频分析;

• 交通监控;

• 物流;

• 安防系统;

• 面向交通基础设施的计算机视觉系统。

从技术角度看,该项目同时结合了多个常见方向:图像标注、目标检测(object detection)、边界框(bounding box)、分类、OCR 标注以及计算机视觉训练数据集准备。

US-DATA:面向复杂计算机视觉任务的图像标注

US-DATA 为计算机视觉系统训练提供图像标注和数据集准备服务,项目规模可从试点批次扩展到数万、数十万甚至更多文件。

我们既可以只负责某一个标注环节,也可以协助搭建完整流程:明确需求、制定标注规则、开展试点、扩展团队并组织质量控制。

真实数据几乎总会包含边界情况。因此,专业标注的目标不仅是快速处理大量文件,更重要的是确保整个数据集在逻辑和标准上保持一致。

类似项目中可使用的服务

机器学习数据标注

神经网络与机器学习图像标注

图像目标检测