Деловой центр «Успенский»
г. Красногорск, ул. Успенская, дом 5, офис 401-8
+7(495)133-85-92
пн-пт 9.00 - 18.00
Заказать звонок

US-DATA разметила более 50 000 фотографий автомобилей для системы распознавания номеров

Команда US-DATA завершила крупный проект по подготовке данных для системы компьютерного зрения: специалисты разметили более 50 000 фотографий транспортных средств и регистрационных знаков.

Задача оказалась значительно сложнее обычного выделения объектов на изображении. На одной фотографии могло находиться сразу несколько автомобилей, а регистрационные знаки относились к разным странам и отличались форматом, расположением символов и визуальным оформлением.

Для каждого релевантного объекта выполнялось несколько видов разметки: определялось положение номерного знака, фиксировалось его текстовое значение, указывалась страна и классифицировался тип транспортного средства.

Главная сложность — реальные данные

В production-среде автомобильный номер далеко не всегда выглядит как чистый прямоугольник, снятый фронтально при хорошем освещении.

В датасете встречались номера, покрытые грязью, снегом и дорожными реагентами, поврежденные и затертые символы, сильные блики, ночные фотографии и изображения, сделанные под нестандартными углами.

Отдельной задачей стало распознавание визуально похожих символов. Например, кириллические С, Р и У могут быть практически неотличимы от латинских C, P и Y, особенно при низком качестве исходного изображения.

При этом на одном кадре могло одновременно присутствовать несколько транспортных средств. Это требовало не просто классифицировать фотографию, а последовательно обнаружить объекты и связать каждый номер с соответствующим автомобилем и набором атрибутов.

Как обеспечить единое качество на десятках тысяч изображений

При работе с большими датасетами критично, чтобы один и тот же объект размечался по одинаковым правилам как в начале проекта, так и после обработки десятков тысяч файлов.

Для проекта были сформированы единые правила аннотирования и обработки спорных ситуаций. Особое внимание при контроле качества уделялось плохо читаемым символам, необычным ракурсам, нестандартным регистрационным знакам и изображениям с несколькими объектами.

Результатом стал структурированный датасет, объединяющий несколько уровней информации:

изображение → транспортное средство → номерной знак → текст номера → страна → тип транспорта.

Такие данные могут использоваться при обучении систем ANPR/ALPR, интеллектуальных транспортных систем, парковочных решений, систем контроля въезда, городской видеоаналитики и других решений на основе computer vision.

Подробно о задаче, сложных случаях и организации контроля качества — в полном кейсе «Разметка 50 000+ фотографий автомобилей и номерных знаков».

Подготовка данных для Computer Vision

US-DATA выполняет проекты по подготовке обучающих датасетов — от пилотной выборки до массивов из десятков и сотен тысяч файлов.

Подробнее об услугах:

Оформить заявку