Я даю Согласие на обработку файлов cookie в соответствии с Политикой конфиденциальности. В случае отказа от обработки cookie я проинформирован о необходимости прекратить использование Сайта или отключить файлы cookie в настройках браузера.
OK

Как правильно размечать дефекты для обучения нейросети

29 сентября 2026
  • /
  • /
Нейросеть учится находить закономерности по размеченным примерам и использовать их при анализе новых изображений. От того, насколько точно и последовательно размечен обучающий набор, зависит, насколько хорошо модель справится с этой задачей на реальном производстве.

Мы в Nord Clan готовим датасеты для промышленных проектов и собрали в статье практическую методику: что считать дефектом, как обозначать его границы, какой класс назначать, что делать с мелкими и частично видимыми дефектами, как делить датасет на выборки и проверять его перед обучением.

Почему качество разметки влияет на результат

Разметка данных для обучения моделей машинного зрения — основа, на которой строится модель. Ошибки в разметке добавляют шум в обучающие данные и могут ухудшать способность модели правильно распознавать дефекты.

Особенно критичны систематические ошибки. Например, когда один и тот же тип дефекта разные разметчики обозначают по разным правилам: кто-то включает соседний нормальный участок в границу объекта, кто-то нет. Такое расхождение сложнее заметить, чем единичную опечатку в классе.

Поэтому чёткие правила разметки изображений, зафиксированные до начала работы, экономят время на переделку и повторное обучение.

Как правильно размечать дефект на изображении

Прежде чем перейти к типам разметки и работе с частными случаями, стоит закрепить общий порядок действий для каждого объекта на изображении.
  • Определите, относится ли участок изображения к дефекту, опираясь на утверждённые критерии.
  • Выберите класс дефекта из согласованного списка.
  • Обозначьте весь видимый дефект в соответствии с выбранным типом разметки и принятой инструкцией.
  • Не включайте в область разметки соседние нормальные участки поверхности без необходимости. Для прямоугольной рамки часть фона внутри области может быть неизбежна, а для сегментационной маски границу проводят по контуру дефекта.
  • Если на изображении несколько отдельных дефектов, создавайте для каждого свой объект разметки, если это соответствует постановке задачи.
  • Одинаковые визуальные случаи размечайте одинаково на всём датасете, независимо от того, кто из команды выполняет работу.
  • Не меняйте правила разметки в процессе работы без фиксации новой версии инструкции и пересмотра уже размеченных данных.
Эта последовательность — то, что мы закрепляем в инструкции для команды перед началом любого проекта по разметке дефектов.
Заполните форму, чтобы узнать больше о внедрении
системы ML Sense
Заполните форму, чтобы узнать больше о внедрении
системы ML Sense

Классификация, детекция и сегментация

Для задач контроля дефектов применяют три основных подхода к разметке.
  • Классификация
    Модель определяет класс всего изображения или заданного участка, но не указывает координаты дефекта. Например, изображение можно отнести к классу «норма», «царапина» или «скол».
  • Детекция дефектов
    Модель находит дефект и обводит его прямоугольной областью. Есть координаты объекта, но не точная форма.
  • Сегментация дефектов
    Для дефекта создается пиксельная маска, а модель обучается определять его точную область.
Каждый подход требует своего типа разметки, и от выбора зависит, сколько времени уйдёт на подготовку датасета.

Когда достаточно прямоугольной рамки, а когда нужна маска

Прямоугольная рамка подходит для следующих случаев:
  • поиск и подсчёт отдельных дефектов на изделии;
  • определение координат дефекта на поверхности;
  • контроль дефектов, для которых точная форма и площадь не имеют значения для решения;
  • случаи, когда дефект можно достаточно точно описать прямоугольной областью без искажения смысла задачи.

Сегментация с маской подходит, когда важно определять точную форму или площадь дефекта:
  • трещины, сколы, коррозия неправильной формы;
  • расчёт доли поражённой поверхности от общей площади изделия;
  • дефекты, которые накладываются друг на друга или пересекаются, если важно точно разделять их области.

В проектах ML Sense мы часто начинаем с разметки прямоугольными областями, а переходим к маскам там, где заказчику нужна количественная оценка дефекта, а не только факт его наличия.

Как формировать классы дефектов

Прежде чем размечать датасет, команда должна договориться о классах. Это отдельная работа, и от неё зависит качество разметки датасета.
  • Если степень тяжести не является отдельной задачей классификации, не стоит без необходимости создавать под неё отдельные классы. Её можно хранить как дополнительный атрибут или оценивать отдельным этапом.
  • Проверяйте, что классы визуально различимы. Если два класса визуально плохо различимы или сами разметчики часто путают их между собой, модели будет сложнее научиться надёжно их разделять.
  • Не дробите классы без необходимости. Степень детализации стоит определять исходя из задачи системы и количества доступных примеров для каждого класса. Если изменить структуру классов позже, может потребоваться переразметка уже подготовленных данных.
  • Фиксируйте критерии в отдельном документе — атласе дефектов с примерами изображений для каждого класса.
Атлас дефектов снимает часть вопросов у команды разметчиков и ускоряет работу над датасетом изображений дефектов.

Нужны ли изображения без дефектов

В задачах, где модель должна отличать брак от нормы, в датасете обязательно нужны примеры нормальной продукции. Они помогают модели отделять дефекты от естественных вариаций поверхности, освещения и внешнего вида изделия.

При этом состав обучающей выборки зависит от выбранного подхода.

Каким должен быть хороший датасет дефектов

Качество разметки — не единственное, что определяет результат. Важно и то, насколько разнообразен сам набор изображений. В датасете стоит представить:
  • разные даты или смены производства, если условия процесса со временем меняются;
  • допустимый диапазон размеров и формы объекта;
  • разные положения изделия относительно камеры;
  • разные степени выраженности дефекта, от едва заметного до явного;
  • реальные условия освещения на производстве;
  • допустимые изменения фона;
  • нормальные изделия без дефектов;
  • редкие и пограничные случаи.

Не стоит просто добавлять сотни почти одинаковых фотографий одного и того же дефекта. Количество изображений само по себе не гарантирует качество датасета, важна его репрезентативность по отношению к реальным условиям, в которых будет работать модель.

Разметка мелких дефектов

Для мелких дефектов важно проверить, сколько пикселей займёт объект после масштабирования изображения внутри модели. Если при изменении размера дефект становится практически неразличимым, одной аккуратной разметкой проблему не решить: потребуется пересмотреть разрешение съёмки, оптику или параметры обработки изображения.

Дополнительно помогают такие правила:
  • при разметке используйте достаточный масштаб отображения, чтобы точно видеть границы мелкого дефекта;
  • не уменьшайте исходное изображение без необходимости и заранее проверяйте, насколько мелкий дефект останется различимым после масштабирования.
При обучении модели важно сохранять достаточный контекст изображения, по которому она сможет отличать дефект от нормальной поверхности. При этом сама область разметки должна соответствовать установленным правилам и не включать лишний фон.

Разметка частично видимых дефектов

Дефект может быть обрезан краем кадра, продолжаться за пределами изображения или частично закрыт другим объектом. Для каждого из этих сценариев нужно заранее решить:
  • как размечать видимую часть дефекта и как обозначать случаи, когда он обрезан границей кадра или перекрыт другим объектом;
  • как помечать такие случаи отдельным признаком, чтобы модель не путала обрезанный дефект с маленьким полным;
  • что делать, если дефект пересекает границу кадра: считать его отдельным объектом или исключать из выборки.

Главное правило здесь — решение должно быть принято до начала разметки и зафиксировано в инструкции, а не определяться каждым разметчиком отдельно для каждого кадра. Если одинаковые случаи размечаются по разным правилам,, датасет получается противоречивым.
Заполните форму, чтобы узнать больше о внедрении
системы ML Sense
Заполните форму, чтобы узнать больше о внедрении
системы ML Sense

Что делать со спорными случаями

Не все дефекты очевидны. Иногда сложно понять, брак это или допустимое отклонение. Здесь помогают три инструмента.
  • Регламент с пограничными примерами: «вот это ещё норма, а вот это уже дефект» с конкретными изображениями.
  • Выделенный проверяющий, который берёт на себя спорные кадры и принимает по ним финальное решение.
  • Отслеживание межаннотаторского согласия — насколько разные разметчики сходятся в оценке одних и тех же изображений.
Для классификации и других типов разметки применяют разные метрики согласованности, а для пространственных аннотаций сравнивают сами области разметки. Зачастую низкое согласие говорит не о плохой работе разметчика, а о том, что критерий дефекта описан недостаточно чётко и его нужно уточнить в инструкции.

Как разделить размеченные данные

Готовый датасет делят на три выборки.
  • Обучающая выборка (training set) — на ней модель непосредственно учится находить закономерности.
  • Валидационная выборка (validation set) — на ней настраивают параметры модели и промежуточно оценивают качество в процессе обучения.
  • Контрольная выборка (test set) — финальная, независимая проверка модели после завершения обучения и настройки.
Отдельно стоит исключить дубли и почти идентичные кадры из разных выборок. Если несколько кадров одного изделия или одной производственной последовательности сильно похожи и случайно распределены между обучающей и контрольной выборками, итоговая оценка модели может оказаться завышенной.

Если изображения связаны между собой — например, получены с одного изделия, одной партии или из последовательных кадров, — их лучше относить к одной выборке, а не распределять между обучением и тестом.

Нужно ли размечать весь датасет сразу

Не всегда. Часто эффективнее итерационный подход: разметка первой партии, обучение модели, поиск сложных или неуверенно классифицируемых моделью изображений, дополнительная разметка этих случаев и повторное обучение.

Такой подход, известный как active learning, помогает выбрать для ручной разметки наиболее информативные или сложные примеры , вместо равномерной обработки всего массива изображений подряд.

Как проверять качество разметки

Прежде чем отдавать датасет на обучение, разметку стоит проверить.
  • Перекрёстная проверка
    Часть кадров размечают два человека независимо, затем сравнивают результат.
  • Метрика IoU
    Рассчитывается как отношение площади пересечения двух областей к площади их объединения: IoU = площадь пересечения / площадь объединения. Чем ближе значение к единице, тем сильнее совпадают области разметки у разных людей. Универсального порога IoU для всех задач не существует, он зависит от типа дефекта и требований к системе.
  • Пробное обучение на подвыборке
    Помогает обнаружить потенциальные проблемы датасета. Аномально низкий результат по отдельному классу может быть поводом повторно проверить его разметку, количество примеров и визуальную различимость, хотя причиной могут быть и другие факторы: недостаток данных, дисбаланс классов, сложность самого дефекта.
  • Выборочный аудит
    Периодическая проверка случайных кадров помогает заметить постепенное расхождение в стандартах разметки внутри команды

Что проверить перед обучением

По каждому изображению:
  • правильный ли класс присвоен объекту;
  • все ли дефекты на изображении размечены;
  • нет ли лишних или дублирующихся объектов разметки;
  • соответствует ли прямоугольная область правилам разметки и достаточно плотно охватывает дефект;
  • соответствует ли маска реальному контуру дефекта.

По датасету в целом:
  • достаточно ли примеров по каждому классу;
  • есть ли изображения без дефектов;
  • представлены ли разные условия съёмки;
  • нет ли перекоса в сторону одного типа дефекта;
  • не попали ли похожие кадры одновременно в обучающую и контрольную выборки;
  • одинаково ли работают разные разметчики на одних и тех же случаях.

В промышленных проектах датасет обычно дорабатывают после первых обучений модели, анализируя её ошибки на валидационной выборке. Контрольную выборку при этом сохраняют для независимой финальной оценки.