Table of Contents

Введение в сегментацию изображений для проверки материалов

Сегментация изображений является фундаментальной задачей компьютерного зрения, которая разделяет цифровое изображение на несколько сегментов — наборы пикселей — для упрощения или изменения представления на что-то более значимое и легко анализируемое. В контексте инспекции инженерных материалов сегментация позволяет точно определить локализацию и количественную оценку дефектов, таких как трещины, коррозионные ямы, включения, расслоения и износ поверхности. Точная сегментация является предпосылкой для автоматизированного контроля качества, позволяя инспекторам выходить за рамки субъективных ручных оценок и в направлении объективных, повторяемых и масштабируемых рабочих процессов проверки.

По мере ужесточения производственных допусков и повышения стандартов безопасности в аэрокосмическом, автомобильном, энергетическом и гражданском секторах инфраструктуры потребность в надежных методах неразрушающей оценки (NDE) никогда не была больше. Традиционные подходы к сегментации - пороговые, краевые обнаружения, растущие области и активные контурные модели - часто терпят неудачу, когда сталкиваются со сложными текстурами материала, неравномерным освещением или тонкими морфологиями дефектов. Глубокое обучение появилось в качестве преобразующей альтернативы, предлагая модели, которые могут изучать иерархические функции непосредственно из данных, резко улучшая точность сегментации и надежность при требовании реальных задач проверки.

От ручной инспекции к глубокому обучению: сдвиг парадигмы

Ограничения традиционных методов сегментации

Ранний промышленный осмотр в значительной степени опирался на визуальный осмотр человека, процесс, склонный к усталости, непоследовательности и высоким затратам труда. Полуавтоматизированные методы с использованием классических методов обработки изображений принесли некоторое облегчение, но ввели свои собственные ограничения. Например, глобальное пороговое значение терпит неудачу, когда дефектные области занимают лишь крошечную часть изображения или когда интенсивность фона широко варьируется. Краевые методы, такие как детекторы Canny или Sobel, борются с шумными или низкоконтрастными изображениями, часто производя фрагментированные или ложные края. Растущий регион требует тщательного отбора семян и может просачиваться в нерелевантные области. Эти методы также требуют ручной настройки параметров для каждого нового материала или типа дефекта, что делает их непрактичными для динамических производственных сред.

Рост сверточных нейронных сетей

Внедрение сверточных нейронных сетей (CNN) и наличие крупномасштабных аннотированных наборов данных (например, ImageNet) вызвало революцию в понимании изображений. Для сегментации полностью сверточные сети (FCN) заменили полностью связанные слои сверточными, что позволило сделать прогнозы с использованием плотных пикселей. С тех пор было разработано семейство специализированных архитектур для решения уникальных задач инспекции инженерных материалов: изображения с высоким разрешением, дисбаланс классов (дефектные пиксели, как правило, намного меньше, чем фоновые пиксели), тонкозернистые границы и необходимость как семантической (класс пикселей), так и индивидуальной сегментации объектов.

Основные архитектуры глубокого обучения для сегментации материалов

U-Net: точность с ограниченными данными

Первоначально разработанный для сегментации биомедицинских изображений, U-Net стал рабочей лошадкой для обнаружения дефектов материала из-за его симметричной структуры кодера-декодера с пропускными соединениями. Кодер захватывает контекст посредством последовательной выборки вниз, в то время как декодер восстанавливает пространственное разрешение. Пропускные соединения сливаются с высокоуровневой семантической информацией с мелкими деталями низкого уровня, позволяя точное определение границы даже тогда, когда дефекты малы или плохо определены. U-Net выполняет сильные функции на наборах данных с относительно небольшим количеством аннотированных изображений (например, несколько сотен), что делает его привлекательным для лабораторий, где маркированные данные дефекта скудны. Его вариант, Внимание U-Net, вводит ворота внимания для подавления нерелевантных фоновых областей и усиления дефектоспецифичных особенностей.

Маска R-CNN: Сегментация в инстанциях для множественных дефектов

Когда одно изображение содержит несколько перекрывающихся или смежных дефектов разных типов (например, трещина, пересекающаяся с коррозионной ямой), семантическая сегментация (классификация каждого пикселя) недостаточна - нам нужно различать отдельные экземпляры дефектов. Маска R-CNN расширяет более быструю R-CNN, добавляя ветвь, которая предсказывает двоичную маску сегментации для каждого обнаруженного объекта. При проверке материала это позволяет инженерам считать, измерять и классифицировать каждый дефект отдельно. Последние адаптации включают вращательные инвариантные якоря и многомасштабные характерные пирамиды для обработки текстурно различных поверхностей, таких как прокатанная сталь или кованые сплавы.

SegNet и EfficientNet-Based Encoders

SegNet использует новую схему отбора проб, которая передает индексы максимального объединения от кодера к декодеру, уменьшая поддающиеся обучению параметры и объем памяти при сохранении высокой граничной точности. Для проверки в реальном времени на производственных линиях легкие магистрали, такие как MobileNet или EfficientNet-Lite, часто заменяются на рамки сегментации. Эти модели достигают 80-90% точности при работе со скоростью 30+ кадров в секунду на встроенных графических процессорах, что позволяет осуществлять встроенный контроль качества.

DeepLab и Atrous Convolution

Серия DeepLab (v3+ является наиболее зрелой) использует атроусные (расширенные) извилины для управления полем зрения фильтров без увеличения параметров. Модуль Atrous Spatial Pyramid Pooling (ASPP) захватывает многомасштабный контекст, применяя параллельные атроусные извилины с различными скоростями расширения. Это особенно ценно для проверки материалов с дефектами, которые резко различаются по масштабу - от микротрещин (< 1 mm) to large delamination areas (>] 10 см. Модели на основе DeepLab в настоящее время широко используются в неразрушающем тестировании композитов и бетонных конструкций.

Трансформаторная сегментация

В новейшей волне сегментации используются трансформаторы зрения (ViT), такие как SAM (Segment Anything Model) от Meta AI и SEgmentation TRansformer (SETR). Вместо того, чтобы полагаться исключительно на локальные ядра свертки, трансформаторы используют самовнимание для моделирования зависимостей на большие расстояния по всему изображению. Для проверки материала это перспективно для обнаружения дефектов, которые охватывают большие площади (например, широко распространенная коррозия) или которые имеют контекстные сигналы (например, трещины, которые периодически повторяются на поверхности). Однако трансформаторы обычно требуют массивных данных обучения и вычислительных ресурсов - активная область исследований снижает эти требования для промышленного развертывания.

Применение в инженерных материалах

Металлы: сталь, алюминий и суперсплавы

В металлообработке модели сегментации идентифицируют поверхностные трещины, дефекты прокатки, поры литья и включения. Например, U-Net, обученный на сканирующих электронных микроскопах (SEM), может сегментировать мелкие усталостные трещины в алюминиевых сплавах авиационного класса с точностью до пикселей выше 95%. В стальных прокатных мельницах Mask R-CNN различает краевые трещины, сегрегацию по центру и масштабные ямы, что позволяет автоматическую классификацию плит. Глубокое обучение также помогает в проверке подводной дуговой сварки путем обнаружения отсутствия синтеза и пористости в рентгенографических изображениях.

Внешний ресурс: Недавнее исследование по глубокому обучению для обнаружения дефектов стали (Измерение, 2022) предоставляет всеобъемлющие результаты бенчмарка.

Композиты: углеродное волокно и стеклянные волокнистые ламинаты

Композитные материалы страдают от уникальных дефектов: деламинаций, несоответствия волокон, пустот в смоле и повреждения удара. Рентгеновская компьютерная томография (КТ) сканирования композитных панелей - это массивные 3D-томы; 2D-сегментация отдельных срезов в сочетании с 3D-реконструкцией стандартна. Модели глубокого обучения, обученные на аннотированных КТ-срезах, могут сегментировать области деламинации с оценками Dice, превышающими 0,9. В последних работах используются генеративные состязательные сети (GAN) для увеличения ограниченных данных обучения путем создания реалистичных изображений синтетических дефектов, повышая надежность модели для редких типов дефектов.

Керамика и бетон

Керамические компоненты, такие как лопасти турбин или электрические изоляторы, проверяются на поверхностные дефекты (зазоры, трещины, чипирование) с использованием оптической микроскопии. Сегментация глубокого обучения помогает автоматизировать этот процесс, сокращая время проверки на 80% по сравнению с операторами-людьми. В гражданском строительстве сегментация бетонных трещин из изображений, полученных с помощью дронов, является зрелым приложением. Полностью сверточные сети (FCN) и варианты U-Net, обученные на общедоступных наборах данных, таких как CrackForest или DeepCrack, достигают F1-баллов выше 0,95. Эти модели теперь развернуты в системах структурного мониторинга здоровья для мостов, плотин и туннелей.

Полимеры и покрытия

В производстве полимерной пленки (например, сепараторы аккумуляторов, упаковка для пищевых продуктов) дефекты, такие как пятна геля, рыбьи глаза и изменения толщины, сегментируются в режиме реального времени с использованием легких архитектур нейронных сетей, таких как ENet или BiSeNet. Аналогичным образом, окрашенные или покрытые металлические поверхности проверяются на наличие волдырей, оранжевой кожуры или царапин с использованием моделей сегментации, которые выводят площадь дефекта в процентах от общей поверхности - ключевая метрика для ворот качества автомобильной краски.

Ключевые преимущества сегментации глубокого обучения в промышленной инспекции

Беспрецедентная точность и последовательность

Модели глубокого обучения достигают точности на уровне пикселей, которая часто превосходит человеческие аннотаторы, особенно для тонких или неоднозначных дефектов. Модель, обученная на тысячах аннотированных изображений, каждый раз создает одну и ту же границу принятия решений, устраняя вариабельность между операторами. Эта согласованность имеет решающее значение для поддержания управления процессом Six Sigma.

Автоматизация с конца до конца

Традиционные инспекционные трубопроводы требовали отдельных этапов для предварительной обработки изображений, извлечения функций, сегментации и классификации — каждый вручную настраивается экспертом. Глубокое обучение разбивает эти этапы на единую готовую модель. С помощью автоматизированных инструментов трубопровода (например, Keras, PyTorch, TensorFlow Extended) даже неспециалисты могут развернуть модели в производство в течение нескольких недель.

Адаптация к новым материалам и дефектам

Обучение передаче позволяет модели, предварительно обученной на большом общем наборе данных (например, ImageNet или COCO), быть точно настроенной на небольшом наборе данных, специфичном для материала, с несколькими сотнями изображений. Это резко снижает усилия по аннотации, необходимые для запуска проверки для новой линейки продуктов. Методы адаптации домена дополнительно позволяют моделям работать с различными модальностями визуализации (оптические, тепловые, рентгеновские) без переподготовки с нуля.

Скорость проведения Inline-инспекции

Современные эффективные архитектуры (MobileNetV3+DeepLabv3, ENet, SwiftNet) могут обрабатывать изображения 512x512 со скоростью более 100 кадров в секунду на GPU среднего класса. При развертывании на периферийных устройствах, таких как NVIDIA Jetson или Intel Myriad, они позволяют сегментировать в реальном времени на производственной линии, останавливая дефектные детали, прежде чем они достигнут станций нисходящего потока.

Проблемы в развертывании глубокой сегментации материалов

Нехватка маркированных данных обучения

Аннотация масок дефектов пикселя трудоемка и требует участия опытных металлургов или ученых-материалистов. Для маркировки одного микрографа высокого разрешения может потребоваться несколько часов. Дисбаланс класса — дефекты часто покрывают <1% площади изображения — делает обучение без специальных функций потери (фокусная потеря, потеря риса) неэффективным. Активные стратегии обучения и слабый надзор (с использованием ограничивающих коробок или точечных аннотаций) являются активными областями исследований, направленными на снижение затрат на аннотацию.

Текстурные вариации и сдвиг доменов

Модель, обученная на одном классе стали (например, 304 нержавеющей стали) часто выходит из строя на другом (например, 6061 алюминия) из-за различий в текстуре поверхности, отражательной способности и морфологии дефектов. Сдвиг домена также происходит при изменении условий освещения, углов камеры или калибровки датчика. Текущие решения включают рандомизацию домена во время обучения, онлайн-усиление с упругими искажениями и адаптацией домена с несколькими выстрелами.

Требования к вычислительным ресурсам

Хотя вывод может быть быстрым, обучение моделей глубокой сегментации требует мощных графических процессоров (12-24 ГБ VRAM) и часто несколько дней для больших наборов данных. Для производителей малого и среднего бизнеса первоначальная стоимость аппаратного обеспечения и облачных вычислений может быть барьером. Перегонка знаний - обучение меньшей «студенческой» модели для имитации более крупного «учителя» - может уменьшить размер модели в 10 раз с минимальной потерей точности, что делает возможным развертывание на периферийных устройствах.

Интерпретируемость и доверие

Промышленные инспекторы настороженно относятся к системам "черного ящика". Методы объяснимости, такие как Grad-CAM (картирование активации класса с взвешенным градусом), подчеркивают, какие входные пиксели наиболее влияют на решение о сегментации. Это помогает инженерам проверить, что модель фокусируется на дефекте, а не на нерелевантных артефактах (например, метки писцов, пылинки). Регуляторные рамки в критически важных для безопасности секторах (аэрокосмическая, ядерная) могут в конечном итоге потребовать таких объяснений для сертификации.

Будущие направления: Инспекции следующего поколения

Обучение с нулевым и нулевым выстрелами

Будущим моделям потребуется лишь один или несколько примеров нового дефекта, чтобы начать сегментировать его надежно. Прототипные сети и сиамские архитектуры, обученные задачам метаобучения, показывают многообещающие результаты. Сегментация с нулевым результатом, где модель может сегментировать невидимый класс дефектов на основе текстового описания, находится на горизонте с моделями языка видения, такими как CLIP.

Генерирующее увеличение данных

Генерация синтетических данных с использованием моделей StyleGAN, Diffusion или физических рендереров может создавать бесконечные, идеально аннотированные обучающие изображения редких дефектов. Объединение реальных и синтетических данных обычно улучшает обобщение модели. Ключевая задача заключается в обеспечении соответствия синтетического распределения реальному распределению дефектов - проблема, решаемая с помощью противоборствующего выравнивания домена.

3D сегментация в реальном времени

По мере того, как 3D-сенсоры (LiDAR, структурированный свет) станут дешевле, 3D-точка облачной сегментации материальных поверхностей (например, для автомобильных панелей кузова) станет стандартной. Архитектура глубокого обучения, такая как PointNet++ или VoxelNet, адаптированная для обнаружения дефектов, может сегментировать геометрические аномалии, такие как вмятины или деформации непосредственно в 3D-пространстве.

Edge-AI и федеративное обучение

Развертывание моделей сегментации непосредственно на интеллектуальных камерах или периферийных устройствах устраняет необходимость передавать изображения с высоким разрешением на центральный сервер.Федерированное обучение позволяет нескольким заводам совместно обучать глобальную модель без обмена изображениями дефектов, сохраняя интеллектуальную собственность при одновременном повышении надежности модели на разных сайтах.

Внешний ресурс: Обзор инструментов для развертывания на периферии см. Примеры сегментации TensorFlow Lite.

Вывод: Надежный фундамент для автоматизированного обеспечения качества

Сегментация изображений на основе глубокого обучения переместилась из исследовательских лабораторий на заводские этажи, обеспечивая измеримые улучшения в точности обнаружения дефектов, скорости и согласованности. В то время как остаются проблемы - объем данных, сдвиг домена и интерпретируемость - быстрый темп инноваций в архитектурах, стратегиях обучения и краевом оборудовании гарантирует, что эти барьеры будут продолжать сокращаться. Для инженерного контроля материалов принятие глубокой сегментации - это не просто технологическое обновление; это стратегический императив для отраслей, где материальный сбой не является вариантом.

Внешний ресурс: Страница сегментации Института информатики Макса Планка предлагает кураторские исследования по самым современным методам.