Химические и амперные материалы; Materials Engineering
Анализ проблем нехватки данных для глубокого обучения в инженерных приложениях
Table of Contents
Глубокое обучение коренным образом изменило ландшафт инженерии, позволив системам обнаруживать аномалии в структурном здоровье, оптимизировать аэродинамические конструкции и прогнозировать сбои оборудования до их возникновения. Его способность изучать сложные, нелинейные отношения из необработанных данных сделала его незаменимым инструментом в областях, начиная от гражданского строительства до аэрокосмической промышленности и производства. Тем не менее, непрекращающееся узкое место ограничивает его широкое распространение в реальных инженерных условиях: дефицит высококачественных, меченых данных. В отличие от потребительских приложений, где миллионы изображений или текстовых образцов легко доступны, инженерные данные часто дороги, трудоемки или даже невозможно собирать в больших количествах. Эта статья исследует многогранную проблему нехватки данных в инженерном глубоком обучении, исследует его глубокое влияние на производительность и надежность моделей и предоставляет подробную дорожную карту стратегий - от физических нейронных сетей до совместного обмена данными - которые практикующие могут использовать для преодоления этих ограничений.
Понимание дефицита данных в инженерии
Нехватка данных в инженерных условиях редко является простым вопросом наличия слишком малого количества образцов. Это системная проблема, коренящаяся в природе инженерных систем, ограничениях реального развертывания и стоимости получения наземной правды. Во многих инженерных приложениях сбор данных затруднен физическими ограничениями, проблемами безопасности и проприетарными барьерами. Например, сбор данных о сбоях для критически важной инфраструктуры, такой как мосты, турбины или самолет, требует лет работы в неблагоприятных условиях - и даже тогда события сбоя могут быть слишком редкими, чтобы дать статистически значимые наборы данных. Аналогичным образом, в биомедицинской инженерии получение меченых медицинских данных визуализации для редких патологий требует обширных клинических испытаний и экспертной аннотации, что приводит к чрезмерно высоким затратам.
Следующие факторы способствуют проблеме дефицита данных в технике:
- Ограниченный доступ к данным о собственности: Инженерные фирмы рассматривают операционные данные как интеллектуальную собственность. Обмен данными между организациями — даже для совместных исследований — часто ограничивается юридическими и конкурентными проблемами, создавая изолированные хранилища данных.
- Высокая стоимость маркировки и аннотации: В отличие от наборов данных изображений в масштабе Интернета, которые могут быть помечены с помощью краудсорсинга, инженерные данные требуют экспертизы домена. маркировка одной усталостной трещины в металлической микрографе высокого разрешения может потребовать металлурга, а маркировка сигналов динамических датчиков для обнаружения неисправностей требует знания всей операционной оболочки системы.
- Редкие или экстремальные события:] Многие инженерные модели глубокого обучения направлены на прогнозирование сбоев (например, скачок компрессора в газовых турбинах, распространение трещин в бетоне). Эти события происходят нечасто и их трудно воспроизвести в контролируемых условиях, что приводит к сильно несбалансированным наборам данных.
- Физические ограничения и ограничения безопасности: Проведение экспериментов по генерации большего количества данных может быть невозможным из-за стоимости, времени или риска. Например, краш-тестирование автомобилей или моделирование реакций землетрясения на полномасштабных структурах не может быть выполнено в масштабе.
- Системная сложность и нестационарность: Инженерные системы часто работают в различных условиях (нагрузка, температура, влажность). Модель, обученная на данных из одного сезона или режима работы, может не обобщаться в другой, эффективно делая доступные данные еще более скудными при стратификации по условиям эксплуатации.
Влияние дефицита данных на модели глубокого обучения
Когда данные обучения ограничены, модели глубокого обучения, особенно с миллионами параметров, ведут себя непредсказуемо. Последствия выходят за рамки простых метрик точности; они влияют на безопасность, надежность и практическую полезность модели в принятии инженерных решений.
Переобучение и плохая генерализация
Переобучение происходит, когда модель запоминает учебные образцы, а не изучает основные шаблоны. При скудных данных способность модели к переобучению усиливается. Модель переобучения может достигать почти идеальной производительности на тренировочном наборе, но катастрофически не достигает новых, невидимых входов. В инженерии, где решения часто включают критически важные системы, такой отказ неприемлем. Например, модель глубокого обучения, обученная только 50 вибрационным сигналам для обнаружения неисправностей подшипников, может классифицировать нормальный подшипник как неисправный просто потому, что шаблон шума соответствует одному из редких примеров обучения. Результатом является дорогостоящая ложная тревога или, что еще хуже, необнаруженный ущерб.
Неспособность научиться сильным функциям
Глубокое обучение процветает на высокоразмерных иерархиях признаков. Когда данных мало, модель не может надежно изучить дискриминационные особенности. Вместо этого она подбирает ложные корреляции, которые присутствуют в ограниченном наборе обучения - например, связывая определенный цвет фона в инфракрасном изображении с дефектом материала, а не фактической тепловой подписью. Это отсутствие надежности означает, что модель не сможет обобщить немного разные датчики, условия освещения или механические установки. Следовательно, инженерные модели, которые хорошо работают в лабораторных условиях, часто сильно ухудшаются в полевых условиях.
Низкая точность и надежность прогнозирования
Количественные показатели, такие как точность, отзыв и оценка F1, страдают, когда данные скудны. Что еще более важно, калибровка доверия становится ненадежной. Модель может выдавать высокий показатель доверия даже для неправильных прогнозов, что приводит к тому, что инженеры доверяют неверным выводам. В таких приложениях, как прогнозное обслуживание, это может привести к пропущенным окнам обслуживания или ненужным заменам, которые напрямую влияют на эксплуатационные расходы и безопасность.
Повышенная неопределенность в принятии решений
Нехватка данных по своей сути увеличивает эпистемическую неопределенность — неопределенность из-за отсутствия знаний об истинной модели. Без достаточного количества данных, чтобы ограничить пространство гипотезы модели, прогнозы становятся очень неопределенными. Инженеры, которые полагаются на такие модели для оптимизации дизайна или оценки риска, остаются с широкими доверительными интервалами, которые делают вывод практически бесполезным. В байесовских терминах заднее распределение остается широким, обеспечивая мало действенной информации.
Ключевые стратегии преодоления дефицита данных
Несмотря на трудности, инженерное сообщество глубокого обучения разработало надежный инструментарий для борьбы с нехваткой данных. Эти стратегии варьируются от чисто ориентированных на данные подходов (увеличение, синтетическая генерация) до алгоритмоцентрических (передача обучения, модели, основанные на физике). Наиболее эффективные решения часто объединяют несколько методов в специально разработанном конвейере.
Увеличение данных для инженерных доменов
Увеличение данных искусственно расширяет набор обучения, применяя преобразования к существующим образцам при сохранении меток. В инженерных задачах на основе изображений (например, обнаружение трещин в бетоне, классификация дефектов на металлических поверхностях), стандартные дополнения включают случайные вращения, переворачивания, корректировки яркости и контраста и гауссовские шумы. Более специфичные для домена дополнения также мощны: для данных датчиков временных рядов (вибрация, акустика, тензодатчики), такие методы, как случайное искажение времени, амплитуда масштабирования и смешивание сигналов (например, объединение сигналов из разных условий эксплуатации) могут значительно повысить надежность. Исследование 2021 года по диагностике неисправностей вращающихся машин показало, что комбинация обрезки временных рядов и увеличения смешивания уменьшила ошибку классификации более чем на 30%, когда было доступно только 50 образцов на класс (см. ] Механические системы и обработка сигналов ]. Ключ заключается в том, чтобы гарантировать, что расширенные данные остаются физически правдоподобными - добавление нереалистичного шума или искажение физики может нанести вред
Трансфертное обучение и адаптация домена
Обучение передаче использует модель, предварительно обученную на большом, связанном наборе исходных данных и тонко настраивающую его на небольшом наборе инженерных данных. В компьютерном зрении предварительно обученные сети на ImageNet были успешно адаптированы для обнаружения дефектов на лопастях турбин или трещинах в мостах с всего лишь 100 мечеными изображениями. Для временных рядов, автокодировщиков или архитектур на основе ResNet могут быть настроены на крупномасштабные задачи распознавания человеческой деятельности или промышленные контрольные показатели датчиков. Адаптация домена, более продвинутый вариант, решает случай, когда распределение данных об источнике и целевой информации отличается из-за размещения датчика, среды или условий работы. Методы, такие как адаптация состязательного домена, выравнивают распределения функций, позволяя модели, обученной на обильных синтетических данных, хорошо работать на реальных показаниях датчиков. Например, в статье 2020 года , продемонстрировали доменно-противоположные нейронные сети для передачи межмашинных отказов, достигая 85% точности только с 10 образцами целей на класс.
Генерация синтетических данных с помощью моделирования и GAN
Когда реальных данных мало, синтетические данные могут быть получены с помощью моделирования на основе физики или генеративных моделей глубокого обучения. Модели с конечными элементами высокой точности, моделирование вычислительной динамики жидкости (CFD) и программное обеспечение для многотелодинамической обработки могут производить меченые данные практически для любого инженерного сценария, от распределения напряжений до аэродинамических коэффициентов. Проблема заключается в том, что разрывы между симулированным и фактическим поведением датчика могут ухудшать передачу модели. Для преодоления этого разрыва требуется тщательная рандомизация домена (изменение трения, шума, освещения в моделировании) или использование генеративных состязательных сетей (GAN) для перевода симулированных изображений в более реалистичные изображения. Pix2pix и CycleGAN были использованы для преобразования синтетических тепловых изображений компонентов электроники в фотореалистичные инфракрасные изображения, что позволяет моделям обнаружения дефектов тренироваться исключительно на синтетических данных и хорошо работать на реальном оборудовании.
Физика-информированные нейронные сети (PINN)
Информированные физикой нейронные сети встраивают физические законы — обычно частичные дифференциальные уравнения (PDE) — непосредственно в функцию потерь, уменьшая количество меченых пар данных. Вместо того, чтобы полагаться исключительно на пары ввода-вывода, PINN также оптимизированы для удовлетворения управляющих уравнений, граничных условий и законов сохранения. Например, в структурной механике PINN, обученный нескольким измерениям напряжения, все еще может предсказать полное поле напряжения, обеспечивая равновесие и конститутивные отношения. Этот подход успешно применяется для решения передних и обратных проблем в динамике жидкости, передаче тепла и характеристике материала. Заметным преимуществом является то, что физика действует как сильный регуляризатор, предотвращая переобучение даже тогда, когда данные чрезвычайно редки. Исследования Raissi et al. показали, что PINN могут изучать решения для уравнений Навье-Стокса только из 1% обычных точек измерения. Однако PINN требуют тщательной настройки гиперпараметров и могут бороться с очень сложными или хаотическими системами.
Небольшие выстрелы и мета-обучение
Обучение с несколькими выстрелами (FSL) направлено на обучение моделей, которые могут обобщать из нескольких примеров в классе. Мета-обучение или «обучение для изучения» обучает модель многим задачам, чтобы она могла быстро адаптироваться к новой задаче с несколькими шагами градиента. В инженерии прототипные сети или модельно-агностические мета-обучение (MAML) были применены к диагностике неисправностей только с 5-10 образцами на тип неисправности. Мета-модель изучает общий экстрактор функций, который захватывает фундаментальные шаблоны (например, спектральные пики, связанные с неисправностями подшипника), а затем тонко настраивает слой классификатора на нескольких доступных целевых примерах. Исследование 2022 года по диагностике неисправностей авиационного двигателя с использованием мета-обучения достигло 92% точности всего с 5 учебными образцами на неисправность, по сравнению с 65% для стандартных настроенных датчиков CNN (], 2022 .
Совместное использование данных и федеративное обучение
Для многих инженерных организаций проблема нехватки данных не абсолютна, а коллективна — каждая организация имеет небольшой частный набор данных, который при объединении будет достаточным для обучения надежных моделей. Совместное использование данных, регулируемое соглашениями об использовании данных, может объединять образцы из нескольких сайтов, объектов или компаний. Например, модели прогнозного обслуживания для ветряных турбин могут извлечь выгоду из вибрационных данных, собранных на нескольких ветряных электростанциях. Для решения проблем конфиденциальности и интеллектуальной собственности, федеративное обучение (FL) предлагает распределенную парадигму обучения, где модели обучаются локально и только обновления моделей (градиенты) делятся с центральным сервером. FL успешно развернута в промышленных настройках IoT для обнаружения аномалий без раскрытия исходных данных процесса. В документе 2023 года от консорциума европейских производственных компаний сообщается, что модель обнаружения аномалий на основе FL достигла сопоставимой производительности с централизованно обученной моделью на объединенных данных, удовлетворяя при этом политике управления данными компании. Основными проблемами являются накладные расходы на связь, неоднородные распределения данных между клиентами и необходимость надежных алгоритмов агрегации.
Гибридные и ансамблевые подходы
Часто не хватает единой техники. Объединение методов, таких как использование увеличения данных для расширения небольшого реального набора данных, а затем добавление физической регуляризации во время обучения, дает более сильные результаты. Обучение ансамблей, где объединены несколько моделей, обученных на разных подмножествах или с различными архитектурами, также может смягчить дисперсию, вызванную разреженными данными. Баггинг (агрегирование бутстрапа) создает несколько загрузочных версий ограниченного набора данных и обучает отдельные модели, затем усредняет их прогнозы. Это уменьшает переобучение и улучшает стабильность. В инженерных контекстах ансамбли глубоких нейронных сетей и более простые модели машинного обучения (например, машины вектора поддержки, случайные леса) часто используются для получения выгоды как от глубокого обучения функциям, так и от надежного статистического моделирования. Практическим руководством является масштабирование сложности ансамбля до размера данных: меньшее количество точек данных требует более простых базовых моделей и более сильной регуляризации.
Заключение
Нехватка данных остается серьезной проблемой для развертывания глубокого обучения в инженерных приложениях, но она не является непреодолимой. Широкий спектр стратегий - от расширения данных и передачи обучения в нейронные сети, основанные на физике, и совместного обмена данными - предоставляет инженерам богатую экосистему инструментов для создания эффективных моделей, даже когда данные ограничены. Ни один подход не подходит для всех проблем; успешная реализация требует глубокого понимания как инженерной области, так и сильных и слабых сторон каждой техники. Лучшие результаты возникают из продуманных комбинаций: увеличение небольшого реального набора данных с физически реалистичными симулированными данными, встраивание знаний о домене через физические условия потерь и надежное объединение моделей в организациях через федеративное обучение. По мере того, как эти методологии созревают и становятся более интегрированными в инженерные рабочие процессы, узкое место данных будет постепенно ослабевать, открывая преобразующий потенциал глубокого обучения для критически важных и высокоценных инженерных систем. В предстоящем десятилетии задача будет смещаться от "как получить больше данных" к "как наиболее эффективно извлекать знания из данных, которые у нас есть".