Как использовать хранилище данных для долгосрочного хранения инженерных данных

Введение

Инженерные команды ежедневно генерируют огромные объемы данных — модели CAD, результаты моделирования, журналы датчиков, результаты испытаний и производственные записи. Хранение данных в операционных базах данных или плоских бункерах файлов быстро становится неуправляемым. Без систематического подхода теряется историческая информация, анализ становится непоследовательным, а принятие решений страдает. Хранение данных решает эти проблемы, предоставляя централизованное долгосрочное хранилище, предназначенное специально для запроса и анализа. Для организаций, управляющих инженерными данными, хорошо спроектированный склад данных превращает необработанные записи в актив, который стимулирует улучшения дизайна, отчетность о соответствии и прогнозное обслуживание.

В этой статье объясняется, как использовать хранилище данных для долгосрочного хранения инженерных данных, охватывающих основные концепции, этапы реализации и лучшие практики, которые сохраняют ваши данные доступными и действенными на долгие годы.

Что такое Data Warehouse?

Хранилище данных - это специализированная база данных, которая объединяет данные из нескольких источников в единый, последовательный магазин. В отличие от транзакционных баз данных, которые обеспечивают повседневную работу (известную как OLTP-системы), хранилище данных оптимизировано для чтения-интенсивных запросов, сложных агрегаций и анализа исторических тенденций. Он хранит данные в структурированном, денормализованном или слегка нормализованном формате, что позволяет аналитикам и инженерам легко исследовать, не влияя на производственные системы.

Определяющие характеристики хранилища данных включают:

Data Warehouse vs. Data Lake (англ.) (недоступная ссылка).

Инженерные команды часто рассматривают вопрос о том, использовать ли хранилище данных или озеро данных. Озеро данных хранит сырые данные в своем родном формате (файлы, капли, объекты) без предварительной трансформации. В то время как озера данных отлично подходят для исследовательской науки о данных или хранения неструктурированных потоков датчиков, они требуют значительных усилий для подготовки запросов к данным. Склад данных, с другой стороны, обеспечивает соблюдение схемы и правил качества перед загрузкой, что делает его идеальным для повторяющихся отчетов бизнес-аналитики и кросс-функционального анализа. Многие организации используют как: озеро данных для сырого проглатывания, так и склад для курируемых, высокоценных наборов данных. Для долгосрочного хранения инженерных данных, которые должны быть надежно запрошены годы спустя, хранилище данных является более надежным выбором.

Почему инженерам нужны данные

Инженерные данные по своей сути долговечны. На дизайн продукта можно ссылаться через десять лет после его создания; система структурного мониторинга накапливает показания для срока службы моста. Хранение данных удовлетворяет эти конкретные потребности:

Консолидируя инженерные данные в склад, организации превращают исторические записи в стратегический ресурс. Инвестиции окупаются, когда дизайнер может запросить «все итерации этой скобки, которые не прошли вибрационное тестирование за последние пять лет» и получить результаты за секунды.

Ключевые компоненты и архитектура хранилища данных

Типичная архитектура хранилища данных включает в себя несколько слоев:

Схема проектирования для инженерных данных

Звездные схемы распространены в инженерных складах. Например, таблица фактов для показаний датчиков может содержать столбцы для временной метки, идентификатор датчика, значение измерения и иностранные ключи к таблицам измерений для местоположения датчика, типа и статуса калибровки. Схемы снежинок далее нормализуют размеры (например, разделение местоположения на участок, пол, машину). Выбор зависит от шаблонов запросов: звездные схемы проще для отчетности, в то время как снежинки уменьшают хранение в высоко иерархических данных. Большинство современных облачных складов обрабатывают оба эффективно, поэтому начните со звездных схем и денормализуйте только тогда, когда этого требует производительность.

Шаги по внедрению хранилища данных для инженерных данных

Создание хранилища данных для инженерных данных требует тщательного планирования.Следуйте этим шагам, чтобы результат соответствовал долгосрочным потребностям хранения и анализа.

1. Требования к сбору и аудиту данных

Начните с определения ключевых вопросов, на которые должен ответить склад. Общие инженерные вопросы включают:

Далее, инвентаризируйте все источники данных: системы управления данными о продуктах CAD (PDM), платформы Интернета вещей (IoT), лабораторные ноутбуки, системы планирования ресурсов предприятия (ERP) и даже журналы одобрения на основе электронной почты. Схемы документов, частоты обновлений и проблемы качества данных. Этот аудит будет формировать дизайн ETL.

2. Моделирование данных

Определите таблицы фактов для измеримых событий (например, каждый тестовый запуск, каждая произведенная часть) и таблицы измерений для контекстных атрибутов (например, процедура тестирования, оператор, партия материала). Используйте инструменты моделирования или даже направьте SQL на прототип схемы звезды. Для инженерных данных обратите особое внимание на временные измерения: включите иерархии дня, недели, месяца, квартала и года, а также инженерные календари (фискальные годы, вехи проекта).

3.ETL Трубопроводный дизайн

ETL является ядром хранилища данных. Для инженерных данных этап преобразования часто требует индивидуального анализа, потому что такие источники, как инструменты анализа конечных элементов, выводят огромные текстовые журналы или файлы CSV с нестандартными разграничителями. Рассмотрите возможность использования специального инструмента ETL, такого как Apache NiFi, Talend или облачные сервисы, такие как AWS Glue или Azure Data Factory. Многие команды также используют скрипты Python для сложных преобразований. Трубопровод должен работать по графику (ежедневно или почасово) и включать обработку ошибок и журналирование. Для нужд реального времени потоковый слой (например, Apache Kafka) может поступать на склад, но для долгосрочного хранения пакетные нагрузки по-прежнему распространены и экономически эффективны.

4.Выбор платформы

Выберите платформу для хранения данных, которая уравновешивает стоимость, масштабируемость и интеграцию с существующей цепочкой инструментов. Популярные варианты включают в себя:

Оцените каждый из них на основе вашего объема данных, бюджета и собственного опыта. Доказательство концепции с подмножеством реальных данных бесценно.

5. Загрузка и проверка

Загрузите преобразованные данные на склад, используя либо полные обновления, либо дополнительные нагрузки. Для инженерных данных дополнительные нагрузки предпочтительны, потому что исторические записи редко меняются. После каждой загрузки запустите запросы проверки: проверьте количество строк, агрегируйте ключевые показатели и сравните с исходными системами. Автоматизируйте эти тесты с использованием рамок качества данных (например, Большие ожидания), чтобы рано улавливать проблемы.

6.Строительство отчетности и аналитики

После загрузки данных создайте панели инструментов и отчеты, которые отвечают на исходные вопросы. Используйте инструменты BI, такие как Tableau, Power BI или пользовательский интерфейс (например, построенный на Directus). Для специального анализа разрешите инженерам запускать SQL-запросы против склада. Предоставьте документацию по схеме и выборке запросов, чтобы стимулировать принятие.

Лучшие практики для долгосрочного хранения

Инженерные данные часто должны храниться в течение многих лет или даже десятилетий.Применяя эти лучшие практики, мы гарантируем, что склад остается ценным и обслуживаемым с течением времени.

Реальные случаи использования в мире

Автомобильный OEM

Производитель автомобилей интегрировал свои системы PLM, испытательный трек и системы качества поставщиков в склад Snowflake. Инженеры теперь могут запрашивать «все транспортные средства с данной партией дроссельных тел, которые не прошли испытания на тепло-мокрый воздух» и соотноситься с изменениями в конструкции за пять лет до этого. Склад сократил время анализа первопричины с недель до часов и улучшил процесс принятия решений о отзыве.

Контроль структурного здоровья

Фирма гражданского строительства собирает данные с тензодатчиков и акселерометров, установленных на мосту. Они используют приложение, поддерживаемое Directus, для управления сенсорной сетью и продвижения очищенных данных в Amazon Redshift. Склад хранит десятилетние показания, что позволяет проводить долгосрочный анализ трендов отклонения. Прогнозные модели, работающие на флаге склада, ненормальные модели, предупреждающие команды обслуживания до достижения критических порогов.

Энергетика и коммунальные услуги

Оператор ветропарка загружает данные SCADA (турбинная RPM, температура, выходная мощность) в Google BigQuery. Склад хранит сырые 10-секундные образцы в течение одного года, а затем перекачивает их в почасовые средние за следующие десять лет. Этот подход уравновешивает детали со стоимостью. Аналитики могут сравнить годовое производство энергии по турбинам и точно определить недостаточную производительность, вызванную деградацией лопастей.

Заключение

Хранение данных - это проверенная стратегия долгосрочного хранения инженерных данных. Благодаря централизации различных источников в структурированный, удобный для запросов репозиторий организации сохраняют свою историю проектирования и открывают идеи, которые стимулируют инновации, качество и соответствие. Реализация требует тщательного планирования - от понимания вопросов, на которые вам нужно ответить, до моделирования схемы, выбора масштабируемой платформы. Сочетание облачного хранилища данных с гибким уровнем управления данными, таким как Directus, может еще больше упростить проглатывание и управление.

Инженерные команды, которые инвестируют в настоящий склад сегодня, окажутся лучше подготовленными к тому, чтобы справляться с требованиями завтрашнего дня: больше датчиков, больше симуляций и больше давления, чтобы превратить исторические данные в конкурентное преимущество. Начните с аудита существующих активов данных, выберите небольшой, но ценный вариант использования и стройте оттуда. Долгосрочная выгода - это единственный источник истины, который служит как инженерам, так и организации на долгие годы.