Вычисление устойчивости системы: количественные показатели в системном мышлении
Устойчивость системы представляет собой важнейшее свойство современных сложных систем, охватывающее способность выдерживать сбои, поглощать потрясения, адаптироваться к изменяющимся условиям и восстанавливать функциональность после неблагоприятных событий. По мере того, как организации сталкиваются со все более сложными проблемами, начиная от кибератак и заканчивая стихийными бедствиями, необходимость в строгих, количественных подходах к измерению и повышению устойчивости никогда не была более важной. В этом всеобъемлющем руководстве исследуются количественные меры, используемые для расчета устойчивости системы в рамках системного мышления, предоставляя практикующим специалистам и исследователям практические идеи для создания более надежных и адаптивных систем.
Понимание устойчивости системы в системном мышлении
Устойчивость описывает способность системы выдерживать экстремальные события, поглощать возмущения, восстанавливаться в ожидаемом устойчивом состоянии и даже претерпевать преобразования, чтобы адаптироваться к новому устойчивому состоянию.Эта многогранная концепция эволюционировала от своих истоков в материаловедении, чтобы стать краеугольным камнем системного мышления в различных областях, включая инфраструктуру, кибербезопасность, экологию и организационное управление.
В системоведении оценка устойчивости предполагает изучение того, как системы реагируют на нарушения в нескольких измерениях. С точки зрения проектирования и эксплуатации это можно оценить, контролируя производительность системы при сбоях. В отличие от простых мер надежности, которые направлены на предотвращение сбоев, устойчивость признает, что сбои неизбежны и подчеркивает способность системы поддерживать критические функции, несмотря на неблагоприятные условия.
Эволюция концепций устойчивости
Первое систематическое техническое применение было в материаловедении, где описывалась способность физического материала поглощать механическую энергию под напряжением и возвращаться к первоначальной форме без постоянной деформации.От этого фундамента концепция расширилась в конструкционное проектирование, защиту инфраструктуры и в конечном итоге в сложные социально-технические системы.
Надежность, надежность и устойчивость описывают надежную производительность в все более сложных условиях, сначала указанную среду, затем более широкую возможную среду и, наконец, непредвиденные разрушительные условия. Эта прогрессия подчеркивает, как устойчивость представляет собой наиболее полный и сложный уровень обеспечения производительности системы.
Отличие устойчивости от связанных концепций
Понимание устойчивости требует отличать ее от тесно связанных концепций, таких как надежность и надежность. Надежность означает способность службы быть здоровой в нормальных условиях, в то время как устойчивость означает способность службы смягчать, выживать и быстро восстанавливаться после сбоев высокого воздействия и оставаться функциональной с точки зрения клиента. Это различие имеет решающее значение для разработки соответствующих стратегий измерения.
Устойчивость идет дальше, чем надежность, требуя некоторой способности выполнять после возникновения неопределенных проблем и изменений, которые нарушают предположения о дизайне.В то время как устойчивость фокусируется на поддержании производительности при ожидаемых изменениях, устойчивость решает реакцию системы на неожиданные и потенциально катастрофические события.
Треугольник устойчивости и метрики, основанные на производительности
С момента появления новаторской парадигмы «треугольника устойчивости» для количественной оценки устойчивости были разработаны различные метрики, основанные на показателях производительности временных рядов, которые визуализируют устойчивость системы как траекторию производительности с течением времени, отслеживая, как системы ухудшаются во время сбоев и восстанавливаются после них.
Реакция системы суммируется в нормализованную меру производительности (MOP), так что значение 1,0 означает полный или удовлетворительный уровень производительности. Фиг 1 иллюстрирует кривую MOP-over-time от момента удара экстремального события (tstart). Затем система подвергается разрушению и восстановлению до конца события или его эффектов (tend). Эта визуализация обеспечивает интуитивную основу для понимания и количественной оценки устойчивости.
Компоненты кривой устойчивости
Кривая устойчивости фиксирует несколько критических фаз реакции системы на сбои. Начальная фаза воздействия показывает, насколько быстро и сильно ухудшается производительность при возникновении разрушительного события. Деградированная фаза производительности представляет собой период, в течение которого система работает при сниженной емкости. Фаза восстановления иллюстрирует, как система восстанавливает функциональность, а конечное состояние показывает, возвращается ли система к своему первоначальному уровню производительности, стабилизируется на новом уровне или продолжает улучшаться.
Кривые устойчивости используются для передачи количественных и качественных аспектов поведения системы и устойчивости заинтересованным сторонам критической инфраструктуры. Это делает их ценными инструментами не только для технического анализа, но и для передачи концепций устойчивости лицам, принимающим решения, и заинтересованным сторонам, которые могут не иметь глубоких технических знаний.
Ограничения традиционных кривых устойчивости
Несмотря на их широкое использование, традиционные кривые устойчивости имеют важные ограничения. Кривая отскока остается наиболее распространенной моделью для концептуализации, измерения и объяснения устойчивости для инженерных и общественных систем путем отслеживания функциональной надежности и восстановления систем с течением времени. (Это также идет по многим названиям, включая кривую устойчивости, треугольник устойчивости и кривую функциональности системы, среди других.) Несмотря на давнее признание того, что устойчивость - это больше, чем отскоок, кривая остается широко используемой, цитируемой и преподаваемой.
Все меры по обеспечению устойчивости, связанные с кривой, не дают представления о деятельности, которая проводилась для достижения заданного уровня производительности. Нет никакого понимания того, насколько «жесткой» была работа системы — какой ценой или какой жертвой. Это ограничение подчеркивает необходимость дополнительных показателей, которые охватывают усилия и ресурсы, необходимые для поддержания устойчивости.
Основные количественные показатели устойчивости системы
Оценка количественной устойчивости основывается на нескольких показателях, которые охватывают различные аспекты поведения системы в условиях стресса. Современные рамки КПЭ устойчивости обычно измеряют три основных аспекта: (а) устойчивость (надежность), (b) восстановление (быстрость) и (с) адаптивные или находчивые способности. Понимание каждого из этих аспектов имеет важное значение для всесторонней оценки устойчивости.
Метрики времени восстановления
Время восстановления представляет собой один из наиболее фундаментальных и широко используемых показателей устойчивости. Быстрота определяется как минимально допустимое время разрушения или максимальное время полного восстановления. Эта метрика количественно определяет, насколько быстро система может восстановить нормальные операции после пережитого нарушения.
Количественные показатели, такие как «время восстановления» или «процент сохраненной функциональности миссии», могут включать суждения МСП и могут поддерживать оценки и качественные оценки.Метрики времени восстановления могут быть измерены с различными грануляриями, от восстановления на уровне компонентов до полного восстановления системы, обеспечивая гибкость для различных аналитических потребностей.
Организации обычно устанавливают цели восстановления времени (RTO), которые определяют приемлемое максимальное время простоя для критических систем. Эти цели служат ориентирами, по которым можно измерить фактическую производительность восстановления, что позволяет постоянно улучшать возможности устойчивости.
Меры стойкости и сопротивления
Надежность была определена как максимально допустимая потеря, которую можно рассматривать как способность системы выдержать сбой или обеспечить надежность.Показатели надежности количественно определяют, насколько хорошо система поддерживает производительность при воздействии стресса или сбоя.
Надежность — способность систем, элементов системы и других единиц анализа выдерживать силы бедствия без существенной деградации или потери производительности. Эта метрика особенно важна для систем, где даже временная деградация производительности может иметь серьезные последствия, такие как критически важная для безопасности инфраструктура или системы реагирования на чрезвычайные ситуации.
Надежность может быть количественно оценена с помощью различных подходов, включая стресс-тестирование, когда системы подвергаются возрастающим уровням сбоев до превышения пороговых значений производительности.Масштабы сбоев, которые система может выдержать, прежде чем испытывать неприемлемое ухудшение производительности, обеспечивают прямую меру надежности.
Метрики избыточности
Увольнение — степень, в которой системы, системные элементы или другие единицы являются заменяемыми, то есть способными удовлетворять функциональные требования, если происходит значительная деградация или потеря функциональности.Увольнение представляет собой фундаментальную стратегию проектирования для повышения устойчивости, гарантируя, что резервные компоненты или пути могут поддерживать функцию системы, когда первичные элементы выходят из строя.
Количественное резервирование включает измерение доступности альтернативных ресурсов, путей или процессов, которые могут заменить неисправные компоненты. Это может включать физическое резервирование (дублирующие аппаратные компоненты), функциональное резервирование (разные компоненты, которые могут выполнять одну и ту же функцию) и информационное резервирование (множественные источники данных или каналы связи).
Метрики резервирования должны сбалансировать преимущества резервной емкости с затратами на поддержание дублирующих ресурсов. Эффективные стратегии резервирования гарантируют, что системы резервирования действительно независимы и не потерпят неудачу из-за сбоев в обычном режиме, которые влияют на первичные системы.
Меры по адаптации и ресурсоспособности
Находчивость — способность диагностировать и расставлять приоритеты проблем и инициировать решения путем выявления и мобилизации материальных, денежных, информационных, технологических и человеческих ресурсов.Метрика адаптивности отражает способность системы изменять операции в ответ на изменяющиеся условия и новые проблемы.
Устойчивость возникает в результате трех способностей: способности к поглощению, способности к адаптации и способности к трансформации. Эта структура признает, что устойчивость предполагает не только возвращение к предыдущим состояниям, но и потенциальное преобразование для лучшего решения новых реалий.
Измерение адаптивности сопряжено с уникальными проблемами, поскольку оно включает оценку способности системы реагировать на непредвиденные обстоятельства.Метрика может включать в себя разнообразие имеющихся вариантов реагирования, скорость, с которой могут быть реализованы новые стратегии, и эффективность механизмов обучения, которые улучшают будущие ответы на основе прошлого опыта.
Расширенные рамки квантификации устойчивости
Помимо базовых показателей, для обеспечения более комплексной оценки устойчивости появились сложные структуры. Эти структуры объединяют несколько показателей и учитывают сложные взаимодействия между различными аспектами производительности системы.
Рамки R4
Термин «устойчивость» широко используется в инфраструктурных системах для описания способности системы выдерживать и восстанавливаться после нарушений или сбоев и может быть охарактеризован в соответствии с четырьмя основными свойствами, то есть надежностью, быстротой, избыточностью и находчивостью. Эта структура R4 обеспечивает структурированный подход к оценке устойчивости по нескольким измерениям.
Рамочная система R4 подчеркивает, что комплексная устойчивость требует внимания ко всем четырем свойствам. Система может хорошо оценивать надежность, но плохо быстроту, что указывает на то, что, хотя она может выдерживать значительные нарушения, она восстанавливается медленно. И наоборот, система с высокой скоростью, но низкой избыточностью может быстро восстанавливаться после незначительных сбоев, но не имеет резервной способности для обработки крупных сбоев.
Композитные метрики устойчивости
Мы предлагаем составную метрику устойчивости, основанную на производительности, которая синтезирует идеи из существующей литературы, интегрируя несколько аспектов производительности системы в единую сводную меру, независимую от формы кривой. Композитные метрики пытаются захватить общую устойчивость с помощью интегрированных мер, которые объединяют несколько измерений производительности.
Они вычисляются с использованием событийных, ансамбльных или составных подходов с временными рядами производительности и надежными статистическими методологиями. Эти сложные подходы позволяют более детально оценивать устойчивость, рассматривая несколько сценариев и траекторий производительности.
Композитные метрики дают преимущество в предоставлении единого числа, которое суммирует общую устойчивость, облегчая сравнение между системами или отслеживая изменения устойчивости с течением времени. Однако они также рискуют скрыть важные детали о конкретных измерениях устойчивости, которые могут потребовать целенаправленного внимания.
Метрики устойчивости затрат
Затраты на устойчивость = затраты на ожидание + затраты на воздействие + затраты на восстановление. Чем ниже затраты на устойчивость, тем более устойчивой является система. Эта экономическая структура обеспечивает иной взгляд на устойчивость путем количественной оценки общих ресурсов, необходимых для поддержания функции системы через сбои.
«Стоимость» относится не только к финансовым затратам, но и к экологическим, социальным, психологическим и пищевым затратам (однако некоторые из них поддаются количественной оценке, чем другие). Эта широкая концепция затрат признает, что устойчивость предполагает компромиссы по нескольким измерениям стоимости, а не только финансовые соображения.
Структура затрат на устойчивость помогает организациям принимать обоснованные решения об инвестициях в устойчивость, явно учитывая ресурсы, необходимые для подготовки, выдержки и восстановления после сбоев. Системы с более низкими общими затратами на устойчивость достигают тех же функциональных результатов с меньшим количеством ресурсов, что указывает на более эффективную устойчивость.
Домен-специфические метрики устойчивости
Различные области применения разработали специализированные показатели устойчивости с учетом их уникальных требований и ограничений. Понимание этих подходов к конкретным областям обеспечивает ценную информацию для измерения устойчивости в разных контекстах.
Устойчивость инфраструктурной системы
Критические системы городской инфраструктуры, такие как транспорт, электроэнергия, водоснабжение, отходы и системы реагирования на чрезвычайные ситуации, сталкиваются с растущим числом угроз и сбоев как от стихийных бедствий, так и от антропогенных катастроф.
В случае систем инфраструктуры показатели устойчивости часто фокусируются на непрерывности и восстановлении обслуживания. Они могут включать такие показатели, как процент населения, обслуживаемого во время сбоев, пространственная степень прерываний обслуживания и время, необходимое для восстановления обслуживания на различных уровнях приоритета (сначала критические объекты, затем общая численность населения).
Оценка устойчивости инфраструктуры должна также учитывать взаимозависимость между системами. Например, отказы энергосистем могут каскадом влиять на водоочистные, телекоммуникационные и транспортные системы. Метрики, которые фиксируют эти взаимозависимости, обеспечивают более реалистичные оценки общей устойчивости инфраструктуры.
Метрики киберустойчивости
В этой статье мы сообщаем о результатах проекта под названием Количественное измерение киберустойчивости (QMoCR), в котором наша исследовательская группа стремится определить количественные характеристики ответов систем на киберкомпромиссы, которые могут быть получены из повторяемых систематических экспериментов. Киберустойчивость представляет собой уникальные проблемы измерения из-за адаптивного характера киберугроз и сложности прогнозирования векторов атак.
Метрики устойчивости системы, как правило, основаны на временной модели разрушения и восстановления, которая предполагает возможность своевременного обнаружения и реагирования. Для киберсистем время обнаружения становится критической метрикой, поскольку необнаруженные компромиссы могут сохраняться и наносить постоянный ущерб.
Метрики киберустойчивости часто включают такие меры, как среднее время для обнаружения (MTTD) вторжений, среднее время для сдерживания (MTTC) угроз и среднее время для восстановления (MTTR) от кибер-инцидентов.Кроме того, метрики могут оценивать процент функциональности миссии, который может быть сохранен во время кибератак, признавая, что полная профилактика может быть невозможной, но достижима изящная деградация.
Устойчивость производственной и производственной системы
Эта работа направлена на предоставление обзора различных показателей устойчивости и извлечение показателей, которые могут быть использованы при оценке устойчивости в производстве. Более конкретно, указываются количественные показатели устойчивости, которые могут быть эффективно использованы при оценке системы помощи работникам в производстве и в процессе проверки этих рабочих станций на основе устойчивости.
Метрики устойчивости производства часто фокусируются на непрерывности производства и качестве продукции. Они могут включать такие показатели, как объем производства, поддерживаемый во время сбоев, частота дефектов качества в условиях стресса и время, необходимое для восстановления полной производственной мощности. Для современных производственных систем, включающих цифровых двойников и автоматизацию, показатели устойчивости могут также оценивать надежность цифровых систем и их способность поддерживать операторов-людей во время сбоев.
Методологии измерения устойчивости системы
Эффективное измерение устойчивости требует соответствующих методологий сбора, анализа и интерпретации данных. Различные подходы предлагают различные уровни точности, стоимости и применимости к различным типам систем.
Оценка на основе моделирования
Моделирование обеспечивает мощный подход для оценки устойчивости, не подвергая реальные системы потенциально разрушительным нарушениям.Вычислительные модели могут имитировать поведение системы в различных сценариях разрушения, что позволяет систематически исследовать устойчивость в широком диапазоне условий.
Моделирование на основе агентов, системная динамика и дискретное моделирование событий представляют собой общие подходы к моделированию для оценки устойчивости. Каждая из них предлагает различные сильные стороны: агентные модели преуспевают в захвате эмерджентного поведения из отдельных взаимодействий компонентов, модели системной динамики эффективно представляют петли обратной связи и процессы накопления, а дискретные моделирования событий эффективно моделируют системы с различными изменениями состояния.
Валидность оценки устойчивости на основе моделирования в решающей степени зависит от точности модели и калибровки. Модели должны точно представлять структуру системы, поведение компонентов и взаимозависимость для получения значимых показателей устойчивости. Валидация против исторических событий разрушения помогает гарантировать, что моделирование дает реалистичные результаты.
Экспериментальное тестирование и стресс-тестирование
В этой статье мы сообщаем о результатах проекта под названием Количественное измерение киберустойчивости (QMoCR), в котором наша исследовательская группа стремится определить количественные характеристики реакций систем на киберкомпромиссы, которые могут быть получены из повторяемых систематических экспериментов.
Стресс-тестирование включает в себя преднамеренное подвергание систем увеличению уровня сбоев для выявления порогов отказа и возможностей восстановления. Этот подход обеспечивает прямые эмпирические доказательства устойчивости, но должен быть тщательно разработан, чтобы избежать причинения неприемлемого ущерба производственным системам. Тестовые среды, цифровые двойники или избыточные системы часто служат объектами для стресс-тестирования для снижения рисков.
Технология хаоса представляет собой новый подход к экспериментальному тестированию устойчивости, особенно в программных системах. Эта методология включает преднамеренное внедрение сбоев в производственные системы контролируемым образом, чтобы проверить, что механизмы устойчивости функционируют как задумано, и выявить неожиданные уязвимости.
Анализ исторических данных
Связи и различия между выбранными показателями были проверены с использованием данных о производительности системы временных рядов, собранных из системы гражданской авиации на материковой части Китая в течение первых двух волн COVID-19 с января 2020 года по март 2021 года. Анализ того, как системы выполняли свои функции во время фактических исторических сбоев, дает ценные эмпирические доказательства устойчивости.
Исторический анализ дает преимущество в захвате реальной сложности, которую может быть трудно воспроизвести в симуляции или контролируемых экспериментах. Однако он также сталкивается с ограничениями, включая неполные данные, факторы смешения и проблему, что исторические сбои могут не представлять весь спектр потенциальных будущих угроз.
Эффективный исторический анализ требует тщательной документации событий сбоев, системных реакций и процессов восстановления. Организации, которые ведут подробные записи о происшествиях и данные об эффективности, имеют больше возможностей для изучения прошлого опыта и повышения устойчивости в будущем.
Подходы сетевого анализа
Метод QtAC моделирует сложную систему как математический граф в более строгом смысле, чем обычный анализ потока, и zu Castell и Schrenk соответствующим образом используют связь из теории спектральных графов для количественной оценки устойчивости. Сетевой анализ предоставляет мощные инструменты для оценки устойчивости в системах, характеризующихся сложными взаимосвязи.
Метрики устойчивости на основе сети могут оценивать такие свойства, как связь, центральность и модульность, которые влияют на распространение сбоев через системы. Высоко связанные сети могут быть более уязвимыми для каскадных сбоев, но также предлагают больше альтернативных путей для поддержания функции. Модульные сетевые структуры могут содержать сбои в модулях, предотвращая сбои в системе.
Графо-теоретические меры, такие как алгебраическая связь, центральная связность и коэффициенты кластеризации, обеспечивают количественные показатели устойчивости сети. Эти показатели помогают идентифицировать критические узлы, отказ которых наиболее сильно повлияет на функционирование системы, что позволяет целенаправленно улучшать устойчивость.
Проблемы в квантификации устойчивости
Несмотря на значительные успехи в измерении устойчивости, остаются важные проблемы. Понимание этих ограничений помогает практикующим применять показатели устойчивости надлежащим образом и интерпретировать результаты с соответствующей осторожностью.
Метрический отбор и интерпретация
Количественные результаты показывают, что только 12 из 66 метрических пар сильно положительно коррелируют и не имеют существенных различий в результатах количественной оценки; качественные результаты показывают, что большинство метрик основаны на различных интерпретациях определений, основных компонентах и формах выражения и, таким образом, по существу измеряют различную устойчивость.Это открытие подчеркивает фундаментальную проблему: разные метрики устойчивости могут производить непоследовательные или даже противоречивые оценки.
Преимущества и недостатки каждой метрики сравнительно обсуждаются, и предлагается руководство «как выбирать» для пользователей метрик.Выбор соответствующих метрик требует тщательного рассмотрения конкретного контекста системы, приоритетов заинтересованных сторон и потребностей принятия решений.
Организации должны избегать соблазна полагаться на единую метрику устойчивости. Вместо этого портфель дополнительных метрик обеспечивает более полную оценку и снижает риск упущения важных измерений устойчивости. Отобранные конкретные метрики должны соответствовать организационным целям и типам сбоев, наиболее актуальным для системы.
Улавливание динамического и адаптивного поведения
Текущие ограничения включают в себя задачу адекватного захвата пространственных / временных корреляционных структур, нестационарных сред и интеграции мягких факторов, таких как организационное обучение и коллективное агентство, в количественные KPI. Устойчивость включает в себя динамические процессы, которые развиваются с течением времени, что делает статические показатели потенциально вводящими в заблуждение.
Системы учатся на сбоях и адаптируют свои реакции, а это означает, что устойчивость, измеренная в определенный момент времени, может не точно предсказать будущую устойчивость. Метрики должны каким-то образом учитывать эту адаптивную способность, которую по своей сути трудно количественно оценить. Такие подходы, как отслеживание тенденций устойчивости с течением времени или измерение скорости повышения устойчивости, могут частично решить эту проблему.
Роль принятия решений человеком и организационных факторов в устойчивости представляет собой особые проблемы измерения.В то время как свойства технической системы могут быть количественно оценены относительно просто, человеческий и организационный вклад в устойчивость включает суждение, творчество и социальную динамику, которые сопротивляются простой количественной оценке.
Борьба с неопределенностью и неизвестными угрозами
Недействительные предположения, будь то из-за неожиданных изменений в окружающей среде или неадекватного понимания взаимодействий внутри системы, могут вызвать неожиданное или непреднамеренное поведение системы. Система устойчива, если она продолжает выполнять намеченные функции при наличии недействительных предположений. Это определение подчеркивает фундаментальную проблему: устойчивость должна решать угрозы, которые нельзя полностью предвидеть.
Традиционная оценка риска фокусируется на известных угрозах с предполагаемыми вероятностями. Устойчивость должна идти дальше, обращаясь к «неизвестным неизвестным», которые не могут быть предсказаны заранее. Метрики, основанные на конкретных сценариях угроз, могут не захватить устойчивость к новым нарушениям.
Такие подходы, как планирование сценариев, стресс-тестирование в экстремальных условиях и измерение общей адаптивной способности, могут частично решить эту проблему. Однако фундаментальная неопределенность в отношении будущих угроз означает, что оценка устойчивости всегда включает в себя некоторую степень неснижаемой неопределенности.
Применение количественных мер устойчивости на практике
Перевод теории устойчивости и метрик в практическое применение требует систематических подходов, которые интегрируют измерение в процессы принятия решений и проектирования системы.
Рамки оценки устойчивости
Linkov et al.4 создали матрицу устойчивости, чтобы предоставить рекомендации, основанные на том, какие показатели устойчивости могут быть разработаны для измерения общей устойчивости системы. В этой матричной системе домены (физические, информационные, когнитивные, социальные) по всему циклу управления событиями функций устойчивости (план / подготовка, поглощение, восстановление, адаптация) отображаются и описываются. Такие рамки обеспечивают структурированные подходы для всесторонней оценки устойчивости.
Эффективные рамки оценки устойчивости обычно включают в себя несколько ключевых элементов: четкое определение границ системы и критических функций, выявление соответствующих угроз и сценариев сбоев, выбор соответствующих показателей для каждого измерения устойчивости, процедуры сбора и анализа данных и процессы для перевода результатов оценки в действия по улучшению.
Организации должны адаптировать рамки оценки устойчивости к своим конкретным контекстам, а не применять общие подходы некритически. Наиболее релевантные угрозы, критические функции и приемлемые пороги эффективности значительно различаются в разных системах и организационных контекстах.
Интеграция устойчивости в системный дизайн
Устойчивый дизайн инженерной системы будет ожидать, что система будет умной, чтобы она могла принимать автономные решения для распознавания риска, вызванного потенциальной опасностью или разрушительным событием, и корректировать или перенастраивать себя в ответ на риск. Количественные показатели устойчивости должны информировать дизайнерские решения с самых ранних стадий развития системы.
Проектирование устойчивости предполагает явные компромиссы между устойчивостью и другими свойствами системы, такими как эффективность, стоимость и производительность. Количественные показатели позволяют систематически оценивать эти компромиссы, а не только на основе интуиции. Например, избыточность повышает устойчивость, но увеличивает затраты и может снизить эффективность. Метрики помогают определить оптимальный уровень избыточности для конкретных контекстов.
В рамках проекта, учитывающего устойчивость, следует рассмотреть несколько стратегий, включая предотвращение (снижение вероятности сбоев), защиту (ограничение серьезности последствий), смягчение (снижение последствий), реагирование (эффективные действия во время сбоев) и восстановление (быстрое восстановление функции). Различные стратегии могут быть подходящими для различных типов угроз и системных контекстов.
Постоянный мониторинг и улучшение
Без какой-либо численной основы для оценки устойчивости сложно отслеживать и отслеживать улучшения. Численные измерения позволяют устанавливать цели и ставить четкие цели для улучшения. Устойчивость должна контролироваться непрерывно, а не оцениваться только периодически.
Постоянный мониторинг позволяет на ранней стадии выявлять ухудшение устойчивости до возникновения серьезных сбоев. Ведущие показатели, такие как увеличение времени восстановления, увеличение отставания в обслуживании или снижение уровня избыточности, могут сигнализировать о возникающих проблемах устойчивости. Организации могут затем принять корректирующие меры до того, как устойчивость ухудшится до неприемлемых уровней.
Повышение устойчивости должно осуществляться на основе систематических процессов, аналогичных другим инициативам по повышению качества. Это включает в себя установление базовых показателей устойчивости, установление целевых показателей улучшения, осуществление мероприятий, измерение результатов и повторение на основе извлеченных уроков. Организации, которые рассматривают устойчивость как постоянную проблему управления, а не единовременную оценку, достигают лучших долгосрочных результатов.
Коммуникация заинтересованных сторон и поддержка принятия решений
Учитывая необходимость изучения устойчивости системы с помощью многочисленных стресс-тестов, метрика обеспечивает краткую и сжатую количественную основу для сравнительной оценки. Количественные показатели облегчают общение о устойчивости с различными заинтересованными сторонами, которые могут иметь разные фоны и приоритеты.
Эффективная передача показателей устойчивости требует перевода технических мер в термины, значимые для лиц, принимающих решения. Вместо того, чтобы просто сообщать о метрических значениях, оценки устойчивости должны объяснять, что означают показатели для организационных целей, сравнивать текущую устойчивость с целями или контрольными показателями и определять конкретные действия, которые могут повысить устойчивость.
Методы визуализации, такие как кривые устойчивости, дисплеи приборной панели и сравнительные диаграммы, помогают сделать количественные данные устойчивости доступными для нетехнических заинтересованных сторон. Эти визуализации должны подчеркивать ключевые идеи и поддерживать принятие решений, а не подавлять аудиторию с чрезмерными деталями.
Новые тенденции в количественной оценке устойчивости
Область измерения устойчивости продолжает развиваться, и несколько новых тенденций обещают повысить нашу способность количественно оценивать и улучшать устойчивость системы.
Машинное обучение и искусственный интеллект
Подходы машинного обучения открывают новые возможности для оценки и прогнозирования устойчивости. Эти методы могут идентифицировать закономерности в больших наборах данных, которые могут быть не очевидны с помощью традиционного анализа, прогнозирования поведения системы в новых условиях и оптимизации стратегий устойчивости в сложных компромиссных пространствах.
Глубокое Q-обучение использует глубокие нейронные сети для аппроксимации функции Q-значения, которая представляет собой ожидаемое кумулятивное вознаграждение за принятие конкретного действия в данном состоянии, что позволяет ему эффективно управлять высокоразмерными состояниями и пространствами действия, где другие методы могут потерпеть неудачу. Такие подходы позволяют более сложную оптимизацию стратегий устойчивости.
Системы устойчивости на основе ИИ могут потенциально обеспечить оценку устойчивости в реальном времени, автоматически настраивая конфигурации системы для поддержания устойчивости по мере изменения условий. Однако эти подходы также создают новые проблемы, включая необходимость обширных данных обучения, потенциал для неожиданного поведения ИИ и трудности объяснения решений, основанных на ИИ, заинтересованным сторонам.
Цифровые близнецы для оценки устойчивости
Мы используем реальные, физические электронные и вычислительные элементы транспортного средства (тем самым улучшая точность киберэффектов) и интегрируем его с виртуальной моделью (цифровым двойником) остальной части транспортного средства. Этот физически-цифровой двойник транспортного средства сочетает в себе точность и относительную доступность. Цифровые двойники обеспечивают высокоточные виртуальные представления физических систем, которые могут использоваться для тестирования устойчивости без риска для реальных систем.
Цифровые двойники позволяют проводить непрерывную оценку устойчивости, имитируя системные реакции на потенциальные сбои в режиме реального времени. По мере функционирования физической системы ее цифровой двойник может подвергаться различным сценариям сбоев для оценки текущей устойчивости и выявления возникающих уязвимостей. Такой подход обеспечивает гораздо более частую и всеобъемлющую оценку устойчивости, чем было бы практично при физическом тестировании.
Эффективность оценки устойчивости на основе цифровых двойников зависит от поддержания точной синхронизации между физическими и цифровыми системами.По мере изменения физических систем посредством технического обслуживания, модернизации или деградации цифровые двойники должны обновляться соответствующим образом, чтобы поддерживать их валидность в качестве инструментов оценки устойчивости.
Концепции антихрупкости и неустойчивости
КПЭ устойчивости продолжают развиваться, активно исследуя показатели антихрупкости (улучшение по сравнению с повторяющимися шоками), количественную оценку событийно-агностической способности, чувствительность к сетевой взаимозависимости и переносимость поперечных доменов. Концепция антихрупкости выходит за рамки устойчивости для описания систем, которые фактически улучшаются при воздействии стресса.
В то время как устойчивые системы возвращаются в свое прежнее состояние после сбоев, антихрупкие системы становятся сильнее. Количественная антихрупкость требует метрик, которые фиксируют не только восстановление, но и улучшение. Это может включать такие меры, как скорость обучения от сбоев, расширение возможностей реагирования после стрессовых событий или укрепление системных структур за счет воздействия проблем.
Разработка систем с антихрупкими свойствами представляет собой амбициозную цель, которая выходит за рамки традиционной инженерии устойчивости. Однако для систем, работающих в быстро меняющихся условиях, где будущие угрозы крайне неопределенны, способность улучшаться благодаря воздействию стресса может иметь важное значение для долгосрочного выживания.
Междоменные метрики устойчивости
Оперативизация KPI устойчивости сильно зависит от домена, охватывая такие области, как сельское хозяйство, инфраструктура, киберфизические системы, микросервисы, связь, энергия, транспорт и коллективные социально-технические системы. Несмотря на специфические для домена вариации, растет интерес к разработке показателей устойчивости, которые могут применяться в разных контекстах.
Междоменные показатели позволят сравнивать устойчивость различных типов систем и облегчат передачу информации о устойчивости между доменами. Например, уроки о устойчивости сети от телекоммуникационных систем могут информировать о устойчивости энергосистемы, или понимание организационной устойчивости от реагирования на чрезвычайные ситуации может повысить устойчивость производства.
Разработка действительно междоменных метрик требует выявления фундаментальных принципов устойчивости, которые выходят за рамки конкретных типов систем. Хотя детали реализации различаются, основные концепции, такие как избыточность, разнообразие, модульность и адаптивная способность, кажутся актуальными во многих областях. Метрики, основанные на этих фундаментальных принципах, могут достичь более широкой применимости, чем меры, относящиеся к конкретным доменам.
Тематические исследования в области количественной устойчивости
Изучение конкретных применений количественной оценки устойчивости дает ценную информацию о том, как теоретические концепции претворяются в жизнь и о проблемах, возникающих при реализации в реальном мире.
Устойчивость авиационной системы во время COVID-19
Благодаря количественно-качественному комбинированному подходу 12 популярных показателей устойчивости на основе показателей эффективности сравниваются с использованием эмпирических данных из авиационной системы Китая при нарушении COVID-19. Данное тематическое исследование демонстрирует, как показатели устойчивости могут быть применены для оценки реакции системы на беспрецедентные сбои.
Пандемия COVID-19 создала естественный эксперимент в области устойчивости авиационной системы, с резким сокращением спроса и эксплуатационными ограничениями, проверяя способность системы адаптироваться и выживать. Показатели устойчивости показали, как различные аспекты авиационной системы реагировали по-разному, причем некоторые элементы оказались более адаптируемыми, чем другие.
В этом тематическом исследовании также подчеркивалась важность использования нескольких показателей, поскольку различные меры дают разное представление о устойчивости системы. Некоторые показатели ориентированы на обеспечение непрерывности работы, другие - на финансовую устойчивость, а третьи - на поддержание безопасности. Всеобъемлющая оценка устойчивости требует интеграции идей с разных точек зрения.
Оценка устойчивости энергосистемы
Энергетические системы представляют собой критическую инфраструктуру, где устойчивость имеет важное значение для общественной безопасности и экономической функции.Метрики устойчивости для энергетических систем обычно фокусируются на непрерывности обслуживания, времени восстановления и степени отключений во время сбоев, таких как серьезные погодные явления, сбои оборудования или кибератаки.
Количественная оценка устойчивости энергосистемы часто использует имитационные модели, которые представляют электрическую сеть, ресурсы генерации и системы управления.Эти модели могут имитировать реакцию системы на различные сценарии сбоев, вычисляя такие показатели, как количество пострадавших клиентов, продолжительность отключений и общая энергия, не обслуживаемая.
Оценка устойчивости энергосистемы должна учитывать сложные взаимозависимости между электрической инфраструктурой и другими системами. Каскад отказов электроснабжения влияет на телекоммуникации, водоочистку, транспортировку и многие другие услуги. Комплексные показатели устойчивости должны охватывать эти взаимозависимости, чтобы обеспечить реалистичные оценки общей устойчивости системы.
Устойчивость производственной системы
Системы производства сталкиваются с различными сбоями, включая сбои оборудования, перебои в цепочке поставок, проблемы качества и проблемы с рабочей силой.Метрики устойчивости для производства обычно фокусируются на непрерывности производства, поддержании качества и времени восстановления после сбоев.
Современное производство все чаще включает в себя цифровые технологии, включая датчики, автоматизацию и аналитику данных. Эти технологии позволяют осуществлять более сложный мониторинг и оценку устойчивости. Данные в режиме реального времени о состоянии оборудования, темпах производства и показателях качества могут обеспечить раннее предупреждение о возникающих проблемах устойчивости.
Оценка устойчивости производства должна сбалансировать эффективность и цели устойчивости. Практика бережливого производства, которая минимизирует запасы и максимизирует использование оборудования, может снизить устойчивость за счет устранения буферов, которые могут поглощать сбои. Количественные показатели помогают определить оптимальные компромиссы между эффективностью и устойчивостью для конкретных производственных контекстов.
Лучшие практики для измерения устойчивости
На основе исследований и практического опыта, для эффективного количественного определения и применения устойчивости появилось несколько лучших практик.
Установить четкие цели и сферу применения
Эффективное измерение устойчивости начинается с четкого определения того, что измеряется и почему. Это включает в себя определение границ системы, определение критических функций, которые должны поддерживаться, и определение того, какие типы сбоев наиболее актуальны. Без четких целей оценка устойчивости может стать неконцентрированной и привести к результатам, которые не поддерживают принятие решений.
Для установления соответствующих целей необходимо участие заинтересованных сторон. Различные заинтересованные стороны могут иметь различные приоритеты в отношении того, какие функции являются наиболее важными и какие уровни нарушения приемлемы. Оценка устойчивости должна отражать эти приоритеты, а не навязывать чисто технические критерии.
Используйте множественные дополнительные метрики
Ни одна метрика не отражает все аспекты устойчивости. Всеобъемлющая оценка требует нескольких показателей, которые учитывают различные аспекты устойчивости, включая надежность, скорость восстановления, адаптивность и эффективность использования ресурсов. Конкретное сочетание показателей должно быть адаптировано к контексту системы и приоритетам заинтересованных сторон.
При использовании нескольких метрик важно понимать, как они связаны друг с другом и какую уникальную информацию предоставляет каждая. Метрики, которые сильно коррелируют, предоставляют избыточную информацию, в то время как метрики, которые захватывают независимые аспекты устойчивости, предлагают взаимодополняющие идеи. Анализ метрических отношений помогает оптимизировать портфель измерений.
Проверка метрик против реальных мировых показателей
Метрики устойчивости должны быть подтверждены путем сравнения их прогнозов с фактической производительностью системы во время сбоев.Метрики, которые точно предсказывают устойчивость в реальном мире, обеспечивают уверенность в принятии решений, в то время как показатели, которые показывают плохое соответствие фактической производительности, должны быть улучшены или заменены.
Проверка требует ведения подробных записей о событиях сбоя и системных ответах. Организации должны систематически документировать сбои, действия реагирования и результаты для создания базы данных, которая может использоваться для проверки и уточнения метрик. Этот процесс обучения постоянно повышает точность и актуальность оценки устойчивости.
Рассмотрим как количественные, так и качественные факторы
Хотя в этой статье основное внимание уделяется количественным показателям, эффективная оценка устойчивости также включает в себя качественные факторы, которые не поддаются количественной оценке. Организационная культура, качество руководства, опыт персонала и отношения с заинтересованными сторонами влияют на устойчивость, но их трудно измерить количественно.
Подходы к комплексной оценке сочетают количественные показатели с методами качественной оценки, такими как экспертное суждение, тематические исследования и анализ повествования. Эта комбинация обеспечивает более полное понимание, чем любой из подходов. Количественные показатели обеспечивают строгость и сопоставимость, в то время как качественная оценка улавливает нюансы и контекстуальные факторы.
Связывайте метрики с действенными улучшениями
Метрики устойчивости должны информировать о конкретных действиях по повышению устойчивости, а не служить просто абстрактными оценками. Это требует понимания причинно-следственных связей между свойствами системы и показателями устойчивости. Например, если время восстановления слишком велико, какие конкретные изменения уменьшат его? Если надежность недостаточна, какие вмешательства укрепят его?
Анализ чувствительности помогает определить, какие свойства системы наиболее сильно влияют на показатели устойчивости. Это позволяет определить приоритетность усилий по улучшению факторов, которые будут иметь наибольшее влияние. Анализ затрат и выгод может дополнительно уточнить приоритеты, учитывая ресурсы, необходимые для различных улучшений устойчивости.
Будущие направления в количественной оценке устойчивости
Сфера количественной оценки устойчивости продолжает развиваться, и в ней есть несколько важных направлений для будущего развития.
Стандартизация и совместимость
Несмотря на увеличение использования концепции инженерной устойчивости, разнообразие ее применения в различных инженерных секторах усложняет универсальное соглашение о ее количественной оценке и связанных с ней методах измерения.Существует настоятельная необходимость разработки общеприменимой основы анализа инженерной устойчивости, которая стандартизирует моделирование, оценку и повышение инженерной устойчивости для более широкой инженерной дисциплины.
Более широкая стандартизация облегчит сопоставление устойчивости систем и организаций, позволит проводить бенчмаркинг и поддерживать разработку передовой практики. Вместе с тем стандартизация должна быть сбалансирована с необходимостью использования конкретных в контексте показателей, учитывающих уникальные характеристики системы и приоритеты заинтересованных сторон.
Отраслевые консорциумы, профессиональные общества и организации по стандартизации работают над разработкой общих рамок и показателей для оценки устойчивости. Эти усилия направлены на создание общего словаря, протоколов измерений и форматов отчетности при сохранении гибкости для адаптации к конкретным областям.
Интеграция с управлением рисками
Устойчивость и управление рисками представляют собой взаимодополняющие подходы к решению проблем неопределенности и сбоев. Управление рисками традиционно фокусируется на выявлении конкретных угроз и внедрении мер контроля для снижения их вероятности или воздействия. Устойчивость подчеркивает способность эффективно реагировать на сбои независимо от их конкретного характера.
Комплексные рамки, объединяющие перспективы риска и устойчивости, обеспечивают более комплексные подходы к управлению неопределенностью. Оценка риска выявляет конкретные угрозы, которые требуют целенаправленного контроля, в то время как оценка устойчивости гарантирует, что системы могут эффективно реагировать даже на непредвиденные сбои. Количественные показатели из обеих областей могут быть объединены для поддержки целостного принятия решений.
Экономика устойчивости и оптимизация инвестиций
По мере того, как количественная оценка устойчивости становится все более сложной, она позволяет проводить более тщательный экономический анализ инвестиций в устойчивость. Организации могут сравнивать затраты на повышение устойчивости с ожидаемыми выгодами с точки зрения снижения воздействия на разрушение и более быстрого восстановления. Это поддерживает более рациональное распределение ограниченных ресурсов по конкурирующим приоритетам устойчивости.
Экономика устойчивости должна учитывать вероятностный характер сбоев и длительные временные горизонты, в течение которых инвестиции в устойчивость обеспечивают преимущества. Такие методы, как анализ реальных вариантов и оценка на основе сценария, могут помочь количественно оценить ценность возможностей устойчивости, которые могут не потребоваться немедленно, но обеспечивают страхование от будущих сбоев.
В государственной политике все чаще признается важность устойчивости для критически важной инфраструктуры и основных услуг. Количественные показатели устойчивости могут информировать о нормативных требованиях, направлять государственные инвестиции в повышение устойчивости и давать возможность оценки соответствия систем приемлемым стандартам устойчивости.
Изменение климата и долгосрочная устойчивость
Изменение климата представляет собой уникальные проблемы для оценки устойчивости, поскольку оно включает в себя постепенное изменение исходных условий, а не отдельные события разрушения. Системы должны поддерживать устойчивость не только к отдельным экстремальным явлениям, но и к изменению моделей температуры, осадков, уровня моря и других факторов окружающей среды.
Показатели устойчивости для адаптации к изменению климата должны учитывать способность эффективно функционировать в изменяющихся условиях на протяжении десятилетий. Для этого требуются иные подходы, чем показатели, ориентированные на восстановление после острых сбоев. Адаптивная способность становится особенно важной, поскольку системы должны непрерывно развиваться, чтобы оставаться устойчивыми по мере изменения условий.
Долгосрочная оценка устойчивости должна также учитывать глубокую неопределенность в отношении будущих условий. Прогнозы климата предполагают значительную неопределенность, особенно в региональном и местном масштабах. Стратегии устойчивости должны быть надежными в целом ряде возможных будущих условий, а не оптимизированными для одного прогнозируемого сценария.
Заключение
Количественное измерение устойчивости системы превратилось из простых концептуальных рамок в сложные аналитические подходы, которые информируют критические решения о проектировании, эксплуатации и улучшении системы.Показатели устойчивости KPI являются количественными показателями, которые измеряют способность системы сопротивляться, восстанавливаться и адаптироваться к разрушительным событиям, обеспечивая необходимые инструменты для управления сложными системами в неопределенных средах.
Эффективная количественная оценка устойчивости требует понимания нескольких аспектов, включая надежность, скорость восстановления, избыточность и адаптивность. Ни одна метрика не охватывает все аспекты устойчивости, что требует портфелей дополнительных мер, адаптированных к конкретным системным контекстам и приоритетам заинтересованных сторон. Треугольник устойчивости и связанные с ним рамки на основе производительности обеспечивают интуитивную визуализацию системного реагирования на сбои, хотя они имеют важные ограничения, которые должны быть признаны.
Методологии моделирования пролета измерения устойчивости, экспериментального тестирования, исторического анализа и анализа сети, каждый из которых предлагает различные сильные стороны и ограничения. Выбор методологии зависит от характеристик системы, доступных данных, приемлемых затрат и рисков и конкретных вопросов, которые рассматриваются. Новые подходы, включающие машинное обучение, цифровые двойники и концепции антихрупкости, обещают повысить возможности оценки устойчивости.
Практическое применение метрик устойчивости требует систематических рамок, которые интегрируют измерения в процессы принятия решений. Устойчивость должна информировать о разработке системы с самых ранних стадий, направлять оперативные решения и стимулировать усилия по постоянному улучшению. Эффективная коммуникация метрик устойчивости с различными заинтересованными сторонами позволяет принимать обоснованные решения об инвестициях и приоритетах устойчивости.
Важными проблемами остаются количественная оценка устойчивости, включая выбор и интерпретацию метрик, захват динамического и адаптивного поведения и решение проблемы неопределенности в отношении будущих угроз.Проводимые исследования решают эти проблемы посредством усилий по стандартизации, интеграции с управлением рисками, экономического анализа инвестиций в устойчивость и адаптации к долгосрочным проблемам, таким как изменение климата.
По мере того, как системы становятся все более сложными и взаимосвязанными, а темпы изменений ускоряются, устойчивость становится все более важной для организационного успеха и общественного благополучия. Количественные показатели устойчивости обеспечивают необходимые инструменты для понимания, измерения и улучшения способности систем противостоять сбоям и поддерживать критические функции. Организации, которые систематически измеряют и повышают устойчивость, позиционируют себя для процветания, несмотря на неизбежные неопределенности и сбои.
Для дальнейшего изучения концепций и приложений устойчивости Альянс устойчивости предоставляет обширные ресурсы по мышлению устойчивости в нескольких областях. Национальный институт стандартов и технологий (NIST) предлагает рамки и руководящие принципы для устойчивости инфраструктуры. Портал исследований природы по устойчивости предоставляет доступ к передовым исследованиям по устойчивости. Журнал систем публикует исследования по системному мышлению и устойчивости. Наконец, стандарт ISO 22316 по организационной устойчивости предоставляет международно признанное руководство по управлению устойчивостью.
Путь к более устойчивым системам продолжается, требуя непрерывного обучения, адаптации и совершенствования. Количественные показатели устойчивости обеспечивают основу для этого путешествия, позволяя организациям измерять, где они находятся, устанавливать цели, где они должны быть, и отслеживать прогресс в достижении целей устойчивости. Приняв строгие измерения устойчивости и применяя идеи к проектированию и управлению системой, организации могут создать способность не только выживать сбои, но и становиться сильнее и более способными.